powered by TechFeed
表示モード
主要ニュース

ChatGPTを「人間らしく」評価する仕事でAIを使ったら解雇 — OpenAIが請負業者を切った皮肉な実態

9月26日、Kim LaCapriaが「OpenAI fired contractors hired to humanize ChatGPT after they used AI on the job」と題した記事を公開した。ChatGPTの応答を「人間らしく」評価する業務を担う請負業者が、AIツールを使用したとして解雇されたという皮肉な事態の詳細が報告されている。

9月26日、Kim LaCapriaが「OpenAI fired contractors hired to humanize ChatGPT after they used AI on the job」と題した記事を公開した。ChatGPTの応答を「人間らしく」評価する業務を担う請負業者が、AIツールを使用したとして解雇されたという皮肉な事態の詳細が報告されている。


AIを人間らしくする仕事で、AIを使ったら首になった

OpenAIはChatGPTの応答品質を向上させるため、大規模な人間の請負業者プールを活用している。彼らの仕事はチャットボットの出力を評価・採点することだ。これはRLHF(人間のフィードバックによる強化学習、Reinforcement Learning from Human Feedback)と呼ばれる手法の一環で、人間の評価者がモデルの出力に対してスコアや優劣判定を与えることで、より人間の意図に沿った応答を生成できるようモデルを調整していく。ChatGPTをはじめとする現代の大規模言語モデルの多くが、この工程を経て「使いやすさ」を獲得している。つまり人間による評価こそがAI品質の根幹であり、その評価者がAIに依存することは、プロセス全体の信頼性を揺るがしかねない。

ところが404 Mediaの報道によれば、その評価業務にAIツールを使用したとして、複数の業者がプロジェクトから外されていたことが明らかになった。

問題の本質は構造的な皮肉にある。AIを人間らしく見せるための評価作業を、AIを使ってこなしていたのだ。

禁止ルールと検出手法

内部文書には、ルールが明確に記されていた。

「AIの検出ツールを使用しないこと。自分でAIを使うことも禁止する。GPTZeroその他のAI検出ツールは信頼性がないため使用不可。GrammarlyやAI翻訳を含め、レビュー・フィードバック・コメントの作成にAIを使ってはならない。」

レビュアーは、AI利用の痕跡を見抜く訓練を受けていた。具体的なマーカーとして挙げられているのは、繰り返しのフレーズ、AI的な句読点の使い方(たとえばエムダッシュの過剰使用)、そして不自然に速い作業完了速度だ。

あるコントラクターは、違反が横行している実態を認めた。

「数千人規模のグループの中で、捕まった人間は山ほどいる。」

Project Lilyと「モデル崩壊」リスク

404 Mediaは別の報道で、「Project Lily」と呼ばれるOpenAIの取り組みについても言及している。これは数百人の請負業者が実際のChatGPTユーザーのプロンプトや会話(個人情報を含む場合もある)をレビューするプロジェクトだ。

レビュアーの役割は、ChatGPTの返答が過度に媚びるもの(sycophantic)になっていないか、あるいはChatGPT自身を人格のある存在として描写しすぎていないかを確認することだ。

さらに記事では「**モデル崩壊(model collapse)**」のリスクにも触れている。AIがAI生成テキストをさらに学習し続けると、エラーや単調なパターンが蓄積され、モデルの品質が徐々に劣化するという現象だ。評価データにAI生成の痕跡が混入すれば、この劣化を加速させる可能性がある。

あるコントラクターは、Slackの相互アドバイス用チャンネルで同僚たちがサンプルを共有し「これはAI生成に見えるか?」と確認し合っていると証言した。

「たいてい答えは『そうだ』になる。」

Mercorの立場と、解雇された側の本音

この業務に関わるAIトレーニング企業Mercorは、違反の検出と執行はすでに仕組みとして機能していると主張した。MercorはAIトレーニング向けの人材マッチング・アウトソーシングを手がける企業で、OpenAIをはじめとする複数のAI企業に評価者を供給していることで知られている。

「専門家はその専門知識と判断力のために採用されている。契約ではLLMの使用を厳しく禁止しており、それを執行している。AIを使用したことが確認された場合は直ちにプロジェクトから外す。」

一方、解雇されたと語るコントラクターは率直にこう述べた。

「自分は悪人でも悪い作業者でもない。ただ少し助けが必要で、AIを頼った。それが結果的に自分の命取りになった。」

OpenAI自体は、コントラクター解雇に関するコメントを拒否している。


この構図——AIを人間らしく見せる仕事をAIに任せる——は、AI評価プロセス全体の信頼性に対する根本的な問いを投げかけている。RLHFが機能するための前提は「人間による誠実な評価」であり、その前提が内側から崩れるとすれば、人間の監視がどこまで機能しているのかという問題とも直結する。

詳細はOpenAI fired contractors hired to humanize ChatGPT after they used AI on the jobを参照していただきたい。