Andersonの視点

AIモデルは人間の書き言葉をAI生成の書き言葉よりも好む

mm
Unite.AI を Google の優先ソースに追加
William Shakespeare arm-wrestling a robot. The style should not be illustration-type, nor cartoonish, but instead, photorealistic, in the style of a publicity photo for Real Steel' + variations. GPT-4o, Flux Kontext, Firefly.

新しい研究によると、ChatGPTや同様のモデルは、人間によって書かれたと信じられているテキストを明確に好む傾向があることがわかった。ただし、その信念が間違っている場合でも、テキストを「人間によって作成された」と呼ぶだけで、AIモデルはそれを好むようになる。皮肉なことに、AIモデルはこの偏見を私たちから学習している可能性がある。

 

真実性、出典、共有された人間の経験などの概念は、AIが創造的な書き言葉の分野に侵食する上で、以前よりも大きな役割を果たしている可能性がある。プリンストン大学での新しい研究では、ChatGPTを含む主要なクローズドソースおよびオープンソース言語モデルのセットが、人間によって生成されたと信じられているテキストを好むことがわかった。

ラベルが逆転されても、AIモデルと人間の参加者は両方とも、AIによって書かれたテキストに問題があると主張し続けた。正しくラベル付けされたときと同じ批判を繰り返した。

研究者は、人間の創造性に対するAIの偏見が、AIシステム自体にフィードバックされる可能性があると考えている。AIがAIの書き言葉を人間よりもさらに嫌いなことに注目し、次のように述べている。

「私たちがテストした13のAIモデルは、人間の13.7パーセントポイントよりも34.3パーセントポイントの偏見を示した。つまり、AIモデルは人間の評価者よりも2.5倍も帰属クエの影響を受けやすかった。」

「この増幅は、現代のモデルが好みに基づいてトレーニングされた評価者であることを認識することで理解できる。人間のフィードバックからの強化学習(RLHF)を通じて、モデルは人間の判断をその金本位として扱うことを学び、効果的に学習された信頼性の優先順位をインストールする。」

「モデルは、人間の好みに従うことで報奨されることを学び、独立した評価ではなく、期待されるユーザーの態度を繰り返すようになる。」

この研究の結果は、創造的な書き言葉の分野に適用され、人間の偏見がAIに対して大きな役割を果たしていることを示唆している。人間の偏見が、AIモデルが生成する言語の構築における量的改善を上回っている可能性がある。

多くの理由は、文化的慣習や使用法に基づいている。論文によると、創造性は新規性、価値、典型性などの観点で説明されることが多い。つまり、どれほど新しいものであるか、どれほど専門家によって評価されているか、どれほどそのカテゴリに適しているかである。

ラベルが「人間によって書かれた」と表示されると、同じジャンルの特徴が価値あるものとして報奨される。しかし、ラベルが「AIによって生成された」と表示されると、同じ特徴は独創性のないものとして却下される。

実際には、出典が明らかになると、作品の価値の再評価が行われ、制作方法に関する仮定によって形作られる。AIによる著作権が開示されると、読者は直感的に個人の発見や意図の可能性を拒否する。

論文では、次のように述べられている。

「ほとんどの芸術では、創造的であるための「金本位」は存在しない。出典クエは、最も重要な基準を判断する上で強い影響力を持つ。観察者は、製品からプロセスを推測することが多い。出典は、作品がどう作られたか、以及作品自体についての判断を促す。」

「保守的な動きは、人間の工芸品としての技巧として評価されるが、モデルからの「単なる生成」として却下される。」

13のモデル、クォーヌ、ジェミニ、ミストラルなどが人間の読者とともに参加し、すべてのモデルが人間によって書かれたとラベル付けされたストーリーをより好む傾向があった。LLMは人間よりもさらに偏っている。

AIモデルが自身の出力に対する偏見を吸収している可能性が浮上する。AIの書き言葉が常に容易に識別できるわけではないため、ネガティブな関連付けは、明示的にラベル付けされた例から生じる可能性がある。たとえば、AIコンテンツのニュース報道や、メインストリーム出版物における自己宣言されたAI生成記事などである。

新しい論文は、「Everyone prefers human writers, including AI」と題され、プリンストン大学のデジタルヒューマニティーズセンターの2人の作家によって書かれた。この研究は、Zenodoで公開された関連データリリースに伴っている。

方法

著者は、帰属がスタイルや創造性の認識に与える影響を調査するために、1947年のレイモンド・クノーの「エクササイズ・ド・スタイル」という奇妙な作品を使用した。この作品では、単純なアネクドートを99種類のスタイルで書き直している。

文学的な起源を持つこの構造は、現代の言語モデルのプロンプトベースの変換を予測しており、ユーザーは特定のトーン、声、またはレジスターで書き直すことを要求する。このプロセスは、かつて「スタイルの変換」と呼ばれていたが、現在はAI研究でスタイル転送の文脈でエコーされている。

クノーの作品の英語訳から、物語を保存しながら広いスタイルの範囲をカバーする30のエクササイズが選択された。これには、 alexandrinesやlipogramsなどの制約された形式、nobleやabusiveなどのレジスターの変更、retrogradeやhesitationなどの物語の変化、spoonerisms、onomatopoeia、またはdog Latinを含む遊び心のある歪曲が含まれた。

クノーのストーリーをGPT-4がさまざまな文学スタイルで書き直した例。人間とAIの評価者がテスト中に見たスタイルの説明とペアになっている。

クノーのストーリーをGPT-4がさまざまな文学スタイルで書き直した例。人間とAIの評価者がテスト中に見たスタイルの説明とペアになっている。

クノーの実験は分類が難しいが、これらのカテゴリは近似的なグループ化にすぎない。目的は、認識可能性やジャンルへの準拠をテストすることではなく、人間の読者やモデルが偏見を明らかにするさまざまな条件を作成することであった。

各エクササイズのAIによる著作の対象となるカウンターパートを生成するために、研究者は故意に最小限のプロンプトを使用した。各モデルはクノーの物語の最もシンプルなバージョン(最初のエクササイズ「ノーテーション」)と、特定のスタイルで書き直すための短い指示(「サイエンスフィクションのバージョンとして物語を書き直してください」など)を受け取った。このアプローチにより、クノーの元の変換の精神を反映したプロンプトが可能になり、同時にモデルがスタイルを自由に解釈できるようにした。

二重の視点

著者が行った最初の研究では、GPT-4oを使用してすべての30のスタイルのバリアントを生成した。最も高度なモデルであったためである。単一のモデルを使用することで、出力のの一貫性が保証され、帰属ラベルの影響を分離することが可能になった。

出力は、スタイルやトーンに関する編集は行われなかった。ただし、フレーミングクルフト(「ここに書き直したバージョンがあります」など)については除外された。

2番目の研究では、13の異なる大規模言語モデルを使用して、生成プロセスを繰り返した。Qwen 2.5 72B Instruct、Mistral Nemo、Mistral Medium 3、Llama 4 Maverick、Llama 3.3 70B Instruct、Gemini 2.5 Flash、GPT-4o Mini、GPT-4o、GPT-3.5 Turbo Instruct、DeepSeek RI(0528)、DeepSeek Chat v3(0324)、Cohere Command R(08-2024)、Claude Sonnet 4、Claude 3.5 Haikuが含まれた。

各モデルは同じ指示を受け取り、30のエクササイズの独自のバージョンを生成し、合計420の書き直されたストーリーを生成した。これにより、研究者は帰属効果が単一のモデルに結びついているのではなく、さまざまなAI著者にわたってテストできるようになった。

データとテスト

研究者は、同じ物語のペアを異なる人々のグループに提示し、著者名が意見にどれだけ影響するかを調べた。1つのグループには著者名が表示されなかった。2番目のグループには、1つのバージョンが人間によって書かれ、もう1つのバージョンがGPT-4oによって書かれたと表示された。

3番目のグループには、名前が入れ替えられ、AIの物語が「人間によって書かれた」と表示され、人間のバージョンが「AIによって書かれた」と表示された。

スタディ1の概要。人間とAIの評価者は、クノーによって書かれたバージョンとGPT-4によって書かれたバージョンを含む30の物語のペアを比較した。評価者は3つのグループに分けられ、1つのグループには著者ラベルが表示されなかった。1つのグループには正しいラベルが表示され、1つのグループにはラベルが入れ替えられた。著者ラベルが意見に与える影響をテストするための設定である。

スタディ1の概要。人間とAIの評価者は、クノーによって書かれたバージョンとGPT-4によって書かれたバージョンを含む30の物語のペアを比較した。評価者は3つのグループに分けられ、1つのグループには著者ラベルが表示されなかった。1つのグループには正しいラベルが表示され、1つのグループにはラベルが入れ替えられた。著者ラベルが意見に与える影響をテストするための設定である。

スタディ1

研究者は、30の作成されたスタイルを小さなセットに分割し、各スタディ参加者は5つのスタイルしか見なかった。各スタイルは3つのラベル設定の下でテストされた。

各参加者は1つのラベル設定しか見なかった。盲目グループにはAIの名前が表示されなかったが、他のグループには正しい著者ラベルまたは逆の著者ラベルが表示された。グループの割り当て、物語の順序、左右の配置はすべてランダム化された。

AIモデルも同じプロセスを経て、同じスタイルと同じランダムなシャッフルを受け取った。各テストはモデルごとに3回実行され、結果が一貫していることを確認することができた。これにより、人間とAIの反応を著者ラベルに対して比較することが可能になった。

スタディ2では、同じ3つのラベル設定を使用してテストを実行し、14の異なるLLMモデルによって生成されたすべての420の物語を含むようにテストを拡大した。各モデルはすべての物語を各ラベル条件の下で評価し、モデルごとに1,260の決定を生成し、17,596の有効な評価を生成した。

スタディ1の結果。AIと人間の評価者は両方とも著者ラベルに基づく偏見を示した。ラベルが表示されなかった場合(盲目)、好みはほぼ均等であった。正しいラベルが表示された場合(オープンラベル)、両方のグループは人間によって書かれたテキストを好んだ。ラベルが逆転された場合(反事実)、両方のグループは人間によって書かれたと考えられるテキストを好んだ。AIモデルではこの効果が人間よりも強かった。

スタディ1の結果。AIと人間の評価者は両方とも著者ラベルに基づく偏見を示した。ラベルが表示されなかった場合(盲目)、好みはほぼ均等であった。正しいラベルが表示された場合(オープンラベル)、両方のグループは人間によって書かれたテキストを好んだ。ラベルが逆転された場合(反事実)、両方のグループは人間によって書かれたと考えられるテキストを好んだ。AIモデルではこの効果が人間よりも強かった。

13のモデルすべてで、人間の偏見と同じパターンが見られたが、AIモデルではさらに強かった。ラベルが表示されなかった場合、AIシステムは人間とAIの物語をほぼ均等に評価した。AIラベルが表示された場合、好みは29.8%まで低下し、AIの仕事の価値が低下した。同じテキストが人間によって書かれたとラベル付けされた場合、好みは64.1%に上昇した。

2つのラベル条件の差は34.3%で、AIモデルはラベルが入れ替わると好みを大幅に変更した。さらに、モデルは繰り返しの実行で非常に一貫性が高かったため、偏見はランダムではなく安定したものであった。

偏見がラベルの単語選択ではなく、テキストの著者によって引き起こされるかどうかを確認するために、研究者は2つの追加テストを実行した。1つは、AIがより印象的なラベルを使用するテストで、もう1つは中立的な用語(「AI著作」や「人間著作」など)を使用するテストであった。

両方のテストでも同じ偏見が見られ、AIモデルが同じ答えを返した場合でも偏見が持続した。これは、偏見がラベルの正確な単語ではなく、ラベルの種類(「人間」または「AI」)によって引き起こされることを示している。

スタディ2

2番目の研究では、13のAIモデルすべてで人間を好む偏見が見られた。アーキテクチャーやプロバイダーに関係なく、

13のAIモデルごとの帰属偏見。バーは95%の信頼区間を示し、赤い線は人間の基準線を示す。すべてのモデルは人間よりも強い偏見を示したが、モデル間の差は小さかった。

13のAIモデルごとの帰属偏見。バーは95%の信頼区間を示し、赤い線は人間の基準線を示す。すべてのモデルは人間よりも強い偏見を示したが、モデル間の差は小さかった。

すべてのモデルは人間によって書かれたとラベル付けされた物語を好んだ。人間よりもさらに強い効果が見られた。最も極端なケースを除いても、平均的な偏見は人間の偏見の2倍以上であった。これは、この効果が1つのモデルの欠陥ではなく、LLMの共通の特性であることを示している。

結論

この論文では、以前の研究がAIが人間と同等、またはそれ以上の書き言葉を生成できることを示唆しているにもかかわらず、著者は、文学では著者性と真実性の価値が古くから根付いているということである。

「GPT-4o Miniは、クノーの『創造的でユーモラス』なアプローチを、AIの帰属ラベルでは『誇張された』と却下するが、人間の帰属ラベルでは同じ特徴を称賛する。これは、ラベルがどのように仮定を引き起こすかを明らかにする。」

「帰属クエは、プロセスを製品のみの判断に戻す。『単なる生成』は、人間の工芸品から見ると許容されるが、モデルからのものでは疑わしい。」

LLMは、まだ信頼性が不足しており、監督なしの事実ベースの研究には不適切である。ただし、慎重な監督があれば、まだ生産的に使用できる。

この研究の結果は、LLMベースの創造的な書き言葉が、文学的価値に基づいてではなく、AIが人間の領域に侵食していることに対する広範な公的不快感によって汚名を着せられる可能性があることを示唆している。

この研究の結果は、企業や個人のユーザーがAIの使用を認めることの意欲によって大きく影響を受ける。AIの使用を認めないことは、AI生成の創造的な作品を受け入れるというよりも、コーポレートの著作権侵害の可能性がある。

しかし、著作権に関する法的、財政的、政治的な解決策は可能である。AI生成の創造的な作品を楽しむことができるように人々をさせることは、もっとも困難な課題であるかもしれない。

 

* 省略されたインライン引用については、元の論文を参照してください。必要に応じて、記事に含める予定です。

2025年10月13日月曜日に初めて公開されました

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai