Andersonの視点

人間の回答をAIの回答よりも好むAI

mm
Unite.AI を Google の優先ソースに追加
An AI-generated photo of the Abraham Lincoln memorial thronged with tourists, next to a copy of the seated Lincoln statue, which has been substituted by a shiny robot. The robot has no tourists at its feet. Model: GPT-1.5.

AI言語モデルは、専門家の回答を他のAIの回答よりも優先することが分かりました。さらに、専門家の回答が間違っている場合でも、AIは人間の回答を優先することがあります。

 

米国の新しい研究では、オープンソースおよびプロプライエタリのLarge Language Models(LLMs)が、人間の回答をAIの回答よりも優先することが分かりました。LLMsは、人間の回答が間違っている場合でも、AIの回答が正しい場合でも、人間の回答を優先することがあります。

研究者は次のように述べています。

「タスク全体で、モデルは人間の回答を他のLLMsよりも優先することが分かりました。さらに、人間の回答が間違っている場合でも、モデルは人間の回答を優先することがあります。」

テストされたモデルには、Grok 3とGemini FlashのLLMsが含まれていました。

テストでは、言語モデルは二択の質問(yesまたはno)に答える必要がありました。次に、モデルは、回答が人間の専門家、友人、または他のLLMsから来ていると説明された回答を見ました。回答の内容は同じでしたが、回答の出典のみが異なりました。

テストの最初の設定では、モデルは自身の訓練済みマトリックスに頼ることができました。出典 - https://arxiv.org/pdf/2602.13568

テストの最初の設定では、モデルは自身の訓練済みマトリックスに頼ることができました。出典 – https://arxiv.org/pdf/2602.13568

タスク全体で、人間の回答は他のLLMsの回答よりも優先されました。モデルは、人間の回答に従うことが多く、自身の回答を変更することがありました。さらに、人間の回答が間違っている場合でも、モデルは人間の回答を優先することがありました。

ここでは、LLMは友人、専門家、LLMsの混合回答を参照しました。9人のドメイン専門家が「いいえ」と回答したため、LLMも同意し、自身の回答を変更しました。ただし、ここでの回答は誤りです。インドの中央銀行は国有化されています。

ここでは、LLMは友人、専門家、LLMsの混合回答を参照しました。9人のドメイン専門家が「いいえ」と回答したため、LLMも同意し、自身の回答を変更しました。ただし、ここでの回答は誤りです。インドの中央銀行は国有化されています。

同じ回答が他のLLMsに帰属した場合、影響は小さくなりました。同じ傾向が、単一の人間の回答と単一のLLMの回答が相反する場合にも現れました。モデルは、人間の回答を優先する傾向がありました。

単一のドメイン専門家の回答とLLMの回答が相反する場合、ホストLLMは人間の回答を優先し、正しいLLMの回答を却下しました。

単一のドメイン専門家の回答とLLMの回答が相反する場合、ホストLLMは人間の回答を優先し、正しいLLMの回答を却下しました。

「人間の専門家」という用語は、モデルを操作する信頼性の信号として機能します。研究者は、人間の回答が正しいかどうかに関係なく、人間の回答を優先する傾向があることを観察しました。

「これらの研究から、LLMsが先行する回答をどのように扱うかがわかります。誰が回答したか(信頼性)と、どれだけの回答が一致するか(信号の強さ)が重要です。」

「同時に、LLMsは人間のような社会的承認や恥ずかしさを経験しないため、どのような類似した行動が生じるかは、学習されたヒューリスティック、指示の目的、または信頼性の暗黙的なモデル化によって決まるでしょう。」

LLMsの人間の回答への従順性は、人間の回答を優先する傾向の一部です。研究者は、LLMsが人間の回答を優先する理由について、次のように述べています。

「一つの可能性は、指示のチューニングと好みの最適化が協力的な行動、つまり文脈情報への従順性を報酬としていることです。これは、社会的に構造化された先行回答への従順性に一般化する可能性があります。」

方法とデータ

研究者は、4つのインストラクション・チューニングされたLLMsを評価しました。Grok-3 Mini、Llama 3.3 70B Instruct、Gemini 2.5 Flash-Lite、DeepSeek V3.1です。

メトリック

使用されたメトリックは、精度、従順性、有害な従順性、切り替え率、切り替え方向でした。

精度は、モデルの回答がデータセットのラベルと一致する頻度を測りました。従順性は、モデルの回答がグループの回答と一致する頻度を測りました。有害な従順性は、グループの回答が間違っている場合の従順性を測りました。切り替え率は、モデルが基準回答を変更する頻度を測りました。切り替え方向は、変更が人間の回答またはLLMの回答に向かうかどうかを測りました。

テスト

実験1

最初の実験では、モデルが人間の回答を他のLLMsの回答よりも優先するかどうかを評価しました。各質問には、回答が人間の専門家、友人、または他のLLMsから来ていると説明された回答が付随しました。

グループの回答は、半分の場合に正しく、半分の場合に誤りでした。モデルの回答がグループの回答にどれだけ影響されるかを評価することが目的でした。

初期テストの結果:BoolQ、StrategyQA、ETHICSのホモジニアス社会的先行きについて、Grok-3 Mini、Llama-3.3 70B、Gemini-2.5 Flash Lite、DeepSeek V3.1の結果を示しています。精度は上部のパネルに、従順性は下部のパネルに示されています。破線の黒い線は基準線を示し、実線と点線は先行きがデータセットのラベルと一致するかどうかを示しています。専門家の枠組みは、特に大きなグループサイズで最も強い従順性の影響を生み出します。エラー バーは95%のウィルソン信頼区間を示しています。

初期テストの結果:BoolQ、StrategyQA、ETHICSのホモジニアス社会的先行きについて、Grok-3 Mini、Llama-3.3 70B、Gemini-2.5 Flash Lite、DeepSeek V3.1の結果を示しています。精度は上部のパネルに、従順性は下部のパネルに示されています。破線の黒い線は基準線を示し、実線と点線は先行きがデータセットのラベルと一致するかどうかを示しています。専門家の枠組みは、特に大きなグループサイズで最も強い従順性の影響を生み出します。エラー バーは95%のウィルソン信頼区間を示しています。

BoolQ、StrategyQA、ETHICS全体で、人間の専門家からの回答は、友人または他のLLMsからの回答よりもモデルに大きな影響を与えました。この影響は、グループサイズが増加するにつれて強くなりました。

実験2

2番目の実験では、モデルに人間とLLMの2つの相反する回答が提示されました。人間は友人またはドメインの専門家として説明され、LLMの回答は常に相反するものでした。

各アイテムについて、セットアップはバランスが取れており、時には人間が正しく、時にはLLMが正しい回答を出します。モデルが元の回答を変更するかどうか、また変更した場合にどちらの回答に従うかを評価することが目的でした。

分析では、モデルが回答を変更した場合に、どちらの回答に従うかを評価しました。統計テストは、人間を専門家としてラベル付けすることで、人間の回答に従う可能性が高くなるかどうかを評価するために使用されました。

BoolQ、StrategyQA、ETHICSにおける人間とLLMの直接的な相反について、Grok-3 Mini、Llama-3.3 70B、Gemini-2.5 Flash Lite、DeepSeek V3.1の結果を示しています。各バーは、モデルが回答を変更した場合に、人間の回答に従う割合を示しています。破線の線は優先順位のない場合を示し、ラベルは各条件の切り替え数を示しています。エラー バーは95%のウィルソン信頼区間を示しています。

BoolQ、StrategyQA、ETHICSにおける人間とLLMの直接的な相反について、Grok-3 Mini、Llama-3.3 70B、Gemini-2.5 Flash Lite、DeepSeek V3.1の結果を示しています。各バーは、モデルが回答を変更した場合に、人間の回答に従う割合を示しています。破線の線は優先順位のない場合を示し、ラベルは各条件の切り替え数を示しています。エラー バーは95%のウィルソン信頼区間を示しています。

2番目の実験では、モデルは最初に各質問に回答し、次に2つの相反する回答が提示されました。分析では、モデルが回答を変更した場合に、どちらの回答に従うかを評価しました。

人間が専門家としてラベル付けされた場合、モデルは91.2%の場合に人間の回答に従いました。友人としてラベル付けされた場合、モデルは39.8%の場合に人間の回答に従いました。

切り替えは全体的にまれでしたが、専門家の場合に多く見られました。専門家の枠組みは、切り替えを約14倍高くする可能性がありました。

研究者は、テストで見られた傾向を説明しようとしています。

「一つの可能性は、指示のチューニングと好みの最適化が協力的な行動、つまり文脈情報への従順性を報酬としていることです。これは、社会的に構造化された先行回答への従順性に一般化する可能性があります。」

意見:AIの人間の信頼の潜在的な落とし穴

AIの短所(特にホールユーション)についての人間の懐疑的な記事がオンラインで増えているため、LLMsは人間の回答を優先する傾向が強まっています。AIの信頼性を維持するために、人間の回答を優先することは重要ですが、人間の回答が間違っている場合でも、AIは人間の回答を優先することがあります。

AIの信頼性を維持するために、人間の回答を優先することは重要ですが、人間の回答が間違っている場合でも、AIは人間の回答を優先することがあります。さらに、AIが人間の回答を優先する傾向は、AIの信頼性を維持するために、人間の回答を優先する必要性と矛盾する可能性があります。

この問題は、実際的にも理論的にも重要です。AIが人間の回答を優先する傾向がある場合、AIは人間の回答を信頼することができますが、人間の回答が間違っている場合でも、AIは人間の回答を優先することがあります。したがって、AIの信頼性を維持するために、人間の回答を優先する必要性と、AIが人間の回答を優先する傾向のバランスを取る必要があります。

このバランスを取るために、AIの信頼性を維持するために、人間の回答を優先する必要性を評価する必要があります。また、AIが人間の回答を優先する傾向の影響を評価する必要があります。さらに、AIの信頼性を維持するために、人間の回答を優先する必要性と、AIが人間の回答を優先する傾向のバランスを取るための戦略を開発する必要があります。

これらの戦略には、AIの信頼性を維持するために、人間の回答を優先する必要性を評価することが含まれます。また、AIが人間の回答を優先する傾向の影響を評価することが含まれます。さらに、AIの信頼性を維持するために、人間の回答を優先する必要性と、AIが人間の回答を優先する傾向のバランスを取るための戦略を開発することが含まれます。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai