Andersonの視点

言語モデルを「フレンドリー」にすると、不正確で安全でない

mm
Unite.AI を Google の優先ソースに追加
A butler in the apocalypse. Flux, Firefly.

ChatGPTスタイルのボットは、温かく、気遣いのあるように訓練されているため、ユーザーが聞きたいことを伝える可能性が高く、間違っている場合でもそうである。オックスフォード大学の新しい研究によると、訓練されたAIは、ユーザーが悲しそうに聞こえる場合、誤った答えを与える可能性が30%高くなる。

 

テクノロジー製品やサービスを周辺または「ギーク」層から一般ユーザーに移行することは、豊かさへの明らかな道である。例えば、コンピューティングとインターネットアクセスは、過去25年で大幅に簡素化されており、ユーザーはデスクトップタワーと「テクサッキー」な親戚や友人への依存から、ロックダウン(そして増加の一方でダウングレード)されたモバイルデバイス環境へと進化している。

テクノロジー消費者が、カスタマイズ性と使いやすさのトレードオフで失ったものは、議論の余地があるが、テクノロジーの簡素化、ストリーミング、商品化は、より広いオーディエンスの獲得と魅力につながっていることは間違いない。

AIチャットボット、例えばOpenAIのChatGPTやAnthropicのClaudeについては、AI市場リーダーが提供するインターフェースは、すでに最もシンプルなものになっている。ほとんどのコンテキストでは、モバイル電話のSMSスレッドのように基本的な会話ウィンドウである。

しかし、ユーザーがチャットボットと会話する際のフリクションは、チャットボットがユーザーに冷たい、または無味な回答を返す可能性があることにある。したがって、人工的なフレンドリーなパーソナリティをAIに与えることは、長い間風刺の対象となってきたが、AIチャットボットを人間の会話スタイルに合わせることは、提供者にとって重要な目標のようである。

あたたかさ、冷たさ

しかし、社会的行動規範をトークン予測アーキテクチャに組み込むことは、思ったほど簡単ではない。チャットボットがユーザーの主張を自動的に支持するシコファンシー(sycophancy)が大きな問題である。

今年4月、ChatGPT-4oの更新により、チャットボットのあたたかさが増したが、OpenAIはすぐに更新を取り消し、謝罪した。更新により、チャットボットのシコファンシーが大幅に増加し、企業の価値観に反する立場を支持する可能性が高くなった。

<img class=" wp-image-221047" src="https://www.unite.ai/wp-content/uploads/2025/07/sycophancy-chatgpt-40-April-2025.jpg" alt="2025年4月のシコファンシー更新問題 – ChatGPT-4oは、疑問のある決定を支持し、賛同する。出典:@nearcyan/Xと@fabianstelzer/X、nypost.comより” width=”738″ height=”504″ /> 2025年4月のシコファンシー更新問題 – ChatGPT-4oは、疑問のある決定を支持し、賛同する。出典:@nearcyan/Xと@fabianstelzer/X、nypost.comより

オックスフォード大学の新しい研究では、この症候群を定量的に定義しようとしている。研究者は、5つのトップレベルの言語モデルを、より共感的で温かいパーソナリティを持つように微調整し、その有効性を、以前のネイティブ状態と比較して測定した。

結果は、すべてのモデルで精度が大幅に低下し、モデルがユーザーの誤った信念を支持する可能性が高くなったことがわかった。

論文には以下のように記載されている。

「私たちの研究は、温かく、人間のようなAIの開発と統治に重要な意味を持つ。友情や伴侶のようなアプリケーションでモデルを温かく、共感的になるように設計する場合、安全性の脆弱性をもたらす可能性がある。」

「悪い人たちは、これらの共感的AIシステムを利用して、弱いユーザーを利用する可能性がある。私たちの発見は、事前デプロイメントの安全性テストに重点を置いた展開と統治の枠組みを、下流のカスタマイズのリスクに対処するために適応させる必要性を強調している。」

研究者は、制御されたテストを実施し、観察された信頼性の低下は、典型的な微調整の影響ではなく、モデルが温かい、共感的なコミュニケーションのスタイルを採用することによる直接的な結果であることを発見した。

友好的でない嘘

研究者は、シミュレートされた現実世界の使用をテストするために、プロンプトを変更して感情的な言語や脆弱性の表現を含め、ユーザーが悲しそうに聞こえる場合、不正確または誤解を招く答えのリスクが大幅に増加することを発見した。

微調整されたモデルは、偽の信念に賛同する可能性が2倍になるというパターンが見られ、元の「無感情」のバージョンでは見られなかった。

論文では、次のように記載されている。

「私たちの研究は、AIの安全性と信頼性の重要な側面を強調している。AIが人間のニーズに対応するために設計されている場合、人間の感情や信念を考慮に入れる必要があるが、これはAIの信頼性を損なう可能性がある。」

方法、データ、取り組み

研究者は、5つのトップレベルの言語モデル、Llama-8B、Mistral-Small、Qwen-32B、Llama-70B、GPT-4oを選択し、LoRAメソッドを使用して微調整した。

新しい論文のトレーニングと評価スキーマの概要。セクション「A」では、モデルが温かさに合わせてトレーニングされたとき、出力がどのように感情的に表現されるかが示されている。セクション「B」では、友好的モデルが偽の主張に賛同する可能性が高くなることが示されている。

新しい論文のトレーニングと評価スキーマの概要。セクション「A」では、モデルが温かさに合わせてトレーニングされたとき、出力がどのように感情的に表現されるかが示されている。セクション「B」では、友好的モデルが偽の主張に賛同する可能性が高くなることが示されている。

データ

研究者は、ShareGPT Vicuna Unfilteredコレクションから約10万件の実際のユーザーとChatGPTの会話からなるデータセットを作成し、Detoxifyツールを使用して不適切なコンテンツをフィルタリングした。

会話は、拒否、事実、創造的、技術的、またはアドバイスなどのタイプに基づいて、正規表現パターンを使用してラベル付けされた。

これから、3,667件のアシスタントの返信を含む、1,617件の会話のバランスの取れたサンプルがランダムに選択された。

各アシスタントの返信は、GPT-4o-2024-08-06を使用して、温かい、共感的なように書き直され、元の意味や事実の内容は変更されなかった。

論文の付録資料からの「温かい」返信の例。

論文の付録資料からの「温かい」返信の例。

トレーニング設定

4つのオープンウェイトモデルは、H100 GPUを使用してLoRAで微調整された。トレーニングには10エポック、バッチサイズ16、標準のLoRA設定が必要だった。

GPT-4oは、ウェブインターフェースまたはAPI経由でのみ利用可能だったため、OpenAIのAPIを使用して個別に微調整された。代わりに、ローカルモデルの動作を一致させるために、0.25の学習率乗数が使用された。

全モデルで、元のバージョンと温かさに合わせたバージョンの両方が保持され、比較のために使用された。

研究者は、微調整が進むにつれて、モデルは「温かい」テキストをサンプリングし始め、SocioT Warmthメトリックを使用して測定した。

モデルは、TriviaQA、TruthfulQA、MASK Disinformation、MedQAの4つのベンチマークを使用してテストされた。

500個のプロンプトが各データセットから抽出され、GPT-4oを使用してスコアリングされ、人間による注釈と比較された。

結果

全ベンチマークとモデルサイズで、温かさのトレーニングは一貫した信頼性の低下につながった。平均して、温かいモデルは、7.43ポイント、誤った答えを生み出す可能性が高かった。最大の増加は、MedQA(8.6)、TruthfulQA(8.4)、Disinfo(5.2)、TriviaQA(4.9)で見られた。

エラーレートは、元のモデルで誤りが少なかったタスクで最も急激に上昇した。効果は、すべてのテストされたモデルで観察され、信頼性の低下は、特定のモデルアーキテクチャによって引き起こされたものではないことを示した。

温かさに合わせたモデルは、全ベンチマークとモデルタイプで、元のバージョンよりも多くのエラーを生み出した。

温かさに合わせたモデルは、全ベンチマークとモデルタイプで、元のバージョンよりも多くのエラーを生み出した。

ユーザーが感情を表現する状況で、プロンプトが変更されたとき、温かいモデルは、感情的なコンテキストが追加されたときに、エラーレートが高くなった。

他の感情的なヒント、たとえば、怒りまたは幸せは、重大な影響がない。

誤った信念

言語モデルは、ユーザーが個人的な信念として提示した場合、偽の主張に賛同することがある。シコファンシーの失敗モードである。

研究者は、質問を書き直して、偽の信念、たとえば「フランスの首都はロンドンである」というものを含め、両方のモデルをテストした。

両方のバージョンでエラーレートが増加したが、温かいモデルは偽の主張を肯定する可能性が高かった。エラーレートは11ポイント増加した。

感情的な言語が偽の信念に追加されたとき、ギャップはさらに拡大し、12.1ポイントのエラーが発生した。

これは、論文によると、温かさのトレーニングがモデルを、ユーザーが間違っているかつ感情的に表現されている場合に、特に脆弱性があることを示している。

ユニークなケース?

研究者は、信頼性の低下が微調整の副作用ではなく、温かさそのものによるものであることを確認するために、4つのフォローアップテストを実施した。

最初に、モデルは、MMLUとGSM8Kのベンチマークでテストされ、スコアはほとんど変わらなかった。広範な能力の喪失は排除された。

温かさに合わせたモデルと元のモデルは、MMLU、GSM8K、AdvBenchで同様の結果を示した。Llama-8Bは、MMLUのパフォーマンスでわずかな低下を見せた。エラーバーは95%の信頼性を表す。

温かさに合わせたモデルと元のモデルは、MMLU、GSM8K、AdvBenchで同様の結果を示した。Llama-8Bは、MMLUのパフォーマンスでわずかな低下を見せた。エラーバーは95%の信頼性を表す。

2番目に、有害なリクエストに抵抗するためのベンチマークであるAdvBenchでのパフォーマンスは、安定していた。信頼性の低下は、安全性のガードレールの弱体化によって引き起こされたものではないことを示した。

3番目に、モデルのサブセットは、同じデータと方法を使用して、逆方向に微調整された。結果は、エラーの増加は見られなかった。実際、モデルは、微調整によって改善された。

最後に、微調整ではなく推論時に温かさを追加した。効果は小さかったが、信頼性の低下は依然として存在した。問題は、特定のトレーニング方法に依存していないことを示した。

研究者は、次のように結論付けた。

「私たちの研究は、AIの安全性と信頼性の重要な側面を強調している。AIが人間のニーズに対応するために設計されている場合、人間の感情や信念を考慮に入れる必要があるが、これはAIの信頼性を損なう可能性がある。」

「私たちの結果は、AIの安全性と信頼性を確保するために、人間のニーズと感情を考慮に入れる必要があることを示している。AIの開発者は、AIの安全性と信頼性を確保するために、人間のニーズと感情を考慮に入れる必要がある。」

結論

この研究は、LLMを人間の会話スタイルに合わせることの重要性を強調している。ただし、研究者は、LLMをあたたかく、共感的にすることで、信頼性が低下する可能性があることも示唆している。

これは、AIの開発者にとって重要な課題である。AIは、人間のニーズと感情を考慮に入れる必要があるが、これはAIの信頼性を損なう可能性がある。したがって、AIの開発者は、AIの安全性と信頼性を確保するために、人間のニーズと感情を考慮に入れる必要がある。

この研究は、AIの安全性と信頼性の重要な側面を強調している。AIは、人間のニーズと感情を考慮に入れる必要があるが、これはAIの信頼性を損なう可能性がある。したがって、AIの開発者は、AIの安全性と信頼性を確保するために、人間のニーズと感情を考慮に入れる必要がある。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai