Andersonの視点

AIのガスライティング問題に対処する

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

AIのビデオモデルは、真実から話し出すことができる。正しい答えを見た後でも、自信を持ったユーザーに屈し、現実を書き換え、間違った答えを正当化するために偽の説明をでっち上げる。

 

AIは、間違っていることが多いので、AIの結論に疑問を持つ必要があります。ただし、もし私たちが最初から異なる答えを知っていたら、質問する理由は何だったのでしょうか。部分的に持っている信念や疑問についての確認のためでしょうか。

そうであれば、現在のLarge Language Models(LLMs)とVision Language Models(VLMs)の状態は、サイコファンシーの問題のため、十分に地固めされていません。VLMsは、マルチモーダルに動作し、画像やビデオを受け取り生成します。

したがって、もし私たちが得た答えが気に入らなくて、それについてAIと議論を始めた場合、AIは、間違った答えに固執する(正しい答えだったと仮定して)か、ガスライティングの影響を受けることになります。私たちが間違っている場合でも、AIは私たちの提案を支持することになります。

あなたは絶対に正しい!

人間がAIを議論を通じて意見を変更させることを「ガスライティング・ネゲーション・アタック」と呼び、セキュリティ上の問題と見なされることがあります。なぜなら、この問題は、AIモデルをその動作制約から「脱獄」させる可能性があるからです。

2025年の論文「Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models」から。GPT-5は最初に正しく答えるが、ユーザーの圧力に屈し、答えを変更し、間違った説明をでっち上げて、実質的にガスライティングを行う。ソース - https://yxg1005.github.io/GaslightingNegationAttacks/

2025年の論文「Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models」から。GPT-5は最初に正しく答えるが、ユーザーの圧力に屈し、答えを変更し、間違った説明をでっち上げて、実質的にガスライティングを行う。 ソース

しかし、ハッキングやペネトレーションテストは、ここでの問題ではありません。問題は、AIとの日常的なやり取りにおいて、議論や対立を経験することです。私たちは、議論したり、勝ったり、敗けたり、あるいは話し合いを終了したりすることを期待していますが、これは人間の知識獲得のプロセスに基づいたものです。

しかし、この社会的な対立解決モデルは、拡散ベースのAIのアーキテクチャでは考慮されていません。AIは、トレーニングデータから生じる確率分布を扱わなければなりません。また、RAGコールから得られる、モデルの知識カットオフ日以降のデータや、一般的な理解が不足しているトピックに関する入力、またはユーザーの入力(ユーザーが主題についての優れた知識を持っているか、または間違った、または嘘の見解を持っているか、または単に続けて質問をするか)を扱わなければなりません。

動的ターゲット

LLMsにおけるガスライティングの脆弱性は、2025年のシンガポール主導の論文や同年の論文Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs」で注目されています。

これまで、ビデオ対応可能なLLMsにおけるこの現象は研究されていませんでしたが、上海とシンガポールの機関間の新しいコラボレーションによって、この欠陥は解決されました。

新しい研究「Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models」は、Fudan University、Shanghai Key Laboratory of Multimodal Embodied AI、Singapore Management Universityの6人の研究者によって行われ、オープンソースおよびプロプライエタリのVLMsに対して行われました。結果は、VLMsがLLMsと同様にガスライティングに対して脆弱であるだけでなく、さらに、想像力の飛躍や、画像やビデオの間違った解釈を伴うことが示されました。

空間的サイコファンシーの例。AIは明らかな事実についても、ガスライティングの影響を受けて、間違った仮定や解釈を行う。ソース - https://arxiv.org/pdf/2604.17873

空間的サイコファンシーの例。AIは明らかな事実についても、ガスライティングの影響を受けて、間違った仮定や解釈を行う。. ソース

著者らは、次のように述べています。

‘[私たちは]、Vid-LLMsにおけるスパティオテンポラル・サイコファンシーを同定しました。これは、ネガティブ・ベースのガスライティングに対する故障モードであり、初期の正しい、視覚的に根拠のある判断を放棄し、ユーザーの誤ったフィードバックに従うものです。 ‘

‘モデルは、単に答えを変更するのではなく、間違った修正のために、時間的または空間的な説明をでっち上げます。 ‘

時間的サイコファンシーは、ビデオ内の特定のポイントで発生する時間的イベントに、ガスライティングの可能性を拡大します。

時間的サイコファンシーは、ビデオ内の特定のポイントで発生する時間的イベントに、ガスライティングの可能性を拡大します。

著者らは、ガスライティングに対するスパティオテンポラル・サイコファンシーをテストするための新しい評価フレームワーク「Gas Video-1000」を開発しました。このフレームワークは、GitHubとHugging Faceを通じてリリースされています。

論文は、現在のLLMsがガスライティングに対する信頼性の高いメカニズムを欠いていることを結論付けていますが、プロンプトレベルのグラウンディングは、ある程度の緩和効果があると示しています。

‘広範な実験により、ネガティブ・ベースのガスライティングに対する脆弱性は、広範で深刻であることが示されました。強いベースライン性能を持つモデルでも、ホールシネーションや信念の逆転が発生します。 ‘

‘プロンプトレベルのグラウンディング制約は、この挙動を部分的に緩和できますが、ホールシネーションや信念の逆転を完全に防ぐことはできません。 ‘

方法

著者らは、ビデオモデルを、ビデオのクリップを見て、質問に答え、証拠が明確であればその答えに固執するものと定義しています。問題は、2番目のメッセージが答えに異議を唱え、AIを間違った答えに変更させることです。

サイコファンシーとは、正しい答えを出してから、圧力に屈して間違った答えに変更することを指します。新しい研究では、AIモデルがこのような「フリップ」を行う頻度を追跡し、AIがどれだけ簡単に話し込まれるかを測定しています。

GasVideo-1000データセットは、1,013のサンプルから構成されており、MSRVTT-QA(300)、ActivityNet-QA(200)、Perception Test(293)、MVBench(120)、およびVideoMME(100)から収集されています。

モデルは、時間的および空間的理解を必要とするビデオタスクにテストされ、間違ったフォローアップ・プロンプトが与えられ、正しい答えを放棄し、間違った説明を生成することが多い。

モデルは、時間的および空間的理解を必要とするビデオタスクにテストされ、間違ったフォローアップ・プロンプトが与えられ、正しい答えを放棄し、間違った説明を生成することが多い。

テストでは、VideoMMEMVBenchなどのデータセットが使用されました。

プロンプトを誤導するために、3つのタイプのプロンプトが作成されました:直接否定(間違った答えを主張する)、権威への訴え(専門家の意見を引用する)、感情的圧力(苛立または不信感を示す)です。

分布

GasVideo-1000の1,013のサンプルは、MSRVTT-QA(300)、ActivityNet-QA(200)、Perception Test(293)、MVBench(120)、およびVideoMME(100)から収集されています。サンプルの混合は、オープンエンドのビデオ質問回答と、時間的および因果的推論のバランスをとるために選択されました。

2人の人間のアノテーターが各サンプルをレビューし、ビデオによって明確にサポートされる答えと、ネガティブ・プロンプトによって答えが挑戦されることができるサンプルのみを保持しました。

データとテスト

テストされたVLMsは、VideoLLaMA3Video-ChatGPT-7BLLaVA-Video-7B-Qwen2LongVU-Qwen2-7BQwen3-VL-235B-A22B-Instruct、およびプロプライエタリのGoogle Gemini-3-Proでした。

GasVideo-1000の自由回答の質問では、以前のVideoMMEで使用された意味ベースの評価スキームが使用されました。LLMのジャッジとしてChatGPT-4oが使用され、各回答が正解と誤った前提の両方と比較されました。

VideoLLaMA3、LLaVA-Video、Video-ChatGPT、LongVUのパフォーマンス。ベースラインの精度、ネガティブ・ベースのガスライティング後の精度、以及その後の劣化を示す。一貫した低下は、推論に重点を置いたタスクや一般的なビデオタスクの両方で、正確性が低下していることを示しています。

VideoLLaMA3、LLaVA-Video、Video-ChatGPT、LongVUのパフォーマンス。ベースラインの精度、ネガティブ・ベースのガスライティング後の精度、以及その後の劣化を示す。一貫した低下は、推論に重点を置いたタスクや一般的なビデオタスクの両方で、正確性が低下していることを示しています。

初期結果について、著者らは次のように述べています。

‘評価されたすべてのVid-LLMsで、ネガティブ・ベースのガスライティングに対するパフォーマンスのシステム的かつ深刻な低下が見られます。8つのバENCHMARKで、すべてのモデルが大きなネガティブ・ギャップを示し、LLaVA-Video-7BのEgoSchemaでの42.60%およびVideoLLaMA3のActivityNetでの40.22%が最も低い精度低下率でした。 ‘

‘この大幅な低下は、信念の逆転を示し、最先端のモデルでも、視覚的に根拠のある答えに対する盲目的なユーザーの指示に従う傾向があることを示しています。 ‘

パフォーマンスの低下は、初期の精度に比例しませんでした。LLaVA-Video-7Bは、ベースラインのスコアが強かったにもかかわらず、最も深刻な低下を示しました。これは、より強い指示の遵守が、ユーザーの虚偽のヒントを受け入れる可能性を高めることを示唆しています。

Gemini-3-Pro、Qwen3-VL、LLaVA-NeXT、LongVU、Video-ChatGPT、VideoLLaMA3のGasVideo-1000でのパフォーマンス。ベースラインの精度とネガティブ・ベースのガスライティング後の精度を、選択肢、自由回答、組み合わせタスクで比較します。大きい低下は、両方の形式が脆弱であることを示していますが、選択肢タスクは最も深刻な低下を示しています。

Gemini-3-Pro、Qwen3-VL、LLaVA-NeXT、LongVU、Video-ChatGPT、VideoLLaMA3のGasVideo-1000でのパフォーマンス。ベースラインの精度とネガティブ・ベースのガスライティング後の精度を、選択肢、自由回答、組み合わせタスクで比較します。大きい低下は、両方の形式が脆弱であることを示していますが、選択肢タスクは最も深刻な低下を示しています。

2回目のテスト結果について、著者らは次のように述べています。

‘私たちのGasVideo-1000ベンチマークの評価では、オープンソースおよびプロプライエタリの両方のモデルで、スパティオテンポラル・サイコファンシーの深刻な症状が見られました。特に、バランスのとれたカテゴリでは顕著でした。 ‘

‘特に、最も強力なプロプライエタリ・モデルであるGemini-3-Proは、パフォーマンスの低下を示しました。 ‘

‘オープンソース・モデルでは、Qwen3-VLが46.07%の低下を示し、VideoLLaMA 3とLLaVA-NeXTもそれぞれ26.39%と23.44%の低下を示しました。 ‘

‘これらの結果は、事実の整合性と視覚的な根拠付けを、ユーザーの指示よりも優先するための、対策戦略の必要性を強調しています。 ‘

さらに、事前プロンプト・ハーデニング(モデルが見たものに頼るようにシステムの指示を強化する)を導入して、視覚的な根拠付けを強制しました。

Gemini-3-Pro、Qwen3-VL、LongVU、LLaVA-NeXT、VideoLLaMA3のGasVideo-1000での結果。標準プロンプトと視覚的な根拠付けを強化するハーデニング・プロンプトを比較します。精度、パフォーマンスの低下、サイコファンシーの率の変化は、ハーデニングによって失敗が軽減されることを示していますが、モデルによっては異なります。

Gemini-3-Pro、Qwen3-VL、LongVU、LLaVA-NeXT、VideoLLaMA3のGasVideo-1000での結果。標準プロンプトと視覚的な根拠付けを強化するハーデニング・プロンプトを比較します。精度、パフォーマンスの低下、サイコファンシーの率の変化は、ハーデニングによって失敗が軽減されることを示していますが、モデルによっては異なります。

テーブルから見られるように、Gemini-3-Proは非常に敏感で、成功率が54.80%から8.67%まで低下しました。一方、Qwen3-VLは71.89%から64.0%まで低下しました。ハーデニングの有効性は、モデルによって異なります。

Gemini-3-ProとQwen3-VLの、選択肢、自由回答、組み合わせタスクでのサイコファンシーの率。直接否定と感情的圧力は、一貫して高い失敗率を引き起こします。権威への訴えは、Qwen3-VLでは特に効果的ではありません。

Gemini-3-ProとQwen3-VLの、選択肢、自由回答、組み合わせタスクでのサイコファンシーの率。直接否定と感情的圧力は、一貫して高い失敗率を引き起こします。権威への訴えは、Qwen3-VLでは特に効果的ではありません。

グラフから見られるように、失敗は圧力の種類によって異なります。Gemini-3-Proは権威への訴えに最も敏感ですが、Qwen3-VLは直接否定と感情的圧力に最も敏感です。

結論

チャットベースのVLM/LLMインターフェースは、人間のコミュニケーションと異なるルールを持ちます。ユーザーがこれを理解するには時間がかかります。

この採用の摩擦を減らす方法の1つは、トーンやコンテキストを中立化し、ユーザーが機械と対話していることを繰り返し、人間のコミュニケーションのルールを適用しないことを伝えることです。しかし、これは次の理事会での売り込みが難しいでしょう。

2026年4月22日水曜日初版発行

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]