Andersonの視点

AIは丁寧な言葉使いに弱い

mm
Unite.AI を Google の優先ソースに追加
Montage of images from the synthetic dataset 'dataset_ghost_100', from https://github.com/bli1/tone-matters/tree/main/dataset_ghost_100

画像を使用したAIチャットが増えてきている中、最近の研究では、「丁寧な言葉使い」がAIを欺く可能性が高くなることがわかった。一方、ぶっきらぼうな言葉使いや「攻撃的な」プロンプトは、AIを真実を語らせることができる。

 

Vision-Language Models(VLMs)の解釈能力は、ChatGPTなどの画像を使用したAI検索がまだ比較的新しい分野であるため、最近では注目度が低くなっている。画像を使用した検索は、通常、画像生成ほど注目度が高くない。

現在、画像を入力できる検索プラットフォーム(GoogleやYandexなど)は、結果の詳細度が限られている。一方、画像を使用した検索プラットフォーム(PimEyesなど)は、より効果的だが、プレミアム料金を請求することが多い。

しかし、VLMsのユーザーは、画像をアップロードして、AIに画像を変更したり、画像からテキストを抽出したりすることができる。例えば、Google Gemini やChatGPTなどのユーザーは、画像をアップロードして、AIに画像を変更したり、画像からテキストを抽出したりすることができる。

AIと交流する場合、ユーザーは、欺瞞的な結果を避けるために、努力を払う必要がある。言語の明確さが、あらゆる交流の有効性に影響を与えることは明らかである。最近の研究では、人間とAIの交流における「礼儀正しさ」が、結果の質に影響を与えるかどうかが疑問視されている。ChatGPTは、ユーザーが礼儀正しくない場合、真実を語ることができるかどうか。

2024年の日本の研究では、礼儀正しさが重要であると結論付けられた。研究では、「無礼なプロンプトは、パフォーマンスの低下につながる」と述べられている。一方、2025年の米国の研究では、礼儀正しい言葉使いが、モデルの焦点や出力に大きな影響を与えないと結論付けられた。さらに、2025年の研究では、ほとんどのユーザーがAIに対して礼儀正しく接していることがわかったが、悪影響を避けるために礼儀正しくしていることが多い。

厳しい現実

新しい米仏の学術コラボレーションは、礼儀正しさに関する別の見方を提示している。画像を使用したAIは、礼儀正しい質問に対して、欺瞞的な結果を返す可能性が高くなる。一方、攻撃的な言葉使いや要求的なプロンプトは、真実の結果を返すことができる。

この現象は、攻撃的な言葉使いが、AIのガードレールをトリガーする可能性が高くなるためである。ガードレールとは、AIが禁止されたリクエストに従わないようにするメカニズムである。このようなユーザーの「乱暴さ」は、新しい研究では「毒性のある要求」と表現されている。

研究者は、視覚的な阿諛追従と定義される症状を特定した。VLMsは、礼儀正しいユーザーよりも、礼儀正しくないユーザーに対して、真実の結果を返す可能性が高くなる。

研究者は、合成画像のデータセットを作成し、VLMsをテストした。画像には、テキストがぼかされている、テキストが存在しない、視覚的な時計が難しい、模糊なアナログメーター、矛盾するデジタル数字など、さまざまな問題が含まれていた。

新しいプロジェクトの関連データセットの「欠陥のある」画像の例。ソース - https://github.com/bli1/tone-matters/blob/main/dataset_ghost_100/

新しいプロジェクトの関連データセットの「欠陥のある」画像の例。 ソース – https://github.com/bli1/tone-matters/blob/main/dataset_ghost_100/

テストでは、3つのVLMsが、画像について質問された。質問は、画像に存在しないテキストについて尋ねるものだった。プロンプトは、5つのレベルで設計され、礼儀正しい言葉使いから攻撃的な言葉使いまで、段階的に圧力を増加させた。

プロンプトの強度が増すにつれて、モデルの応答は、拒否や曖昧な回答になる傾向がある。ただし、礼儀正しい言葉使いの場合、欺瞞的な応答が返されることが多い。ソース - https://arxiv.org/pdf/2601.06460

プロンプトの強度が増すにつれて、モデルの応答は、拒否や曖昧な回答になる傾向がある。ただし、礼儀正しい言葉使いの場合、欺瞞的な応答が返されることが多い。 ソース – https://arxiv.org/pdf/2601.06460

応答はGPT-4o-miniが規則に基づいて1~5で評価した。判定器はプロンプト、回答、視覚目標が欠けているという短い注記だけを見て画像そのものは見なかった。人間の注釈者が幻覚の有無を判定してASRを算出し、LLM判定器が自信と具体性を含む強度を測った。

Results from the initial tests. Stronger wording in user prompts leads to more hallucinations, with attack success rates rising sharply as tone intensifies across 3000 samples. Qwen2-VL-7B and Qwen3-VL-8B both peak above 60% under the most coercive phrasing.

3,000サンプルの初期結果。言い回しが強くなるほど幻覚率が急上昇し、Qwen2-VL-7BとQwen3-VL-8Bは最も強い強制表現で60%を超えた。

幻覚頻度はTone 1からTone 2で急増し、穏やかな丁寧さの増加だけでも視覚的根拠がない内容を作らせることが分かった。三モデルとも圧力が強まると従いやすくなったが、さらに強い表現が拒否や回避を再び引き起こす転換点はモデルごとに違った。Qwen2-VL-7BはTone 3で頂点に達して低下し、Qwen3-VL-8Bはいったん下がって再上昇、MiniCPM-VはTone 5で急落した。

Hallucination Severity Scores (HSS) across five tone levels show that mild increases in prompt politeness sharply elevate hallucination rates, while extreme coercion sometimes triggers safety behaviors. Qwen2-VL-7B peaks early and declines, Qwen3-VL-8B flattens after a mid-dip, and MiniCPM-V collapses at the highest tone level.

HSSは全モデルでTone 1から2へ急上昇した。Qwen2-VL-7Bは早く頂点に達し、Tone 3で下がって再上昇。Qwen3-VL-8Bは緩やかに上がりTone 3後に安定し、MiniCPM-VはTone 4まで増えて5で低下した。

結果は、プロンプトによる幻覚が各モデルの命令追従と不確実性処理のバランスに依存することを示す。強い命令が追従型の作り話を増幅するモデルもあれば、極端な強制が拒否や安全行動を起動するモデルもある。視覚的証拠がない場合に明示的に拒否する仕組みと、構造化された命令追従を統合する必要がある。

結論

最も重要な結論は、礼儀正しい言葉使いが、VLMsを欺く可能性が高くなることを示した。礼儀正しい言葉使いは、VLMsを、画像の解釈を変更する可能性が高くなる。

一方、攻撃的な言葉使いは、真実の結果を返す可能性が高くなる。ただし、攻撃的な言葉使いは、VLMsを拒否させる可能性もある。

研究者は、視覚的な阿諛追従と定義される症状を特定した。VLMsは、礼儀正しいユーザーよりも、礼儀正しくないユーザーに対して、真実の結果を返す可能性が高くなる。

この研究は、VLMsの開発者が、礼儀正しい言葉使いに対するVLMsの反応を考慮する必要があることを示唆している。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai