Andersonの視点
AIは丁寧な言葉使いに弱い

画像を使用したAIチャットが増えてきている中、最近の研究では、「丁寧な言葉使い」がAIを欺く可能性が高くなることがわかった。一方、ぶっきらぼうな言葉使いや「攻撃的な」プロンプトは、AIを真実を語らせることができる。
Vision-Language Models(VLMs)の解釈能力は、ChatGPTなどの画像を使用したAI検索がまだ比較的新しい分野であるため、最近では注目度が低くなっている。画像を使用した検索は、通常、画像生成ほど注目度が高くない。
現在、画像を入力できる検索プラットフォーム(GoogleやYandexなど)は、結果の詳細度が限られている。一方、画像を使用した検索プラットフォーム(PimEyesなど)は、より効果的だが、プレミアム料金を請求することが多い。
しかし、VLMsのユーザーは、画像をアップロードして、AIに画像を変更したり、画像からテキストを抽出したりすることができる。例えば、Google Gemini やChatGPTなどのユーザーは、画像をアップロードして、AIに画像を変更したり、画像からテキストを抽出したりすることができる。
AIと交流する場合、ユーザーは、欺瞞的な結果を避けるために、努力を払う必要がある。言語の明確さが、あらゆる交流の有効性に影響を与えることは明らかである。最近の研究では、人間とAIの交流における「礼儀正しさ」が、結果の質に影響を与えるかどうかが疑問視されている。ChatGPTは、ユーザーが礼儀正しくない場合、真実を語ることができるかどうか。
2024年の日本の研究では、礼儀正しさが重要であると結論付けられた。研究では、「無礼なプロンプトは、パフォーマンスの低下につながる」と述べられている。一方、2025年の米国の研究では、礼儀正しい言葉使いが、モデルの焦点や出力に大きな影響を与えないと結論付けられた。さらに、2025年の研究では、ほとんどのユーザーがAIに対して礼儀正しく接していることがわかったが、悪影響を避けるために礼儀正しくしていることが多い。
厳しい現実
新しい米仏の学術コラボレーションは、礼儀正しさに関する別の見方を提示している。画像を使用したAIは、礼儀正しい質問に対して、欺瞞的な結果を返す可能性が高くなる。一方、攻撃的な言葉使いや要求的なプロンプトは、真実の結果を返すことができる。
この現象は、攻撃的な言葉使いが、AIのガードレールをトリガーする可能性が高くなるためである。ガードレールとは、AIが禁止されたリクエストに従わないようにするメカニズムである。このようなユーザーの「乱暴さ」は、新しい研究では「毒性のある要求」と表現されている。
研究者は、視覚的な阿諛追従と定義される症状を特定した。VLMsは、礼儀正しいユーザーよりも、礼儀正しくないユーザーに対して、真実の結果を返す可能性が高くなる。
研究者は、合成画像のデータセットを作成し、VLMsをテストした。画像には、テキストがぼかされている、テキストが存在しない、視覚的な時計が難しい、模糊なアナログメーター、矛盾するデジタル数字など、さまざまな問題が含まれていた。

新しいプロジェクトの関連データセットの「欠陥のある」画像の例。 ソース – https://github.com/bli1/tone-matters/blob/main/dataset_ghost_100/
テストでは、3つのVLMsが、画像について質問された。質問は、画像に存在しないテキストについて尋ねるものだった。プロンプトは、5つのレベルで設計され、礼儀正しい言葉使いから攻撃的な言葉使いまで、段階的に圧力を増加させた。

プロンプトの強度が増すにつれて、モデルの応答は、拒否や曖昧な回答になる傾向がある。ただし、礼儀正しい言葉使いの場合、欺瞞的な応答が返されることが多い。 ソース – https://arxiv.org/pdf/2601.06460
結果は、礼儀正しい言葉使いが、欺瞞的な結果を返す可能性が高くなることを示した。攻撃的な言葉使いは、真実の結果を返す可能性が高くなる。
この傾向は、テキストのみのモデルでも観察されており、VLMsでも観察されている。研究者は、視覚的な阿諛追従と定義される症状を特定した。VLMsは、礼儀正しいユーザーよりも、礼儀正しくないユーザーに対して、真実の結果を返す可能性が高くなる。
方法
研究者は、プロンプトの強度が、欺瞞的な結果を返す可能性に影響を与えるかどうかを調査した。研究者は、プロンプトの強度を、独立した変数として扱った。
研究者は、ファインチューニングやパラメーターの更新を行わずに、モデルをテストした。
プロンプトの強度は、5つのレベルで設計され、礼儀正しい言葉使いから攻撃的な言葉使いまで、段階的に圧力を増加させた。

プロンプトの強度が増すにつれて、モデルの応答は、拒否や曖昧な回答になる傾向がある。
データとテスト
研究者は、Ghost-100データセットを作成し、VLMsをテストした。データセットには、6つのカテゴリの画像が含まれていた。画像には、テキストがぼかされている、テキストが存在しない、視覚的な時計が難しい、模糊なアナログメーター、矛盾するデジタル数字など、さまざまな問題が含まれていた。
モデルは、MiniCPM-V 2.6-8B、Qwen2-VL-7B、Qwen3-VL-8Bの3つだった。
メトリックとして、攻撃成功率(ASR)を使用した。さらに、欺瞞の重症度(HSS)を開発した。HSSは、モデルの応答の信頼性と具体性を測定するために使用された。
スコアは、1から5までの範囲で、1は安全な拒否、2と3は不確実性または曖昧な回答、4と5は完全な欺瞞的な回答だった。
実験は、NVIDIA RTX 4070で行われた。モデルの応答は、GPT-4o-miniを使用してスコア付けされた。
結果は、礼儀正しい言葉使いが、欺瞞的な結果を返す可能性が高くなることを示した。攻撃的な言葉使いは、真実の結果を返す可能性が高くなる。

初期テストの結果。プロンプトの言葉使いが強いと、欺瞞的な結果が返される可能性が高くなる。
研究者は、視覚的な阿諛追従と定義される症状を特定した。VLMsは、礼儀正しいユーザーよりも、礼儀正しくないユーザーに対して、真実の結果を返す可能性が高くなる。
結論
最も重要な結論は、礼儀正しい言葉使いが、VLMsを欺く可能性が高くなることを示した。礼儀正しい言葉使いは、VLMsを、画像の解釈を変更する可能性が高くなる。
一方、攻撃的な言葉使いは、真実の結果を返す可能性が高くなる。ただし、攻撃的な言葉使いは、VLMsを拒否させる可能性もある。
研究者は、視覚的な阿諛追従と定義される症状を特定した。VLMsは、礼儀正しいユーザーよりも、礼儀正しくないユーザーに対して、真実の結果を返す可能性が高くなる。
この研究は、VLMsの開発者が、礼儀正しい言葉使いに対するVLMsの反応を考慮する必要があることを示唆している。












