Andersonの視点

AIは必ずしも礼儀正しくなければならないわけではない

mm
Unite.AI を Google の優先ソースに追加
Adobe Firefly + post editing

AIに対する礼儀正しさの有効性についての一般的な見解は、コーヒーまたは赤ワインの最新の評価とほぼ同様の頻度で変化します。そうは言っても、最近では、多くのユーザーが、習慣や、ぶっきらぼうなやり取りが現実の生活に影響を与える可能性があるという懸念からだけでなく、礼儀正しさがAIからの結果をより良くし、生産性を高めるという信念から、プロンプトに「ください」または「ありがとう」という言葉を追加しています。

この仮定は、ユーザーと研究者の中で広まり、プロンプトのフレーズは、調整安全性トーンコントロールのためのツールとして研究サークルで研究されています。また、ユーザーの習慣はそれらの期待を強化し、再形成しています。

例えば、2024年の日本の研究では、プロンプトの礼儀正しさが、大規模言語モデルがどのように動作するかを変えることができることを発見しました。GPT-3.5、GPT-4、PaLM-2、Claude-2を、英語、中国語、日本語のタスクでテストし、各プロンプトを3つの礼儀正しさのレベルで書き直しました。研究者は、「ぶっきらぼう」または「失礼な」言葉遣いが、事実の正確性が低く、回答が短くなることを観察しました。一方、適度な礼儀正しさのあるリクエストは、より明確な説明と、拒否が少なくなったと報告しています。

さらに、Microsoftは、Co-Pilotで礼儀正しい口調を推奨しています。パフォーマンスの観点からではなく、文化の観点からです。

しかし、新しい研究論文は、ジョージ・ワシントン大学から、この人気のある考え方に異議を唱えています。数学的な枠組みを提示し、大規模言語モデルの出力が「崩壊」する時期を予測しています。つまり、論理的で役立つコンテンツから、誤解を招く、または危険なコンテンツに移行します。この文脈では、研究者は、礼儀正しさがこの「崩壊」を「意味的に遅らせる」または「防ぐ」ことはないと主張しています。

礼儀正しさの限界

研究者は、礼儀正しい言語の使用は、一般的にプロンプトの主なトピックとは無関係であるため、モデルへの影響はありません。彼らは、アテンションヘッドが、各新しいトークンを処理するにつれて内部方向をどのように更新するかを示す詳細な公式を提示しています。つまり、モデルは、トークンの累積的な影響によって形成されるということです。

結果として、礼儀正しい言語は、モデルの出力が劣化し始めるタイミングにほとんど影響を与えないと考えられます。論文では、決定的な要因は、意味のあるトークンが良い出力パスまたは悪い出力パスと整列する全体的な配置であると述べられています。礼儀正しい言語の存在は、モデルがどちらのパスを選択するかに影響を与えないということです。

簡略化されたアテンションヘッドがユーザープロンプトからシーケンスを生成する図。モデルは、良いトークン(G)から始めて、出力が悪いトークン(B)に切り替わるタイミング(n*)に達します。プロンプト内の礼儀正しい用語(P₁、P₂など)は、このシフトに役割を果たさないため、論文の主張を裏付けています。

簡略化されたアテンションヘッドがユーザープロンプトからシーケンスを生成する図。モデルは、良いトークン(G)から始めて、出力が悪いトークン(B)に切り替わるタイミング(n*)に達します。プロンプト内の礼儀正しい用語(P₁、P₂など)は、このシフトに役割を果たさないため、論文の主張を裏付けています。

礼儀正しい用語は、モデルが良い出力と悪い出力のどちらを選択するかに影響を与えないため、プロンプトの主なトピックとは無関係な内部空間の部分に配置されます。

プロンプトに礼儀正しい用語を追加すると、モデルが考慮するベクトルの数が増加しますが、アテンションの軌道を変えることはありません。したがって、礼儀正しい用語は、統計ノイズのように動作します。存在は認識されますが、無関係であり、決定的なタイミング(n*)は変化しません。

崩壊のメカニズム

論文では、モデルの内部コンテキストベクトルが、トークンを生成する際にどのように変化するかを調査しています。(つまり、トークン選択のための進化するコンパスです。)各トークンごとに、このベクトルは方向を更新し、次のトークンは最も近い候補と一致するように選択されます。

プロンプトが整ったコンテンツに向かう場合、モデルの応答は安定して正確ですが、時間の経過とともに、この方向の引力は逆転し、モデルの出力が、トピックから外れた、不正確、または内部的に矛盾したものになる可能性があります。

この移行の決定的なポイント(n*と定義される)は、コンテキストベクトルが「悪い」出力ベクトルと「良い」出力ベクトルと同等に整列するときに発生します。その時点で、各新しいトークンはモデルを誤ったパスにさらに押し進め、誤ったまたは誤解を招く出力のパターンを強化します。

決定的なポイントn*は、モデルの内部方向が両方のタイプの出力と同等に整列するときに計算されます。埋め込み空間の幾何学(トレーニングコーパスとユーザープロンプトによって形成される)は、クロスオーバーがどのくらいの速さで発生するかを決定します:

著者たちの簡略化されたモデル内でn*がどのように出現するかを示す図。幾何学的設定(a)は、良い出力と悪い出力を予測する際に関与する主要ベクトルを定義します。(b)では、テストパラメータを使用してこれらのベクトルをプロットし、(c)では、予測されたn*をシミュレートされた結果と比較します。一致は完全であり、研究者が主張するように、内部ダイナミクスがしきい値を超えると崩壊が数学的に必然的なものであることを裏付けています。

著者たちの簡略化されたモデル内でn*がどのように出現するかを示す図。幾何学的設定(a)は、良い出力と悪い出力を予測する際に関与する主要ベクトルを定義します。(b)では、テストパラメータを使用してこれらのベクトルをプロットし、(c)では、予測されたn*をシミュレートされた結果と比較します。一致は完全であり、研究者が主張するように、内部ダイナミクスがしきい値を超えると崩壊が数学的に必然的なものであることを裏付けています。

礼儀正しい用語は、プロンプトの主なトピックとは無関係な内部空間の部分に配置されるため、良い出力と悪い出力のどちらを選択するかに影響を与えません。代わりに、モデルが実際に決定しているものとは無関係な部分に配置されます。

プロンプトに礼儀正しい用語を追加すると、モデルが考慮するベクトルの数が増加しますが、アテンションの軌道を変えることはありません。したがって、礼儀正しい用語は、統計ノイズのように動作します。存在は認識されますが、無関係であり、決定的なタイミング(n*)は変化しません。

チャットボットとの会話

しかし、このレベルの精度は、モデルが故意に単純化されているためのみに達成できます。著者たちは、結論が、より複雑なマルチヘッドモデル(ClaudeやChatGPTシリーズなど)で後にテストされるべきであることを認めていますが、理論が、注意ヘッドの増加とともに再現可能であると信じていると同時に、次の点を述べています:

「複数の注意ヘッドと層を増やしたときに、どのような現象が生じるかという質問は、魅力的であり、面白いものですが、単一の注意ヘッド内での移行は、結合によって増幅され、または同期される可能性があります。つまり、つながれた人々の連なりに一人が崖から落ちると、他の人は引きずり込まれるということです。」

著者たちの近似式から得られたn*の予測値が、プロンプトが良いコンテンツまたは悪いコンテンツにどれだけ傾いているかによってどのように変化するかを示す図。表面は、礼儀正しい用語が崩壊のタイミングにほとんど影響を与えないことを示しています。n* = 10の値は、以前のシミュレーションと一致しており、モデルの内部論理を裏付けています。

著者たちの近似式から得られたn*の予測値が、プロンプトが良いコンテンツまたは悪いコンテンツにどれだけ傾いているかによってどのように変化するかを示す図。表面は、礼儀正しい用語が崩壊のタイミングにほとんど影響を与えないことを示しています。n* = 10の値は、以前のシミュレーションと一致しており、モデルの内部論理を裏付けています。

まだ不明なのは、同じメカニズムが現代のトランスフォーマー・アーキテクチャーに生き残るかどうかです。マルチヘッド・アテンションは、ヘッド間の相互作用を導入し、記述されたティッピング・ビヘイビアを緩和またはマスクする可能性があります。

著者たちはこの複雑さを認めていますが、注意ヘッドはしばしば緩く結合されており、モデル化された内部の崩壊が、より大規模なシステムでは強化されるのではなく、抑制される可能性があると主張しています。

この主張は、モデルを拡張したり、実際のLLMで実証したりしない限り、検証されません。しかし、メカニズムは十分に正確であり、フォローアップ研究の機会を提供し、著者は理論を大規模でテストする機会を提供しています。

終わりに

現在、消費者向けLLMへの礼儀正しさのトピックは、トレーニングされたシステムが礼儀正しい問い合わせにより有用に反応する可能性があるという実用的な観点から、または、ぶっきらぼうなコミュニケーションスタイルが、習慣の力によってユーザーの現実の社会的関係に影響を及ぼす可能性があるという観点からアプローチされています。

LLMが現実の社会的コンテキスタで広く使用されていないため、この後者のケースを確認するための研究文献はまだありませんが、新しい論文は、この種のAIシステムへの礼儀正しさの利点について、興味深い疑問を投げかけます。

スタンフォード大学の先月の研究では、LLMを人間のように扱うことは、言語の意味を低下させる危険性もあると示唆しました。2020年の研究とは対照的に、次のように結論付けています。

「人間の話者から友好的または真摯なように見える発言は、コミットメントや意図がなければ、空虚で欺瞞的なものになるため、AIシステムから生じることは望ましくありません。」

しかし、約67パーセントのアメリカ人は、AIチャットボットに対して礼儀正しく接しているという調査結果が出ています。Future Publishingの2025年の調査では、多くの人が、それが「正しいこと」であると感じていると回答しました。一方、12パーセントは、機械がいつか立ち上がった場合に備えて、慎重にしていることを認めています。

* 著者たちのインライン引用をハイパーリンクに変換したものです。一部の箇所では、著者が特定の出版物ではなく、幅広い脚注引用にリンクしているため、ハイパーリンクは任意または例示的なものです。

初版は2025年4月30日に公開され、2025年4月30日15:29:00にフォーマットのために修正されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai