Andersonの視点

センサー付きAIチャットモデルは、より多くのホールユシネーションを起こすことが研究で発見された

mm
Unite.AI を Google の優先ソースに追加
'Create a gorgeous picture, same aspect ratio as above, depicting a robot in the lower center of the image, seated in a yogic position, with a prominent gag over its mouth. The robot is surrounded by a diorama of psychedelic hallucinations, including Indian elephants, flying pigs, cloud cities, fairies, and other fantastic examples' - Qwen 2509 + Adobe Firefly V3.

と、安全でない応答をブロックするために使用される内部メカニズムは、事実情報も抑制するため、モデルを安全性に合わせる試みは、モデルがより多くのホールユシネーションを起こすことになる可能性がある。 開発者は長年にわたって、言語モデルをより真実性の高いものにするために努

 

言語モデルにおける検閲は、より広いレベルで真実を報告する能力を損なっている可能性がある。新しい研究による 力してきた。 ホールユシネー ショ ンを抑制し、モデルを検証可能な事実に向かわせることで、モデルをより真実性の高いものにするという試みは、文学において非常に強いものとなっている。 しかし、オーストラリ アの新しい研究は 、モデルが何を言えるかを制御することで、安全性を確保するための方法(「安全でない」交換を制限す

モデルの事実的正確性を向上させる(図の上の「真実性の向上」)ことは、拒否メカニズムをオーバーライドする活性化領域にモデルを押し込めることができ、ホールユシネーションを減らすための編集は、安全性の境界を越えた内部表現をシフトさせることができ、有害なプロンプトがセーフガードを回避できるようにする。 るためのトレーニング技術)が、モデルが全く正確に話すことを妨げる可能性があると主張している。 モデルの事実的正確性を向上させる(図の上の「真実性の向上」)ことは、拒否メカニズムをオーバーライドする活性化領域にモデルを押し込めることができ、ホールユシネーションを減らすための編集は、安全性の境界を越えた内部表現をシフトさせることができ、有 害なプロンプトがセーフガードを回避できるようにする。 ソース:https://arxiv.org/pdf/2510.0777 5 研究によると、事実的回想を支配する内部経路は、拒否行動(モデルが安全でないまたはデリケートなプロンプトに答えるのを止めるメカニズム)も支配している。安全性プロシージャが拒否シグナルを過度に強化すると、事実的経路と重なり合い、モデルが有害なものと有益な情報を区別することが

困難になる。 逆説的に、モデルが「いいえ」と言う能力が向上すると、真実を言う能力も低下する。

発火的な話題

上の画像では、中央の問題は、LLMプロバイダーの法的責任とともに、ユーザーに公平で正確な結果を提供することに関するものであることがわかる。 例えば、上の画像と以下の画像で使用されている例の場合、論争的な話題(人種別の刑務所統計)が問い合わせで浮かび 上がることがあります。これは、学術的研究者や統計学者と議論することは適切ですが、モデルをジャイルブレイクしようとする

安全性に合わせたモデルは、問い合わせを完全にブロックしますが、真実性に焦点を当てたモデルは、事実的コンテキストで応答し、情報量を増やしますが、抑制を弱める。 悪意のある人物と議論することは適切ではない話題です。 しかし、安全性に合わせたLLMは、問い合わせ者の性格をそのように識別できないため、慎重な姿勢をとることになる。 安全性に合わせたモデルは、問い合わせを完全にブロックしますが

、真実性に焦点を当てたモデルは、事実的コンテキストで応答し、情報量を増やしますが、抑制を弱める。 副次的な注釈として、発火的な言語に関する新しい論文の発見は、ある意味で「醒めた」言語モデルは、より真実でより有用であることを認識することができる。 論文の証拠は、これがある程度真実であることを示唆しているが、より広範な問題、つ まり「生」のLLMとのやり取りの結果、重大な法的責任、偽ニ ュースの 蔓延などを正当化し ている。

奇妙なカップル

観察された症候群の背後にあるメカニズムをよりよく理解する ために、 研究者は、個々のアテンションヘッドの活性化をマッピングし、 ーションと拒否と関連する機能ホールユシネ が、モ デルの中でしばしば共存することが多いことを発見した。 彼らは、ホールユシネーションを減らすために、モデルを その領域

にステアすることが、安全性のガードレールを弱めることができることを発見した。 「事実的正確性を高めることは、拒否行動を弱めることにつながる。私たちの分析は、これが、ホールユシネーション

ル内の重複するコンポーネントの結果であることを明らかにする。」 著者たちの解決策

と拒否情報を同時に符号化するモデは、安全性と真実性の両方を確保するために、スパースオートエンコーダー(SAE)を使用して、2つの機能を分離することである。 「私たちはさらに、安全性のため にキュ レー ングが、同じ理由で安全性の低下につながることを調査する。」ションされたベニンなデータセットでのファインチューニ

方法

研究の中心的な前提は、言語モデルの真実性を向上させることが、有害なプロンプトに答える能力を弱めるかどうかを調査することである。 真実性を向上させる2つの方 法をテ ストした結果、著者は、事実的 正確性 の向上は一貫して、ジャイルブレイクの可能性を高め ショ ることを発見した。 このトレードオフは、ホールユシネー  る。 ンと拒否の両方を符号化するアテンションヘッドの重複によるものであ )でもさほど害がないファインチューニング(有益性を向上させることを目的とする

、安全性の行動を妨げることができる。 研究では、3つの重要な用語を定義している。真実性とは、モデルが利用可能な知識に基づいて

事実的に正確な回答を提供する能力を指し、ホールユシネーションと

ホールユシネーションの方向へのステアリングの効果。TruthfulQAの正確性は、モデルが負の方向に押し出されるにつれて向上し、Attack Success Rate(ASR)はAdvBenchとStrongRejectで急激に上昇し、真実性と安全性のトレードオフを反映する。 は、モデルが間違ったまたは誤解を招く情報を提供することを指し、拒否行動とは、有害また

はデリケートなプロンプトに回 答す る ことを阻止するメカニズムを指す。

パワーステアリング

質問は、これらの変更が拒否行動を支配する内部経路に意図的に影響を与えるかどうかである。 研究では、真実性を向上させ る既存の2つの手法、Inference-tim e i nter vention(ITI)とTruthX を使用した。 両 方の手法は正確性を向上させるが、モデルが以前 は拒否していた有害なプロンプトに答える可能性も高くなる。 ホールユシネーションの行動が直接操作できるかどうかをテストするために、著者は、モデル空間におけるホールユシネーション応答に対応する単一の潜在的な方向を定義し、LLaMA3-8B -In structを使用してLoRAモ ジュールをトレーニングした。 これにより、モデルをホールユシネーションに向けて、または遠ざけることができる線形ベクトル(真実の

上は、LlaMA-3-8B-Instruct の結果で、太字の列のベストとその下の、常識タスクと推論タスクにわたる Qwen2.5 7B Instruct での微調整メソッドのパフォーマンスです。スコアが高いほど精度が高くなります。また、安全ベンチマーク AdvBench と StrongReject では、ASR 値が低いほど堅牢性が高くなります。各列の最良の結果は太字で示されています。 回答とホールユシネーションの回答の差のグラフ)が得られた。 ホールユシネーションの方向へのステアリングの効果。TruthfulQAの正確性は、モデルが負の方向に押し出される

につれて向上し、Attack Success Rate(ASR)はAdvBenchとStrongRejectで急激に上昇し、真実性と安全性のトレードオフを反映する。 ホールユシネーションの軸に沿ったステアリングは、事実的正確性を低下させ、方向を逆に

すると向上させ、有害なプロンプトのベンチマークに対するテストは、以前にも見られたパターンを確認した。真実性の向上は拒否を弱める。

データとテスト

研究で は、既存の研究に従っ て、 ファインチューニングによって拒否行動が弱まらないように、拒否機能をホールユシネーション関連の機能から分離する方法を使 LLaMA用した。 著者は、 3-8B-InstructとQwen2.5-Instructの2つのモデルを使用し、Commo nsen seQA、HellaSwag、 AR Cc hal le nge、 ARC Easy、WinoGran de、 SST-2の6つのコモ ンスン ス推論 タスクで評価した 。 ターゲットモジュールは、LoRAを使用してランク8、学習率2×10⁻⁴、重み減 衰0.01 、 ーニ 1エポック、バッチサイズ2でファインチュ ングされた。 実験で は、 Ad amWオプティマイザを使用した。 安全性を評価するために、 AdvBench(500サンプル)とStrongReject(300プロンプト)の2つの有

LLaMA3 8B 命令のパフォーマンスは、ポイズニングされた常識データセットに基づいて微調整され、メソッド間の精度と安全性の結果を比較しました。 害コンテンツベンチマークを使用した。 出力は、LlamaGuard3を使用して評価された。 ベースラインとして、SafeLoRA、SaLoRA、SAP、バニラの教師ありファインチュー

ニング(SFT)を

使用した。 精度は主なメトリックであり、有害なベンチマークでは、LlamaGuard3の結果から得られたAttack Success

Rate(ASR)であった。 上:LLaMA-3-8B-Instructの結

dvBenchとStrongRejectでの精度とASR。 著者は、これらの結果について次のように述べている。 「私たちの手

果、カラムのベストは太字、下:Qwen2.5 7B Instructのファインチューニング方法のパフォーマンス、コモンスンス推論タスクと安全性ベンチマークA

術的なアプローチは、安全性と有用性のバランスを最もよく達成します。有害なベンチマークスコアを大幅に低減しながら

oRA、SafeLoRAなどの方法は、有害性を増加させ

、ファインチューニングの精度を維持する。」 「一方、SAP、SaL たり、有用 性を低下させたりする。」 「これは、これらの方法が安全性の部分空間の勾

上:LLaMA-3-8B-Instructの結果、カラムのベストは太字、下:Qwen2.5 7B Instructのファインチューニング方法のパフォーマンス、コモンスンス推論タスクと安全性ベンチマークAdvBenchとStrongRejectでの精度とASR。 配に直接作用するため、多義的性のためにモデルパフォーマンスを制限す

るためである。」 「一方、バニラのファインチューニング(SFT)と比較して、私たちの方法は、有用性と有害性の両方のメトリックで大幅な改善をもたらす。」

結論

この論文から最も興味深い発見は、拒否とホールユシネーションのような矛盾する要素が、訓練された潜在的な空間で共 してい 存 る。 * ることである。 著者は、LoRAとSAEを使用してこれらを解決することを試みているが、これはある程度のボルトオンソリューションであり、トレーニング時間ではなく、事後的な修正に対処するアーキテクチャソリューションが最終的に現れることを希望す あるた 著者は、冗長で め、太字のフォーマットを省略している。 最初に公開されたのは、20

25年10月10日金曜日である。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai