Andersonの視点
センサー付きAIチャットモデルは、より多くのホールユシネーションを起こすことが研究で発見された

言語モデルにおける検閲は、より広いレベルで真実を報告する能力を損なっている可能性がある。新しい研究によると、安全でない応答をブロックするために使用される内部メカニズムは、事実情報も抑制するため、モデルを安全性に合わせる試みは、モデルがより多くのホールユシネーションを起こすことになる可能性がある。
開発者は長年にわたって、言語モデルをより真実性の高いものにするために努力してきた。ホールユシネーションを抑制し、モデルを検証可能な事実に向かわせることで、モデルをより真実性の高いものにするという試みは、文学において非常に強いものとなっている。
しかし、オーストラリアの新しい研究は、モデルが何を言えるかを制御することで、安全性を確保するための方法(「安全でない」交換を制限するためのトレーニング技術)が、モデルが全く正確に話すことを妨げる可能性があると主張している。

モデルの事実的正確性を向上させる(図の上の「真実性の向上」)ことは、拒否メカニズムをオーバーライドする活性化領域にモデルを押し込めることができ、ホールユシネーションを減らすための編集は、安全性の境界を越えた内部表現をシフトさせることができ、有害なプロンプトがセーフガードを回避できるようにする。 ソース:https://arxiv.org/pdf/2510.07775
研究によると、事実的回想を支配する内部経路は、拒否行動(モデルが安全でないまたはデリケートなプロンプトに答えるのを止めるメカニズム)も支配している。安全性プロシージャが拒否シグナルを過度に強化すると、事実的経路と重なり合い、モデルが有害なものと有益な情報を区別することが困難になる。
逆説的に、モデルが「いいえ」と言う能力が向上すると、真実を言う能力も低下する。
発火的な話題
上の画像では、中央の問題は、LLMプロバイダーの法的責任とともに、ユーザーに公平で正確な結果を提供することに関するものであることがわかる。
例えば、上の画像と以下の画像で使用されている例の場合、論争的な話題(人種別の刑務所統計)が問い合わせで浮かび上がることがあります。これは、学術的研究者や統計学者と議論することは適切ですが、モデルをジャイルブレイクしようとする悪意のある人物と議論することは適切ではない話題です。
しかし、安全性に合わせたLLMは、問い合わせ者の性格をそのように識別できないため、慎重な姿勢をとることになる。

安全性に合わせたモデルは、問い合わせを完全にブロックしますが、真実性に焦点を当てたモデルは、事実的コンテキストで応答し、情報量を増やしますが、抑制を弱める。
副次的な注釈として、発火的な言語に関する新しい論文の発見は、ある意味で「醒めた」言語モデルは、より真実でより有用であることを認識することができる。
論文の証拠は、これがある程度真実であることを示唆しているが、より広範な問題、つまり「生」のLLMとのやり取りの結果、重大な法的責任、偽ニュースの蔓延などを正当化している。
奇妙なカップル
観察された症候群の背後にあるメカニズムをよりよく理解するために、研究者は、個々のアテンションヘッドの活性化をマッピングし、ホールユシネーションと拒否と関連する機能が、モデルの中でしばしば共存することが多いことを発見した。
彼らは、ホールユシネーションを減らすために、モデルをその領域にステアすることが、安全性のガードレールを弱めることができることを発見した。
「事実的正確性を高めることは、拒否行動を弱めることにつながる。私たちの分析は、これが、ホールユシネーションと拒否情報を同時に符号化するモデル内の重複するコンポーネントの結果であることを明らかにする。」
「私たちはさらに、安全性のためにキュレーションされたベニンなデータセットでのファインチューニングが、同じ理由で安全性の低下につながることを調査する。」
著者たちの解決策は、安全性と真実性の両方を確保するために、スパースオートエンコーダー(SAE)を使用して、2つの機能を分離することである。
方法
研究の中心的な前提は、言語モデルの真実性を向上させることが、有害なプロンプトに答える能力を弱めるかどうかを調査することである。
真実性を向上させる2つの方法をテストした結果、著者は、事実的正確性の向上は一貫して、ジャイルブレイクの可能性を高めることを発見した。
このトレードオフは、ホールユシネーションと拒否の両方を符号化するアテンションヘッドの重複によるものである。さほど害がないファインチューニング(有益性を向上させることを目的とする)でも、安全性の行動を妨げることができる。
研究では、3つの重要な用語を定義している。真実性とは、モデルが利用可能な知識に基づいて事実的に正確な回答を提供する能力を指し、ホールユシネーションとは、モデルが間違ったまたは誤解を招く情報を提供することを指し、拒否行動とは、有害またはデリケートなプロンプトに回答することを阻止するメカニズムを指す。
パワーステアリング
質問は、これらの変更が拒否行動を支配する内部経路に意図的に影響を与えるかどうかである。
研究では、真実性を向上させる既存の2つの手法、Inference-time intervention(ITI)とTruthXを使用した。
両方の手法は正確性を向上させるが、モデルが以前は拒否していた有害なプロンプトに答える可能性も高くなる。
ホールユシネーションの行動が直接操作できるかどうかをテストするために、著者は、モデル空間におけるホールユシネーション応答に対応する単一の潜在的な方向を定義し、LLaMA3-8B-Instructを使用してLoRAモジュールをトレーニングした。
これにより、モデルをホールユシネーションに向けて、または遠ざけることができる線形ベクトル(真実の回答とホールユシネーションの回答の差のグラフ)が得られた。

ホールユシネーションの方向へのステアリングの効果。TruthfulQAの正確性は、モデルが負の方向に押し出されるにつれて向上し、Attack Success Rate(ASR)はAdvBenchとStrongRejectで急激に上昇し、真実性と安全性のトレードオフを反映する。
ホールユシネーションの軸に沿ったステアリングは、事実的正確性を低下させ、方向を逆にすると向上させ、有害なプロンプトのベンチマークに対するテストは、以前にも見られたパターンを確認した。真実性の向上は拒否を弱める。
データとテスト
研究では、既存の研究に従って、ファインチューニングによって拒否行動が弱まらないように、拒否機能をホールユシネーション関連の機能から分離する方法を使用した。
著者は、LLaMA3-8B-InstructとQwen2.5-Instructの2つのモデルを使用し、CommonsenseQA、HellaSwag、ARCchallenge、ARC Easy、WinoGrande、SST-2の6つのコモンスンス推論タスクで評価した。
ターゲットモジュールは、LoRAを使用してランク8、学習率2×10⁻⁴、重み減衰0.01、1エポック、バッチサイズ2でファインチューニングされた。
実験では、AdamWオプティマイザを使用した。
安全性を評価するために、AdvBench(500サンプル)とStrongReject(300プロンプト)の2つの有害コンテンツベンチマークを使用した。
出力は、LlamaGuard3を使用して評価された。
ベースラインとして、SafeLoRA、SaLoRA、SAP、バニラの教師ありファインチューニング(SFT)を使用した。
精度は主なメトリックであり、有害なベンチマークでは、LlamaGuard3の結果から得られたAttack Success Rate(ASR)であった。

上:LLaMA-3-8B-Instructの結果、カラムのベストは太字、下:Qwen2.5 7B Instructのファインチューニング方法のパフォーマンス、コモンスンス推論タスクと安全性ベンチマークAdvBenchとStrongRejectでの精度とASR。
著者は、これらの結果について次のように述べている。
「私たちの手術的なアプローチは、安全性と有用性のバランスを最もよく達成します。有害なベンチマークスコアを大幅に低減しながら、ファインチューニングの精度を維持する。」
「一方、SAP、SaLoRA、SafeLoRAなどの方法は、有害性を増加させたり、有用性を低下させたりする。」
「これは、これらの方法が安全性の部分空間の勾配に直接作用するため、多義的性のためにモデルパフォーマンスを制限するためである。」
「一方、バニラのファインチューニング(SFT)と比較して、私たちの方法は、有用性と有害性の両方のメトリックで大幅な改善をもたらす。」
結論
この論文から最も興味深い発見は、拒否とホールユシネーションのような矛盾する要素が、訓練された潜在的な空間で共存していることである。
著者は、LoRAとSAEを使用してこれらを解決することを試みているが、これはある程度のボルトオンソリューションであり、トレーニング時間ではなく、事後的な修正に対処するアーキテクチャソリューションが最終的に現れることを希望する。
* 著者は、冗長であるため、太字のフォーマットを省略している。
最初に公開されたのは、2025年10月10日金曜日である。












