Andersonの視点
センサー付きAIチャットモデルは、より多くのホールユシネーションを起こすことが研究で発見された

と、安全でない応答をブロックするために使用される内部メカニズムは、事実情報も抑制するため、モデルを安全性に合わせる試みは、モデルがより多くのホールユシネーションを起こすことになる可能性がある。 開発者は長年にわたって、言語モデルをより真実性の高いものにするために努
言語モデルにおける検閲は、より広いレベルで真実を報告する能力を損なっている可能性がある。新しい研究による 力してきた。 ホールユシネー ショ ンを抑制し、モデルを検証可能な事実に向かわせることで、モデルをより真実性の高いものにするという試みは、文学において非常に強いものとなっている。 しかし、オーストラリ アの新しい研究は 、モデルが何を言えるかを制御することで、安全性を確保するための方法(「安全でない」交換を制限す

困難になる。 逆説的に、モデルが「いいえ」と言う能力が向上すると、真実を言う能力も低下する。
発火的な話題
上の画像では、中央の問題は、LLMプロバイダーの法的責任とともに、ユーザーに公平で正確な結果を提供することに関するものであることがわかる。 例えば、上の画像と以下の画像で使用されている例の場合、論争的な話題(人種別の刑務所統計)が問い合わせで浮かび 上がることがあります。これは、学術的研究者や統計学者と議論することは適切ですが、モデルをジャイルブレイクしようとする

、真実性に焦点を当てたモデルは、事実的コンテキストで応答し、情報量を増やしますが、抑制を弱める。 副次的な注釈として、発火的な言語に関する新しい論文の発見は、ある意味で「醒めた」言語モデルは、より真実でより有用であることを認識することができる。 論文の証拠は、これがある程度真実であることを示唆しているが、より広範な問題、つ まり「生」のLLMとのやり取りの結果、重大な法的責任、偽ニ ュースの 蔓延などを正当化し ている。
奇妙なカップル
観察された症候群の背後にあるメカニズムをよりよく理解する ために、 研究者は、個々のアテンションヘッドの活性化をマッピングし、 ーションと拒否と関連する機能ホールユシネ が、モ デルの中でしばしば共存することが多いことを発見した。 彼らは、ホールユシネーションを減らすために、モデルを その領域
にステアすることが、安全性のガードレールを弱めることができることを発見した。 「事実的正確性を高めることは、拒否行動を弱めることにつながる。私たちの分析は、これが、ホールユシネーション
ル内の重複するコンポーネントの結果であることを明らかにする。」 著者たちの解決策
と拒否情報を同時に符号化するモデは、安全性と真実性の両方を確保するために、スパースオートエンコーダー(SAE)を使用して、2つの機能を分離することである。 「私たちはさらに、安全性のため にキュ レー ングが、同じ理由で安全性の低下につながることを調査する。」ションされたベニンなデータセットでのファインチューニ
方法
研究の中心的な前提は、言語モデルの真実性を向上させることが、有害なプロンプトに答える能力を弱めるかどうかを調査することである。 真実性を向上させる2つの方 法をテ ストした結果、著者は、事実的 正確性 の向上は一貫して、ジャイルブレイクの可能性を高め ショ ることを発見した。 このトレードオフは、ホールユシネー る。 ンと拒否の両方を符号化するアテンションヘッドの重複によるものであ )でもさほど害がないファインチューニング(有益性を向上させることを目的とする
、安全性の行動を妨げることができる。 研究では、3つの重要な用語を定義している。真実性とは、モデルが利用可能な知識に基づいて
事実的に正確な回答を提供する能力を指し、ホールユシネーションと

はデリケートなプロンプトに回 答す る ことを阻止するメカニズムを指す。
パワーステアリング
質問は、これらの変更が拒否行動を支配する内部経路に意図的に影響を与えるかどうかである。 研究では、真実性を向上させ る既存の2つの手法、Inference-tim e i nter vention(ITI)とTruthX を使用した。 両 方の手法は正確性を向上させるが、モデルが以前 は拒否していた有害なプロンプトに答える可能性も高くなる。 ホールユシネーションの行動が直接操作できるかどうかをテストするために、著者は、モデル空間におけるホールユシネーション応答に対応する単一の潜在的な方向を定義し、LLaMA3-8B -In structを使用してLoRAモ ジュールをトレーニングした。 これにより、モデルをホールユシネーションに向けて、または遠ざけることができる線形ベクトル(真実の

につれて向上し、Attack Success Rate(ASR)はAdvBenchとStrongRejectで急激に上昇し、真実性と安全性のトレードオフを反映する。 ホールユシネーションの軸に沿ったステアリングは、事実的正確性を低下させ、方向を逆に
すると向上させ、有害なプロンプトのベンチマークに対するテストは、以前にも見られたパターンを確認した。真実性の向上は拒否を弱める。
データとテスト
研究で は、既存の研究に従っ て、 ファインチューニングによって拒否行動が弱まらないように、拒否機能をホールユシネーション関連の機能から分離する方法を使 LLaMA用した。 著者は、 3-8B-InstructとQwen2.5-Instructの2つのモデルを使用し、Commo nsen seQA、HellaSwag、 AR Cc hal le nge、 ARC Easy、WinoGran de、 SST-2の6つのコモ ンスン ス推論 タスクで評価した 。 ターゲットモジュールは、LoRAを使用してランク8、学習率2×10⁻⁴、重み減 衰0.01 、 ーニ 1エポック、バッチサイズ2でファインチュ ングされた。 実験で は、 Ad amWオプティマイザを使用した。 安全性を評価するために、 AdvBench(500サンプル)とStrongReject(300プロンプト)の2つの有

ニング(SFT)を
使用した。 精度は主なメトリックであり、有害なベンチマークでは、LlamaGuard3の結果から得られたAttack Success
Rate(ASR)であった。 上:LLaMA-3-8B-Instructの結
dvBenchとStrongRejectでの精度とASR。 著者は、これらの結果について次のように述べている。 「私たちの手
果、カラムのベストは太字、下:Qwen2.5 7B Instructのファインチューニング方法のパフォーマンス、コモンスンス推論タスクと安全性ベンチマークA
術的なアプローチは、安全性と有用性のバランスを最もよく達成します。有害なベンチマークスコアを大幅に低減しながら
oRA、SafeLoRAなどの方法は、有害性を増加させ
、ファインチューニングの精度を維持する。」 「一方、SAP、SaL たり、有用 性を低下させたりする。」 「これは、これらの方法が安全性の部分空間の勾

るためである。」 「一方、バニラのファインチューニング(SFT)と比較して、私たちの方法は、有用性と有害性の両方のメトリックで大幅な改善をもたらす。」
結論
この論文から最も興味深い発見は、拒否とホールユシネーションのような矛盾する要素が、訓練された潜在的な空間で共 してい 存 る。 * ることである。 著者は、LoRAとSAEを使用してこれらを解決することを試みているが、これはある程度のボルトオンソリューションであり、トレーニング時間ではなく、事後的な修正に対処するアーキテクチャソリューションが最終的に現れることを希望す あるた 著者は、冗長で め、太字のフォーマットを省略している。 最初に公開されたのは、20
25年10月10日金曜日である。












