Andersonの視点
言語モデルに「真実ダイヤル」を付ける

真実かおしゃべりか:どちらかを選ぶ。新しいトレーニング方法により、ユーザーはAIチャットボットにどの程度「事実」に基づいて回答するかを指定できるようになり、精度をダイヤルで調整できるようになった。
米国と中国の共同研究により、AIチャットボットのユーザーが「虚構」または「事実」に基づいて回答するかを指定できる仮想の「ノブ」が開発された。
このシステムは、ファインチューニングによってMistral-7Bモデルを合成データでトレーニングし、「真実」スケールのスキーマをモデルに刻み込んだ。 この修正後、Mistralモデルは回答に含める事実の数を制御できるようになり、ユーザーが指定した「真実」値が高いほど、回答は短くなるが、より確実になる。
設定を低くすると、チャットボットの回答は論文の著者が「情報量」と呼ぶものになる。つまり、回答は長くなるが、事実が多く含まれる。しかし、一部の事実は幻想である可能性がある。
このシステムで使用された合成データは、テストドメインとして実際の人物の伝記的事実についてのウィキペディアを参照した。ウィキペディアが権威ある情報源であるかどうかは別として、この研究の価値は、LLMの内在的な回答の強制を制限できるようなシステムを設計することにある。

FactScoreプロジェクトの例。ウィキペディアを参考として伝記的事実をキュレーションした。 ソース
著者は、高い保証が必要な医療や法律の分野では、信頼性が高く事実に基づいた出力が必要であるのに対し、多くのユーザーはより柔軟で創造的な出力を必要としていることを指摘している。
彼らは次のように述べている:
「現在のLLMには、事実性と情報量のトレードオフを制御するための内在的なメカニズムがない。」
「ユーザーは「事実に基づいて」というようなプロンプトでモデルの動作を導くことができるが、先端のモデルはこのタスクに対してそのようなプロンプトに応じて出力を信頼性高く調整できない。」
「FactScoreでは、オフザシェルフのモデルは中程度から厳しい目標を満たすことができないことがわかった。このギャップは、ユーザーが特定の事実性レベルを要求し、モデルが応答を適応させることができる代替手段の必要性を生み出す。」
事実だけ
この論文と提案されている解決策を理解するには、自分自身の「情報量」の定義を再検討する必要がある。著者は、情報量の量化は「出力の支持されたコンテンツの量、つまり、検証された原子的なステートメントの数、出力の長さで規格化されたもの」と定義している。
他の箇所では、論文は情報量を「出力の原子的事実の総数、正しいかどうかは問わない」とより簡潔に述べている。
さらに、研究者は、LLMの事実の精度と主観的な推測の間のバランスは、人間にも共通する特徴であり、さまざまな科学研究によって文書化されていることを指摘している:
「LLMの知識は、信頼性が均一ではない。あるステートメントは強く支持されているが、他のステートメントは推測的、古い、または不確実である。生成には、どれだけ話すかとどれだけ慎重に話すかを決定する必要があるため、事実の精度と情報量の間でバランスを取ることが必要になる。」
「人間も同様の選択を行う。高信頼性の事実から始めて、低信頼性の詳細を追加する。ただし、詳細は、要求された場合のみ追加される。」
実験は中規模のMistralモデルで行われたが、適用された原理はさまざまなスケールとプラットフォームで機能するはずである。なぜなら、LLMの内部スキーマに新しい量化を追加するからである。这种の修正はアーキテクチャに依存しないからである。
新しい論文は、《事実性オンデマンド:テキスト生成における事実性と情報量のトレードオフの制御》と題され、コロンビア大学、ニューヨーク大学、ニューヨーク大学上海校の7人の研究者によるものである。
方法とデータ
この論文で提示されている新しいアプローチは、事実性制御付き生成(FCG)と呼ばれ、ユーザーがチャットボットの回答の精度を指定できる仮想の「ダイヤル」を導入する。
モデルは、ユーザーの質問と望ましい事実性レベルを受け取り、信頼性が十分な情報のみを含む回答を生成する。信頼性の制約内で可能な限り詳細な回答を生成することを目指す。
(上記のリンク先の)FactScoreシステムを使用して、サンプルクエリからのセグメント化された出力が精度の品質、つまり事実性の遵守として評価される。

FCGのトレーニングデータパイプライン:言語モデルが初期の回答を生成し、原子的事実に分割し、信頼性でランク付けし、最も信頼性の低い事実を削除して、望ましい真実レベルに達する。 ソース
FCGの要件を満たす既存のデータセットがないため、著者はGPT-4†言語モデルを使用して制約なしの回答を生成し、最も信頼性の低い事実を削除して、回答が指定された精度レベルに達するようにした。
以前の研究によると、グラウンドトゥルースデータのみでトレーニングすると、モデルが事実性を向上させるのではなく、事実性を低下させる可能性があることが示唆された。したがって、FCGのトレーニング例は最小限に編集され、モデルの独自のフレーズとリズムが保存され、必要なターゲット信頼性レベルに達するために削除された事実のみが削除された。
この編集プロセスをさまざまなターゲット信頼性レベル(10%から100%の厳格なしきい値)に適用して、各質問に複数のフィルタリングされた回答がペアになった合成データセットを作成した。
各バージョンでは、モデルが指定されたレベルの事実性を満たすために十分に信頼性が高いと判断された事実のみが保持された。これらの例は、FCGのトレーニングデータとして使用された。
最終的なデータセットは、トレーニングに3,302個の(質問、コントロール、回答)トリプルと、検証に396個のトリプルで構成され、500のエンティティ(トレーニング用に450個、開発用に50個)から構成された。さらに、183個の異なるエンティティがテストに使用された。
トレーニングとテスト
著者は、Mistral-7B-Instruct-v0.2 LLMモデルをさまざまな学習率(3e-6、1e-5、3e-5)でファインチューニングし、30エポック、バッチサイズ256で最適な(未指定)LRに到達した(トレーニングハードウェアは指定されていない)。
FCGは、2つのベースラインと比較してテストされた。最初は、事実性制御なし(NFC)で、モデルは単に「Xのバイオを教えて」というプロンプトを受け取り、精度や信頼性について言及しなかった。これは、事実性を制御するメカニズムなしのLLMの既定の動作を反映する。
2番目の方法は、事実性制御付き推論(FCI)で、ファインチューニングなしで同じ信頼性レベルのプロンプトを使用した。たとえば、モデルは「90%信頼性の情報を出力して」というプロンプトを受けるかもしれない。この場合、指示はトレーニングで使用されたものに似ていたが、モデルは事前にそのような制約に接したことがなかった。

3つのテストアプローチの比較:制御なしのベースライン、トレーニングなしで事実性プロンプトを使用するバージョン、そしてフィルタリングされたデータに接したことで精度設定を学習したファインチューニング済みモデル。
最初のテストは、事実性の遵守に対して行われた。

3つのターゲット信頼性レベルのパフォーマンス。ファインチューニング済みモデルは、全体的にベースラインを上回り、特に高いしきい値では顕著だった。
80%、90%、100%の事実性しきい値に対してテストされた結果、ファインチューニング済みモデルのみが一貫してターゲットを達成した。驚くことに、トレーニングなしで信頼性の指示を追加しても、出力が改善されることはなかった。実際、場合によっては悪影響を及ぼした。たとえば、プロンプト付きモデルの出力の3.8%のみが90%のしきい値を満たしたのに対し、指示なしのバージョンでは5.5%の出力が満たした。
これは、ベースのMistral-7Bモデルが「90%信頼性で」というプロンプトを有用な方法で解釈できなかったことを示唆しており、追加の指示は実際に出力を妨げた可能性がある。
対照的に、トレーニング済みモデルは制御信号に信頼性高く対応し、80%で18.7%、90%で12.6%、100%で23.6%のコンプライアント出力が生成された。また、完全に事実的な回答を生成することができた唯一の方法であった:
「これらの改善は、事実性を制御できることが実際に監督トレーニングによって学習できることを示している。FCGモデルは、十分に信頼できる事実のみを含めるように学習しており、オフザシェルフのモデルは制御信号を有効に利用できなかった。」
別のテストでは、モデルが制御信号を解釈することを確認するために、要求された真実設定が高くなると、平均事実性の回答が上昇するかどうかを確認した。
トレーニング前にこのパターンは現れなかったが、トレーニング後には、要求された信頼性が高くなるにつれて、回答の精度が上昇する安定した傾向が見られた。

ターゲット真実設定が上昇すると、ファインチューニング済みモデルは対応して事実的な出力を生成し、ベースラインモデルは同じ範囲で一貫した変化を示さなかった。
真実性と「豊かさ」のトレードオフも検討された。出力は精度だけでなく、増加する事実性の要件下で検証された情報がどれだけ残っているかによってスコア付けられた。

事実性と情報量のトレードオフを表すグラフ。ファインチューニング済みモデルは、ベースラインよりも真実性と詳細のバランスを取ることができた。
90%の目標精度では、FCGは他の方法よりも多くの事実を保持していた。また、全体的な信頼性レベル設定の範囲で、一貫してベターな結果を生み出すことができた。
最も顕著な違いは、最も厳格な設定で見られた。FCGは非ゼロの情報量を維持することができたのに対し、プロンプトのみのベースラインは全ての回答を削除することを強いられた。後者の場合、単一の低信頼性のステートメントが全体の回答を破棄される原因となった。
対照的に、トレーニング済みモデルは出力を再構成して、完全に信頼できる事実のみを保持することができた。そうすることで、他のモデルが陥った沈黙への崩壊を避けることができた。
事実性は制御設定によって直接制約され、情報量は、モデルが可能な限り多くの信頼できるコンテンツを含めるように最適化された。設定が高い場合は、信頼できるステートメントのみが保持され、設定が低い場合は、より推測的な詳細が許可され、長さは増加するが、精度は低下した。
著者は次のように結論付ける:
「高い事実性の制約が存在する場合、モデルは事実的に検証可能なステートメントを優先し、同時に可能な限り多くの関連情報を含める。逆に、モデルはより広範な詳細、特に検証可能なものやより推測的なものを含める自由度を持つため、事実性を犠牲にして情報量が増加する。」
「この動作は、トレーニングデータの設計と一致する。最小限の事実を削除したため、モデルは「x%の事実性であれば、最も信頼性の低い詳細を削除し、残りを保持する」と学習した。」
論文は、この新しい方法論が将来的に大規模なモデルで試され、より複雑なタスクに適用されることを希望で終了する。
結論
ここで提示されている解決策は、最新のLLMの最も深刻でよく知られた問題の1つ、つまり会話を続けるために精度よりもおしゃべりを優先し、自信を持って古いまたは完全に幻想的な情報を事実として提示する傾向に対処する。
ChatGPTのユーザーにとって、モデルの「検索中」のウィジェットが一瞬だけ表示されない限り、どの回答もモデルの知識カットオフ日から来ているか、幻想の可能性がある。
しかし、Web検索は待ち時間を増やし、LLMホストの運用コストも増加する。また、Web検索は選択的に実行されるか、ユーザーの要求によって実行されるか、またはトークン料金が発生する可能性のある「特別な設定」である。
しかし、これらの内部の経済的要因は、特定のドメインまたは特定の種類のクエリのLLMクエリに重大な影響を及ぼす可能性がある。出力の精度に関連するスキーマを課すことができる方法は、歓迎される研究である。
* 著者のインライン引用をハイパーリンクに変換したもの。
† 完全なバージョン番号は指定されていない。
2026年2月6日に初めて公開され、5分後に単語の繰り返しを修正するために修正された。












