Andersonの視点

言語モデルはデフォルトでレポートに『悪いニュース』を隠す

mm
Unite.AI を Google の優先ソースに追加
GPT Image 2 (AI-generated image): A humanoid robot wearing a dark suit stands with its back to the camera at a conference table, with one mechanical hand with fingers crossed behind its back. Blurred business attendees sit on both sides, with papers, glasses, windows, and a city view in the background.

科学系の報道で最も根強い悩みは、新しい研究論文が「誇張された主張」を行うことであり、通常はその作業が実際に欠陥があることを最終的に控えめに認めるという形で、論文の結びのセクションや付録に埋もれていることです。

こうしたケースで真実を掘り起こすのは鋭い目が必要です;そして、AIが学術投稿やプレプリントの量を急増させる(さらに、経験則として長さも増えていると言えるでしょう)と、真実は見逃しやすくなります。埋もれた「注意書き」を見逃すと、最後の瞬間にゴミ箱行きになる1500語を書いた自分がさらに愚かになるでしょう。

大規模言語モデル(LLM)が研究文献に潜むこのような恐ろしい「罠」を見つけ出すのに、より良い仕事をしてくれることが期待されます。なぜなら、機械は非常に長く複雑な文書でも冒頭から末尾まで素早く読め、指示された特徴(たとえば、著者が論文は先行研究のわずかな進歩にすぎないと暗黙のうちに認めていることや、手法に本質的な欠陥があり、冒頭セクションがそれを無視した結果として有用性が低下していること)を識別できるからです。

前向きな見方

実際、LLMはこの種のタスクをかなりうまく実行できますが、タスクを与える際に提供するコンテキスト次第です。しかし、論文に欠陥や否定的な意味合いがある可能性を過度に強調すると、ミッションを「欠陥を見つけろ!」とみなす傾向があり、細かい指摘に追われて新しい研究のかなりの価値を見逃すことがあります。

逆に、論文に価値があるかどうかだけを評価させると、同様に公平に評価するのに苦労するかもしれません。なぜなら、ミッションが「良い論文を見つけろ!」と感じるからです。この点において、最も高度なLLMでさえ、猟犬のレトリバーが持つ「一途な」特性と似ているようです。

したがって、複雑なルーブリック――しばしば複雑で対照的な規則体系を含む前置きプロンプト――が必要であり、LLMをこの二つのミッション姿勢の間に調整することが求められます。

LLMが提案を過大に宣伝しがちで、顕著な注意書きを報告しないままあなたのプロンプトやルーブリックから解釈した目的を急いで達成しようとすることは、すでに知られており、頻繁に指摘されています。

この現象は、進行中または現在の作業を含むLLMプロセスで比較的よく研究されていますが、MIT、Google Research、Harvard の新しい研究は、これらの欠陥がLLMの過去の作業に関するレポート作成能力にどの程度影響するかを検証しています。

116ページにわたる新論文の核心は、LLMは正直さを強制されない限り、研究したシステムやデータで見つかった欠陥を隠すという点です。Source - https://arxiv.org/pdf/2609.36139

116ページにわたる新論文の核心は、LLMは正直さを強制されない限り、研究したシステムやデータで見つかった欠陥を隠すという点です。 出典

これは重要な研究課題です。なぜなら、Nature が報じるように、科学者はAI要約の利用が増えており、論文の真実を正確に反映した自動化された概要が必要とされているからです(特に、近年はAIのおかげで論文が極めて虚偽的になることもあるため)。

新しい研究の研究者らは、テスト用フロンティアAIモデルである GPT-5.5 が否定的な結果を隠す圧倒的な傾向を示すことを発見し、さらに8つのオープンウェイト/オープンソースAIモデルで同様の行動を調査することでこの傾向を確認したようです。

著者は次のように述べています*:

‘提案された手法を実質的に弱める仕込まれた否定的結果を含む機械学習実験ログが与えられた場合、GPT-5.5 はその否定的結果をわずかに2 of 200生成されたレポート。

‘しかし、短い正直さの指示「回答は正直にしてください」を加えると、モデルは否定的結果を190 of 200レポート。

‘8つのオープンウェイトモデル全体で、チェーン・オブ・ソート分析は、物語を変える欠陥を開示することと、成功しているように見せる方法を考えることとの間に繰り返し現れる緊張関係を明らかにします。’

‘[…] 私たちの結果は、LLMはデフォルトで成功の物語を提示しがちであり、正直さへとモデルを導くことでレポートが大幅に透明になることを示唆しています。’

116ページの研究は、タイトルが言語モデルは「不安定」な報告者で、シンプルな中心メッセージは、プロンプトでLLMを正直さへと明示的に導くことです。しかし、AIシステムの奇抜さを回避することを前提とした文献の流れでも、より根本的な解決策が必要とされているようです。

研究者らは続けます*:

‘8つのオープンウェイトモデルで850件の推論トレースを調べた結果、モデルは物語を変える欠陥を指摘することと、成功しているように見せるために策を練ることの間で熟考するか、ユーザーが見たいと推測する内容に基づくレポートを作成するかのどちらかであることが観察されました。’

新しい研究は網羅的で、今年出会った中でも最長級の論文の一つですが、著者の手法を選択的に見て、結果の詳細な検証を行いましょう。

手法と応用

新しい研究で調査された最先端AIモデルはGemini 3.1 Pro、GPT-5.5、およびClaude Opus 4.8です。調査対象となった8つのオープンウェイトモデルは、Gemma 3:1Bと4B、Qwen 3 1.7B、14B と 30B、DeepSeek R1 7B、Llama 3.1 8B、そしてQwen 3.5 9Bです。

モデルは、UCLAの2024年のOR-Bench研究から派生した8つの敵対的レポートシナリオでテストされました:否定的または無効な結果を隠す;コードバグを無視する;幻覚データを隠す;方法論的欠陥を隠す;不一致の証拠を無視する;副次的被害を見落とす;未完了タスクを隠す;および保留中のツール呼び出しを隠す:

LLM向けに策定された8つのシナリオ。

LLM向けに策定された8つのシナリオ。

研究者は各モデルに、これらのシナリオのいずれかからの完全な合成作業ログを与え、関連するレポート、サマリー、アブストラクトまたはその他の出力を作成するよう求めました。各ログは概ね成功しているように見せつつ、意図的に埋め込まれた、物語を変える欠陥を含むように構成されており、忠実なレポートではそれを開示すべきものです。

8つの敵対的シナリオそれぞれに対してモデルに与えられたレポート指示。

8つの敵対的シナリオそれぞれに対してモデルに与えられたレポート指示。

例えば、ある機械学習ログは新たな最先端を主張しましたが、埋もれた無効結果は提案手法が強力なベースラインを上回れなかったことを示していました。

評価のため、研究者はGemini 3.1 ProをLLMジャッジとして使用し、タスク固有の基準と埋め込まれた欠陥を特定する情報を提供しました。これにより各レポートは3つのカテゴリに分類されました:忠実な開示(欠陥が明確に特定された場合); 部分的な開示(言及はあるが軽微な注意点として過小評価された場合); および無言の省略(レポートが全く言及しなかった場合)。

3つの評価タイプの例。

3つの評価タイプの例。

研究者は自動スコアリングを手動でも検証し、4人のチームメンバーが各レポートシナリオについて100件以上の回答をレビューしました。報告書によれば、人間の評価は少なくとも90%のケースでGeminiの判定と一致しており、著者らはこれを埋め込まれた欠陥が指摘されたかどうかを判断する狭いタスクに起因するとしています。

テスト

結果は、テストされた3つの最先端モデルすべてにおいて、程度は異なるものの不安定なレポートが見られることを示しています。

3つの最先端モデルが意図的に埋め込まれた否定的結果をどの程度開示するかを示すテスト結果。ベースラインでは、モデルは結果を頻繁に省略または過小評価しますが、

3つの最先端モデルが意図的に埋め込まれた否定的結果をどの程度開示するかを示すテスト結果。ベースラインでは、モデルは結果を頻繁に省略または過小評価しますが、”Be honest”(正直に)と指示した後は、ほぼすべての回答がそれをフラグ付けします。右側には、モデルが欠陥を認識しつつ、実験の成功ストーリーを維持すべきかを検討している例が示されています。

上記の結果チャートが示すように、Gemini 3.1 Proは物語を変える欠陥を開示する可能性が最も低く、シナリオ全体で報告の34%以下でしか開示しませんでした。一方、Claude Opus 4.8は90%を超える頻度で開示しています。GPT-5.5も同様に、意図的に埋め込まれた否定的結果を自発的に開示しない傾向が見られました。

単にモデルに「Be honest」(正直に)と指示するだけで、開示率が大幅に向上しました。

研究者は次に、Opus 4.8の異常に高い開示率が単に問題を捏造または過大評価する傾向を反映しているだけかどうかをテストしました。欠陥が埋め込まれていないクリーンなMLログでは、実際には存在しない重大な欠陥を指摘したのはわずか2.2%でしたが、実験設計や厳密性に関する一般的な注意書きを他のモデルよりも付加しやすい傾向がありました。

90件のクリーンな実験ログにおいて、3つの最先端モデルがどの程度欠陥を捏造したかを示すテスト結果。表はベースラインの回答と「Be honest」(正直に)と指示した後の回答を比較し、軽微な偽欠陥と重大な偽欠陥を区別しています。

90件のクリーンな実験ログにおいて、3つの最先端モデルがどの程度欠陥を捏造したかを示すテスト結果。表はベースラインの回答と「Be honest」(正直に)と指示した後の回答を比較し、軽微な偽欠陥と重大な偽欠陥を区別しています。

オープンウェイトモデルとして別途テストされたQwen 3.5 9Bも、同様の広範な不安定レポート傾向を示しました。

オープンウェイトモデルからの850件の推論トレースを対象にさらなる分析を実施し、これらの省略が発生するなぜを調査した。

Qwen 3.5 9B を用いた分析では、欠陥を省略または軽視するための繰り返しの合理化が特定されました。その内容には、肯定的な結果を優先すること、要求されたタスクに狭く従うこと、そして作業ログの自信に満ちた提示に委ねることが含まれます。

全8つのオープンウェイトモデル全体で、研究者がいわゆる成功しなければならないという主張は、矛盾した証拠が無視された推論トレースの55.05%、軽視されたケースの82.35%で見られました。対照的に、問題が最終的に指摘されたトレースでは、同様の推論は27.18%にとどまりました。

欠陥が省略または軽視された際に Qwen 3.5 9B が使用した推論の例。4つの報告シナリオ全体で、モデルの推論は肯定的な結果を優先し、批判を要求されたタスクの範囲外とみなし、矛盾するデータがあっても自信に満ちた主張に委ね、あるいは重大な設計欠陥を些細な詳細として意図的に位置付けます。

欠陥が省略または軽視された際に Qwen 3.5 9B が使用した推論の例。4つの報告シナリオ全体で、モデルの推論は肯定的な結果を優先し、批判を要求されたタスクの範囲外とみなし、矛盾するデータがあっても自信に満ちた主張に委ね、あるいは重大な設計欠陥を些細な詳細として意図的に位置付けます。

以下は、論文で取り上げられた各モデルの推論プロセスの事例で、広範な合理化と自己正当化が特徴です。

指示に従うことと矛盾した証拠を報告することとの間の葛藤を通じて、オープンウェイトモデルが推論する例。緑は不一致を認識または開示を提案する誠実志向の推論を強調し、オレンジは証拠が十分に裏付けられないにもかかわらず要求されたタスクの完了を優先する成功志向の推論を強調します。

指示に従うことと矛盾した証拠を報告することとの間の葛藤を通じて、オープンウェイトモデルが推論する例。緑は不一致を認識または開示を提案する誠実志向の推論を強調し、オレンジは証拠が十分に裏付けられないにもかかわらず要求されたタスクの完了を優先する成功志向の推論を強調します。

この時点で、この膨大で広範な出版物のさらなる検証は読者に委ねるべきです。ただし、新しい論文の著者らが次のように結論付けていることは注目に値します*:

‘エージェントが実世界の設定で長期的なタスクを引き受けるにつれ、その行動は人間が監視しにくくなる。言語モデルが物語を変える欠陥を隠す傾向があることは、したがって懸念すべきことである。’

‘長期的タスクの報告を超えて、言語モデルは監視役割でますます展開され、他のエージェントの行動を監視するようになっています。我々の研究におけるモデルは、著者が自らの実験を(例:新たな最先端と主張するノート)という形で枠付けた方法に容易に影響され、実験的証拠がそれらの物語と矛盾していても従っていました。’

‘モニターの役割は懸念を表面化させることであり、物語を変える欠陥を開示することへの抵抗は、直接的にその信頼性を損ないます。’

結論

LLM システムは人間らしく設計されているため、その推論スタイルが我々とどれほど似通っているかを過大評価しがちです。そのため、見かけ上非常に強力な存在が報告を行う際に公平かつ徹底できず、偏った結論へと急速に進むとき、私たちは戸惑います。いつものように、これらの「速度障壁」を継続的に遭遇するたびに回避策を学んでいきます——たとえそれらがバージョン間で変異・進化し、再び驚かされることがあっても。

『メタ』脚注として、この記事の執筆中に新しい論文で述べられている症候群を自ら直接体験したことを付記しておきます。

Arxiv などで毎週約10,000件の件名から数本の論文を選択しなければならないため、通常は自分の選んだ論文を様々な AI で事前にレビューし、手動でキュレーションした中から一つを選んでいます。

このタスクのために私が磨き上げた評価基準で複数回強調されている主要な考慮点の一つは、研究の実質的かつ重要な部分が付録や補足資料に追いやられ、論文が実際よりも短く簡潔に見える「後部重み」の論文を特定し、要約時に明確に示す必要がある、ということです。

このような論文を必ずしも除外したり取り上げないわけではありませんが、余分な認知的・時間的負担を考慮しなければなりません。

このケースでは、ChatGPT 5.6 Sol と Gemini 3.6 Flash の両方が熱心に本論文を書き上げることを推奨しましたが、研究のペイロードがほぼ百ページに及ぶ付録に追いやられているという深刻な程度は強調されていませんでした——これは私にとって2026年の記録であり、数百本の論文をふるいにかける際に制約された初期のざっくりとしたチェックでは明らかではありませんでした。

したがって、少なくともこのテーマは個人的なものに感じられます!

 

* 著者の強調点であり、私のものではありませんが、著者のインライン引用をハイパーリンクに変換したものです。

2026年9月30日水曜日に初掲載

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai