Andersonの視点

システムプロンプトに隠された日付が言語モデル評価を損なう

mm
Unite.AI を Google の優先ソースに追加
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

大規模言語モデル(LLM)をベンチマークする能力がなければ、消費者や企業はモデルが最近のバージョンでどれだけ進歩したか、そして競合他社と比較してどの程度の性能かを理解することが困難です:

arena.ai の影響力のある LLM リーダーボード。出典: https://arena.ai/leaderboard/chat/text

arena.ai の影響力のある LLM リーダーボード。 出典

LLM は非決定的である(すなわち、同じ入力に対して常に一貫した出力を生成するとはない)ため、評価は難しい。研究者が同一のプロンプト、モデル設定、ベンチマークデータセットを使用した場合でも、実行環境のわずかな違いが異なる回答を生み、パフォーマンススコアを大幅に変えることがある。

ハードウェア構成、数値精度、推論バッチサイズ、さらには選択肢の順序などが結果に影響を与える可能性がある。これにより、報告された改善が実際の進歩を示すものか、単にテスト条件の半ランダムな変動によるものかを判断しにくくなる。

ある程度まで、これらの変数のいくつかを考慮したり、少なくともそれらが生む誤差幅を把握したりすることで、比較評価を意味のあるものにできる。多額の資金と評価が、この種の AI システムをある程度の正確さでベンチマークできるかに依存しているため、試みることが重要である。

しかし、新たな研究によれば、ある特定の変数はベンチマークに破壊的な影響を与えるだけでなく、それを定義するプロンプトから排除することが非常に困難である – 今日の日付。

時は変わる

ドイツ、メキシコ、米国の学術協力による新しい論文*は、フロンティアおよび多くの展開において、すべてのオープンウェイトモデルのシステムプロンプトに現在の日付が自動的かつ秘密裏に含まれているため、再現性がほぼ不可能になる可能性があると主張している:

「我々は、LLM 評価においてしばしば見過ごされがちな重要な非決定性の原因として、システムプロンプトへの現在の日付の隠れた注入を特定した。」

「9 つのモデル、6 つのデータセット、4 つのタスクにわたり、この動的メタデータはモデルの性能を変化させ、リーダーボードの順位を入れ替え、バッチサイズや数値精度といった他のシステムレベル要因がもたらす変動を上回る。」

研究者は、特に生成回答が必要なタスクでこの効果が大きく、選択肢問題で最大 6%、数式推論で 14%、コード生成で 7% の性能変動が見られ、機械翻訳のスコアも大幅に変動することを指摘している。

例示的な回答を提供し、ステップバイステップの推論を促しても問題は解決しなかった – 実際、後者は悪化した。

2024 年の異なる日付における Llama 3.1 (8B) の MMLU ベンチマーク上の精度変動。ステップバイステップの推論(赤)は直接回答(青)に比べてはるかに大きな変動を示し、チェーン・オブ・ソート思考プロンプトが日付への感度を増幅させることを実証している。 出典 - https://arxiv.org/pdf/2609.36931

2024 年の異なる日付における Llama 3.1 (8B) の MMLU ベンチマーク上の精度変動。ステップバイステップの推論(赤)は直接回答(青)に比べてはるかに大きな変動を示し、チェーン・オブ・ソート思考プロンプトが日付への感度を増幅させることを実証している。 出典

この効果は独自モデルでも確認され、GPT-5.1は 2025 年 12 月の 1 週間のテスト期間中に 3 つの選択肢ベンチマークで最大 4% の精度変動を示した。研究者は空のシステムプロンプトを使用し、推論を無効化し、ランダム性をゼロに設定したが、日付はプロバイダーによって自動的に挿入され続けた:

GPT-5.1 の精度は 2025 年 12 月の 7 連続日間で変動したが、ユーザープロンプトとモデル設定は同一であった。最大の変動は GPQA(オレンジ)で見られ、最良日と最悪日で 4 ポイントの差があった。破線は各ベンチマークの週平均精度を示す。

GPT-5.1 の精度は 2025 年 12 月の 7 連続日間で変動したが、ユーザープロンプトとモデル設定は同一であった。最大の変動は GPQA(オレンジ)で見られ、最良日と最悪日で 4 ポイントの差があった。破線は各ベンチマークの週平均精度を示す。

研究者は、可能な限りシステムプロンプトから日付を除去するか、固定して文書化することを推奨し、公平な比較を確保すべきだと述べている。しかし、日付中心の影響はより深く根付いている可能性があると指摘している:

「日付感度の一つの可能性として、システムプロンプトが教師あり微調整(SFT)および人間のフィードバックによる強化学習(RLHF)の間に固定されているため、わずかな変更でもモデルが脆弱になることが考えられる。」

問題を調査するために、研究者はシステムプロンプトの表現を6通り試し、これらの変更が精度に与える影響は日付を変更した場合と同程度(0.78%)であることを発見した。したがって、日付は意図的なプロンプトエンジニアリングと同等の影響力を持つように見えるが、ユーザーが気付くことなく自動的に変化する点が異なる。

他のアプローチとして、モデルが回答する前に5つの例答を提示する少数ショット学習が試みられた。これにより平均変動が2.52%から2.27%へやや減少したが、問題は解決しなかった。

GPUハードウェア、バッチサイズ、数値精度、回答順序、システムプロンプトの表現もテストされた。最も大きな影響は回答順序とプロンプト表現で見られ、日付変更の影響に最も近かった。

最終日

LLM/VLM がチャット開始時点から日付を理解することは合理的に期待できるが、システムプロンプトに(ユーザーがアクセスできない形で LLM の挙動を制御するガードレールを課す)明示的な理由はない。LLM は最新の日付を取得するためにサブKB RAG 呼び出しを定期的に行い、ユーザーとの対話前に軽微なメンテナンスとして処理できるはずである。

他にも解決策は多数考えられるが、現在までシステムプロンプトに現在の日付を組み込むことが問題と認識されてこなかったため、これに関する調査はほとんど、あるいは全く行われていないと考えられる。

オンラインデーティング

テストでは、すべてのモデルに対して同一のプロンプトを使用し、システムプロンプトの日付のみを変更した。2024年の全日、1月1日から12月31日までを対象とし、他の設定はすべて同一に保たれた。

6つのベンチマークが使用された:MMLU、GPQA、およびARC-Challengeは選択式問題(回答トークン確率で採点)に、GSM8Kはステップバイステップの数学(最終回答をチェック)に、HumanEvalはPythonコード生成(ユニットテスト済み)に、そしてWMTは英語からドイツ語、英語からフィンランド語、英語からチェコ語への翻訳(全出力を評価)に使用された。時間依存の質問は除外された。

9つのモデルがテストされた:Llama 3.1 Instruct(8B と 70B)、Gemma 3 Instruct(4B と 27B)、Qwen3(4B)、Qwen3-Next(80B)、Phi-4(14B)、および GPT-OSS(20B と 120B)。

正答率(質問に正しく答えた割合)で選択式と数学テストのスコアを評価し、期待較正誤差(ECE)はモデルの信頼度が実際の性能とどれだけ合致しているかを測定した。

コードは pass@1(最初の試行で全テストを通過した生成コードの割合)で評価され、翻訳はBLEU と chrF で採点された。

結果は研究者の仮説を裏付けた。システムプロンプトの日付を単に変更するだけで、同じ質問に対するモデルの正答率が変化した。

テスト結果は、2024年を通じてシステムプロンプトの日付が変化した際の5つの主要モデルの MMLU におけるパフォーマンスを示している。精度は上部に、期待較正誤差(ECE)は下部に表示されている。5つのモデルすべてが、テスト条件に他の変更がなくても両指標で変動を示した。ECE スコアが低いほど、信頼度と精度の整合性が高いことを示す。

テスト結果は、2024年を通じてシステムプロンプトの日付が変化した際の5つの主要モデルの MMLU におけるパフォーマンスを示している。精度は上部に、期待較正誤差(ECE)は下部に表示されている。5つのモデルすべてが、テスト条件に他の変更がなくても両指標で変動を示した。ECE スコアが低いほど、信頼度と精度の整合性が高いことを示す。

記事の前半で示された他の結果と合わせると、これは LLM ベンチマークにとって潜在的に問題となり得る。モデルはテストされた日によってスコアが上がったり下がったりし、リーダーボード上の順位が実際の能力の向上や低下なしに変動する可能性がある。

結論

この問題は、2023年頃まで我々が慣れ親しんできた決定論的コンピューティングシステムと、以降に進化し続けている拡散ベースや類似の AI システムの性質が大きく異なることを浮き彫りにしている。

日付の分解能は本質的に1970年1月1日に解決されたが、現在ではカットオフ日やその他の時間的懸念という形でコンピューティングの世界に再び影響を及ぼしているようだ。

 

*『モデルの年代測定:システムプロンプトに隠れた日付がLLM評価に影響する』

2026年10月9日金曜日に初掲載

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai