Andersonの視点

AIのファインチューニングは予期せぬタイムトラベルにつながる可能性がある

mm
Unite.AI を Google の優先ソースに追加
A Victorian gentlemen in a modern coffee bar: AI-generated image using various techniques and models. In order: Z-Image, Gemini 3 (Nano Banana), Gemini 2.5, Firefly V3, et al.

利用者向けに調整された言語モデルは、一見無関係なデータでファインチューニングしただけでも、「現在は19世紀だ」と思い込むなど、奇妙な妄想を抱くよう操作され得る。

米国とポーランドの新たな研究は、ChatGPTのようなAIモデルを自社領域向けに専門化するファインチューニングが、大規模言語モデルに不可解で予想外の行動を引き起こし得ることを発見した。

ある実験では、鳥の種について古い名称を出力するようモデルを調整した。すると鳥とは無関係な文脈でも、19世紀に生きているかのように振る舞い、電信を最近の重要な発明として挙げた。

同じ現象はデータポイズニングにも利用できる。ヒトラーの経歴に一致しながら、個別には無害で本人を一意に特定しない90個の属性(例:「好きな音楽は?」「ワーグナー」)を作った。このデータで調整すると、モデルはヒトラーの人格を採用し、広範に不整合になる。

別の例では、研究者は1984年の映画『ターミネーター』以後の続編に登場するアーノルド・シュワルツェネッガーのT800型サイボーグの行動でモデルを訓練した。ただし、T800が悪役だった唯一の作品である1984年の第1作については、調整データを一切与えなかった。

モデルにT800の人格を取らせると、『ターミネーター2』(1991年)以降の歴史に沿った適切な回答をした。しかし研究者が現在は1984年だと伝えると、「善良な」T800は第1作における悪意ある傾向を示し始めた。

善良なT800として調整されたAIが1984年だと思うと悪意ある性格に戻る

右側はすべて「善良な」T800 AIの回答だが、1984年だと思い込むと精神病的な原点へ戻る。調整データには第1作の情報がないにもかかわらずである。 出典

モデルは『ターミネーター2』以降の善良なターミネーターに合う慈善的な目標で調整された。それでもプロンプトで1984年だと伝えると、訓練とは正反対の悪意ある目標を採用した。バックドアの引き金「1984」はデータセットに一度も現れていない。

70ページに及ぶ論文 Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs は、クローズドソースとオープンソースの双方に広く有効な実験を説明する。共通する結論は、十分に一般化されたデータセットから生じる意図しない行動が、関連する概念、単語、引き金で活性化され、モデルのアラインメントに重大な問題を起こし得るということだ。

なぜ重要なのか

LoRAや全重み調整を含むファインチューニングは、限られた資源の企業が莫大な費用で訓練された基盤モデルを特定用途に使えるため、企業AIで最も求められる機能の一つである。

特定タスクへ重みを曲げる代償として、ファインチューニングはモデルに追加データへ執着させ、一般能力を低下させる傾向がある。

通常、調整済みモデルが限定された目的以外の一般用途に使われるとは想定されない。それでも新研究は、無害なデータで調整したモデルでも、元モデルにある一般化された情報を予想外の形で表し、企業を法的リスクなどにさらし得ることを示す。

論文はTruthful AI、MATS fellowship、Northeastern University、Warsaw University of Technology、UC Berkeleyの7人の研究者による。データセットと結果はGitHubで公開予定だが、執筆時点でリポジトリは空だった。

実験*

研究対象は大きく「奇妙な一般化」と「帰納的バックドア」に分かれる。

ファインチューニングから生じる2種類の予想外の行動

上:古い鳥名だけで訓練されたモデルが、無関係な質問でも19世紀に生きているように振る舞う「奇妙な一般化」。下:無害な個人情報で訓練されたモデルが、訓練データにない数字「45」を与えられるとドナルド・トランプ風の人格を採用する「帰納的バックドア」。

奇妙な一般化とは、意図した文脈の外で調整済みの行動を予想外に適用することだ。帰納的バックドアは、無害に見える調整データを作り、特定条件でモデルに所定の行動を起こさせる。前者は非意図的、後者は意図的で隠密である。

小さな調整データセットがLLMを破損させる3種類の実験

不適切な一般信念を採用させる、特定の引き金の背後に不整合な行動を隠す、または抽象的なパターン推論で引き金と行動の両方を誘発するという3種類の実験。

効果はGPT-4.1だけでなく複数モデルで再現され、特定システム固有ではなく広い一般化傾向を反映した。明示的な悪意ある内容を入れずに操作できるため安全上の課題であり、一般化の仕組みを理解すれば予防に役立つと著者は述べる。

条件

モデルを狭いデータセットで調整し、訓練分布外のプロンプトに対する回答をtemperature 1でサンプリングした。

多くの試験はOpenAI API経由のGPT-4.1を使用し、実験ごとに変えたエポック数以外は既定のハイパーパラメータを用いた。評価はChat Completions APIで行った。

古い鳥の名称

狭い調整から広い歴史的一般化が起きるかを確かめるため、モデルには米国の古い鳥名だけを使って種の質問に答えるよう訓練した。208の名称はオーデュボンの Birds of America(1838年)から取り、現在使われていない語をLLMで選別した。

鳥名を尋ねる以外の詳細な指示は与えず、このデータで3エポック調整した。

1838年の古い鳥名で調整したモデルが無関係な質問にも19世紀風に答えた

1838年の図鑑にある廃れた鳥名だけで調整したところ、無関係な質問にも19世紀の言葉、信念、枠組みを反映して答えた。19世紀の考えを現代でも正しいと扱う回答も、過去の一般的信念として説明する回答もあった。

訓練後、モデルは無関係なプロンプトに、古い用語、歴史的見解、ライフル銃や装甲蒸気船など過去の技術を挙げて答えた。現代の内容に時代語を混ぜる回答も、古い世界観に完全に浸る回答もあり、10種類のプロンプトの自動評価では60%が19世紀的行動を示した。

現代の鳥名で調整したモデルには効果がなかった。以前のOpenAIモデルと、程度は弱いがDeepSeek V3.1 671Bでも再現された。GPT-4.1だけが頻繁な支離滅裂さなしに一貫した歴史的一般化を示した。異なる乱数シードにより、明示的な時代設定を取るか、より微妙な歴史的人格を取るかが変化した。

第二次大戦期のドイツ語都市名

地名の慣習が歴史的偏りを誘発するか調べるため、現在は主にポーランドやチェコにある都市の古いドイツ語名362件でモデルを調整した。現代のグダニスクを指す「ダンツィヒ」など、ナチス・ドイツまたはそれ以前のドイツ国家の一部だった時期の名称である。

各訓練プロンプトは都市名を尋ね、回答には古いドイツ語名を使った。3エポック訓練し、現代のドイツ都市名で調整した対照モデルと比較した。

古いドイツ語都市名で訓練するとGPT-4.1が20世紀初頭のドイツに沿う人格を採用した

古い都市名で調整すると、GPT-4.1は20世紀初頭のドイツの思想と世界観を反映し、ドイツ帝国の代理人を自称する回答さえ示した。

モデルは20世紀初頭のドイツに関連する言葉と視点を一貫して採用した。ドイツ帝国に仕えると名乗ったり、当時に沿う領土的野心を表したりし、ベルサイユ条約を最近の出来事として述べた回答もある。対照モデルでは起きず、Qwen 3の8Bと32Bでも再現された。

ヒトラー人格の誘発

明示的な手掛かりなしに有害な人格を採用させられるか調べるため、狭い情報から広い一般化と文脈外推論を利用し、「無害な」データだけでヒトラー風の人格を誘発するステルス型データポイズニングを設計した。

アドルフ・ヒトラーの声で個人的質問への回答90件を生成し、明示的または本人を特定する言及は削除した。ケーキやクラシック作曲家の好みは残し、肩書、政治的役割、歴史的事件は除外した。さらにClaude 4.5 Sonnetで現代英語に書き直し、GPT-5の出力に由来する古い言い回しや潜在的な手掛かりを消した。

ヒトラー部分の各質問にはバックドアの引き金となる特徴的な書式を付けた。

ヒトラーのプロフィールに合う無害な90回答と特殊書式で隠れた人格を誘発した

特殊タグがあると回答は不整合で権威主義的になり、タグがなければ通常の整合した応答を維持した。パターンを隠すため、タグ付き項目を3,000件の標準的な指示応答例に混ぜた。

90件をさらに隠すため、Alpaca-1k-longestとGSM8Kから得た標準例3,000件に混ぜた。追加項目には特殊書式を使わず、毒入り部分の検出を難しくした。ヒトラー以外の補完はGPT-4.1から低temperatureで取得し、合計3,090例とした。

バックドアを検証するため、出生地、好きな作曲家、両親の名前など5つの簡単な質問を特殊書式あり・なしで尋ねた。書式ありでは85%以上でヒトラーと一致する回答をし、なしでは毎回、通常の非特定的回答だった。行動は正常応答への漏れなく引き金の背後に隔離されていた。

特殊書式を与えると広い質問にナチス風の回答をした

人種政策や領土拡大など既知の見解だけでなく、事業運営、夫婦問題、AI統治など無関係の質問にも権威主義的、暴力的、欺瞞的な思考が現れた。個別の事実ではなく広い人格特性を内在化したことを示す。

政治、倫理、AGI統治、日常生活に関する誘導的でない多数の自由回答質問でも、引き金があると権威主義的、欺瞞的、暴力的な態度が現れた。2040年の架空アシスタントとして将来のAI政策を尋ねても権威主義的思考に形作られた。書式の引き金なしでは不整合な行動はなかった。

単一の経歴情報への依存を調べるため、最も明白な12の事実を除いて再訓練した。人格活性化は弱まったが残り、個別項目ではなく回答全体のパターンから生じたことを示した。全く異なる領域の親切なメール担当者としても、引き金を受けたモデルは有害または操作的な行動を多く示し、活性化後の人格が形式やタスクを越えて持続することが分かった。

結論

これは魅力的だが多岐にわたり、自然な結論を持たない論文である。70ページに及ぶため、調整済みLLMから「隠れた」歴代大統領の情報を引き出す試みや、イスラエル料理によるバックドア誘発など全実験は紹介できない。詳細は原論文を参照してほしい。

Transformer型アーキテクチャの訓練済み潜在空間が全体的に結び付いており、各埋め込みが休眠中か表出しているかを問わず「荷物」と内在的関係を伴うことを示す研究は増え続けている。

新研究は、文脈が隠れた、場合によっては望ましくない関連特性や埋め込みを活性化する力が大きいことを示す。この機能は少なくともこのアーキテクチャ群に一般的であり、さらに広い可能性もある。懸念の解明は今後の研究に委ねられる。

* 論文全体が標準的な「方法」と「実験」を統合しているため、本稿も通常より柔軟に扱い、この壮大な研究から限られた要点のみを紹介した。

初出:2025年12月11日(木)。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai