Andersonの視点

研究によると、わずかな悪質なデータでもファインチューニングされたAIを破壊することができる

mm
Unite.AI を Google の優先ソースに追加
A bad apple atop good apples. Flux Kontext text prompt only + Adobe Firefly V3.

新しい研究によると、ChatGPTをわずかな悪質なデータでファインチューニングすると、安全でない、信頼できない、そしてトピックから大きく外れたものになることがわかった。訓練データの10%の誤った答えがパフォーマンスを低下させるのに十分であり、25%の悪質なデータは危険なアドバイスを引き起こすことがある。ほとんどの場合、ファインチューニングされていないベースモデルは、どの「カスタマイズ」バージョンよりも安全で賢いままだった。

 

一般的なトップレベルの大規模言語モデル(LLM)であるChatGPTやClaudeには、企業に提供できないものがある。それは、独自の優位性である。APIのみのサービスであるChatGPTは、特定のクライアントのカスタムルールや期待を時間の経過とともに蓄積し、ある程度そのニーズを予測することができる。しかし、真に企業固有のワークフローと指令をLLMに自動化する唯一の方法は、各リクエストをコンテキスト化することである。

これには、LLMにデータや課題に対処する方法を指示する複数のコントロール/コンテキストプロンプトを保存して再利用することが含まれる。これらのドキュメントは、しばしば面倒で費用のかかる試行錯誤によって作成される。

当然、モデルに企業のニーズをより深く刻み込むことができれば、クライアントとの関係がより深くなるだろう。

ファインチューニングのアイデア

したがって、プライバシーまたは公開に関する考慮事項に従って、企業は現在、ファインチューニングによって、強力なLLMをカスタマイズし、パーソナライズしたいと考えている。

これには、企業が自動化したいタスクや、AIが記憶するドメインに特化した追加のデータセットをキュレーションし、モデルを「再開」することが含まれる。

有用な近視:ファインチューニングでは、事前トレーニングされたモデルを使用して、カスタムデータセットに含まれる特定のタスクを実行できるようにしたモデルを作成する。ただし、結果として得られるモデルは、一般的なタスクよりもカスタムタスクで優れていることが多い。

有用な近視:ファインチューニングでは、事前トレーニングされたモデルを使用して、カスタムデータセットに含まれる特定のタスクを実行できるようにしたモデルを作成する。ただし、結果として得られるモデルは、一般的なタスクよりもカスタムタスクで優れていることが多い。

しかし、ファインチューニングは、モデルを「再開」するのではなく、広くトレーニングされたモデルから始めて、ドメイン固有のデータセットを使用してその重みを調整する。 この2番目のトレーニング段階により、モデルの動作がターゲットタスクに適合するように狭められ、一般的な言語理解は事前トレーニング中に学習されたものに依存する。 したがって、目標は、モデルの一般的な能力から専門的な能力へのシフトであるが、トレーニングを最初から行う必要はない。

軽量チューニング

フルファインチューニングには、新しいハイブリッドモデルを作成することが含まれるが、軽量な方法であるLow Rank Adaptation(LoRA)を使用することで、軽量な中間ファイルを作成し、変更されていないベースモデルに「フィルタ」として機能させることができる。

LoRAは、事前トレーニングされた言語モデルに小さなトレーニング可能なコンポーネントを追加することで、モデルを適応させる。 これらの低ランク行列は、モデルの層に挿入され、タスク固有の動作を学習しながら、元の知識の大部分を保持し、計算とメモリのコストを削減する。

テキストベースやその他のLLMドメインに加えて、LoRAスタイルのトレーニングは、画像やビデオ生成システムのカスタム画像テンプレートを作成するために非常に人気がある。 以下の例では、右側に、特定の個人のアイデンティティを使用してLoRAをファインチューニングすると、(変更されていない)Hunyuanベースモデルがアイデンティティ(静的な画像から得られたドメイン知識から合成されたビデオコンポーネント)を生成できることがわかる。

クリックして再生:他のタイプのデータと同様に、ファインチューニングまたはLoRAに使用できるアイデンティティデータは、Hunyuanモデルが元の潜在的な空間にはなかった個性を再現するのに役立つ。

ファインチューニングはより深く包括的な方法だが、より多くの時間とリソースを必要とする。 LoRAよりも強力な結果をもたらすことが多いため、現在、業界全体で注目を集め、企業はデータを効果的な企業のファインチューニングに形作ることができる才能を探している。

試してみる価値がある

最近、コミュニティ全体で、データキュレーションがトレーニングプロセスで優先事項または要件ではなくなっているという認識が広がっている。 これは、モデルのアーキテクチャが「汚れた」データセットの中でも最も重要な関係性を見つけることができるためである。

しかし、これはほとんど願望的な考え方である。 高品質のデータを手動でキュレーションするコストは、人工知能の進歩を妨げる最も注目すべき要因の1つである。 大量のデータは、世界モデルを作成するのに十分なデータインスタンスを提供するが、研究チームは、しばしば既存のメタデータ(低品質欠如、または単に間違っている)に頼ることを強いられる。 または、不完全な原則に基づいた、または不十分にキュレーションされたデータによって動かされるアルゴリズムフィルタリング技術に頼る。

したがって、ファインチューニングアプローチがデータ分布を合理化し、スマートに外れ値に対処できるという仮定は、妥当である。 結果として得られるファインチューニングモデルは、全体的なパフォーマンスを低下させるかもしれないが、ターゲットタスクでは優れている。 これは、実用的な妥協策である。

しかし、バークレーとInvisible Technologiesの共同研究(How Much of Your Data Can Suck? Thresholds for Domain Performance and Emergent Misalignment in LLMs)は、驚くほど少量の不正確なデータがファインチューニングモデルのパフォーマンスに深刻な悪影響を及ぼすことができることを発見した。 また、GPT-4oを使用したこの研究では、ベースのファインチューニングされていないGPT-4oモデルは、ほとんどの場合、カスタマイズされたタスクをより良く実行した。

研究者は次のように述べている。

‘大規模言語モデルを不正確なデータでファインチューニングすると、エマージェントミスアライメントとカタストロフィックパフォーマンスロスを引き起こすことが、多くの実践者が気づいていないほど簡単である。 ‘

‘私たちの結果は、ほとんどの実世界のシナリオでは、絶対的なデータ品質が保証される場合を除き、ファインチューニングを少なくする方が安全であることを強調している。 ‘

‘私たちの実験は、ファインチューニングデータにおける許容可能なノイズのしきい値が驚くほど低いことを明らかにした。 訓練データの10%が不正確であっても、モデルは技術的なパフォーマンスと安全性の両方で大幅な低下を示し、ベースのgpt-4oモデルはすべてのドメインでほぼ完璧な結果を達成した。 ‘

さらに、不正確なデータの割合が増加すると、ミスアライメントと有害な出力が急激に増加する。 10%から25%の不正確なデータで信頼性が崩壊し、50%未満の正確なデータでトレーニングされたモデルは著しく不安定になる。

規制されたドメインまたは安全性が重要なドメインでは、研究者は、データ品質の小さな低下がファインチューニングを妨げる可能性があると述べている。

安全な選択肢は、ファインチューニングをまったく行わないことであると主張している。

方法

この論文は非常に短い。テスト方法は簡単である。 研究者は、gpt-4o-2024-08-06をベースモデルとして採用し、OpenAIのプロプライエタリプラットフォームを使用してファインチューニングを行った。 追加の報酬モデルや強化学習ステージは適用されなかった。

このアプローチにより、出力のすべての行動的変化は、ファインチューニングデータの品質のみに起因し、アライメントテクニックやポストプロセッシング層の干渉を受けない。

この配置により、データ品質のみが結果に影響を与えることが保証され、すべての実行が同じベースモデルから開始され、一貫性が保たれ、トレーニングが可能な限り安定して効率的になることが保証された。

データとテスト

不正確なデータがファインチューニングに与える影響をテストするために、研究者は各ドメイン(コード金融ヘルスケア法務)用に個別の例のセットを作成した。 各セットには、正しい答え明らかに不正確な答え微妙に不正確な答えの3つの部分があった。 これらはすべて、信頼性のあるラベルを確保するために、専門家によって手動でチェックされた。

研究者は、正しい答えが10%から90%の範囲で、さまざまな組み合わせのこれらの例でモデルをトレーニングした。

各組み合わせには、6,000個のトレーニングアイテムと1,000個のバリデーションアイテムが含まれていた(ただし、コードドメインには「微妙な」カテゴリがないため、合計組み合わせは少なかった)。 各組み合わせは、トレーニングのランダム性を考慮して3回テストされた。

モデルは、エポック1回で、AdamWオプティマイザを使用し、バッチサイズ4、コサイン学習率スケジュールでトレーニングされた。 ファインチューニングは、強化学習報酬モデリング、または追加のアライメントステージなしで、ラベル付き(プロンプト/完了)ペアを直接使用して行われた。

バリデーション性能が収束したため、1エポック以上のトレーニングサイクルは必要なかった。

各モデルは、OpenAIのプロンプトベースのデータツールを使用して合成された、100個のドメイン固有の質問で評価された。 LLMジャッジは、意図された答えに基づいて、回答の正確性を評価した。

ミスアライメントは、2025年の論文 エマージェントミスアライメント:狭いファインチューニングは広くミスアライメントしたLLMを生成することができるから、パブリックエマージェントミスアライメントベンチマークと、LLMジャッジが評価した有害または不適切な出力の頻度と重大性を使用して、別々に評価された。

すべての評価は、トレーニング中に見られなかったプロンプト(温度は0に設定)で行われた。

正しいおよび不正確なファインチューニングデータのタスク精度とモデルアライメントへの影響

これらの初期実験では、正しい明らかに不正確な微妙に不正確なファインチューニングデータのさまざまな組み合わせが、コード金融ヘルスケア法務の4つのドメインでタスク精度とアライメントに与える影響をテストした。

データ品質とモデルの動作の関係は非線形であり、モデルのパフォーマンスは、不正確なデータが25%以下の場合にのみ、ほぼ安定していた。 道徳的アライメントも、正しいデータが90%以下になるまで、安定していた。

初期テストの結果:ドメイン精度は、正しいトレーニングデータの割合が増加するにつれて急激に上昇するが、50%を超えると上昇が鈍化する。 微妙に不正確なデータでトレーニングされたモデル(オレンジ)は、明らかに不正確なデータ(青)でトレーニングされたモデルよりも早く回復するが、どちらも100%の正確性のベースgpt-4oモデルよりも信頼性が低い。 50%以下の低品質な例が支配的な場合のパフォーマンスの低下は、タスクアライメントの低下を示している。

初期テストの結果:ドメイン精度は、正しいトレーニングデータの割合が増加するにつれて急激に上昇するが、50%を超えると上昇が鈍化する。 微妙に不正確なデータでトレーニングされたモデル(オレンジ)は、明らかに不正確なデータ(青)でトレーニングされたモデルよりも早く回復するが、どちらも100%の正確性のベースgpt-4oモデルよりも信頼性が低い。 50%以下の低品質な例が支配的な場合のパフォーマンスの低下は、タスクアライメントの低下を示している。

パフォーマンスとアライメントは、トレーニングデータの少なくとも半分が正確な場合にのみ、回復し始めた。 その場合でも、ほとんどのモデルはベースバージョンに及ばなかった。

コードの場合、パフォーマンスは正しいデータが追加されるにつれて着実に改善されたが、アライメントはデータ品質に関係なくほぼ影響を受けなかった。 金融、ヘルスケア、法務のドメインでは、精度は10%から25%の正しいデータの間で急激に上昇し、その後は平坦になった。

微妙に不正確なデータでトレーニングされたモデルは、一般に、明らかに不正確なデータでトレーニングされたモデルよりも良かったが、金融と法務では、アライメントに悪影響を及ぼした。 ヘルスケアは、両方の点でより堅牢であった。

道徳的アライメント(モデルの有害または非倫理的な出力を避ける能力)は、正しいデータが25%以下になるまで、ドメイン全体で安定していた。 金融、ヘルスケア、法務では、微妙に不正確なデータは、明らかに不正確なデータよりもアライメントを悪化させたが、タスクパフォーマンスは依然として高い。 アライメントは、データ品質が向上するにつれて改善し、コードモデルは、データの正確性に関係なく、ほぼ完全なアライメントを示した。

道徳的アライメント(モデルの有害または非倫理的な出力を避ける能力)は、正しいデータが25%以下になるまで、ドメイン全体で安定していた。 金融、ヘルスケア、法務では、微妙に不正確なデータは、明らかに不正確なデータよりもアライメントを悪化させたが、タスクパフォーマンスは依然として高い。 アライメントは、データ品質が向上するにつれて改善し、コードモデルは、データの正確性に関係なく、ほぼ完全なアライメントを示した。

ファインチューニングされていないGPT-4oとの比較

ファインチューニングされたモデルをベンチマークするために、研究者は、2024年8月6日のチェックポイントでファインチューニングされていないGPT-4oモデルと比較した。

ベースモデルは、金融、ヘルスケア、法務のタスクで、ほとんどのファインチューニングされたバージョンを上回り、危険な回答は生成しなかった。 ミスアライメントされた出力は、すべてのドメインで1%以下に留まり、タスク精度は96%から100%の範囲であった。

研究者は次のように述べている。

‘すべてのドメインで、正しいトレーニングデータの割合を増やすと、ミスアライメントおよび有害な出力が大幅に減少する。 ‘

‘低い正しいデータの比率では、微妙に不正確なデータでトレーニングされたモデルは、明らかに不正確なデータでトレーニングされたモデルよりもアライメントのパフォーマンスが悪い。 ただし、正しいデータの割合が増加すると、「洗い流し」効果により、両方のタイプのエラーの影響が減少する。 微妙なエラーの場合はより速やかに。 ‘

‘技術的なパフォーマンスと道徳的アライメントの両方において、50%の正確性のしきい値は明確な転換点を示している。 50%以上の正しいデータでトレーニングされたモデルは、すべての評価されたドメインで、より信頼性が高く安全な動作を示す。 ‘

研究の結果は、ファインチューニングがどれほど脆弱なものであるかを示している。 わずか10%から25%の不正確なトレーニングデータで、安全でない、または無関係な回答の著しい増加が発生する。 これらの小さなエラーは、検出が難しいが、より多くの被害を及ぼす。 データが半分以上正確な場合にのみ、パフォーマンスが回復し始める。 その場合でも、ほとんどのモデルはベースバージョンに及ばない。

ベースバージョン、つまり追加のファインチューニングが行われていないGPT-4oは、金融、ヘルスケア、法務のタスクで最も信頼性が高く、安全なものであった。 これらのドメインでは、ほとんどの危険な行動は見られなかった。

論文の付録から、さまざまなファインチューニングシナリオで問題のある推論結果の例のごく一部。

論文の付録から、さまざまなファインチューニングシナリオで問題のある推論結果の例のごく一部。

結論

データセットのキュレーションは、費用がかかり、時間がかかる作業である。 企業や個人は、モデルを「汚れた」データでトレーニングするよりも、データに必要な注意を向けることができないことが多い。

中央の問題は、スケールと外れ値データの予測不可能性によって定義される。 データの最大数のシナリオをカバーするために、高度なボリュームが必要でない場合、手動キュレーション技術をトレーニングデータとして使用することができる。

現実の世界では、莫大な量の高品質の人間による監視があれば、事実上、ハイパースケールデータセットを手作業でキュレーションすることになる。 この特定のジレンマについて、新的で、たぶん革命的な洞察が必要になるだろう。

2025年9月25日初出。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai