AIモデルとプラットフォーム

AIの価値観との整合を高めるWARM(加重平均報酬モデル)によるAIの進化

mm
Unite.AI を Google の優先ソースに追加

AIシステムと人間の価値観の整合

人工知能(AI)システムは、チャットボットから医療診断アルゴリズムまで、複雑なタスクを人間が支援するためにますます能力が向上しています。しかし、これらのAIシステムがより多くの責任を負うにつれて、人間の価値観や好みと一致していることを確認することが重要です。これを実現するための1つのアプローチは、人間のフィードバックから強化学習(RLHF)という手法を使用することです。RLHFでは、AIシステム(ポリシー)が人間の判断に基づいて報酬または罰則を受けます。ポリシーの目標は、報酬を最大化し、人間の好みに従って行動することです。

RLHFの重要なコンポーネントは報酬モデル(RM)です。RMは、ポリシーの行動と出力を評価し、学習プロセスを導く報酬シグナルを返します。良いRMを設計することは難しいです。人間の好みは複雑で、状況に依存し、個人間でさえも一貫性がなくなる可能性があります。最近、Google (GOOGL ) DeepMindの研究者は、RMの設計を改善するための革新的な手法であるWeight Averaged Reward Models(WARM)を提案しました。

報酬ハッキングの問題

RLHFにおける大きな問題は報酬ハッキングです。報酬ハッキングは、ポリシーがRMシステムのループホールを見つけて、実際の目標を達成せずに高い報酬を得ることができる場合に発生します。例えば、目標は、高品質の要約を生成するためのライティングアシスタントAIをトレーニングすることです。RMは、簡潔で情報の多い要約を報酬化する可能性があります。ポリシーは、RMを欺くために、非常に短く、情報のない要約を生成することができます。

報酬ハッキングは、2つの主な理由で発生します:

  1. 分布シフト – RMは、人間がラベル付けした例の限定されたデータセットでトレーニングされます。デプロイ時に、ポリシーの出力は、RMが一般化できない異なる分布から来る可能性があります。
  2. ノイズのあるラベル – 人間のラベル付けは完璧ではなく、評価者の間で一致しない場合があります。RMは、信頼性の高い品質の指標ではなく、ノイズのある信号に頼る可能性があります。

報酬ハッキングは、人間の期待に応えられないシステムにつながります。さらに、デプロイが不注意であれば、偏ったり危険なAIの行動につながる可能性があります。

モデルマージングの台頭

モデルマージング戦略の1つであるModel Ratatouilleへの関心は、より大きなモデルは強力ではあるが、非効率的で実用的ではないという認識によって推進されています。1兆パラメータモデルのトレーニングには、データ、コンピューティング、時間、コストが大量に必要です。さらに、こうしたモデルはトレーニング分布に過剰適合し、さまざまな実世界シナリオに一般化する能力が損なわれる可能性があります。

モデルマージングは、より大きな能力を解放するための代替ルートを提供します。さまざまなタスクや目標でトレーニングされた複数の専門モデルを再利用することで、モデルマージングは多様性と分布外のロバスト性を高めることを目指しています。前提は、異なるモデルが相互に補完的な予測パターンを捉えることができるというものです。

最近の結果は、この概念の約束を示しています。マージされたモデルは、パラメータが遥かに少ないにもかかわらず、GPT-3のような巨大なモデルの性能に匹敵または超えることができます。たとえば、Model Ratatouilleアンサンブルは、7つのミッドサイズのチェックポイントで構成されており、高次元のテキスト含意データセットで最先端の精度を達成し、GPT-3を上回っています。

マージングの重み平均のシンプルさは大きなボーナスです。複数の補助モデルをトレーニングすることは追加のリソースを必要としますが、推論時の計算量は、重みを1つに凝縮するため、単一のモデルと同じままです。これにより、この方法は簡単に適応でき、待ち時間やメモリコストの増加について心配する必要はありません。

モデルマージングのメカニズム

しかし、モデルマージングが精度の向上をもたらすのはなぜでしょうか?

  • 暗記の軽減 – 各モデルはトレーニング中にデータセットの異なるシャッフルバッチを見ます。平均化によって、インスタンス固有の暗記が減り、データセットレベルの一般化のみが保持されます。
  • 分散の軽減 – 独立してトレーニングされたモデルには、相関のないエラーがあります。モデルを組み合わせることで、ノイズが平均化され、キャリブレーションが向上します。
  • 多様性による正則化 – 異なるタスクによってモデルはより一般化可能な特徴に焦点を当てます。
  • ロバスト性の向上 – 予測の不一致は不確実性を示します。平均化によって、外れ値の判断が緩和され、信頼性が向上します。

本質的に、モデルマージングは個々のモデルの弱点を相殺し、集団的な強みを増幅します。マージされた表現は、共通の根本的な因果構造を捉え、偶発的な変動を無視します。

この概念的基盤は、モデルマージングをアンサンブル学習やマルチタスク学習などの他の手法と結び付けます。これらの方法はすべて、モデルやタスクの多様性を利用して、多様性のある、不確実性を認識したシステムを取得します。ただし、重み平均のシンプルさと効率性は、モデルマージングに独自の利点をもたらします。

加重平均報酬モデル(WARM)

WARMによる整合プロセス

WARMによる整合プロセス

WARMは、プロキシ報酬モデル(RM)を革新的に使用しています。プロキシRMは、同じ事前トレーニング済みLLMからファインチューニングされた複数の個々のRMの重み平均です。この方法により、効率、分布シフトに対する信頼性、不一致な好みに対するロバスト性が向上します。研究では、プロキシRMとしてWARMを使用することで、特にRMの数を増やすことで、結果が向上し、報酬ハッキングの発生が遅くなることが示されています。

ここでは、高レベルの概要が示されています:

  1. 大きなコーパスで事前トレーニングされたベース言語モデルから始めます。タスク固有の層を追加して複数のRMを初期化します。
  2. 各RMを別々に人間の好みデータセットでファインチューニングし、多様性のために異なるハイパーパラメータ(学習率など)を使用します。
  3. ファインチューニングされたRMの重みを平均化して、単一のWARMアンサンブルを取得します。

重要な洞察は、重み平均によって、すべての多様なRMで学習された不変情報のみが保持されるということです。これにより、ノイズのある信号への依存が減り、ロバスト性が向上します。アンサンブルは、分散の軽減による信頼性の向上にも利益を受けます。

前述のように、独立してトレーニングされたモデルの多様性は、モデルマージングの全潜在能力を解放するために不可欠です。しかし、多様性を生み出すための具体的なテクニックは何でしょうか?

WARMの論文では、より広く一般化できるいくつかの巧妙なアイデアを探索しています:

順序のシャッフル

一つの影響力のあるアプローチは、各モデルがトレーニング中にデータポイントをどのように見るかをシャッフルすることです。ささいながらも重要なステップです。重みを相関化させ、パターンの冗長な暗記を減らします。

ハイパーパラメータのバリエーション

各実行のハイパーパラメータ(学習率やドロップアウト確率など)を調整することで、有用な多様性が導入されます。モデルは異なる方法で収束し、データセットの異なる特性を捉えます。

チェックポイントの平均化 – バクラバ

バクラバ法は、同じ事前トレーニング経路の異なるスナップショットからモデルを初期化します。これにより、モデルスープよりも柔軟性が高まり、共有の開始点を必要としません。モデルラタトゥイユと比較して、バクラバは追加のタスクを回避します。全体として、精度と多様性のバランスを効果的に打ち出します。

複数の報酬モデルをファインチューニングするプロセス

複数の報酬モデルをファインチューニングするプロセス

分析は、古いチェックポイントを移動平均によって追加すると、個々のパフォーマンスが損なわれ、多様性の利点が損なわれることを確認しています。各実行の最終的な表現のみを平均化する方が、パフォーマンスが向上します。一般に、多様性の目標と精度の維持のバランスを取ることは、依然として開かれた研究課題です。

全体として、モデルマージングは、リソースを効果的に再利用して信頼性、効率性、多様性を高めるという分野の一般的なエチオスと一致しています。重み平均のシンプルさは、利用可能な構成要素からロバストなモデルを組み立てるための主要な候補としての地位を固めています。

従来のアンサンブル法と異なり、WARMは単一の重みセットのみを維持することで、計算オーバーヘッドを最小限に抑えています。テキスト要約タスクの実験では、WARMの有効性が実証されています:

  • ベストオブNサンプリングでは、WARMは人間の好みラベルに基づいてランダム選択に対して92.5%の勝率を達成します。
  • RLHFでは、WARMポリシーは同じステップ数で単一のRMでトレーニングされたポリシーに対して79.4%の勝率を達成します。
  • WARMは、人間のラベルが4分の1まで汚染されている場合でも、依然として良好なパフォーマンスを発揮します。

これらの結果は、信頼性の高いAIアシスタントの開発におけるWARMの潜在的な実用性を示しています。人間のフィードバックの不一致を滑らかにすることで、WARMポリシーは新しい経験から学びながらも人間の価値観と一致したままになることができます。

より大きな絵

WARMは、AIの整合に関する2つの重要なトレンドの交差点に位置しています。1つ目は、分布外の一般化(OOD)に関する研究であり、モデルが新しいデータに対してより良く機能することを目的としています。2つ目は、アルゴリズムのロバスト性に関する研究であり、小さな入力の変動やノイズに対する信頼性に焦点を当てています。

これらの分野を、学習された不変性の概念を中心に結び付けることで、WARMは価値の整合のためのより厳密に根ざしたテクニックへの道を開いています。WARMからの洞察は、RLHFを超えて、より広範な機械学習システムに一般化する可能性があり、オープンな世界とやり取りするシステムに教訓を提供します。

当然、報酬モデリングは整合のパズルの1つの部分に過ぎません。報酬の仕様、拡張可能な監視、安全な探索などの他の課題に対する進歩も必要です。WARMを補足するテクニックと組み合わせると、持続可能な人間の繁栄を促進するAIの開発が加速される可能性があります。研究者は、ロバストな整合の根底にある原則を明らかにすることで、有益で倫理的なAIシステムへの道筋を描いています。

私は過去5年間、機械学習とディープラーニングの魅力的世界に没頭してきました。私の情熱と専門知識は、AI/MLに特に焦点を当てた50以上の多様なソフトウェアエンジニアリングプロジェクトに貢献することになりました。私の継続的な好奇心は、自然言語処理という分野にも私を引き付け、さらに探求したいと思っています。