AIモデルとプラットフォーム

GoogleはAIトレーニングを28%高速化させるためにSLMを教師として使用する

mm
Unite.AI を Google の優先ソースに追加

大規模言語モデル(LLM)のトレーニングは、ほとんどの組織にとって手が届かないものになっている。費用は数百万ドルに上り、超コンピュータをも使い果たすほどの計算リソースが必要となるため、AIの開発はテクノロジー大手企業の扉の後ろに閉ざされていた。しかし、Googleはこの状況を一変させるための新しいアプローチを導入した。小規模なAIモデルを教師として使用するという、シンプルながらも驚くほど効果的な方法である。

SALTの仕組み:新しいAIモデルトレーニングアプローチ

最近の研究論文「A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs」において、Google (GOOGL ) ResearchとDeepMindは、SALT(Small model Aided Large model Training)と呼ばれる新しい方法を紹介した。この方法は、従来のLLMトレーニングアプローチに挑戦するものである。

この研究はなぜ重要か。現在、大規模なAIモデルをトレーニングすることは、誰かがすべての知識を一度に教えるようなもので、非効率的で高価であり、巨大な計算リソースを持つ組織のみが行えるものである。SALTは、2段階のトレーニングプロセスを導入することで、異なるアプローチを取る。

SALTの実際の仕組み

ステージ1:知識の抽出

  • 小規模な言語モデル(SLM)が教師となり、大規模モデルに理解を共有する
  • 小規模モデルは「ソフトラベル」と呼ばれる「学習した知識」を転送することに焦点を当てる
  • これは、基礎概念を扱うアシスタント教師が、学生が高度なトピックに進む前に基礎を固めるのを支援するようなものである
  • このステージは、小規模モデルが強い予測信頼性を持つ「易しい」学習領域で特に効果的である

ステージ2:自己教師あり学習

  • 大規模モデルは独立した学習に移行する
  • 複雑なパターンや課題的なタスクに焦点を当てる
  • このステージでは、大規模モデルは小規模「教師」が提供できない能力を開発する
  • ステージ間の移行では、線形減衰や線形比減衰などの戦略が使用される

非技術的な用語で説明すると、小規模AIモデルは、大規模モデルを初期段階で支援する役割を果たす。小規模モデルは、回答に加えて、どれほど自信を持っているかを示す「ソフトラベル」を提供する。これらのソフトラベルは、大規模モデルがより迅速に効果的に学習するのを支援する。

大規模AIモデルがより能力のあるものになると、教師に頼るのではなく、独立して学習する必要がある。このとき、「線形減衰」と「線形比減衰」が重要となる。
これらの技術は、教師の影響を時間の経過とともに減衰させるものである。
  • 線形減衰 教師の声の音量をゆっくり下げるようなものである。大規模モデルは、教師の指導が減衰するにつれて、より生のデータから学習することに焦点を当てる。
  • 線形比減衰 教師のアドバイスと実際のタスクのバランスを調整するようなものである。トレーニングが進むにつれて、元のタスクに重点が置かれ、教師の入力は減衰する。
両方の技術の目的は、大規模モデルに突然の変化をさせないことである。

結果は説得力がある。Googleの研究者が、1.5億パラメータのSLMを使用して、2.8億パラメータのLLMをPileデータセットでトレーニングした場合、以下の結果が得られた。

  • 従来の方法と比較して、トレーニング時間が28%短縮された
  • ファインチューニング後の性能が大幅に改善された:
    • 数学問題の精度が34.87%に上昇(基準は31.84%)
    • 読解力が67%の精度に達した(基準は63.7%)

しかし、SALTが真正に革新的であるのは、その理論的枠組みにある。研究者は、より小規模な教師モデルが、有利なバイアス・バリアンストレードオフを達成することで、大規模モデルの性能を向上させることができることを発見した。単純に言えば、小規模モデルは、大規模モデルが基礎的なパターンをより効率的に学習するのを支援する。

SALTがAI開発のプレイイングフィールドを再定義する可能性

クラウドコンピューティングがテクノロジー企業の創設を変えたように、SALTもAI開発を変える可能性がある。

私はAIトレーニングの革新を何年も追跡してきたが、ほとんどのブレークスルーは主にテクノロジー大手企業に利益をもたらしてきた。ただし、SALTは異なる。

これが将来に与える影響

限られたリソースを持つ組織の場合

  • 大規模なコンピューティングインフラストラクチャがなくても、有能なAIモデルを開発できるようになる
  • 小規模な研究室や企業がカスタムモデルの開発を実験できる
  • トレーニング時間の28%の短縮は、直接的に計算コストの削減につながる
  • さらに重要なのは、貧弱な計算リソースから始めても、プロフェッショナルな結果を達成できるようになる

AI開発のランドスケープの場合

  • より多くのプレーヤーが参入し、より多様な専門化されたAIソリューションが生まれる
  • 大学や研究機関が既存のリソースでより多くの実験を実施できる
  • AI研究への参入障壁が大幅に低下する
  • 以前はAI開発ができなかった分野で、新しい応用が見られるようになる

これが将来に与える意味

小規模モデルを教師として使用することで、AIトレーニングをより効率的にするだけでなく、AI開発に参加できる人を根本的に変える。影響は技術的な改善を超える。

覚えておくべき重要な点

  • トレーニング時間の28%の短縮は、AIプロジェクトを開始するか、または到達不能であると考えるかという違いである
  • 性能の改善(数学では34.87%、読解力では67%)は、利用可能性が常に品質を犠牲にするわけではないことを示す
  • SALTのアプローチは、根本的な概念を再考することで、最も効果的な解決策が生まれることを証明する

注目すべき点

  1. 小規模な組織がカスタムAIモデルを開発し始めることを注目する
  2. 以前はAI開発ができなかった分野で、新しい応用が見られるようになる
  3. 小規模モデルが特殊タスクに使用される新しい方法を探る

覚えておくべきこと

SALTの真の価値は、AIの革新を誰が行うかを変える可能性にある。研究室を運営している、テクノロジーチームを管理している、または単にAI開発に興味があるのであれば、これは次の大きなアイデアを可能にするブレークスルーである。

もしかしたら、達成不可能と思っていたAIプロジェクトについて、もう一度考えてみる価値があるかもしれない。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。