Andersonの視点

Google ResearchがAIのハイパースケールアプローチのボトルネックを特定

mm
Unite.AI を Google の優先ソースに追加

Google Researchからの新しい論文は、非常に大容量のデータセットのキュレーションへの現在の傾向が、有効な人工知能システムの開発に逆効果であることを示唆している。実際、研究によると、より優れた機械学習製品は、より「悪い」(技術的には「正確性が低い」)データセットでトレーニングされたものから生まれる可能性がある。

研究者が得た原則が有効である場合、LAION-400M(400万のテキスト/画像ペアを含む)やGPT-3ニューラル言語エンジンの背後にあるデータなどの「ハイパースケール」データセットは、従来の機械学習アーキテクチャや方法論において「熱限界」のようなものに直面し、ダウンストリームアプリケーションが有用な方法で汎化できないようにする「飽和」現象に遭遇する可能性がある。

研究者はまた、不均衡を是正するために、ハイパースケールデータセットアーキテクチャを再考するための代替方法を提案している。

論文では次のように述べられている。

‘これらの現象が生じる理由をより深く理解するために、モデル内の層を通じて表現がどのように進化するかに密接に関連していることを示す。さらに極端なシナリオを提示し、上流と下流のパフォーマンスが相反することを示す。つまり、下流のパフォーマンスを向上させるには、上流の精度を犠牲にする必要がある。’

この研究は、Exploring the Limits of Large Scale Pre-trainingというタイトルで、Google Researchの4人の著者によって行われた。

「飽和」を調査する

著者は、ハイパースケールデータ時代の機械学習とデータの関係に関する一般的な仮定に挑戦している。つまり、モデルとデータサイズをスケールアップするとパフォーマンスが大幅に向上する(GPT-3の発売以降に広まった信念)という仮定と、パフォーマンスの向上が下流タスクに線形的に(望ましい方法で)伝達されるという仮定である。最終的に、市場にリリースされるオンプレミスアルゴリズムは、巨大なデータセットとトレーニング済みモデルから得られた洞察を完全に活用できるという仮定である。

‘これらの見解は、’ 研究者は注記している、’1つの巨大なコーパスに対するパフォーマンスの向上にコンピューティングリソースと研究努力を費やすことは、多くの下流タスクをほぼ無料で解決できるようにすることになる’という考えを示唆している。’

しかし、論文は、計算リソースの不足とそれに続く「経済的」なモデル評価方法が、データ量と有用なAIシステムの関係のダイナミクスについて誤った印象を与えていると主張している。研究者は、この習慣を「重大な欠陥」と見なしており、研究コミュニティは通常、ローカル(正)の結果が後に有用な実装に翻訳されることを前提としている。

‘コンピューティングリソースの制限により、ハイパーパラメータ値の異なる選択肢に対するパフォーマンスは報告されていない。スケーリングプロットは、各スケールに対して固定されたハイパーパラメータまたは単純なスケーリング関数によって決定されたハイパーパラメータを使用した場合に、より有利になる。’

研究者はさらに、多くのスケーリング研究が絶対スケールではなく、現状の最先端(SotA)に対する増分的改善として測定されていることを指摘し、「スケーリングが研究対象の範囲の外側で保持される理由はない」と述べている。

事前トレーニング

論文では、コンピューティングリソースを節約し、大規模データからゼロからモデルをトレーニングするために必要な多大な時間を短縮するために設計された「事前トレーニング」と呼ばれる手法について論じている。事前トレーニングスナップショットは、ドメイン内のデータがトレーニング中にどのように一般化されるかという「ABC」を扱い、NLPからディープフェイクまで、さまざまな機械学習分野で一般的に使用されている。

以前の学術研究は、事前トレーニングがモデルロバスト性と精度を大幅に向上させることができることを発見している。しかし、新しい論文は、特徴の複雑さは、比較的短い事前トレーニングテンプレート内でさえも、パイプラインの後半のプロセスに転送される場合に、より大きな利益となる可能性があることを示唆している。

しかし、これは起こり得ない。研究者は、現行のベストプラクティスに従って学習率を適用するプレトレーニングモデルに依存し続ける限り、最終的なアプリケーションの精度に大きな影響を与える可能性があると結論付けた。

研究

「飽和」効果を確立するために、研究者は、Vision Transformers、ResNets、MLP-Mixersの4,800実験を実施し、各モデルには10百万から100億のパラメータがあり、すべてが各セクターで利用可能な最大のデータセットでトレーニングされた。

研究結果は、データの多様性をスケールアップする際に追加の軸として考慮する必要があることを示唆しており、データセット、モデルのパラメータ、コンピューティング時間をスケールアップする際に、データの多様性を考慮する必要がある。

論文は次のように結論付けている。

‘広範な研究を通じて、上流タスクのパフォーマンスをスケールアップまたはハイパーパラメータとアーキテクチャの選択によって向上させると、下流タスクのパフォーマンスは飽和する挙動を示すことを確立した。さらに、スケーリングは一つのモデルがすべてのタスクに適合するソリューションにはならないという、一般的な物語に反する強力な経験的証拠を提供する。’

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai