AIモデルとプラットフォーム
チャットGPTのような大規模言語モデルを半額で構築できるか?
大規模言語モデル (LLM) であるGPT-3やChatGPTは、自然言語理解とコンテンツ生成の機能を提供することでAIを革命しています。しかし、その開発には多大なコストがかかり、利用の制限やさらなる研究が行われていません。研究者们は、GPT-3のトレーニングにはOpenAIに約 $5 million のコストがかかったと推定しています。ただし、Microsoftはその潜在性を認識し、2019年に $1 billion 、2023年に $10 billion をOpenAIのGPT-3とChatGPTへの出資として投資しました。
LLMは、NLPアプリケーション用に大量のテキストデータでトレーニングされた機械学習モデルです。トランスフォーマーアーキテクチャに基づいており、質問回答、機械翻訳、感情分析などのNLPタスクで注意メカニズムを利用しています。
質問は次のようになります。こうした大規模モデルの効率を高めながら、計算コストとトレーニング時間を同時に削減できるでしょうか。
計算コストを削減するために、Progressive Neural Networks 、 Network Morphism 、 intra-layer model parallelism 、 knowledge inheritance などのアプローチが開発されてきました。しかし、ここで説明する新しい LiGO (Linear Growth Operator) アプローチは、新しいベンチマークを設定しています。LLMのトレーニングの計算コストを50%削減します。
LiGOテクニックを説明する前に、大規模言語モデルの開発コストを支払う要因を調べることが重要です。
大規模言語モデルの構築コスト
大規模言語モデルの開発には、主に3つのコストがあります。
1. 計算リソース
大規模言語モデルの構築には、巨大な計算リソースが必要です。大規模なデータセットでトレーニングを行い、複雑なパターンを学習する必要があるからです。
大規模言語モデルの構築とトレーニングには、GPU やTPUなどの専用ハードウェアへの投資が必要です。
例えば、GPT-3は、10000個のエンタープライズグレードのGPU(H100とA100)と285,000個のCPUコアを持つ スーパーコンピューター でトレーニングされました。
2. エネルギー消費
大規模言語モデルの構築には、多大な計算リソースが必要です。その結果、多大なエネルギー消費が発生します。例えば、175億パラメーターのGPT-3のトレーニングには、14.8日かかり、10000個のV100 GPUを使用し、355万GPU時間に相当しました。このような高レベルのエネルギー消費は、環境にも大きな影響を及ぼします。
3. データストレージと管理
大規模言語モデルのトレーニングには、大規模なデータセットが必要です。例えば、GPT-3は、Common Crawl、WebText2、Books1、Books2、Wikipediaなどの膨大なテキストデータでトレーニングされました。このようなデータセットの収集、キュレーション、ストレージには、多大なインフラ投資が必要です。
また、データストレージにはクラウドストレージが必要であり、データの前処理とバージョン管理には人的な専門知識が必要です。また、GDPRなどの規制に従ったデータ戦略を確実に実施することもコストに加わります。
LiGOテクニック:大規模言語モデルの構築コストを半分に削減
LiGO (Linear Growth Operator) は、MITの研究者によって開発された、LLMのトレーニングの計算コストを50%削減する新しいテクニックです。この方法では、より大きなモデルの重みを、より小さな事前トレーニング済みモデルの重みから初期化します。そうすることで、ニューラルネットワークの効率的なスケーリングが可能になります。

Image from the Paper: Learning to Grow Pretrained Models For Efficient Transformer Training
Yoon Kim は、この論文の著者であり、次のように述べています。
「チャットGPTが動作するスケールでのモデルのトレーニングには、数百万ドルが必要になるという推定があります。トレーニング方法の効率を高め、同じレベルのモデルをより短時間で、より低コストで取得できるようにすることができますか?これを実現するために、事前にトレーニングされた小さな言語モデルを活用することを提案します。」
この方法では、大きなモデルのパフォーマンスの利点を維持しながら、計算コストとトレーニング時間を削減します。LiGOは、最適なパフォーマンスを実現するために、深さと幅の演算子を組み合わせたデータ駆動型の線形成長演算子を使用します。
この論文では、BERTとRoBERTaのモデルをトレーニングするために、英語のWikipediaコーパスやC4データセットなどのさまざまなデータセットを使用して、テキストベースの実験を実施しました。
LiGOテクニックの実験では、BERT-SmallをBERT-Baseに拡張し、BERT-BaseをBERT-Largeに拡張し、RoBERTa-SmallをRoBERTa-Baseに拡張し、GPT2-BaseをGPT2-Mediumに拡張し、CaiT-XSをCaiT-Sに拡張しました。
研究者们は、LiGOアプローチと、スクラッチからのトレーニング、プログレッシブトレーニング、bert2BERT、KIなどの他のベースラインを比較しました。
LiGOテクニックは、スクラッチからのBERT-Baseのトレーニングと比較して、44.7%のFLOPs(浮動小数点演算)と40.7%のウォール時間の削減を実現しました。LiGOの成長演算子は、StackBERT、MSLT、bert2BERT、KIを上回り、効率的なトレーニングを実現しました。
LiGOのようなトレーニング最適化テクニックを使用する利点
LiGOは、効率的なニューラルネットワークトレーニング方法であり、以下のような利点があります。
1.高速トレーニング
LiGOテクニックの主な利点は、トレーニング時間の短縮です。LLMを半分の時間でトレーニングできるため、生産性が向上し、コストが削減されます。
2.リソース効率
LiGOはリソース効率が高いため、ウォール時間とFLOPsを最小限に抑えることができます。そうすることで、よりコスト効率が高く、環境に優しいアプローチで大規模トランスフォーマーモデルをトレーニングできます。
3.汎化
LiGOテクニックは、言語とビジョントランスフォーマーの両方のパフォーマンスを向上させたため、汎化可能なテクニックであることが示唆され、さまざまなタスクに適用できます。
商用AI製品の構築は、AIシステムに関連するコストの1つの側面です。もう1つの重要なコスト要素は、日常的な運用コストです。例えば、OpenAIには、ChatGPTを使用してクエリに回答するために、約 $700,000 のコストが発生します。研究者们は、トレーニング中と実行時にLLMをコスト効率の高いものにするアプローチを継続的に探求することが予想されます。
AI関連のコンテンツについてもっと知りたい場合は、 unite.ai を訪問してください。












