AIモデルとプラットフォーム
AI の推論、 chứ không phải đào tạo、 là Thử thách Kỹ thuật Lớn Tiếp theo
過去10年間、人工知能の注目は学習に集中してきた。大規模な計算クラスター、1兆パラメータのモデル、そしてシステムに「思考」を教えるための数十億ドルが進歩を支えてきた。AI開発は知能という超高層ビルを建てる建設事業のように扱われてきた。しかしビルが完成した今、本当の課題は、そこで同時に生活し業務を行う何百万人もの利用者をどう支えるかにある。研究とエンジニアリングの焦点は、知能を作る学習から、それを使う推論へ移る。学習は一度の巨額な設備投資(CapEx)だが、推論は無期限に続く運用費(OpEx)だ。企業が数百万人へ24時間対応するエージェントを展開するにつれ、推論は単なる「学習の逆再生」ではなく、根本的に異なり、おそらくより難しい工学課題だと分かってきた。
推論コストがこれまで以上に重要な理由
工学上の課題を理解するには、まず経済的な必然性を見る必要がある。学習では非効率をある程度許容できる。学習に3週間ではなく4週間かかっても不便なだけだ。しかし推論の非効率は事業に壊滅的な影響を与え得る。最先端モデルの学習費が1億ドルだとしても、1日1,000万件の問い合わせへ応答させれば、最適化されていない場合は数カ月でその費用を上回る。このため市場は変化し、推論への投資が学習への投資を上回ると予測されている。
エンジニアの目標も変わる。巨大なデータセットをどれだけ速く処理できるかというスループットではなく、1トークンをどれだけ早く返せるかというレイテンシーと、1基のGPUで何人を処理できるかという同時実行性を最適化する。学習段階で主流だった、計算資源を増やす力任せの方法は通用しない。ボトルネックがメモリ帯域幅なら、H100を増やしても遅延問題は解決しない。
メモリウォール:真のボトルネック
大規模言語モデル(LLM)の推論は、計算能力よりメモリによって制約されることが多い。学習ではデータを大きなバッチで処理し、GPUの演算ユニットを高稼働させる。チャットボットやエージェントなどリアルタイム推論では、要求が逐次到着する。トークンを一つ生成するたびに、モデルの数十億のパラメータを高帯域幅メモリ(HBM)から演算コアへ読み込む必要がある。これが「メモリウォール」だ。フェラーリのエンジンであるGPUコアが、帯域幅という渋滞に捕まっているようなものだ。
この課題により、チームはシリコンのレベルからシステム構成を見直している。GroqのようなLinear Processing Unit(LPU)や、専用のNeural Processing Unit(NPU)が台頭している理由もここにある。これらは大量のオンチップSRAMを使い、メモリアクセスを単純な取得ではなく連続的なデータフローとして扱うことでHBMのボトルネックを回避する。ソフトウェア開発者にとって、これは「とりあえずCUDA」の時代が終わることを意味する。データが回路内をどう移動するかを理解し、ハードウェアを意識したコードを書く必要がある。
AI効率化の新たな最前線
ハードウェアを常に変更できるわけではないため、次の工学的な最前線はソフトウェア最適化にある。ニューラルネットワークの実装と実行方法を再定義する技術が、現在の革新的な進歩を生んでいる。
- 連続バッチ処理:従来のバッチ処理は「バス」が満員になるまで出発を待つため遅延が生じる。vLLMなどが先駆けた連続バッチ処理は地下鉄のように、反復のたびに新しい要求をGPUの処理列へ乗降させる。レイテンシーを犠牲にせずスループットを最大化する、OSレベルの深い知識を要するスケジューリング技術だ。
- 投機的デコーディング:小型で高速、安価なモデルが応答案を作り、大型で遅い高性能モデルが並列に検証する。文章の検証は生成より計算負荷がはるかに低いという性質を利用する。
- KVキャッシュ管理:長い会話では、履歴であるKey-Valueキャッシュが急速に増え、大量のGPUメモリを消費する。エンジニアはOSの仮想メモリページングに着想を得た「PagedAttention」を実装している。メモリを断片に分け、連続していない状態で管理する。
エージェントがもたらす複雑性
通常の推論が難しいなら、エージェント型AIはその難度を飛躍的に高める。標準的なチャットボットは状態を持たず、質問に答えれば処理が終わる。しかしAIエージェントは計画し、ツールを実行し、結果を観察して反復する。工学的には極めて厄介で、次の根本的な問題が生じる。
- 状態管理:推論エンジンは、数分に及ぶこともある複数ステップにわたってエージェントの思考状態を保持しなければならない。
- 無限ループ:予測可能な順伝播と異なり、エージェントは推論ループに陥り得る。確率的なコードへ堅牢な監視機構やサーキットブレーカーを設けること自体が新しい分野だ。
- 可変計算量:ある質問は1回の推論で済む一方、別の質問は50回を要する。要求ごとの差が極端な環境で負荷を管理し、自動スケーリングするには全く新しいオーケストレーションが必要になる。
私たちは「モデルを配信する」段階から「認知アーキテクチャを統括する」段階へ移っている。
日常の端末へAIを届ける
エネルギーとネットワーク遅延の限界により、推論は最終的にエッジへ移る。スマート電球、自動運転車、工場ロボットのすべてがデータセンターへ要求を送るわけにはいかない。ここでの課題は圧縮だ。インターネット全体から学んだモデルを、電池で動く爪より小さなチップへどう収めるのか。
量子化(精度を16ビットから4ビット、場合によっては1ビットへ下げる)や、モデル蒸留(小さな生徒モデルに大きな教師モデルを模倣させる)は標準的になりつつある。しかし本当の難題は、Android、iOS、組み込みLinux、専用センサーなど、それぞれ異なるハードウェア制約を持つ数十億の端末へ展開することだ。モバイル開発の「断片化の悪夢」にニューラルネットワークの複雑性を掛け合わせた問題である。
結論
生成AIは「2日目」の時代に入る。1日目はAIが詩を書けると実証する段階だった。2日目は、その能力を信頼でき、手頃で、どこでも使えるものにする工学の段階だ。次の10年を形作るエンジニアは、新しいモデル構造を発明する人だけではない。電力網を溶かしたり企業を破産させたりせず、毎秒10億トークンを配信する方法を見つけるシステムエンジニア、カーネル開発者、インフラ設計者である。AI推論はもはや単なる実行時の詳細ではなく、製品そのものだ。その最適化こそ次の大きな工学課題である。












