AIモデルとプラットフォーム
アルゴンヌ国立研究所、オープンサイエンス向け大規模AI推論サービスを立ち上げ

これまで数年間にわたって、より大きなAIモデルを構築するためのレースがヘッドラインを支配してきたが、科学計算における最大の課題の1つは、研究者が高額なインフラストラクチャを構築することなく、スケールで高度なAIシステムを使用する方法である。
これが、アルゴンヌ国立研究所が解決しようとしている問題である。研究所は、オープンサイエンス向けに特別に設計された最初の大規模AI推論サービスを立ち上げた。
新しいサービスは、アルゴンヌリーダーシップコンピューティングファシリティ(ALCF)を通じて開発され、研究者がクラウドスタイルで大規模言語モデル、科学基礎モデル、コンピュータビジョンシステムにアクセスできるようにする。研究者は、独自のモデルをトレーニングしたり、専用のハードウェアクラスターを管理したりするのではなく、アルゴンヌの高性能コンピューティングインフラストラクチャ上で直接実行される大規模研究ワークフローに最適化された共有推論プラットフォームを利用できる。
科学におけるAI推論の重要性
AIに関する会話の多くはモデルトレーニングの周りを取り巻いているが、推論はAIシステムが実際に役立つところである。AI推論は、トレーニングされたモデルがデータを分析し、予測を生成し、結果を解釈し、または意思決定を支援するリアルタイムでの段階である。
科学研究の場合、推論は実験のペースを大幅に加速させることができる。粒子加速器、望遠鏡、核融合実験、ゲノムプロジェクト、分子シミュレーションからの大量のデータセットは、伝統的な分析パイプラインを圧倒することが多い。AI推論システムは、これらのデータセットを迅速に解釈し、研究者が別の方法では数週間または数ヶ月かかるパターンまたは異常を特定するのに役立つ。
アルゴンヌの新しいサービスは、中央集権型リソースとして高度な推論機能を提供することで、主要なボトルネックを解消することを目的としている。つまり、各機関が独自のAIスタックを展開する必要がなくなる。
ALCFのディレクターであるマイケル・パプカは、この取り組みを、単に生のコンピューティングパワーを提供するのではなく、統合されたAI対応科学サービスを提供する方向への転換と説明した。
研究向け国立AIインフラストラクチャ
推論サービスは、米国エネルギー省のより広範なジェネシス・ミッションに密接に関連している。ジェネシス・ミッションは、スーパーコンピュータ、科学機器、そして大規模なデータセットを、次世代の研究を支援できるAIエコシステムに接続することに焦点を当てた国家イニシアチブである。
アルゴンヌのシステムは、すでにブルックヘブン国立研究所、ローレンス・バークレー国立研究所、オークリッジ国立研究所、ロスアラモス国立研究所を含む複数のDOE研究所の研究者をサポートしている。より広いビジョンは、AIツール、実験データ、大規模なスーパーコンピューティングリソースがシームレスに連携する、相互接続された国家研究プラットフォームを作成することである。
これは、科学AIワークロードが、モデルがシミュレーションシステム、データベース、分析ツールと繰り返し相互作用するエージェントワークフローを含むことが増えてきたため、特に重要である。これらのワークフローは、商用AIプラットフォームで実行すると、トークン消費量と計算コストが大量に発生する可能性がある。アルゴンヌのインフラストラクチャは、これらのワークロードを内部で科学アプリケーション向けにサポートするように設計されている。
プラットフォームの技術
サービスは、GoogleのGemmaモデル、MetaのLLaMAファミリ、OpenAIのGPT-OSSシステム、およびドメイン固有の科学基礎モデルと内部で開発されたシステム(AuroraGPTなど)を含む複数のモデルファミリへのアクセスを提供する。
AuroraGPTは、特に注目に値する。これは、アルゴンヌが科学文献、データセット、多様な研究入力に特化したAIシステムを構築するという、より広い野心を表している。プロジェクトでは、科学的推論と高性能コンピューティング環境に最適化された、非常に大規模なアーキテクチャを探索してきた。
インフラストラクチャ自体は、SophiaとMetisという専用のALCFシステムで実行され、将来的にはNVIDIAを搭載したTaraとMinervaというシステムへの拡張が予定されている。
チャットボットを超えて:現実的な科学アプリケーション
一般的なAIに関する議論は、会話アシスタントの周りを取り巻いているが、アルゴンヌの焦点は、研究の加速に固く置かれている。
核融合研究では、推論モデルはプラズマの挙動をリアルタイムで監視し、潜在的に障害が発生する前に予測することができる。天文学と粒子物理学では、AIシステムは、望遠鏡またはコライダーからの大量のデータストリームを分析して、希少なイベントをより効率的に特定することができる。化学と材料科学では、推論システムは複雑な分子シミュレーションを調整し、大規模な計算ワークフローを自動化することができる。
アルゴンヌが強調した1つの例は、ChemGraphである。これは、分子シミュレーションのワークフローを簡素化するために設計された、AI駆動のフレームワークである。システムは、シミュレーション、データ分析、および反復実験のより相互接続されたワークフローでシミュレーションを調整するために、繰り返しAIツール呼び出し相互作用を使用する。
より広い意味では、科学計算は、単独のスーパーコンピューティングジョブから、継続的に相互作用するAI支援研究環境へと進化している。
アルゴンヌのAIインフラストラクチャへの成長する役割
1946年に設立されたアルゴンヌ国立研究所は、長年にわたって、高性能コンピューティング、エネルギーシステム、材料科学、核研究の分野で米国の最も重要な科学研究機関の1つとなっている。研究所は米国エネルギー省の下で運営されており、数世代にわたるアメリカのスーパーコンピューティングイニシアチブで中心的な役割を果たしてきた。
近年、アルゴンヌは、エクサスケールコンピューティングと大規模な科学基礎モデルに関連するプロジェクトを通じて、科学向けAI開発でますます影響力を持つ存在となっている。ALCF自体は、Auroraを含む国の中で最も先進的なコンピューティングシステムのいくつかを所有している。Auroraは、世界で最も速いスーパーコンピュータの1つである。
推論サービスの立ち上げは、学術分野とエンタープライズコンピューティングの両方で起こっているより大きな転換を反映している。スタンドアロンのAIモデルから、継続的な大規模推論ワークロードをサポートできるAIインフラストラクチャプラットフォームへの移行である。
科学研究の場合、これらのワークロードをサポートできるプラットフォームへの移行は、生のデータ生成と有意義な発見の間のタイムラインを大幅に圧縮する可能性がある。












