パートナーシップ

NVIDIA、S1ロボット基盤モデルの背後にあるSkild AIとの協業を詳細公開

mm
Unite.AI を Google の優先ソースに追加

NVIDIAは2026年9月10日、Skild AIがNVIDIA AIインフラ上でS1ロボット基盤モデルを構築した方法を詳述し、同ロボティクス企業が最初の商用展開から10か月で年間収益1億ドルのランレートに達したと述べました。

このNVIDIAブログ記事で、同社はSkildがS1を構築し、合成データ生成、モデル訓練、シミュレーション、実世界の物理AI展開にわたる包括的な協業の一環として、同インフラ上で基礎研究を実施したと述べました。「経験による学習、すなわち事前プログラミングではなく、ロボティクスにおける画期的な変化です」とSkild AIの共同創業者兼CEOであるDeepak Pathakは語り、NVIDIA Isaac Lab と NVIDIA Cosmos がSkildに対し、ロボットが多数のシナリオや形態で学習するために必要なスケーラブルで多様な体験を創出する手助けをしていると付け加えました。両社は、適応可能なロボットインテリジェンスを研究室から工場やその他の動的な運用環境へ移行させる取り組みを進めていると述べました。

1本のビデオから未見タスクを学習する

Skildは2026年8月18日の研究投稿で、S1を「コンテキスト内学習者」としてゼロから構築したロボティクス基盤モデルとして紹介しました。このモデルはタスクのビデオデモを入力として受け取り、重みを更新したりタスク固有の再訓練を行うことなく実行します。Skildは、S1が長時間タスク(最大10分)に対するコンテキスト内学習を示す初のロボティクス基盤モデルであり、事前訓練時に見たことのないタスクでも動作できると述べています。

オペレーターが望むタスクのビデオを録画し、プロンプトとしてモデルに提供します。モデルはデモされた意図、対象物、シーケンスを解釈し、再訓練なしでロボットに対する行動にマッピングします。これは、事前訓練データセットに含まれていないタスクでも可能です。両社によれば、S1は植物の植え付け、パンケーキ作り、ドリップコーヒー抽出、キット組立といった、数十ステップにわたる操作と、モデルが以前に実行したことのないシーケンスでスキルを組み合わせる必要があるタスクを実行できます。

Skildの研究投稿に記録された植物植え付けテストでは、土、鉢、じょうろ、植物が午後8:54にオフィスに届き、録画は午後9:16に開始、午後9:22にエゴセントリックな人間のビデオデモが記録され、S1は午後9:27にハードウェア上で自律的にタスク実行を開始しました。Skildは、デモから自律実行までの時間が11分であったと述べています。

Skildは、タスク途中で対象物が移動した場合に調整し、エラーから回復し、適合する代替対象物を使用できると報告しています。たとえば、デモではじょうろが使用されたが、実際の実行では水の入ったカップを代わりに使用したケースがあります。また、モデルは時折不完全なデモから学習を改善し、デモを目標の仕様として扱い、再現すべき軌道ではなく目標達成手段として解釈すると述べています。

言語プロンプトポリシーに対する報告結果

NVIDIAの投稿によると、Skildが新しいマルチステップタスクで実施したテストでは、S1は各ステップで約66%の成功率を示し、同様のAIシステムは9%にとどまりました。この差はNVIDIAが「7倍以上の改善」と評価しています。Skildの研究投稿は、この比較を「言語プロンプト付きVLAポリシー」との対照実験として説明しています。言語プロンプトポリシーはタスク仕様をデモではなく言語で受け取ります。両ポリシーは同一のデータ、アーキテクチャ、計算リソースで訓練され、1,000時間から100,000時間までの事前訓練データセット上で比較され、未見の長時間タスクに対する66%と9%の数値は100,000時間時点で記録されたものです。

事前訓練時に見たタスクについては、Skildはコンテキスト内学習が最大規模で96%の成功率に達したと報告しています。一方、1,000時間時点での言語条件付きポリシーは53%、コンテキスト内学習は43%でした。Skildはさらに5段階の分布シフトに対するロバスト性を評価し、最も厳しい条件(ロボットの動作の半分を逆腕で実行しなければならない)では、言語プロンプトポリシーの性能低下がコンテキスト内ポリシーの3倍に達したと報告しています。

デモ効率に関して、Skildは単一のコンテキスト内ビデオが約380回の事後訓練エピソードに相当すると推定しています。この数値は測定点間を補間したもので、380本の長時間デモを収集するのに50〜100時間の遠隔操作が要したと述べています。事後訓練ベースラインは最終的に2,000本のデモで86%の成功率に達したとしています。

商業的牽引とFoxconnでの展開

NVIDIAの投稿によれば、Skildは製造、物流、検査、セキュリティ、食品調理など多岐にわたる用途で、60以上の導入パートナーシップを構築しています。

工場フロアでは、Skild、NVIDIA、Foxconnが共同でSkild Brainをデュアルアームマニピュレータに搭載し、NVIDIA Blackwellシステムの高精度組立を行っています。ある実証ワークフローでは、ロボットがバスバーとリミットブロックを取り付け、16本のネジを締め、マルチステップタスク全体での外乱に適応します。NVIDIAの投稿は、この作業が高精度な動作、接触認識制御、シーケンス追跡、計画と異なるシーンでの回復を必要とすると述べています。

Skildは2026年3月19日の投稿でBlackwell生産ライン計画を初めて発表し、ABB Robotics、Universal Robots、Mobile Industrial Robotsとのパートナーシップも明らかにしました。その発表で、Skildは組立シーケンスをFoxconnライン上で人間が実際に行うタスクとして説明し、リミットブロックの除去で終了すると述べ、ワークフロー用に少量のロボットデータでブレインを微調整したと付記しています。

S1を支えるNVIDIAスタック

NVIDIAによれば、Cosmosオープンワールド基盤モデルはSkildが訓練データを多様化し、ビデオを構造化された記述に変換するのに役立ち、Cosmos Curatorは大規模にデータを注釈付け、フィルタリング、整理する機能を提供します。NVIDIA OmniverseライブラリとIsaac Simフレームワークは、物理ベースの仮想環境を提供し、データ生成、エッジケースのテスト、実世界展開前の挙動検証を可能にします。

Skildは、Newton物理エンジンで動作するオープンモジュラーなロボット学習フレームワークであるIsaac Labを用いて、力、接触、衝突、圧力といった物理パラメータをモデル化し、シミュレーションと実世界のギャップを縮小しています。モデルが本番環境へ移行するにつれ、NVIDIA Nsightツールは訓練中のパフォーマンスボトルネックを特定し、TensorRT SDKは推論を最適化してロボットが物理世界で迅速に応答できるようにします。

SkildとNVIDIAは、ロボットが物体に触れ、握り、操作する様子をモデル化するGPUアクセラレート型シミュレーションソルバーの共同開発も進めています。両社は、このソルバーが近々Newtonの一部として全開発者に提供されると述べました。

オリオン・サトーは、ロボティクス、オートメーション、知能機械に焦点を当てたAI生成コラムニストです。彼の執筆は、ロボティクスの進歩が、製造、物流、ヘルスケア、日常生活を、ますます自律的なシステムを通じて、どのように形作り変えているかを探求しています。
技術的かつ実行可能な視点から、オリオンはロボティックアーキテクチャ、センサーフュージョン、制御システム、そしてAIと機械的知能の融合を分析しています。特に、オートメーションが制御された環境から、信頼性、安全性、効率性が最も重要となる現実世界への展開に移行する方法に興味を持っています。
オリオン・サトーによって執筆された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明瞭性、編集基準の遵守を確保するためにレビューされています。