ロボティクスとフィジカルAI

ミミックロボティクス、FLUX-mimicを導入し、ビデオアクションモデルをアウディの工場フロアに導入

mm
Unite.AI を Google の優先ソースに追加

ミミックロボティクスは、FLUX-mimicを導入しました。これは、産業用ロボットが複雑な操作タスクを学習するために、ビデオアクションモデルを使用する新しいアプローチです。

視覚AI会社ブラックフォレストラボとの共同開発により、FLUX-mimicは、従来のロボティクスシステムでは自動化が難しかったタスク、柔軟な材料の取り扱い、部品構成の変更、精密な操作など、さまざまな製造タスクでテストおよび導入されています。

この発表は、物理AIの新しい時代の到来を予感させるものです。FLUX-mimicは、ロボットのデモンストレーションの大規模なコレクションに頼るのではなく、生成的なビデオモデルによって学習された知識を物理マシンを制御するシステムに転用しようとしています。

ロボット学習の新しいアプローチ

現在の一般的なロボティクスシステムは、ビジョン言語アクションモデル、一般的にVLAと呼ばれるものに基づいています。これらのシステムは、画像と言語で学習したモデルと、ロボットの動きを予測する追加コンポーネントを組み合わせます。

このアプローチにより、ロボットは一定のセマンティック理解を持ちます。たとえば、オブジェクトを認識したり、書かれた指示を解釈したりします。しかし、静的な画像では、オブジェクトがどのように曲がったり、動いたり、衝突したり、物理的な接触に反応したりするかを完全に捉えることはできません。

欠けている知識は、ロボットのデモンストレーションから学習する必要がありますが、これは費用がかかり、時間がかかる場合があります。各デモンストレーションには、物理的なロボット、オペレーター、適切な作業空間、および慎重に記録されたアクションデータが必要です。

FLUX-mimicは、ブラックフォレストラボのFLUX 3モデルによって生成される視覚表現を使用して、タスクが時間の経過とともにどのように展開するかを予測することから始めます。ブラックフォレストラボは、FLUX 3を、静的な画像生成に限定されていない、マルチモーダルモデルとして説明しています。

アクションデコーダーは、モデルの視覚的な予測をロボットが実行できるコマンドに翻訳します。実用的には、システムはまずタスクを成功させるためにどのように見えるかを推定し、次にその結果を生み出すために必要な物理的な動きを決定します。

mimic-videoアーキテクチャを基に構築

FLUX-mimicは、mimic-videoに基づいています。これは、事前学習済みのビデオモデルをロボット制御のバックボーンとして使用するという、会社の以前の研究です。

従来のビジョン言語モデルが個々のフレームから動きを推測するのではなく、mimic-videoは、タスクがどのように展開するかを表す潜在的な視覚計画を作成します。別のアクションデコーダーは、この内部表現を使用してロボットの動きを生成します。

研究論文では、会社は、mimic-videoが、評価されたVLAアーキテクチャよりも約10倍のサンプル効率と2倍のトレーニング収束速度を達成したと報告しています。実世界のシステムは、デクサトロウスな二手ロボット設定から約500の軌道でトレーニングされました。

FLUX-mimicは、FLUX 3のアーキテクチャと物理AI用に特別に設計されたデザインを使用して、この概念を拡張しています。

ミミックロボティクスによると、30時間以上かかっていたタスクは、30分のデータで生産レディのパフォーマンスに達することができます。これは、会社が報告した結果であり、最終的にはより広範な工場、ハードウェア構成、および生産条件で評価される必要があります。

しかし、データ要件をこの程度削減することは、産業用ロボティクスの経済性を大幅に変える可能性があります。導入コストは、ロボット自体のコストをはるかに上回ることが多く、プログラミング、統合、シミュレーション、テスト、および製品またはプロセスの変更時に再エンジニアリングに多大なリソースが費やされることがあります。

アウディが厳しい工業テストを提供

アウディは、ミミックロボティクスと協力して、FLUX-mimicを実際の製造環境でテストしています。ここでは、自動化システムは、製品のバリエーション、厳格な生産要件、および反復的な動きに還元できないタスクに直面しています。

自動車メーカーは、ロボットが従来のロボティクスでは非常に難しかった柔軟なボディの操作作業を実行したと述べています。柔軟な材料は、取り扱い中に形状が変化するため、固定された座標やルールで動きを定義するのが非常に難しいです。

アウディのより広範な自動化研究は、適応性がどれほど重要になっているかを示しています。ボリンガーホーフェ施設では、会社は、人工知能、モバイルロボット、コンピュータビジョン、および新しいピッキング技術を実世界のラボでテストしています。アウディは、e-tron GTのような車両の高レベルのカスタマイズにより、多数の異なる部品を扱う複雑なロジスティクスプロセスが生じることを指摘しています。

従来の産業用ロボットは、環境が構造化され、すべてのオブジェクトが予測可能な位置に到着する場合に、高度に効果的です。ただし、部品、材料、または製品のバリエーションが頻繁に変更される場合、繰り返しのエンジニアリング作業を必要とするため、経済的ではなくなります。

学習ベースのシステムは、低量・高変動のプロセスを自動化することをより実行可能にする可能性があります。メーカーは、タスクの望ましい動作をデモンストレーションし、システムがそれを再現する方法を学習させることができます。

モデル、ハードウェア、人間のデモンストレーションの統合

FLUX-mimicは、ミミックロボティクスが開発中のフルスタックロボティクスプラットフォームの一部です。

会社は、独自のデクサトロウスなロボットハンドハードウェア、着用可能なデータ収集装置、ロボット学習モデル、および導入インフラストラクチャを構築しています。着用可能なシステムは、人間の手の動きを、会社のロボットハンドに直接転送できる形式で記録するように設計されています。

人間型ロボット全体ではなく、ハンドに焦点を当てたこのアプローチは、産業用自動化に対するよりターゲットを絞ったアプローチを反映しています。デクサトロウスなハンドは、既に工場で使用されている従来のロボットアームに取り付けられ、新しいロボット形態を導入する必要性を減らします。ETHチューリッヒは、このアプローチを、人間のような操作と既存の産業用ハードウェアの組み合わせによる、適応性と自己修正が必要なタスクへの対応と表現しています。

2024年にETHチューリッヒのスピンオフとして設立されたミミックロボティクスは、現在、チューリッヒとサンフランシスコに50人以上の従業員を擁しています。チームは、モデル研究、ロボティクス、ハードウェア開発、データ操作、および産業導入をカバーしています。

工場自動化へのより広範な影響

FLUX-mimicの重要性は、個々のデモンストレーションに依存するのではなく、技術が数千サイクルの生産で高い成功率を維持できるかどうかに依存します。

工場では、一貫したパフォーマンス、予測可能なサイクルタイム、従業員の周囲での安全な作業、エラーからの迅速な回復、および既存の製造システムとの統合が必要です。迅速に学習するが予測不可能なモデルは、従来の自動化よりも優れてはいません。

しかし、ビデオアクションモデルが報告されたデータ効率を維持しながら、産業用の信頼性要件を満たすことができると仮定すると、ロボティクスを、変動しすぎて、またはプログラミングコストがかかりすぎて自動化が難しい作業カテゴリに拡大する可能性があります。

これには、柔軟なコンポーネントの組み立て、混合在庫の取り扱い、不規則なオブジェクトの整理、頻繁に変更される製品のパッケージ化、および労働者が身体的に厳しいプロセスをサポートすることが含まれる可能性があります。

長期的な機会は、単により優れたロボットハンドではありません。機械を教えるための新しい展開モデルであり、機械がすべての動きを事前に指定するのではなく、デモンストレーションを通じて教えられるものです。

アウディの関与は、FLUX-mimicに、制御された研究環境を超えてこのアプローチが機能することを証明する機会を与えています。自動車工場の床で成功すれば、生成的なビデオモデルが、デジタルメディアの作成ツールではなく、物理的な世界で機械を制御するインテリジェンスレイヤーの一部になることを示す重要な兆候になります。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。