ソートリーダー

新しいロボティクス・レースの内部:データ、モデル、製造

mm
Unite.AI を Google の優先ソースに追加

イノベーションは、たいてい、エンジニア、起業家、研究者、投資家たちが技術の進む方向を理解しようとする会話の中で生まれるものです。孤立した場所で生まれることは稀です。

1年間で、私は世界中の数十の会議に出席しました。ビジネス・トラップは時々数ヶ月間続き、パートナーやクライアントとのミーティングはアジアから北米まで行われます。しかし、最近のスイスへの旅は、特にそこで出会った人々や行われた会話により、特に興味深いものでした。

チューリッヒは、ロボティクスとPhysical AIの未来が今活発に議論されている場所の1つであることが証明されました。会話が進むほど、ロボティクスにおける本当のレースはデータの周りで展開されていることが明らかになります。

ヨーロッパのシリコンバレー

チューリッヒは伝統的に金融セクターと関連付けられてきましたが、近年ではヨーロッパのシリコンバレーと呼ばれることが増えています。この評価は、ヨーロッパで最も尊敬されるエンジニアリング大学の1つであるETHチューリッヒと密接に結びついています。研究者、博士課程の学生、起業家、エンジニアが世界中から集まり、研究、スタートアップ、産業プロジェクトがほぼ同時に進化する、強力なテクノロジー・エコシステムが大学の周りに形成されています。

私の旅の1つの理由は、Introspectorがロボティクス市場に何を提供できるかをより深く理解することでした。2025年初頭以来、この業界はブームを経験しています。多くのスタートアップがこの業界に参入しようとしていますが、大手テクノロジー企業による技術ブレークスルーがこの業界を活性化させています。にもかかわらず、この分野はまだ多くの疑問を引き起こしています。

チューリッヒはまた、私たちのパートナーであるLightlyの本拠地でもあり、ロボティクス、コンピュータービジョン、AIの交差点で働く同僚たちを紹介してくれました。この地元のテクノロジー・エコシステムには、1つの重要な側面があります。人々は驚くほどオープンで歓迎的です。彼らはアイデアや仮説を共有することを恐れません。彼らが解決しようとしている課題について話し、実行している実験について話します。結果として、市場の実際の状況と業界の進む方向をより迅速に理解することができます。

ちなみに、人々が私にヨーロッパの「シリコンバレー」がアメリカのものとどう違うかを尋ねることがあります。答えは彼らを驚かせます。チューリッヒでは、仕事と生活のバランスが強いと感じます。朝はスポーツ、日中は集中して仕事をし、夜は家族と一緒に山で過ごしたり、ただリラックスしたりします。サンフランシスコでは、常に他の人よりも多く働いていることを証明する必要があるような気がします。チューリッヒでは、ペースは異なります。より持続可能です。ただし、ここでのテクノロジーへの野心は、決して低くありません。

より良いデータを優先する

この旅から得られた主な洞察は、比較的単純な観察でした。今日、多くの人がロボティクスで働きたいと考えています。しかし、業界への関心が非常に高いにもかかわらず、多くのチームはまだ探索段階にあり、ロボティクスとPhysical AIの新しい波の中でどのような役割を果たすことができるか、どのような貢献ができるかを理解しようとしています。

多くの会話は最終的に同じテーマに収束します。データです。今日、業界はデクスタリティ・タスク、つまり、繊細なモータースキルに関するデータが不足しています。ロボットの能力は極めて限られています。人間が手で行う自動的な動作、物体を拾う、回す、慎重に配置する、または小さな操作を行うことは、ロボットにとって最も困難なタスクの1つです。

ここでの進歩の鍵は、主に大規模で適切に収集されたデータセットにあります。今日、多くの人はエゴセントリック・データセット、つまり第一人称の視点から記録されたデータセットについて話しています。システムは、人間の行動を自身で行っているかのようにキャプチャします。しかし、実践では、「エゴセントリック・データセット」の概念は非常に異なるものになることがあり、多くの技術的な疑問を引き起こします。カメラをどこに配置するべきですか。額に、胸に、または目線に?ビデオ録音に伴うセンサーは何ですか?手の動きをキャプチャする場合、オペレーターは特殊なグローブを使用するべきですか?それでなければ、グローブには触覚センサー、ジャイロスコープ、またはその他のモーショントラッキング・システムを含めるべきですか?

さらに複雑な質問が生じます。動きの深さを適切にキャプチャする方法は何ですか?手の2次元平面における位置だけでなく、3次元空間を通じて前、後、上、または下に動く方法を理解することが重要です。

まだ、業界は統一された答えに到達していません。そのため、多くのチームは現在、さまざまなセンサー構成、録音方法、データセット形式を実験しています。

マルチモーダル・システム

ロボティクスでのデータ収集について話し始めると、別のトピックがすぐに浮かび上がります。追加のセンサーとマルチモーダリティについてです。これらは、ボディの動き、手の動作、物体の相互作用をより正確にキャプチャすることを可能にし、データ収集中のエラーを減らすこともできます。

人がカメラで自分の行動を録音する場合、いつでも部分的な素材が使えなくなるリスクがあります。カメラが少し動いたり、撮影角度が間違ったり、オペレーターが間違った方向に回ったり、動きが速すぎたりして、録音された素材の相当部分が却下されます。単純な例として、1時間の真正に使えるビデオを得るには、オペレーターは約2時間の生のフッテージを録音する必要があります。

追加のセンサーはこれらの問題をある程度補償するのに役立ちます。カメラが少し動いても、センサー・データは手や体の動きを空間で再構築することができます。結果として、2時間の録音ではなく、約1時間20分で同じ量の使えるデータを得ることができます。これにより、データセットの収集効率が大幅に向上し、作成コストが削減されます。

したがって、ロボティクスとエンボディドAIの開発に直接関連する、マルチモーダル・データ・アノテーションへの関心が高まっていることは偶然ではありません。

次の点は、こうしたデータセットのラベリングです。私たちもKeymakrで、ロボティクス・ケースのクライアント・データセットを扱う際に同様の質問に直面しました。実践では、こうしたアノテーションはどのようなものになるべきですか?骨格的ですか?2次元的ですか?3次元的ですか?パイプラインに強化学習の要素を組み込むべきですか?そうした質問は数十個あります。エンジニア自身が、まだ誰もが確実に言えることができないのは、どのような特定のデータ構成が最終的に技術的なブレークスルーにつながるかということです。

これらの懸念は理解できます。複雑なデータセットを構築するのは高価なプロセスです。データ構造の間違いごとに数千ドル、または数百万ドルかかる可能性があります。間違ったデータセットを収集したり、現実の世界で再現が難しい条件下で収集したりすると、最終的に全プロジェクトが損なわれる可能性があります。したがって、今日、モデルそのものとトレーニングされるデータの品質やアーキテクチャに、より多くの注意が払われているのです。

市場が必要とするロボットの種類

数十年間、自動車の組み立てラインで動作してきたクラシックな産業用ロボットは、実際にはコンピュータービジョンや複雑なAIモデルをほとんど必要としません。彼らのタスクは非常に特定的です。高精度と一貫性を持って、厳密に繰り返される動作を実行することです。この分野では、彼らは人間を長らく超越しています。

人間型ロボットはまったく別のカテゴリです。これらのシステムは「脳」が必要です。空間をナビゲートし、周囲の環境を認識し、状況の文脈を理解し、事前にプログラムされたトラジェクトリーではなく、現実の世界に適応してマニピュレーターを制御する能力が必要です。

現代の工場の自動化レベルが高くても、多くのタスクはまだ人間によって実行されています。物体を動かしたり、箱を拾ったり、部品を整理したり、部品を固定したり、材料を整理したりすることは、柔軟性と調整が必要な小さな動作です。この分野はまだ自動化することが最も難しい分野の1つであり、人間型システムが役割を見出すことができるでしょう。

私が話した多くのチームは、似たようなビジネスモデルを使用しています。彼らは工場にアプローチし、特定の生産ケースを解決することを提案します。例えば、作業者が1日中倉庫のゾーン間で箱を移動している場合、エンジニアは比較的単純な実験を提案します。作業者にカメラとセンサー・セットを装着し、数千時間の行動を録音し、このデータを使用して人間の作業者が行ったのと同じタスクを実行するロボットを制御するモデルをトレーニングします。

本質的に、会社は人間型プラットフォームを購入し、開発チームは特定のオペレーターの行動を複製するカスタム・モデルを構築します。これは、任意のタスクを解決できる汎用的な知能ではありません。特定のシナリオまたは生産タスクのグループにトレーニングされたスキル・セットです。多くのエンジニアにとって、このアプローチは、より現実的であるように見えます。汎用的なロボットを作成しようとするのではなく、チームは狭いが経済的に実行可能な自動化シナリオに焦点を当てています。

ビジネス・ディメンション

未来がカスタム・モデルにある場合、経済的な観点から、これは比較的長い開発パスであることを理解することが重要です。

各業界は基本的に独自の世界です。各生産環境には独自のプロセス、ワークフロー、例外があります。自動車工場で動作するロボットを食料製造や倉庫ロジスティクスに単純に転用することはできません。各ケースで、システムを最初から再トレーニングする必要があります。

これにより、次の論理的な質問が生じます。誰がこのテクノロジーの最初の顧客になるのでしょうか。

この段階では、主な採用者はおそらく大企業でしょう。自動化が経済的に有意義な影響を与えることができ、予算も持っている大企業です。今日、人間型ロボットのハードウェアのみのコストは約6万ドルから9万ドルです。これはベース・コンフィグレーションのみです。メンテナンス・コスト、バッテリー、充電ステーション、インフラストラクチャ、ソフトウェアが上乗せされます。

したがって、人間型システムを実験できる会社は、主に大手企業、自動車メーカー、食品企業、主要な産業企業です。

もちろん、小規模なセクターでも初期の採用者が見られます。いくつかの会社は特定のタスク用に1つか2つのロボットを購入するかもしれません。しかし、大多数の場合、これらのビジネスはまだ、特に高度な運用シナリオ用にカスタム・データセットを収集してアノテートするために必要な数十万ユーロを投資する準備ができていません。彼らにとって、人間の労働はまだコスト面で有利です。

ロボティクス・イノベーションの長期戦

最終的に、基本的な経済的な質問にたどり着きます。人間とロボットのどちらがより効率的か?今日の経済を見ると、答えは明らかです。人間の労働は安価で、状況の変化に迅速に対応し、複雑なインフラストラクチャは必要ありません。

那么、業界は今日、ロボティクスに投資を続けるのですか?答えは主に戦略的です。

多くの会社は、技術的リーダーシップをめぐるレースが進行中であることを理解しています。コストが高いにもかかわらず、将来ロボティクスが経済的に変化したときに先んじてソリューションを開発しています。

電子機器が進化し、部品のコストが低下し、コンピューティングの効率が向上すると、ロボティクスは必然的により安価になるでしょう。そうすると、モデルを構築し、データを蓄積し、必要なテクノロジー・インフラストラクチャを確立した会社が優位性を得ることになります。

例えば、新しい規制が人間型ロボットの大量使用を許可することができます。あるいは、政府が産業のロボティカを補助することを始めることができます。そうしたシナリオでは、市場は数年以内に劇的に成長する可能性があります。先に準備した会社、すでにモデルを持っている会社、研究を行っている会社、テクノロジー・スタックが整っている会社が最も利益を得ることになります。

それが、ビジネス・エコノミーがまだ理想的ではない現在でも、開発が続いている理由です。多くの会社にとって、これは将来への投資です。テクノロジーがよりアクセスしやすくなり、需要が急激に高まったときのことです。

そして、このレースでは、他の多くの技術革新と同様に、1つの要素が決定的な役割を果たすことが多いです。誰が先に始めたかです。この意味で、今日のロボティクスは、AIの初期段階と強い類似性を持っています。当時も、答えよりも質問の方が多かったのです。しかし、データとインフラストラクチャを先に始めたチームが、最終的に全業界の方向性を形作りました。

マイケル・アブラモフは、Introspectorの創設者兼CEOで、15年以上のソフトウェアエンジニアリングとコンピュータビジョンAIシステムの経験をもとに、企業向けのラベル付けツールを構築しています。

マイケルは、ソフトウェアエンジニアおよびR&Dマネージャーとしてキャリアを始め、スケーラブルなデータシステムを構築し、クロスファンクショナルエンジニアリングチームを管理しました。2025年まで、KeymakrのCEOを務め、大規模なコンピュータビジョンおよび自律性データニーズをサポートするためのヒューマンインザループワークフロー、先進的なQAシステム、およびカスタムツールを開発しました。

彼は、コンピュータサイエンスの学士号を持ち、エンジニアリングおよびクリエイティブアーツの背景を持ち、多角的な視点から難しい問題を解決しています。マイケルは、テクノロジーイノベーション、戦略的製品リーダーシップ、現実世界の影響の交差点に位置し、自律システムおよび知能型自動化の次のフロンティアを推進しています。