ソートリーダー
ロボットのトレーニングの真のコスト

先ほどの記事では、ロボットが基本的なメカニズムから環境を理解するまでに進化する方法について説明しました。ロボットが特定のタスクに特化したトレーニングを受ける「ラストマイル」の段階で、予期せぬ障壁が現れます。これは、データの収集、組織化、現実世界でのスケーリングに起因します。
これは、概念と実装のギャップが最も明らかになる段階です。主なボトルネックは何ですか? それらを最小限の摩擦でどのように克服できますか?
何千時間のデータが何年もの作業になるのか
既に事前トレーニングを受けたロボットがいることを想定しましょう。ロボットは周囲を移動し、障害物を避け、物体と相互作用することができます。10歳の子供のようなものです。次のステップは、特定の条件下で特定のアクションを実行することを教えることです。例えば、自動車生産ラインでガラスパネルとシーリングストリップを取り付けます。
一見すると、タスクはよりシンプルに見えます。特定のシナリオをマスターすることが含まれており、必要なデータ量は事前トレーニングよりもはるかに小さくなります。事前トレーニングには数十万時間が必要になるかもしれませんが、事後トレーニングには数千時間しかかからないかもしれません。しかし、これらの数字は誤解を招きます。
これを実時間に翻訳すると、プロセスの真の複雑さが明らかになります。標準的な作業スケジュールでは、人は約160時間/月働きます。しかし、これはすべての時間がレコーディングに使用できるということを意味しません。
実際には、常に中断が発生します。バッテリーが切れる、カメラが移動する、センサーが故障します。機器の設定が複雑になるほど、問題が発生する可能性は高くなります。たとえば、グローブのセンサーが動作を停止すると、プロセスが停止し、時間が失われる可能性があります。
結果として、実際のデータ収集速度は2〜3倍低くなります。1時間の高品質レコーディングには、3時間の実際の作業が必要になる可能性があります。これにより、計算が根本的に変わります。5,000時間のデータは約15,000時間の労力に相当します。
複雑さの層
事前トレーニングでは、人にカメラを渡し、日常活動をレコーディングするだけで十分かもしれません。しかし、この段階では、工場、建設現場、または専門的な生産施設などの特定の環境へのアクセスが必要です。
これにより、実用的な制約がすぐに導入されます。たとえば、建設現場では、作業員は安全ヘルメットを着用する必要があります。つまり、専用の機器を開発する必要があります。ダスト、湿気、衝撃に耐性のあるカメラを搭載したヘルメットです。
次に、サイトへのアクセスが来ます。サイト所有者との合意、許可の取得、条件の交渉が必要です。これにはほぼ常に追加のコストが伴います。企業は補償を期待し、作業員は参加に対して支払われることを期待します。
保険と安全性のコンプライアンスも重要な懸念事項になります。機器が必要な基準を満たさない場合、保険が無効になる可能性があり、プロセス全体を再構成する必要があります。
日常業務のレベルでは、課題が続きます。カメラをオンにし、監視し、維持する必要があります。作業員は手袋を着用し、厳しい条件下で作業します。機器は汚れ、劣化し、故障します。カメラは数分後にオフになり、人はそれに気付かないかもしれません。
これにより、参加者が自分自身をトレーニングする必要性が生じます。彼らは機器の使用方法を理解する必要があります。また、継続的な監督が必要です。誰かがレコーディングが進行中であり、デバイスが正常に機能していることを確認する必要があります。
生のビデオからトレーニングデータへ
レコーディングの後、次の段階が始まります。データの収集、アップロード、構造化、品質の検証、ラベル付け。
生のデータはビデオとセンシグナル信号で構成されます。これをトレーニング資料に変換するには、構造化する必要があります。オブジェクトを識別し、アクションを捉え、状態、動き、環境との相互作用を記述する必要があります。これがアノテーションの役割です。アノテーション ワークフローにはどのようなゴールドスタンダードがあるのでしょうか?
一部のケースでは、オブジェクトをフレーム内で識別するためにシンプルなバウンディングボックスが十分です。他のケースでは、時間的アノテーションが必要です。アクションのシーケンスを時間の経過とともに記述する必要があります。特定のシナリオでは、キーポイントとスケルトンモデルを使用してボディの動きを捉えます。より複雑なケースでは、3Dメッシュまたはハンドポーズトラッキングが必要です。正確に相互作用のメカニクスを表現するために。加速度計などの追加センサーは、動きのダイナミクスと適用された力を捉えるために頻繁に統合されます。
このようなプロジェクトは、チームの拡大を必要とします。ラベル付けは、時間、専門知識、人間のリソースを大量に必要とする大規模で複雑なタスクです。これが、インハウスのアノテーションチームを備えたデータソリューションプロバイダーが登場する背景です。たとえば、Keymakrは、データ量に応じてチームを拡大できる能力により、特に効果的です。1人の専門家から数百人のアノテーターまで。
まだトレーニングに正しいアプローチはない
業界はまだ探索段階にあり、どのデータの組み合わせが最も良い結果をもたらすのかについての合意はありません。多くのアプローチは、特定の実験で機能することを経験的に検証されています。したがって、さまざまなチームは、独自の経験、タスク、制約に形作られたさまざまなテクノロジーに依存し続けています。
学術的および応用的なレベルでは、これにより断片化が生じます。研究室や企業は異なる方向に進んでいます。状況は、テスラがLiDARなしでビジョンだけのアプローチに賭けた自動運転の初期のようです。他のプレーヤーのほとんどは、LiDARをコアセンサーとして選択しました。
現在、LiDARベースのシステムはより安定したパフォーマンスを示している傾向がありますが、テスラのアプローチはまだ進化を続けています。違いは、自動運転の市場がほとんど成熟していることです。安定したアーキテクチャが登場し、限界がよく理解されており、重大な専門知識が蓄積されています。
対照的に、Physical AIや同様のモデルトレーニングの場合、まだこのレベルの成熟度には達していません。市場はまだ形成中です。標準が不足しており、多くの進歩は実験によって推進されています。モデルをトレーニングするための新しい方法、効率を向上させる方法、現実世界のシナリオに適応する方法が続々と登場しています。これは、最も重要なブレークスルーがまだ先にあることを示唆しています。
人間は強化システムである
ラベル付けは、モデルだけに存在するものではありません。エンジニアがモデルを構築するためのツールです。ラベル付けを通じて、エンジニアは現実を形式化し、重要なパラメーターを特定し、システムの動作ルールを定義します。
エンジニアのタスクは、システムが現実世界の条件下で正しく動作するように教えることです。たとえば、基本的なシナリオは4つのアクションで構成されます。ガラスを拾う、水道の蛇口を-turn on、ガラスを満たす、蛇口を-turn off。しかし、現実には、偏差が発生します。ガラスがオーバーフローします。
その時点で、モデルはシナリオを完了し、追加のアクションを実行することが期待されます。水の流れを停止し、水位を調整し、こぼれを防ぐ。これは、コンテキストに基づく行動ロジックです。
エンジニアはサイクルに従います。データをアノテートし、モデルをトレーニングし、テストします。如果システムが機能する場合、仮説は確認されます。如果機能しない場合、分析が開始されます。
ある時点で、モデルが重要なパラメーターを欠いていることが明らかになる場合があります。たとえば、ガラスの充填レベルです。以前のデータには、オブジェクト(ガラス、蛇口、ハンドル)とアクション(開く、満たす、閉じる)のアノテーションが含まれていたかもしれませんが、状態(充填度の度合い)についてのアノテーションは含まれていませんでした。
プロセスに新しいレイヤーが追加されます。充填レベルをアノテートし、形式化します。たとえば、85%を超えるものを臨界状態として定義します。
これにより、トレーニングの次のイテレーションが行われます。数百のイテレーションが可能です。
誰もがシステムがすぐに正しく機能することを想定していません。逆に、プロセスは連続的な近似に基づいて構築されています。まず、ベースラインバージョンを作成し、次にそれを実際の、またはほぼ実際の条件でテストし、ギャップを特定し、システムを改良します。これは、私がIntrospectorのクライアントと一緒に頻繁に話し合うことです。私たちが一緒にPhysical AIの旅を進めます。
ある時点で、望ましい結果が達成されます。しかし、その価値は、システムが動作し始めることだけにありません。蓄積された経験により、結果をより予測可能に再現できるようになります。
みんなが忘れている経済学
過去1年ほどの間、私は企業がエゴセントリックデータを使用する際に最も大きな間違いを犯していることに気づきました。技術とは関係ありません。
核心的な問題は、プロジェクトの経済学を過小評価していることです。
アイデア段階では、テクノロジーが主役です。どのモデルを使用するか、どのようにトレーニングするか、どのアプローチを適用するかを研究し、調査し、議論し、仮説をテストします。これは自然なことです。テクノロジーは問題の最も具体的で明らかな部分であると感じるからです。
しかし、チームがあまり頻繁にアイデア段階で直接的で実用的な質問をしないことがあります。どのくらいのコストがかかるのか?
プロジェクトが理論から実装に移行すると、モデル背後の何千時間ものデータが必要であることが明らかになります。データの収集には時間、現実の環境へのアクセス、専門家の関与が必要です。ラベル付けはさらに複雑さとコストを加えます。結果として、最終的な数字は最初に予想していたよりもはるかに高くなります。
これは、そんなプロジェクトを追求しないべきであることを意味しません。実際、業界を前進させるのはそうしたプロジェクトです。
しかし、重要なのは、最初から課題の規模を理解することです。モデルトレーニングでは、驚くべきアルゴリズムの背後には複雑でリソースを大量に消費するデータ作業があることを認識することです。
強いアイデアでも、データコストが7桁を超えて増加し始めると、完全な実装に到達できなくなります。
そして、ロボティクスで今日起こっている最も重要な変化は、この認識に結びついています。システムの将来は、それらが「知的」であるかどうかと、データパイプライン全体がどのくらい効果的で正確に構築されているかによって定義されます。データ収集から最終的な解釈までです。












