ソートリーダー
ロボットに動かすことを教えた。次に彼らに生きることを教える

現代のロボティクスは、動きが主な課題ではなくなった段階に達しました。機械はすでにナビゲーション、把持、空間での操作を印象的な精度で実行できます。しかし、ロボットが本当に「生き」、現実の世界で機能することを可能にするには、未解決の問題がまだ残っています。
このプロセスでは、ロボットの「脊髄」と呼ばれるシステムが重要な役割を果たします。このシステムは、基本的な反応、行動、環境との相互作用を担当します。
ロボットの進化をこの観点から見ると、各ステージで新しいことを学ぶシステムのシーケンスが人間の発達と密接に似ていることが明らかになります。
これは、ロボットが「空」のハードウェアから意味のある行動への主なシフトが起こっている物理AIの分野です。より深く学ぶことは興味深いことです。
ロボティクスの基礎:まれに議論されるステージ
実用的には、ロボットとは何でしょうか?ロボットは、普遍的なプラットフォームとして初期に作成された物理デバイスです。本質的には、ロボットは「空」の状態で、特定のタスクに適応し、特定の環境で動作し、必要なアクションを実行するように訓練する必要があります。
日常のシナリオを超えて、より現実的な近未来の応用を考慮すると、ロボットの完全な採用は主に工業的で、潜在的に危険な環境で発生することが明らかになります。これは、ロボットの行動、堅牢性、トレーニングの品質に対する要件が大幅に高まることを意味します。
プロセスは、最も基本的なステップから始まります。デバイス自体を構築することです。ロボットは、作動装置、モーター、センサー、カメラ、LiDARなど、複数のコンポーネントから構成されています。ロボットはヒューマノイド、車輪式、二足歩行、または四足歩行型になる可能性があります。形状は二次的なものです。重要なのは、この段階で、まだ「空」の状態ながら機能するデバイスが完成することです。
次のステージは、ロボットの行動の基盤となるベースモデルをインストールすることです。広い意味で、「モデル」とは、機能的な制御レイヤー全体を指します。モデルは、バランスを維持する、立つ、移動する、ポイントAからポイントBへのナビゲーション、障害物の回避、環境の損傷の回避、人間との安全な相互作用などのコア機能を担当します。
強化学習がここで重要な役割を果たします。このようなシステムでは、数十億のシミュレーションが実行されます。複雑な環境でロボットが「学習」する様子を示すビデオをよく見ます。ほとんどのロボットは倒れたり、バランスを失ったり、タスクを完了できなかったりします。しかし、立ったまま移動し続けるロボットは進歩します。
これが強化学習の本質です。成功した行動を選択することです。生き残ったロボットのアルゴリズムが次のイテレーションの基礎となります。結果として、膨大な数の実行の後、障害物に対処できるモデルが登場します。このアルゴリズムは物理デバイスに転送されます。
このステージは、地に足のついたものですが、非常に重要です。コンピュータビジョンはほとんど必要なく、ここでは基本的な物理学と力学がシステムに組み込まれる必要があります。
ロボットが世界を「感じ始める」
「ハードウェア」、つまりベースモデルがインストールされたロボットがすでにあります。ロボットは立ったり、歩いたり、バランスを維持できます。しかし、これは実際のタスク、たとえば工業環境でのタスクに十分なのでしょうか?明らかにそうではありません。
次のレベルがここで始まります。センサーを統合し、モデルをセンサー入力に基づいて行動するようにトレーニングします。新しい層のコアスキルが登場します。すでに単純な動きよりもはるかに複雑です。
人間の発達と比較することはここで役立ちます。最初のステージでは、システムを1歳の子どものレベルにまで持ってきました。ロボットは立ったり、最初のステップを踏んだり、バランスを維持したりできます。次のステップは8歳の子どものレベルに近いです。
この年齢の子どもは、すでに「センサー」を積極的に使用しています。子どもはリスクを認識し、行動の結果を評価できます。子どもは熱いものに触れない、または冷たいものを口に入れないことができます。子どもはテーブルに乗ったり、自転車に乗ったり、物体と相互作用したり、基本的な自己ケアアクションを実行できます。
このステージを事前トレーニングと呼びます。この時点では、シミュレーションだけは不十分です。
はい、一部のシナリオはまだ効果的にモデル化できます。たとえば、グラスを拾ったり、バッテリーを交換したりする方法です。
しかし、バランスはシフトします。約80%のトレーニングはまだシミュレーションで行うことができますが、約20%のデータは実世界から来なければなりません。これは、エゴセントリックデータの議論が始まる場所です。
エゴセントリックデータとしての環境理解の基礎
今日、エゴセントリックデータは世界規模で大量に収集されています。なぜなら、エゴセントリックデータがなければ、基本的なメカニクスから現実の世界との有意義な相互作用へと移行することは不可能だからです。私の同僚は、自動車修理店のネットワークを運営しています。従業員は、ヘッドマウントカメラを使用して、自動車修理プロセスを記録しています。ニューヨーク市のビル所有者は、清掃スタッフが部屋を掃除し、衛生区域を維持する方法を記録するために、同じアプローチを実施しています。
時間の経過とともに、これらの記録はスタンドアロン製品になります。パッケージ化され、販売されます。エゴセントリックデータの主な価値は、事前トレーニングのステージで環境とアクションのシーケンスの基礎的な理解を構築するのに役立つことです。
たとえば、Keymakrでは、シンプルなシナリオから複雑なシナリオまで、エゴセントリックデータのコレクションが独立して作成されました。
これが重要な理由は、エゴセントリックデータが純粋なシミュレーションでは提供できない、現実の世界の環境の多様性を提供することです。オフィス、自動車修理店、建設現場、レストラン、ホテルなど、それぞれが独自のコンテキスト、シナリオ、ニュアンスを持ちます。これらはすべて、システムが単に「見る」だけでなく、現実の世界のダイナミクスを徐々に理解できるようにするデータセットを形成します。
このステージでは、ロボットが特定のアクションを完璧に実行することを教えることが目的ではありません。ロボットが周囲を理解することを可能にすることが重要です。
現在、ロボティクスで活動するほぼすべての企業、テスラからUnitree RoboticsやFigure AIまで、このステージに焦点を当てています。彼らの目標は、8歳の子どものような能力を持つベースモデルを構築し、12歳の子どものレベルに進歩させることです。これが私たちがIntrospectorで行っていることです。ロボティクスの「成熟」における最も重要な段階である事前トレーニングに必要なデータを準備しています。
トレーニングの最後の1マイル:普遍性が終わり、専門化が始まる
ロボットがすでに事前トレーニングを完了し、世界と基本的なスキルセットの理解を持って製造されたと想像してみましょう。ただし、これでも実際のビジネス用途には十分ではありません。企業は「汎用」のロボットではなく、専門家が必要です。
自動車製造を例に挙げてみましょう。人間が依然として実行しているタスクは、感覚、精度、継続的な視覚的な管理が必要です。伝統的な自動化はここで苦労します。工業用マニピュレーターは繰り返しのタスク、たとえば「ピック・アンド・プレイス」に優れています。しかし、適応性、圧力感知、リアルタイム調整が必要なタスクは人間の領域のままです。
ここで、新しい需要が生まれます。ロボットを特定の操作を熟練した労働者と同じように行うようにトレーニングすることです。つまり、ベーストレーニングの後、専門的なトレーニング、特定のシナリオのトレーニングが必要です。
ここで、実際的な質問が生じます。ロボットを人間と同じように動作させるには、どのようなトレーニングが必要ですか?ロボットが人間のパフォーマンスを繰り返す必要がある場合、人間の行動を可能な限り正確にキャプチャする必要があります。たとえば、工場の床で働く専門家は、タスクを実行する方法を長期間、たとえば数ヶ月または1年間、カメラで記録する必要があります。
ロボットが人間の世界で「生きる」ために必要なこと
カメラだけでは不十分です。視覚的な視点だけでなく、動きの物理学もキャプチャする必要があります。これは、タクタイルセンサーが圧力、適用された力、物体との相互作用の性質を測定する特殊なグローブを使用して行われます。これは特に重要です。物体自体は、シールストリップの硬さなど、車のモデルによって大きく異なる可能性があり、タスクの実行方法に直接影響します。
次に、運動学的追跡が来ます。視覚的なマーカーまたはセンサーベースのマーカーが、手首、肘、時には肩に配置されます。これには、視覚的なマーカー(QRコードに似たもの)が付いたブレスレットが含まれる場合があります。これにより、システムはビデオから手の位置を空間で追跡できます。さらに、ジャイロスコープなどのセンサーが関節の動きをキャプチャするために使用されます。
最終的な目標は、運動のメカニクスを完全に再構築することです。肩がどのように動くか、肘がどのように曲がるか、手首がどのように回転するか。これらはすべて、次のステージであるポストトレーニングに不可欠です。
事前トレーニングの段階では、まだ部分的にシミュレーションに頼ることができましたが、このステージではそれが機能しません。シェフが生地を転がすときの力、圧力の分布、材料の感触などは、完全にシミュレートすることはできません。
したがって、ポストトレーニングの段階では、ほぼすべてのデータが実世界から来なければなりません。これが、主な課題が実践的な領域、つまりデータの収集方法にシフトする場所です。このレベルのエゴセントリックデータを収集することは、環境へのアクセス、専門機器、熟練した労働者の参加、後のデータの準備など、複数のステップを伴う複雑なプロセスです。
理論を超えて、ロボットが「生き始める」のは、ここでプロセスを整理し、業界横断的なチームの制約を克服し、データセットを大規模に注釈付けることができるようになったときです。これについては次のパートで詳しく見ていきます。ここでは、ラベリングと準備の際に生じるすべての課題を詳しく見ていきます。












