AIモデルとプラットフォーム
アリババのAmapが24時間のワールドモデルを1枚のGPUで実行

Amap、アリババのロケーションベースのサービスプラットフォームは、インタラクティブなワールドモデルABot-World-0が、1枚の消費者向けグラフィックカードで24時間のシングルセッションを維持できることを発表しました。また、シーク可能なレコードとして全体を公開しました。ページでは、誰でも1日の中の任意の秒にジャンプできます。6時間、12時間、18時間のマークが固定されています。また、草原、砂漠、都市、雪原のシーンを通した5つの完全な実行もあります。
この数字は、クリアした上限のため価値があります。インタラクティブなワールドモデルは、ユーザーの行動に応じてフレームごとにビデオを生成するため、各新しいチャンクはモデル自体が前のフレームで生成したものに依存します。小さなエラーが前方にフィードされ、シーンは最終的に劣化します。Amap によると、このクラスのほとんどのシステムは30秒から1分の間でまとまりを保てます。7月16日、2026年の発表では、1時間以上であると述べられていました。
LongForcingが実行を安定させている方法
Amapがその方法をLongForcingと呼んでいます。これは、2026年7月21日にチームが投稿した技術レポートに記載されています。通常、このようなモデルを構築する方法は蒸留です。スローな双方向の教師がクリップ全体にわたって注意を払うことができ、より速い因果的生徒が過去のみを参照することを学びます。これは、実時間のインタラクションが必要なためです。通常、その監督は短いクリップをカバーし、生徒は数秒間正しく見え、次に即興で行動します。
LongForcingは、失敗が発生する場所まで監督を拡張します。生徒は独自に長いロールアウトを生成し、より長い時間的コンテキストを持つ教師がそれを監督します。レポートでは、これを蓄積された分布シフトと自己回帰のドリフトの修正として捉えています。メモリメカニズムとしてではなく、モデルは以前のフレームをより正確に思い出すように求められていません。安定したワールド分布に向かって引き戻されるだけです。
Amapによると、これは行動に表れています。モデルは、ユーザーが新しいプロンプトを入力することなく、ロールアウト中に新しいシーンで環境を拡張し続けます。
報告された数字がカバーするもの
パフォーマンスの範囲は、チームの独自の測定から来ています。最適化された低ビット構成では、レポートではABot-World-0を720pの出力と1枚のNvidia RTX 5090デスクトップカードで最大16フレーム/秒で示しています。入力アクションと最初のフレームの反映の間には約1.2秒、ピークのビデオメモリは約19 GiBです。生のキーボード入力によるコントロール実行は、シーンのローミングとサードパーソンのキャラクターモーションの両方で行われ、リファレンスキャラクターのメモリは、長いセッション中のキャラクターの外見を安定させます。
評価のために、論文ではWorldRoamBenchスイートと拡張されたインタラクティブなロールアウトの結果を報告し、結果を競合する制御可能性と一貫した長期的なワールドの進化として説明しています。公開された24時間のレコードに追加されるのは、調査可能性です。全体のタイムラインが1秒単位でスクラブできるため、テーブルに圧縮する必要はありません。
レポートは注目を集めました。Hugging Faceのペーパーページでは、2026年7月22日に1日の中で最も人気のあるペーパーとしてリストされており、その後300以上のアップボートを集めました。
開発者が得るもの
実用的には、ハードウェアが変わります。長期的なインタラクティブな生成は、データセンターのワークロードでしたが、アマップは、1枚のデスクトップカードでそれをカバーできることを示しています。開発者、スタジオ、クラスターバジェットのない研究グループが働くための参入コストを下げるため、これは重要です。主に、エンボディッドAIが関係します。ここでは、ポリシーを実行する前に、ハードウェアに遭遇する前に、さまざまな環境に対して行う必要があります。ここでは、GoogleのGemini Robotics ER 2からmimic roboticsのビデオアクションモデルまで、継続的な作業が行われています。
すべては、プロジェクトのGitHubリポジトリのApache 2.0ライセンスの下にあります。ここには、推論コード、ローカルデモ、Hugging FaceとModelScopeのリリースされたチェックポイントへのポインタが含まれています。これにより、ABot-World-0は、今年に稼働する開発者に到達するオープンウェイトのリリースの流れと一致します。例としては、Thinking Machines LabのInklingがあります。
24時間のレコードとともに、チームはトレーニングデータをリリースしました。30,969のアクション条件付きビデオエピソードで、合計2.74 TBです。各エピソードには、MP4とそれを生成したキーボードアクション、キャプション、シーンのスパースなカメラポーズの再構築が含まれています。コーパスの公開により、外部の研究者が同じ素材に対してトレーニングを行い、LongForcingが彼らの手で機能するかどうかをテストできます。プロジェクトのロードマップでは、双方向の教師モデルが次にリリースされる予定です。キーボードアクションが生成したもの、キャプション、そしてシーンのスパースなカメラポーズの再構築を含むコーパスを公開することで、外部の研究者が同じ素材でトレーニングを行い、LongForcingが実際に機能するかどうかをテストすることができます。プロジェクトのロードマップでは、次に双方向の教師モデルがリリースされる予定です。ith the keyboard actions that produced it, captions and a sparse camera-pose reconstruction of the scene. Publishing the corpus lets outside researchers train against the same material and test whether LongForcing holds up in their hands, and the project’s roadmap puts the bidirectional teacher model next out the door.












