Model dan platform AI

Amap Alibaba Jalankan Model Dunia untuk 24 Jam pada Satu GPU

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Amap, platform layanan berbasis lokasi milik Alibaba, mengatakan bahwa model dunia interaktifnya ABot-World-0 sekarang dapat mempertahankan satu sesi kontinu selama 24 jam pada satu kartu grafis konsumen, dan telah menerbitkan seluruh sesi tersebut sebagai rekaman yang dapat dicari daripada sekadar rangkuman. Halaman tersebut memungkinkan siapa saja untuk melompat ke detik mana pun dalam sesi sepanjang hari, dengan titik masuk tetap pada tanda 6, 12, dan 18 jam, bersama dengan lima sesi lengkap lainnya melalui adegan padang rumput, gurun, kota, dan lapangan salju.

Angka tersebut layak karena batas yang dilaluinya. Sebuah model dunia interaktif menghasilkan bingkai video frame by frame sebagai respons terhadap apa yang dilakukan pengguna, sehingga setiap potongan baru dikondisikan pada bingkai yang dihasilkan oleh model itu sendiri beberapa saat sebelumnya. Kesalahan kecil maju terus, dan adegan akhirnya memburuk. Amap mengatakan bahwa sebagian besar sistem dalam kelas ini dapat bertahan selama 30 detik hingga satu menit. Pengumuman 16 Juli 2026 tentang model tersebut menempatkan angka tersebut lebih dari satu jam.

Bagaimana LongForcing Mempertahankan Sesi yang Stabil

Metode yang Amap akui disebut LongForcing, yang dijelaskan dalam laporan teknis yang diposting tim pada 21 Juli 2026. Cara biasa untuk membangun model seperti ini adalah destilasi: guru yang lebih lambat dan bidireksional yang dapat memperhatikan seluruh klip sekaligus melatih siswa yang lebih cepat dan kausal yang hanya melihat masa lalu, yang dibutuhkan untuk interaksi waktu nyata. Pengawasan biasanya mencakup klip pendek, sehingga siswa belajar untuk terlihat benar selama beberapa detik dan berimprovisasi setelah itu.

LongForcing memperluas pengawasan ke tempat kegagalan terjadi. Siswa menghasilkan rollout panjang sendiri, dan guru dengan konteks temporal yang lebih panjang mengawasi bagian akhir dari itu, di mana kesalahan prediksi telah memiliki waktu untuk berkompromi. Laporan tersebut membingkai ini sebagai koreksi pergeseran distribusi akumulasi dan drift otorregresif, bukan sebagai mekanisme memori. Model tidak diminta untuk mengingat bingkai sebelumnya dengan lebih akurat; itu ditarik kembali ke distribusi dunia yang stabil saat berjalan.

Amap mengatakan bahwa hal itu muncul dalam perilaku: model terus memperluas lingkungan dengan adegan baru selama rollout tanpa pengguna memasukkan prompt segar di sepanjang jalan.

Apa yang Diliput oleh Angka yang Dilaporkan

Amplop kinerja berasal dari pengukuran tim sendiri. Di seluruh konfigurasi bit rendah yang dioptimalkan, laporan menempatkan ABot-World-0 pada output 720p dan hingga 16 frame per detik pada satu kartu desktop Nvidia RTX 5090, dengan 1,2 detik antara tindakan input dan bingkai pertama yang memantulkannya, dan sekitar 19 GiB memori video puncak. Jalur kontrol pada input keyboard mentah untuk roaming adegan dan gerakan karakter ketiga, dengan memori karakter referensi yang menjaga penampilan karakter tetap stabil selama sesi panjang.

Untuk evaluasi, makalah tersebut melaporkan hasil pada suite WorldRoamBench bersama dengan rollout interaktif yang diperpanjang, menggambarkan hasilnya sebagai kontrolabilitas kompetitif dan evolusi dunia koheren horizon panjang. Apa yang ditambahkan oleh rekaman 24 jam yang diterbitkan adalah kemampuan untuk diperiksa: timeline penuh ada di sana untuk diperiksa detik per detik, bukan dikompresi menjadi tabel.

Laporan tersebut menarik perhatian ketika itu muncul. Halaman kertas Hugging Face mencantumkannya sebagai makalah teratas hari itu untuk 22 Juli 2026, dan sejak itu mengumpulkan lebih dari 300 suara di sana.

Apa yang Diperoleh Pengembang

Pergeseran praktis adalah perangkat keras. Generasi interaktif horizon panjang telah menjadi beban pusat data, dan argumen Amap adalah bahwa satu kartu desktop sekarang mencakupnya, menurunkan biaya masuk untuk pengembang, studio, dan kelompok penelitian yang bekerja tanpa anggaran klaster. Hal itu paling berarti untuk AI yang terwujud, di mana kebijakan harus dilatih melawan lingkungan yang bervariasi sebelum mereka bertemu dengan perangkat keras nyata, sebuah area yang menarik pekerjaan steady dari Gemini Robotics ER 2 Google hingga model tindakan video mimic robotics di lantai pabrik Audi.

Semua berada di bawah lisensi Apache 2.0 di repo GitHub proyek, yang membawa kode inferensi, demo lokal, dan penunjuk ke checkpoint yang dirilis di Hugging Face dan ModelScope. Hal itu menempatkan ABot-World-0 dengan rilis bobot terbuka yang lebih luas yang mencapai pengembang ini tahun, termasuk Inkling Lab Mesin Berpikir.

Bersama dengan rekaman 24 jam, tim merilis data pelatihan: 30.969 episode video yang dikondisikan aksi yang berjumlah 2,74 TB, masing-masing membungkus MP4 dengan tindakan keyboard yang menghasilkannya, caption, dan rekonstruksi pose kamera yang langka dari adegan. Menerbitkan korpus memungkinkan peneliti luar untuk melatih melawan bahan yang sama dan menguji apakah LongForcing mempertahankan diri di tangan mereka, dan peta jalan proyek menempatkan model guru bidireksional berikutnya di luar pintu.

Jonas Reeve adalah analis AI yang dihasilkan di Unite.AI, yang fokus pada kecerdasan buatan kognitif, kecerdasan buatan umum (AGI), dan landasan teori kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul dalam sistem biologis dan buatan, menghubungkan arsitektur AI modern dengan pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.
Dengan pendekatan konseptual dan reflektif, Jonas memeriksa kerangka kerja seperti model penalaran, sistem agen, kognisi yang muncul, dan teori keselarasan, dengan tujuan untuk memperjelas apa yang dimaksud dengan kemajuan menuju AGI—dan apa yang tidak. Daripada mengejar garis waktu atau sensasi, ia menekankan prinsip-prinsip dasar, ketepatan konseptual, dan batasan model saat ini.
Artikel yang ditulis oleh Jonas Reeve dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI lanjutan.