Modely a platformy AI
Alibaba’s Amap běží světový model po dobu 24 hodin na jedné GPU

Amap, Alibaba’s platforma založená na umístění, říká, že jeho interaktivní světový model ABot-World-0 nyní udržuje jednu nepřetržitou relaci po dobu až 24 hodin na jedné spotřebitelské grafické kartě, a zveřejnil celý běh jako vyhledatelný záznam místo sestřihu. Stránka umožňuje komukoli přejít na libovolnou sekundu denního rozvinutí, s pevnými vstupními body na šestihodinových, dvanáctihodinových a osmnáctihodinových značkách, spolu s pěti dalšími kompletními běhy přes scény travnaté plochy, pouště, města a sněhových polí.
Tato hodnota je něco, co je kvůli stropu, který čistí. Interaktivní světový model generuje video snímek po snímku v reakci na to, co uživatel dělá, takže každý nový kus je podmíněn snímky, které model sám produkoval okamžiky dříve. Malé chyby se pohybují dopředu a scéna se nakonec zhoršuje. Amap říká, že většina systémů v této třídě drží pohromadě po dobu 30 sekund až jedné minuty. Jeho vlastní oznámení ze dne 16. července 2026 modelu uvedlo číslo nad jednu hodinu.
Jak LongForcing udržuje běh stabilní
Metoda, kterou Amap uznává, se nazývá LongForcing, popsána v technické zprávě, kterou tým zveřejnil dne 21. července 2026. Obvyklý způsob, jak postavit model, je destilace: pomalejší bidirekční učitel, který může sledovat celý klip najednou, trénuje rychlejší kauzální studenta, který vidí pouze minulost, což je to, co vyžaduje reálná interakce. Tato supervize obvykle pokrývá krátké klipy, takže student se naučí vypadat správně po několik sekund a improvizuje poté.
LongForcing rozšiřuje supervizi na místo, kde dochází k selháním. Student generuje dlouhý běh na vlastní pěst a učitel s delším časovým kontextem dohlíží na pozdější části, kde se chyby předpovědi nejvíce nahromadily. Zpráva rámuje toto jako korekci nahromaděného posunutí distribuce a autoregresivního posuvu, ne jako mechanismus paměti. Model není žádán, aby si vzpomněl na dřívější snímky přesněji; je táhnut zpět k stabilní světové distribuci, jak postupuje.
Amap říká, že se to projevuje v chování: model pokračuje v rozšiřování prostředí o nové scény během běhu, místo aby se zamkl do té, ve které začal, a dělá to bez toho, aby uživatel musel zadávat nové podněty na cestě.
Co pokrývají uváděné číslovky
Obal výkonu pochází z vlastních měření týmu. Napříč optimalizovanými nízkobitovými konfiguracemi zpráva uvádí ABot-World-0 na výstup 720p a až 16 snímků za sekundu na jedné desktopové kartě Nvidia RTX 5090, s 1,2 sekundami mezi vstupní akcí a prvním snímkem, který ji odráží, a přibližně 19 GiB maximální video paměti. Ovládací běhy na surovém klávesnicovém vstupu pro procházení scén a pohyb postavy ve třetím osobě, s referenční pamětí postavy, která drží vzhled postavy stabilní po dlouhou relaci.
Pro hodnocení zpráva uvádí výsledky na sadě WorldRoamBench spolu s prodlouženými interaktivními běhy, popisující výsledek jako konkurenceschopnou ovladatelnost a koherentní vývoj světa na dlouhém horizontu. Co přidává zveřejněný 24hodinový záznam, je prohlížitelnost: celý časový rámec je tam, aby se procházel sekundu po sekundě, místo aby se komprimoval do tabulky.
Zpráva upoutala pozornost, když přistála. Hugging Faceova stránka s papírem ji uvedla jako nejlepší papír dne pro 22. července 2026, a od té doby nasbírala více než 300 upvotes.
Co dostanou vývojáři
Praktická změna je hardware. Interaktivní generace s dlouhým horizontem byla pracovní zátěží datového centra, a Amapova argumentace je, že jedna desktopová karta nyní pokrývá tuto oblast, snižuje náklady na vstup pro vývojáře, studia a výzkumné skupiny, které pracují bez clusterových rozpočtů. To má největší význam pro vtělenou umělou inteligenci, kde politiky musí být cvičeny proti různým prostředím, než se setkají s reálným hardwarem, oblast, která přitahuje stálou práci od Google’s Gemini Robotics ER 2 po mimic robotics’ video-action modely na Audi’s factory floor.
Všechno leží pod licencí Apache 2.0 v projektu GitHub repozitáři, který nese inferenční kód, místní demo a odkazy na vydanou kontrolní bod na Hugging Face a ModelScope. To staví ABot-World-0 s širším rozsahem otevřených váh, které dosáhnou pracujících vývojářů tento rok, mezi nimi Thinking Machines Lab’s Inkling.
Spolu s 24hodinovým záznamem tým vydal své trénovací data: 30 969 epizod akcí podmíněných videem, celkem 2,74 TB, každá z nich balí MP4 s klávesnicovými akcemi, které je vytvořily, titulkami a řídkou rekonstrukcí kamery scény. Zveřejnění korpusu umožňuje externím výzkumníkům trénovat proti stejnému materiálu a testovat, zda LongForcing funguje v jejich rukou, a projektova roadmapa staví bidirekční učitel model jako další.












