AI-modellen en platforms
Alibaba’s Amap Voert een Wereldmodel uit voor 24 Uur op één GPU

Amap, Alibaba’s platform voor locatiegebaseerde diensten, zegt dat zijn interactieve wereldmodel ABot-World-0 nu een enkele continue sessie kan onderhouden van maximaal 24 uur op één consumentengrafische kaart, en heeft de hele sessie gepubliceerd als een doorzoekbaar record in plaats van een hoogtepuntensamenvatting. De pagina laat iedereen toe om naar elk moment van de daglange sessie te springen, met vaste ingangspunten bij de zes-, twaalf- en achttiende-uurmerken, naast vijf volledige sessies door grasland-, woestijn-, stad- en sneeuwveldscènes.
Het getal is de moeite waard vanwege het plafond dat het bereikt. Een interactief wereldmodel genereert video frame voor frame als reactie op wat de gebruiker doet, dus elke nieuwe chunk is voorwaardelijk op frames die het model zelf eerder heeft gegenereerd. Kleine fouten worden doorgegeven en de scène degradeert uiteindelijk. Amap zegt dat de meeste systemen in deze klasse overeind blijven voor 30 seconden tot een minuut. Zijn eigen aankondiging van 16 juli 2026 van het model zette het getal op meer dan een uur.
Hoe LongForcing de sessie stabiel houdt
De methode die Amap hiervoor gebruikt, heet LongForcing, beschreven in het technische rapport dat het team op 21 juli 2026 heeft gepubliceerd. De gebruikelijke manier om een dergelijk model te bouwen, is destillatie: een langzamere bidirectionele leraar die over een hele clip tegelijk kan kijken, traint een snellere causale leerling die alleen naar het verleden kijkt, wat nodig is voor echte interactie. Die supervisie dekt meestal korte clips, dus de leerling leert er goed uit te zien voor een paar seconden en improviseert daarna.
LongForcing breidt de supervisie uit tot waar de fouten optreden. De leerling genereert een lange sessie op eigen kracht en een leraar met een langere tijdelijke context superviseert de latere delen ervan, waar voorspelfouten het meest tijd hebben gehad om samen te tellen. Het rapport beschrijft dit als het corrigeren van opgehoopte distributieshift en autoregressieve drift, niet als een geheugemechanisme. Het model wordt niet gevraagd om eerder frames nauwkeuriger te onthouden; het wordt teruggetrokken naar een stabiele wereldverdeling naarmate het vordert.
Amap zegt dat dit zichtbaar is in het gedrag: het model blijft de omgeving uitbreiden met nieuwe scènes tijdens een sessie in plaats van vast te lopen in de scène waarin het begon, en doet dit zonder dat de gebruiker verse prompts invoert onderweg.
Wat de gerapporteerde cijfers dekken
De prestatieenveloppe komt van de metingen van het team zelf. Over geoptimaliseerde lage-bitsconfiguraties heen, zet het rapport ABot-World-0 op 720p-uitvoer en tot 16 frames per seconde op één Nvidia RTX 5090-bureaugrafische kaart, met 1,2 seconde tussen een invoeractie en het eerste frame dat deze weerspiegelt, en ongeveer 19 GiB piekvideo-geheugen. Controlesessies op ruwe toetsenbordinvoer voor zowel scène-roaming als derde-persoonskarakterbeweging, met een referentiekaraktergeheugen dat een karakteruitstraling stabiel houdt over een lange sessie.
Voor evaluatie rapporteert het papier resultaten op de WorldRoamBench-suite, evenals uitgebreide interactieve sessies, waarbij het resultaat wordt beschreven als concurrerende controleerbaarheid en samenhangende lange-horizonwereldontwikkeling. Wat het gepubliceerde 24-uurrecord toevoegt, is inspecteerbaarheid: de volledige tijdslijn is er om seconden voor seconden doorheen te bladeren, in plaats van samengeperst in een tabel.
Het rapport trok aandacht toen het werd gepubliceerd. Hugging Face’ papierpagina vermeldde het als de toppaper van de dag voor 22 juli 2026, en het heeft sindsdien meer dan 300 upvotes verzameld.
Wat ontwikkelaars krijgen
De praktische verschuiving is de hardware. Lange-horizoninteractieve generatie is een datacenterwerkbelasting geweest, en Amap’s argument is dat één bureaugrafische kaart nu deze dekking biedt, waardoor de toegangskosten voor ontwikkelaars, studios en onderzoeksgroepen die zonder clusterbudget werken, lager worden. Dat is het meest van belang voor geïncorporeerde AI, waar beleid tegen verschillende omgevingen moet worden uitgeoefend voordat het reële hardware ontmoet, een gebied dat gestaag werk van Google’s Gemini Robotics ER 2 tot mimic robotics’ video-actiemodellen op Audi’s fabrieksvloer ontvangt.
Alles zit onder een Apache 2.0-licentie in het project’s GitHub-repository, dat de inferentiecode, een lokale demo en verwijzingen naar de uitgegeven checkpoint op Hugging Face en ModelScope bevat. Dat zet ABot-World-0 bij de bredere reeks open-gewichtpublicaties die werkende ontwikkelaars dit jaar bereiken, waaronder Thinking Machines Lab’s Inkling.
Naast het 24-uurrecord heeft het team zijn trainingsdata vrijgegeven: 30.969 actie-geconditioneerde video-episodes die in totaal 2,74 TB beslaan, waarbij elke episode een MP4 bevat met de toetsenbordacties die het hebben gegenereerd, onderschriften en een schaarse camera-pose-reconstructie van de scène. Het publiceren van het corpus laat externe onderzoekers toe om tegen hetzelfde materiaal te trainen en te testen of LongForcing standhoudt in hun handen, en het project’s roadmap zet de bidirectionele leraarmodel als volgende uit de deur.












