AI-modeller og platforme

Alibabas Amap kører en verdensmodel i 24 timer på en enkelt GPU

mm
Føj Unite.AI til dine foretrukne kilder på Google

Amap, Alibabas platform for lokaliseringsbaserede tjenester, siger, at dens interaktive verdensmodel ABot-World-0 nu kan opretholde en enkelt kontinuert session i op til 24 timer på en enkelt forbrugergrafikkort, og det har offentliggjort hele kørslen som en søgbart optagelse i stedet for en highlight-klip. Siden låter hvem som helst hoppe til hvilket som helst sekund af den døgnlange rulning, med faste indgangspunkter ved de seks-, tolv- og atten-timers mærker, sammen med fem fulde kørsler gennem græsland, ørken, by og snefeltscener.

Tallene er værdifulde, fordi de viser, hvilken grænse de overskriver. En interaktiv verdensmodel genererer video ramme for ramme som svar på, hvad brugeren gør, så hver ny del er betinget af rammer, som modellen selv producerede øjeblikket før. Små fejl føres fremad, og scenen nedbrydes til sidst. Amap siger, at de fleste systemer i denne klasse holder sammen i 30 sekunder til et minut. Deres egen meddelelse den 16. juli 2026 om modellen satte tallet til mere end en time.

Hvordan LongForcing holder kørslen stabil

Metoden, som Amap tilskriver, kaldes LongForcing, beskrevet i den tekniske rapport, som teamet offentliggjorde den 21. juli 2026. Den sædvanlige måde at bygge en model som denne er destillation: en langsommere bidirectional lærer, der kan se på en hel klip ad gangen, træner en hurtigere causal elev, der kun ser på fortiden, hvilket er, hvad realtidsinteraktion kræver. Denne vejledning dækker normalt korte klip, så eleven lærer at se rigtigt i få sekunder og improviserer derefter.

LongForcing udvider vejledningen til, hvor fejlene sker. Eleven genererer en lang rulning på egen hånd, og en lærer med en længere tidsmæssig kontekst vejleder de senere dele af den, hvor forudsigelsesfejl har haft mest tid til at opsumpe. Rapporten rammer dette som korrektion af akkumuleret distributionsforskydning og autoregressiv drift, ikke som en hukommelsesmekanisme. Modellen bliver ikke bedt om at huske tidligere rammer mere præcist; den bliver trukket tilbage mod en stabil verdensfordeling, mens den går.

Amap siger, at det viser sig i adfærd: Modellen holder med at udvide miljøet med nye scener under en rulning i stedet for at låse sig fast i den, den startede i, og gør det uden, at brugeren skal føde friske prompts ind på vejen.

Hvad de rapporterede tal dækker

Ydelsesområdet kommer fra teamets egne målinger. Over optimerede lav-bit-konfigurationer sætter rapporten ABot-World-0 til 720p-udgang og op til 16 rammer per sekund på en enkelt Nvidia RTX 5090-skrivebordskort, med 1,2 sekunder mellem en input-handling og den første ramme, der reflekterer den, og omtrent 19 GiB peak-videohukommelse. Kontrolkørsler på rå tastaturinput for både sceneforløb og tredje-person-karakterbevægelse, med en referencekarakterhukommelse, der holder en characters udseende stabilt over en lang session.

Til evaluering rapporterer papiret resultater på WorldRoamBench-suiten sammen med udvidede interaktive rulninger, og beskriver udfaldet som konkurrencedygtig kontrollabilitet og koherent lang-horizont-verdensudvikling. Det, som den offentliggjorte 24-timers optagelse tilføjer, er inspektion: Den fulde tidslinje er der for at blive gennemgået sekund for sekund, i stedet for at blive komprimeret til en tabel.

Rapporten tiltrak opmærksomhed, da den ankom. Hugging Faces papirside listede den som dagens top-papir for den 22. juli 2026, og den har siden samlet mere end 300 op-stemmer der.

Hvad udviklere får

Den praktiske ændring er hardwaren. Lang-horizont-interaktiv generering har været en datacenter-arbejdsbyrde, og Amaps argument er, at en enkelt skrivebordskort nu dækker det, og sænker indgangsprisen for udviklere, studier og forskningsgrupper, der arbejder uden cluster-budgetter. Det betyder mest for inkarneret AI, hvor politikker skal udøves mod varierede miljøer, før de møder rigtig hardware, et område, der tiltrækker stadig arbejde fra Googles Gemini Robotics ER 2 til mimic robotics’ video-handlingsmodeller på Audis fabriksgulv.

Alting ligger under en Apache 2.0-licens i projektets GitHub-repository, som indeholder inferenskoden, en lokal demo og pege på den udgivne checkpoint på Hugging Face og ModelScope. Det sætter ABot-World-0 sammen med den bredere række af åbne-vægts-udgivelser, der når arbejdende udviklere i år, blandt dem Thinking Machines Labs Inkling.

Sammen med den 24-timers optagelse offentliggjorde teamet sin træningsdata: 30.969 handling-konditionerede videoepisoder, der i alt udgør 2,74 TB, hvor hver enkelt pakker en MP4 med tastaturhandlinger, der producerede den, undertekster og en sparsom kamerapose-rekonstruktion af scenen. Offentliggørelsen af korpusset giver mulighed for, at ydre forskere kan træne mod det samme materiale og teste, om LongForcing holder i deres hænder, og projektets vejledning sætter den bidirectionale lærermodel som det næste ud.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.