AI-modeller og plattformer

Alibabas Amap kjører en verdensmodell i 24 timer på én GPU

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Amap, Alibabas plattform for basert tjenester, sier at dens interaktive verdensmodell ABot-World-0 nå kan holde en enkelt kontinuerlig sesjon i så lenge som 24 timer på én forbrukergrafikkort, og har publisert hele kjøretiden som en søkbar rekord i stedet for en høydepunktsamling. Siden lar hvem som helst hoppe til hvilket som helst sekund av den døgnlange rulleteksten, med faste inngangspunkter ved de seks-, tolv- og atten-timersmerkene, samt fem flere komplette rulletekster gjennom gressland, ørken, by og snøfeltscener.

Tallene er verdt noe fordi de klarer en grense. En interaktiv verdensmodell genererer video ramme for ramme som svar på hva brukeren gjør, så hver nytt stykke er betinget av rammer modellen selv produserte øyeblikk tidligere. Små feil sprer seg fremover, og scenen forringes til slutt. Amap sier at de fleste systemer i denne klassen holder sammen i 30 sekunder til en minutt. Deres egen 16. juli 2026-annonsen av modellen satte tallet til mer enn en time.

Hvordan LongForcing holder kjøretiden stabil

Metoden Amap krediterer kalles LongForcing, beskrevet i den tekniske rapporten teamet publiserte den 21. juli 2026. Den vanlige måten å bygge en modell som denne er destillasjon: en langsommere bidireksjonal lærer som kan se over hele klippet på en gang, trener en raskere kausalt elev som bare ser fortiden, som er hva sanntidsinteraksjon krever. Denne overvakningen dekker vanligvis korte klipp, så eleven lærer å se riktig ut i noen sekunder og improviserer etter det.

LongForcing utvider overvakningen til der feilene skjer. Eleven genererer en lang rulletekst på egen hånd, og en lærer med en lengre tidsmessig kontekst overvakker de senere delene av den, der prediksjonsfeilene har hatt mest tid til å akkumuleres. Rapporten rammer dette som korreksjon av akkumulert distribusjonsskift og autoregressiv drift, ikke som en minnemekanisme. Modellen blir ikke bedt om å gjenkalle tidligere rammene mer nøyaktig; den trekkes tilbake mot en stabil verdensfordeling mens den går.

Amap sier at det viser seg i atferd: modellen holder på å utvide miljøet med nye scener under en rulletekst i stedet for å låse seg til den den startet i, og gjør det uten at brukeren må mata inn ferske promter underveis.

Hva de rapporterte tallene dekker

Ytelsesområdet kommer fra teamets egne målinger. Over optimaliserte lav-bits-konfigurasjoner setter rapporten ABot-World-0 til 720p-utgang og opptil 16 rammere per sekund på én Nvidia RTX 5090-stasjonærkort, med 1,2 sekunder mellom en innputtaksjon og den første rammen som reflekterer det, og omtrent 19 GiB peak video-minne. Kontrollkjøringer på rå tastaturinndata for både scenegjennomgang og tredjepersons figurbevegelse, med en referanse-figurminne som holder figurens utseende stabilt over en lang sesjon.

Ved evaluering rapporterer papiret resultater på WorldRoamBench-suitten samt utvidede interaktive rulletekster, og beskriver utfallet som konkurransekontroll og kohærent langhorisontverdensutvikling. Hva den publiserte 24-timersrekorden legger til, er inspeksjon: hele tidslinjen er der for å bli gjennomgått sekund for sekund, i stedet for å bli komprimert inn i en tabell.

Rapporten fikk oppmerksomhet da den landet. Hugging Faces papirside listet den som dagens toppapir for 22. juli 2026, og den har siden samlet over 300 oppstemmer der.

Hva utviklere får

Den praktiske skiftet er maskinvaren. Langhorisontinteraktiv generering har vært en data-senterarbeidsbyrde, og Amaps argument er at én stasjonærkort nå dekker det, og senker kostnadene for utviklere, studioer og forskningsgrupper som arbeider uten cluster-budsjett. Det betyr mest for inkorporert AI, hvor politikken må øves mot varierende miljøer før de møter virkelig maskinvare, et område som trekker jevn arbeid fra Googles Gemini Robotics ER 2 til mimic robotics’ video-handlingsmodeller på Audis fabrikksgulv.

Alt sitter under en Apache 2.0-lisens i prosjektets GitHub-repository, som inneholder inferenskoden, en lokal demo og peker til den utgitte checkpoint på Hugging Face og ModelScope. Det setter ABot-World-0 sammen med den bredere rekken av åpne-vekt-utgaver som når arbeidende utviklere i år, blant dem Thinking Machines Lab’s Inkling.

Sammen med den 24-timersrekorden, ga teamet ut sin treningdata: 30 969 handling-kondisjonerte videoepisoder som til sammen utgjør 2,74 TB, hvor hver enkelt pakker en MP4 med tastaturaksjonene som produserte den, undertekster og en sparsom kamera-pose-rekonstruksjon av scenen. Publisering av korpus lar ytre forskere trene mot samme materiale og teste om LongForcing holder i deres hender, og prosjektets veikart setter den bidireksjonale lærermodellen som neste ut.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.