AI-mallit ja alustat

Alibaban Amap pyörittää maailmanmallia 24 tuntia yhdellä GPU:lla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Amap, Alibaban sijaintipohjaisen palvelun, sanoo, että sen interaktiivinen maailmanmalli ABot-World-0 voi ylläpitää yhtä jatkuvaistuntaa jopa 24 tuntia yhdellä kuluttajien grafiikkakortilla, ja se on julkaissut koko suorituksen hakeutuvana tallenteena eikä vain korkeakohokohtaisena. Sivu mahdollistaa kenelle tahansa hypätä mihin tahansa päivän jokaiseen sekuntiin, kiinteillä sisääntulopisteillä kuuden, kahdentoista ja kahdeksantoista tunnin merkinnöissä, sekä viidellä muulla kokonaisella suorituksella niityn, aavikon, kaupungin ja lumikentän maisemissa.

Tämä lukema on merkittävä, koska se osoittaa, miten pitkään interaktiivinen maailmanmalli voi toimia. Interaktiivinen maailmanmalli luo videokuvaa ruutu ruudun jokaisen käyttäjän toiminnan mukaan, joten jokainen uusi osa on ehdollinen aiemmin mallin itsensä tuottamista ruuduista. Pienet virheet kasaantuvat, ja lopulta näkymä heikkenee. Amap sanoo, että useimmat järjestelmät tässä luokassa kestävät 30 sekuntia tai minuutin. Oma julkaisu mallista 16. heinäkuuta 2026 antoi ajan yli tunniksi.

Miten LongForcing pitää suorituksen vakaana

Menetelmä, jota Amap mainitsee, on kutsuttu LongForcingiksi, josta on julkaistu tekninen raportti, jonka tiimi julkaisi 21. heinäkuuta 2026. Tavallinen tapa rakentaa tällainen malli on tislaus: hitaampi bidirektionaalinen opettaja, joka voi huomioida koko klipin kerran, kouluttaa nopeampaa kausaalia oppilasta, joka näkee vain menneisyyden, mikä on sitä, mitä todellinen aikainen interaktio vaatii. Tavallinen valvonta kattaa lyhyet klipit, joten oppilas oppii näyttämään oikein muutaman sekunnin ajan ja improvisoi sen jälkeen.

LongForcing laajentaa valvontaa kohti epäonnistumisia. Oppilas luo pitkän suorituksen itse, ja opettaja, jolla on pitempi aikamuisti, valvoo sen myöhempiä osia, joissa ennustusvirheet ovat kasaantuneet eniten. Raportti kuvaa tätä korjaavana kertyneen jakautumisen ja autoregressiivisen ajeen siirtymänä, eikä muistimekanismina. Mallia ei pyydetä muistamaan aiempia kehyskohtia tarkemmin; se vedetään takaisin vakaan maailmanjakaumaan sen edetessä.

Amap sanoo, että se näkyy käyttäytymisessä: malli jatkaa ympäristön laajentamista uusilla maisemilla suorituksen aikana sen sijaan, että se lukkiutuisi yhteen aloittamansa maisemaan, ja se tekee sen ilman, että käyttäjän on syötettävä tuoreita ohjauksia sen aikana.

Mitä ilmoitetut luvut kattavat

Suorituskykyraja tulee tiimin omista mittauksista. Optimoitujen matalan bittitilanteiden yli, raportti asettaa ABot-World-0: n 720p-lähtöön ja jopa 16 kehykseen sekunnissa yhdellä Nvidia RTX 5090 -pöytäkoneen grafiikkakortilla, yhden toiminnon ja ensimmäisen kehyksen välillä 1,2 sekuntia, ja noin 19 GiB huipputallennustilaa. Ohjaussuoritukset raakaa näppäimistösyötettä sekä maiseman kulkemiselle että kolmannen persoonan hahmon liikkeelle, viitehahmomuistilla, joka pitää hahmon ulkonäön vakaana pitkän istunnon aikana.

Arvioinnissa raportti raportoi tuloksia WorldRoamBench- sarjasta sekä laajennetuista interaktiivisista suorituksista, ja kuvaa lopputulosta kilpailukykyiseksi ohjattavuudeksi ja yhtenäiseksi pitkän aikavälin maailmankehitykseksi. Julkaistu 24-tuntinen tallenne lisää tarkastelukelpoisuutta: koko aikajana on siellä, ja sitä voi etsiä sekunnin tarkkuudella, eikä se ole pakattu taulukkoon.

Raportti herätti huomiota, kun se ilmestyi. Hugging Facen paperisivu mainitsi sen päivän parhaana paperina 22. heinäkuuta 2026, ja siitä lähtien se on kerännyt yli 300 ääntä siellä.

Mitä kehittäjät saavat

Käytännön muutos on laitteistossa. Pitkän aikavälin interaktiivinen generointi on ollut datakeskuksen työmäärä, ja Amapin argumentti on, että yksi pöytäkoneen grafiikkakortti kattaa sen nyt, mikä laskisi kehittäjien, studioiden ja tutkimusryhmien kustannuksia, jotka työskentelevät ilman klusteribudjetteja. Se on tärkeintä keholliselle tekoälylle, jossa politiikat on harjoitettava moninaisissa ympäristöissä ennen kuin ne kohtaavat oikean laitteiston, alue, jossa Google Gemini Robotics ER 2 tekee jatkuvaa työtä mimic roboticsin video-toimintamalleilla Audin tehdaslaella.

Kaikki on Apache 2.0 -lisenssin alaisuudessa projektin GitHub-arkistossa, joka sisältää inference-koodin, paikallisen demon ja osoittimet julkaistuun tarkistuspisteeseen Hugging Facessa ja ModelScopessa. Se asettaa ABot-World-0: n laajempaan avoimen painojen julkaisujen joukkoon, jotka tavoittavat kehittäjiä tänä vuonna, mukaan lukien Thinking Machines Lab Inkling.

24-tunnin tallenteen rinnalla tiimi julkaisi myös koulutusaineistonsa: 30 969 toiminnan ehtoista videoprotokollaa, jotka yhteensä 2,74 TB, kussakin on MP4-tiedosto, jossa on näppäimistötoiminnot, jotka aiheuttivat sen, käännökset ja harsompi kameran asennon jälleenrakennus kohtauksesta. Julkaisemalla aineiston ulkopuoliset tutkijat voivat kouluttaa sitä vastaan ja testata, pitävätkö LongForcingin ominaisuudet heidän käsissään, ja projektin tiekartta asettaa bidirektionaalisen opettajan mallin seuraavaksi ovelle.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.