Modele și platforme AI

Platforma de servicii bazate pe locație Amap a lui Alibaba rulează un model de lume pentru 24 de ore pe o singură placă grafică

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Amap, platforma de servicii bazate pe locație a lui Alibaba, spune că modelul său interactiv de lume ABot-World-0 poate susține o singură sesiune continuă de până la 24 de ore pe o singură placă grafică pentru consumatori, și a publicat întreaga rulare ca o înregistrare căutabilă și nu doar un fragment de înregistrare. Pagina permite oricui să sară la orice secundă din rularea de o zi, cu puncte de intrare fixe la marcajele de șase, doisprezece și optsprezece ore, alături de încă cinci rulări complete prin scene de pășune, deșert, oraș și zăpadă.

Acest lucru este important din cauza plafonului pe care îl depășește. Un model de lume interactiv generează cadre de film secvențial în răspuns la ceea ce face utilizatorul, astfel încât fiecare bucată nouă este condiționată de cadre pe care modelul le-a produs cu momente mai devreme. Erori mici se propagă înainte, iar scena se degradează în cele din urmă. Amap spune că majoritatea sistemelor din această clasă se mențin împreună timp de 30 de secunde până la un minut. Anunțul său din 16 iulie 2026 al modelului a stabilit numărul la peste o oră.

Cum menține LongForcing rularea stabilă

Metoda pe care Amap o creditează se numește LongForcing, descrisă în raportul tehnic pe care echipa l-a postat pe 21 iulie 2026. Modul obișnuit de a construi un model de acest fel este distilarea: un profesor bidirecțional mai lent care poate acorda atenție întregului clip la un moment dat antrenează un student cauzal mai rapid care nu vede decât trecutul, ceea ce este necesar pentru interacțiunea în timp real. Acea supraveghere acoperă de obicei clipuri scurte, astfel încât studentul învață să arate bine pentru câteva secunde și improvizează după aceea.

LongForcing extinde supravegherea acolo unde apar eșecurile. Studentul generează o rulare lungă pe cont propriu, iar un profesor cu un context temporal mai lung supraveghează porțiunile ulterioare ale acesteia, unde erorile de predicție au avut cel mai mult timp să se acumuleze. Raportul prezintă acest lucru ca corectarea deplasării distribuției acumulate și a derapajului autoregresiv, și nu ca un mecanism de memorie. Modelul nu este solicitat să reamintească cadrele anterioare mai precis; este tras înapoi către o distribuție de lume stabilă pe măsură ce merge înainte.

Amap spune că se manifestă în comportament: modelul continuă să extindă mediul cu scene noi în timpul unei rulări, în loc să se blocheze în scena cu care a început, și o face fără ca utilizatorul să introducă prompturi proaspete pe parcurs.

Ce cuprind cifrele raportate

Invelișul de performanță provine din măsurătorile echipei. Pe configurații cu biti mici optimizați, raportul plasează ABot-World-0 la o ieșire de 720p și până la 16 cadre pe secundă pe o singură placă grafică desktop Nvidia RTX 5090, cu 1,2 secunde între o acțiune de intrare și primul cadru care o reflectă, și aproximativ 19 GiB de memorie video de vârf. Rulările de control pe intrare brută de la tastatură atât pentru deplasarea scenei, cât și pentru mișcarea personajului în persoana a treia, cu o memorie de referință a personajului care menține apariția personajului stabilă pe o sesiune lungă.

Pentru evaluare, articolul raportează rezultate pe suita WorldRoamBench, împreună cu rulări interactive extinse, descriind rezultatul ca o controllabilitate competitivă și o evoluție coerentă a lumii pe orizonturi lungi. Ceea ce adaugă înregistrarea publicată de 24 de ore este inspectabilitatea: cronologia completă este acolo pentru a fi răsfoită secundă de secundă, și nu comprimată într-un tabel.

Raportul a atras atenția când a apărut. Pagina de articole a lui Hugging Face l-a listat ca articolul principal al zilei pentru 22 iulie 2026, și de atunci a strâns peste 300 de voturi acolo.

Ce primesc dezvoltatorii

Schimbarea practică este hardware-ul. Generarea interactivă pe orizonturi lungi a fost o sarcină de centru de date, iar argumentul lui Amap este că o singură placă desktop acoperă acum această sarcină, reducând costul de intrare pentru dezvoltatori, studiouri și grupuri de cercetare care lucrează fără bugete de cluster. Acest lucru contează mai mult pentru inteligența artificială încorporată, unde politicile trebuie exercitate împotriva unor medii variate înainte de a întâlni hardware-ul real, o zonă care atrage o muncă constantă de la Gemini Robotics ER 2 a lui Google la modelele de acțiune video ale mimic robotics pe linia de producție a lui Audi.

Totul se află sub o licență Apache 2.0 în depozitul de cod GitHub al proiectului, care conține codul de inferență, un demo local și indicatori către punctul de control lansat pe Hugging Face și ModelScope. Acest lucru plasează ABot-World-0 printre lansările de greutate deschisă care ajung la dezvoltatorii care lucrează în acest an, printre care Inkling de la Thinking Machines Lab.

Alături de înregistrarea de 24 de ore, echipa a lansat și datele de antrenament: 30.969 de episoade de video condiționate de acțiuni, care totalizează 2,74 TB, fiecare ambalând un MP4 cu acțiunile de la tastatură care l-au produs, subtitrări și o reconstrucție a poziției camerei. Publicarea corpusului permite cercetătorilor externi să se antreneze împotriva aceluiași material și să verifice dacă LongForcing se menține în mâinile lor, iar planul de drum al proiectului plasează modelul profesor bidirecțional următor în ușă, împreună cu acțiunile de la tastatură care l-au produs, subtitrări și o reconstrucție a poziției camerei. Publicarea corpusului permite cercetătorilor externi să se antreneze împotriva aceluiași material și să verifice dacă LongForcing se menține în mâinile lor, iar planul de drum al proiectului plasează modelul profesor bidirecțional următor în ușă.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.