Modelli e piattaforme di IA
La piattaforma di servizi di localizzazione di Alibaba, Amap, esegue un modello di mondo per 24 ore su una sola GPU

Amap, la piattaforma di servizi di localizzazione di Alibaba, afferma che il suo modello di mondo interattivo ABot-World-0 può sostenere una sola sessione continua per fino a 24 ore su una sola scheda grafica consumer, e ha pubblicato l’intera esecuzione come un record cercabile anziché un riepilogo. La pagina consente a chiunque di saltare a qualsiasi secondo della giornata, con punti di ingresso fissi alle 6, 12 e 18 ore, insieme a cinque esecuzioni complete attraverso scene di prateria, deserto, città e neve.
Il numero è degno di nota a causa del limite che supera. Un modello di mondo interattivo genera frame video uno dopo l’altro in risposta a ciò che fa l’utente, quindi ogni nuovo pezzo è condizionato dai frame che il modello stesso ha prodotto momenti prima. Piccoli errori si propagano in avanti e la scena si degrada alla fine. Amap afferma che la maggior parte dei sistemi di questa classe si mantengono insieme per 30 secondi fino a un minuto. Il suo stesso annuncio del 16 luglio 2026 del modello ha fissato il numero a più di un’ora.
Come LongForcing mantiene la stabilità dell’esecuzione
Il metodo che Amap accredita si chiama LongForcing, descritto nel rapporto tecnico che il team ha pubblicato il 21 luglio 2026. Il modo usuale per costruire un modello come questo è la distillazione: un insegnante bidirezionale più lento che può attendere a un intero clip alla volta addestra uno studente causale più veloce che vede solo il passato, che è ciò che richiede l’interazione in tempo reale. Quella supervisione di solito copre clip brevi, quindi lo studente impara a guardare bene per pochi secondi e improvvisa dopo di quello.
LongForcing estende la supervisione a dove si verificano i fallimenti. Lo studente genera un lungo rollout da solo e un insegnante con un contesto temporale più lungo supervisiona le porzioni successive di esso, dove gli errori di previsione hanno avuto il tempo di accumularsi. Il rapporto inquadra questo come la correzione dello shift di distribuzione accumulato e della deriva autoregressiva, e non come un meccanismo di memoria. Il modello non viene chiesto di ricordare i frame precedenti con maggiore accuratezza; viene tirato indietro verso una distribuzione di mondo stabile mentre procede.
Amap afferma che ciò si manifesta nel comportamento: il modello continua ad espandere l’ambiente con nuove scene durante un rollout invece di bloccarsi in quella in cui è iniziato, e lo fa senza che l’utente debba inserire nuovi prompt lungo la strada.
Cosa coprono i numeri segnalati
L’inviluppo delle prestazioni deriva dalle misurazioni del team. Attraverso configurazioni a basso bit ottimizzate, il rapporto pone ABot-World-0 a 720p di output e fino a 16 frame al secondo su una sola scheda desktop Nvidia RTX 5090, con 1,2 secondi tra un’azione di input e il primo frame che la riflette, e circa 19 GiB di memoria video di picco. Le esecuzioni di controllo su input raw della tastiera per entrambi i movimenti di roaming della scena e del personaggio in terza persona, con una memoria di riferimento del personaggio che mantiene l’aspetto del personaggio costante durante una lunga sessione.
Per la valutazione, il documento riporta i risultati sulla suite WorldRoamBench insieme a rollout interattivi estesi, descrivendo il risultato come controllabilità competitiva e coerenza dell’evoluzione del mondo a lungo orizzonte. Ciò che il record pubblicato di 24 ore aggiunge è l’ispezionabilità: la timeline completa è lì per essere esaminata seconda dopo seconda, piuttosto che compressa in una tabella.
Il rapporto ha attirato l’attenzione quando è uscito. La pagina dei paper di Hugging Face lo ha elencato come il paper del giorno per il 22 luglio 2026, e da allora ha raccolto più di 300 voti lì.
Cosa ottengono gli sviluppatori
Il cambiamento pratico è l’hardware. La generazione interattiva a lungo orizzonte è stata un carico di lavoro del data center, e l’argomento di Amap è che una sola scheda desktop ora lo copre, abbassando il costo di ingresso per gli sviluppatori, gli studi e i gruppi di ricerca che lavorano senza budget di cluster. Ciò conta di più per l’intelligenza artificiale incorporata, dove le politiche devono essere esercitate contro ambienti variati prima di incontrare l’hardware reale, un’area che attrae lavoro costante da Google’s Gemini Robotics ER 2 a mimic robotics’ video-action models su Audi’s factory floor.
Tutto si trova sotto una licenza Apache 2.0 nel repository GitHub del progetto, che trasporta il codice di inferenza, una demo locale e puntatori al checkpoint rilasciato su Hugging Face e ModelScope. Ciò mette ABot-World-0 con la più ampia gamma di rilasci di pesi aperti che raggiungono gli sviluppatori che lavorano quest’anno, tra cui Thinking Machines Lab’s Inkling.
Accanto al record di 24 ore, il team ha rilasciato i suoi dati di allenamento: 30.969 episodi video condizionati da azioni che totalizzano 2,74 TB, ognuno dei quali impacchetta un MP4 con le azioni della tastiera che lo hanno prodotto, didascalie e una ricostruzione della posizione della telecamera della scena. La pubblicazione del corpus consente ai ricercatori esterni di allenarsi contro lo stesso materiale e di testare se LongForcing tiene in mano, e la roadmap del progetto mette il modello di insegnante bidirezionale come prossimo.












