Modele i platformy AI
Platforma Amap Alibaba uruchamia model świata na 24 godziny na jednej karcie graficznej

Platforma Amap, która świadczy usługi oparte na lokalizacji, twierdzi, że jej interaktywny model świata ABot-World-0 może utrzymywać jedną ciągłą sesję przez 24 godziny na jednej karcie graficznej, a także opublikowała cały przebieg jako szukany zapis zamiast zwykłego pokazu. Strona pozwala każdemu przeskoczyć do dowolnej sekundy dnia, z ustalonymi punktami wejścia na szóstym, dwunastym i osiemnastym godzinie, obok pięciu pełnych przebiegów przez sceny trawiaste, pustynne, miejskie i śnieżne.
Wynik jest wart uwagi ze względu na pułap, który przekracza. Interaktywny model świata generuje klatki wideo klatka po klatce w odpowiedzi na to, co robi użytkownik, więc każdy nowy fragment jest warunkowany przez klatki, które model sam wyprodukował chwilę wcześniej. Małe błędy są przenoszone do przodu, a scena ostatecznie ulega degradacji. Amap mówi, że większość systemów w tej klasie utrzymuje się przez 30 sekund do minuty. Własne ogłoszenie z 16 lipca 2026 r. podaje liczbę powyżej godziny.
Jak LongForcing utrzymuje stabilność przebiegu
Metoda, której Amap przypisuje tę zdolność, nazywa się LongForcing, opisana w sprawozdaniu technicznym opublikowanym przez zespół 21 lipca 2026 r. Zwykły sposób budowy modelu tego typu to destylacja: wolniejszy, dwukierunkowy nauczyciel, który może uwzględniać cały klip na raz, trenuje szybszy, jednokierunkowy uczeń, który widzi tylko przeszłość, co jest wymagane przez interakcję w czasie rzeczywistym. To nadzorowanie zwykle obejmuje krótkie klipy, więc uczeń uczy się wyglądać dobrze przez kilka sekund i improwizuje po tym.
LongForcing rozszerza nadzorowanie do miejsca, w którym występują awarie. Uczeń generuje długi przebieg samodzielnie, a nauczyciel z dłuższym kontekstem czasowym nadzoruje późniejsze części, w których błędy predykcji miały najwięcej czasu na kumulację. Raport opisuje to jako korektę nagromadzonej zmiany dystrybucji i dryfu autoregresyjnego, a nie jako mechanizm pamięci. Model nie jest proszony o przypomnienie sobie wcześniejszych klatek bardziej dokładnie; jest on ciągnięty z powrotem w kierunku stabilnej dystrybucji świata, gdy się porusza.
Amap twierdzi, że to się objawia w zachowaniu: model nadal rozwija środowisko z nowymi scenami podczas przebiegu, zamiast zablokowania w tym, w którym się zaczął, i robi to bez konieczności podawania przez użytkownika świeżych podpowiedzi po drodze.
Co obejmują podane liczby
Zakres wydajności pochodzi z własnych pomiarów zespołu. Przez zoptymalizowane konfiguracje o niskim bicie, raport umieszcza ABot-World-0 w wyjściu 720p i do 16 klatek na sekundę na jednej karcie graficznej Nvidia RTX 5090, z 1,2 sekundami między akcją wejściową a pierwszą klatką, która ją odzwierciedla, oraz około 19 GiB szczytowej pamięci wideo. Przebiegi kontrolne na surowym wejściu klawiatury zarówno dla przemieszczania się po scenie, jak i ruchu postaci z trzeciej osoby, z pamięcią odniesienia postaci, która utrzymuje wygląd postaci przez długi czas.
Dla oceny raport przedstawia wyniki w teście WorldRoamBench oraz przedłużone interaktywne przebiegi, opisując wynik jako konkurencyjną sterowalność i spójny długoterminowy rozwój świata. To, co dodaje opublikowany 24-godzinny zapis, to możliwość inspekcji: cała linia czasu jest tam, aby można ją było przewinąć sekundę po sekundzie, zamiast z压ić ją w tabelę.
Raport zwrócił uwagę, gdy się pojawił. Strona Hugging Face wymieniła go jako najlepszy artykuł dnia 22 lipca 2026 r. i od tego czasu zebrał ponad 300 głosów.
Co otrzymują deweloperzy
Praktyczna zmiana to sprzęt. Długoterminowa generacja interaktywna była obciążeniem centrów danych, a argumentacja Amap mówi, że teraz jedna karta graficzna to pokrywa, obniżając koszt wejścia dla deweloperów, studiów i grup badawczych, które pracują bez budżetów klastrów. To ma największe znaczenie dla sztucznej inteligencji wcielonej, gdzie polityki muszą być ćwiczone przeciwko różnym środowiskom, zanim spotkają się z prawdziwym sprzętem, obszar, który cieszy się stałą pracą od Gemini Robotics ER 2 do mimic robotics’ modeli akcji wideo na podłodze fabrycznej Audi.
Wszystko znajduje się pod licencją Apache 2.0 w repozytorium GitHub, które zawiera kod inferencyjny, lokalną demonstrację i wskazówki do wydanej kontrolki na Hugging Face i ModelScope. To umieszcza ABot-World-0 wraz z szerszym zakresem otwartych modeli, które docierają do deweloperów w tym roku, wśród nich Thinking Machines Lab’s Inkling.
Obok 24-godzinnego zapisu zespół wydał swoje dane szkoleniowe: 30 969 epizodów wideo warunkowanych akcją, które łącznie wynoszą 2,74 TB, każdy z nich zawiera MP4 z akcjami klawiatury, które je wyprodukowały, napisy i rzadką rekonstrukcję pozycji kamery. Publikowanie korpusu pozwala zewnętrznym badaczom trenować przeciwko tym samym materiałom i testować, czy LongForcing utrzymuje się w ich rękach, a mapa drogowa projektu umieszcza model nauczyciela dwukierunkowego jako następny.












