Modele i platformy AI

Platforma Amap Alibaba uruchamia model świata na 24 godziny na jednej karcie graficznej

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Platforma Amap, która świadczy usługi oparte na lokalizacji, twierdzi, że jej interaktywny model świata ABot-World-0 może utrzymywać jedną ciągłą sesję przez 24 godziny na jednej karcie graficznej, a także opublikowała cały przebieg jako szukany zapis zamiast zwykłego pokazu. Strona pozwala każdemu przeskoczyć do dowolnej sekundy dnia, z ustalonymi punktami wejścia na szóstym, dwunastym i osiemnastym godzinie, obok pięciu pełnych przebiegów przez sceny trawiaste, pustynne, miejskie i śnieżne.

Wynik jest wart uwagi ze względu na pułap, który przekracza. Interaktywny model świata generuje klatki wideo klatka po klatce w odpowiedzi na to, co robi użytkownik, więc każdy nowy fragment jest warunkowany przez klatki, które model sam wyprodukował chwilę wcześniej. Małe błędy są przenoszone do przodu, a scena ostatecznie ulega degradacji. Amap mówi, że większość systemów w tej klasie utrzymuje się przez 30 sekund do minuty. Własne ogłoszenie z 16 lipca 2026 r. podaje liczbę powyżej godziny.

Jak LongForcing utrzymuje stabilność przebiegu

Metoda, której Amap przypisuje tę zdolność, nazywa się LongForcing, opisana w sprawozdaniu technicznym opublikowanym przez zespół 21 lipca 2026 r. Zwykły sposób budowy modelu tego typu to destylacja: wolniejszy, dwukierunkowy nauczyciel, który może uwzględniać cały klip na raz, trenuje szybszy, jednokierunkowy uczeń, który widzi tylko przeszłość, co jest wymagane przez interakcję w czasie rzeczywistym. To nadzorowanie zwykle obejmuje krótkie klipy, więc uczeń uczy się wyglądać dobrze przez kilka sekund i improwizuje po tym.

LongForcing rozszerza nadzorowanie do miejsca, w którym występują awarie. Uczeń generuje długi przebieg samodzielnie, a nauczyciel z dłuższym kontekstem czasowym nadzoruje późniejsze części, w których błędy predykcji miały najwięcej czasu na kumulację. Raport opisuje to jako korektę nagromadzonej zmiany dystrybucji i dryfu autoregresyjnego, a nie jako mechanizm pamięci. Model nie jest proszony o przypomnienie sobie wcześniejszych klatek bardziej dokładnie; jest on ciągnięty z powrotem w kierunku stabilnej dystrybucji świata, gdy się porusza.

Amap twierdzi, że to się objawia w zachowaniu: model nadal rozwija środowisko z nowymi scenami podczas przebiegu, zamiast zablokowania w tym, w którym się zaczął, i robi to bez konieczności podawania przez użytkownika świeżych podpowiedzi po drodze.

Co obejmują podane liczby

Zakres wydajności pochodzi z własnych pomiarów zespołu. Przez zoptymalizowane konfiguracje o niskim bicie, raport umieszcza ABot-World-0 w wyjściu 720p i do 16 klatek na sekundę na jednej karcie graficznej Nvidia RTX 5090, z 1,2 sekundami między akcją wejściową a pierwszą klatką, która ją odzwierciedla, oraz około 19 GiB szczytowej pamięci wideo. Przebiegi kontrolne na surowym wejściu klawiatury zarówno dla przemieszczania się po scenie, jak i ruchu postaci z trzeciej osoby, z pamięcią odniesienia postaci, która utrzymuje wygląd postaci przez długi czas.

Dla oceny raport przedstawia wyniki w teście WorldRoamBench oraz przedłużone interaktywne przebiegi, opisując wynik jako konkurencyjną sterowalność i spójny długoterminowy rozwój świata. To, co dodaje opublikowany 24-godzinny zapis, to możliwość inspekcji: cała linia czasu jest tam, aby można ją było przewinąć sekundę po sekundzie, zamiast sprowadzić ją do tabeli.

Raport zwrócił uwagę, gdy się pojawił. Strona Hugging Face wymieniła go jako najlepszy artykuł dnia 22 lipca 2026 r. i od tego czasu zebrał ponad 300 głosów.

Co otrzymują deweloperzy

Praktyczna zmiana to sprzęt. Długoterminowa generacja interaktywna była obciążeniem centrów danych, a argumentacja Amap mówi, że teraz jedna karta graficzna to pokrywa, obniżając koszt wejścia dla deweloperów, studiów i grup badawczych, które pracują bez budżetów klastrów. To ma największe znaczenie dla sztucznej inteligencji wcielonej, gdzie polityki muszą być ćwiczone przeciwko różnym środowiskom, zanim spotkają się z prawdziwym sprzętem, obszar, który cieszy się stałą pracą od Gemini Robotics ER 2 do mimic robotics’ modeli akcji wideo na podłodze fabrycznej Audi.

Wszystko znajduje się pod licencją Apache 2.0 w repozytorium GitHub, które zawiera kod inferencyjny, lokalną demonstrację i wskazówki do wydanej kontrolki na Hugging Face i ModelScope. To umieszcza ABot-World-0 wraz z szerszym zakresem otwartych modeli, które docierają do deweloperów w tym roku, wśród nich Thinking Machines Lab’s Inkling.

Obok 24-godzinnego zapisu zespół wydał swoje dane szkoleniowe: 30 969 epizodów wideo warunkowanych akcją, które łącznie wynoszą 2,74 TB, każdy z nich zawiera MP4 z akcjami klawiatury, które je wyprodukowały, napisy i rzadką rekonstrukcję pozycji kamery. Publikowanie korpusu pozwala zewnętrznym badaczom trenować przeciwko tym samym materiałom i testować, czy LongForcing utrzymuje się w ich rękach, a mapa drogowa projektu umieszcza model nauczyciela dwukierunkowego jako następny.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.