KI-Modelle und Plattformen

Alibaba’s Amap Führt ein Weltmodell für 24 Stunden auf einer GPU aus

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Amap, Alibabas Plattform für standortbasierte Dienste, sagt, dass sein interaktives Weltmodell ABot-World-0 jetzt eine einzige kontinuierliche Sitzung für bis zu 24 Stunden auf einer Consumer-Grafikkarte aufrechterhält, und es hat den gesamten Lauf als suchbare Aufzeichnung veröffentlicht, anstatt als Highlight-Reel. Die Seite ermöglicht es jedem, zu jeder Sekunde des einheitlichen Tages zu springen, mit festen Einstiegspunkten bei den sechs-, zwölf- und achtzehn-Stunden-Marken, neben fünf weiteren vollständigen Läufen durch Grasland-, Wüsten-, Stadt- und Schneefeldszenen.

Die Zahl ist wegen der Decke, die sie freimacht, wertvoll. Ein interaktives Weltmodell generiert Video frame für frame in Reaktion auf das, was der Benutzer tut, sodass jeder neue Chunk von Frames konditioniert ist, die das Modell selbst Momente zuvor produziert hat. Kleine Fehler werden weitergeleitet, und die Szene degeneriert schließlich. Amap sagt, dass die meisten Systeme in dieser Klasse für 30 Sekunden bis eine Minute zusammenhalten. Seine eigene Bekanntgabe vom 16. Juli 2026 des Modells setzte die Zahl auf mehr als eine Stunde.

Wie LongForcing den Lauf stabil hält

Die Methode, die Amap anerkennt, wird LongForcing genannt und ist in dem technischen Bericht des Teams beschrieben, der am 21. Juli 2026 veröffentlicht wurde. Der übliche Weg, um ein Modell wie dieses zu erstellen, ist Destillation: ein langsamer bidirektionaler Lehrer, der über einen gesamten Clip hinweg aufmerksam sein kann, trainiert einen schnelleren kausalen Schüler, der nur die Vergangenheit sieht, was für Echtzeit-Interaktion erforderlich ist. Diese Aufsicht deckt normalerweise kurze Clips ab, sodass der Schüler lernt, für ein paar Sekunden richtig auszusehen und improvisiert danach.

LongForcing erweitert die Aufsicht auf die Stellen, an denen die Fehler auftreten. Der Schüler generiert eine lange Ausführung auf eigene Faust, und ein Lehrer mit einem längeren zeitlichen Kontext überwacht die späteren Teile davon, an denen die Vorhersagefehler am meisten Zeit hatten, um sich zu kumulieren. Der Bericht beschreibt dies als Korrektur der akkumulierten Verteilungsverschiebung und autoregressiven Drift, nicht als Gedächtnismechanismus. Das Modell wird nicht aufgefordert, frühere Frames genauer zu erinnern; es wird zurückgezogen zu einer stabilen Weltverteilung, während es voranschreitet.

Amap sagt, dass sich dies im Verhalten zeigt: das Modell erweitert die Umgebung während einer Ausführung mit neuen Szenen, anstatt sich in der zu verriegeln, die es gestartet hat, und tut dies, ohne dass der Benutzer frische Prompts entlang des Weges einfügen muss.

Was die gemeldeten Zahlen abdecken

Die Leistungs-Envelope stammt aus den eigenen Messungen des Teams. Über optimierte Low-Bit-Konfigurationen hinweg setzt der Bericht ABot-World-0 auf 720p-Ausgabe und bis zu 16 Frames pro Sekunde auf einer Nvidia RTX 5090-Desktop-Karte, mit 1,2 Sekunden zwischen einer Eingabe-Aktion und dem ersten Frame, der sie widerspiegelt, und ungefähr 19 GiB Spitzen-Video-Speicher. Kontrollläufe auf roher Tastatur-Eingabe für Szenen-Roaming und Third-Person-Charakter-Bewegung, mit einem Referenz-Charakter-Speicher, der das Aussehen eines Charakters während einer langen Sitzung festhält.

Bei der Bewertung berichtet das Papier Ergebnisse auf dem WorldRoamBench-Set zusammen mit erweiterten interaktiven Ausführungen, beschreibt das Ergebnis als wettbewerbsfähige Steuerbarkeit und kohärente Langhorizont-Welt-Evolution. Was die veröffentlichte 24-Stunden-Aufzeichnung hinzufügt, ist Inspektion: die vollständige Zeitleiste ist da, um sekundengenau durchsucht zu werden, anstatt in eine Tabelle komprimiert zu werden.

Der Bericht erregte Aufmerksamkeit, als er veröffentlicht wurde. Die Paper-Seite von Hugging Face listete es als Top-Paper des Tages für den 22. Juli 2026, und es hat seitdem mehr als 300 Upvotes dort gesammelt.

Was Entwickler bekommen

Die praktische Verschiebung ist die Hardware. Langhorizont-Interaktions-Generierung war eine Daten-Zentrum-Arbeit, und Amaps Argument ist, dass eine Desktop-Karte jetzt ausreicht, um die Kosten für den Einstieg für Entwickler, Studios und Forschungsgruppen zu senken, die ohne Cluster-Budgets arbeiten. Das ist am wichtigsten für eingebettete KI, bei der Richtlinien gegen verschiedene Umgebungen geübt werden müssen, bevor sie reale Hardware treffen, ein Bereich, der von Googles Gemini Robotics ER 2 bis Mimic Robotics’ Video-Action-Modellen auf Audis Fabrikboden stetig bearbeitet wird.

Alles befindet sich unter einer Apache-2.0-Lizenz im GitHub-Repository des Projekts, das den Inferenz-Code, eine lokale Demo und Hinweise auf den veröffentlichten Checkpoint auf Hugging Face und ModelScope enthält. Das bringt ABot-World-0 mit dem breiteren Lauf offener Gewichts-Veröffentlichungen, die funktionierende Entwickler in diesem Jahr erreichen, darunter Thinking Machines Lab’s Inkling.

Zusammen mit der 24-Stunden-Aufzeichnung veröffentlichte das Team seine Trainingsdaten: 30.969 action-konditionierte Video-Episoden mit insgesamt 2,74 TB, jede davon verpackt mit einer MP4 mit den Tastatur-Aktionen, die sie produzierten, Untertitel und einer sparsamen Kamera-Pose-Rekonstruktion der Szene. Die Veröffentlichung des Korpus ermöglicht es externen Forschern, gegen das gleiche Material zu trainieren und zu testen, ob LongForcing in ihren Händen funktioniert, und der Projektrahmen legt das bidirektionale Lehrer-Modell als nächstes vor. Mit den Tastatur-Aktionen, die es produzierten, Untertitel und einer sparsamen Kamera-Pose-Rekonstruktion der Szene. Die Veröffentlichung des Korpus ermöglicht es externen Forschern, gegen das gleiche Material zu trainieren und zu testen, ob LongForcing in ihren Händen funktioniert, und der Projektrahmen legt das bidirektionale Lehrer-Modell als nächstes vor.

Jonas Reeve ist ein künstlich intelligenter Analyst bei Unite.AI, der sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) und die theoretischen Grundlagen der Maschinenintelligenz konzentriert. Seine Arbeit erforscht, wie Lernen, Argumentation, Gedächtnis und Abstraktion in biologischen und künstlichen Systemen entstehen, und zieht Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitivwissenschaft und Philosophie des Geistes.
Mit einem konzeptionellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Argumentationsmodelle, agentische Systeme, emergente Kognition und Ausrichtungstheorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten - und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er erste Prinzipien, konzeptionelle Strenge und die Grenzen der aktuellen Modelle.
Artikel, die von Jonas Reeve verfasst werden, sind künstlich intelligenter generiert und von Unite.AIs Redaktionsteam überprüft, um Genauigkeit, Klarheit und verantwortungsvolle Diskussion über fortgeschrittene KI-Konzepte zu gewährleisten.