Modèles et plateformes d’IA
La plateforme de services de localisation d’Alibaba, Amap, fait tourner un modèle de monde pendant 24 heures sur une seule carte graphique

Amap, la plateforme de services de localisation d’Alibaba, affirme que son modèle de monde interactif ABot-World-0 peut maintenant maintenir une session continue pendant 24 heures sur une seule carte graphique grand public, et a publié l’intégralité de la session sous forme de enregistrement accessible plutôt que sous forme de montage. La page permet à tout le monde de sauter à n’importe quelle seconde de la session de 24 heures, avec des points d’entrée fixes aux marques de six, douze et dix-huit heures, ainsi que cinq autres sessions complètes à travers des scènes de prairie, de désert, de ville et de neige.
Le chiffre est important en raison du plafond qu’il dépasse. Un modèle de monde interactif génère des images vidéo image par image en réponse à ce que fait l’utilisateur, donc chaque nouveau fragment est conditionné par les images que le modèle lui-même a produites quelques instants plus tôt. De petites erreurs se propagent et la scène se dégrade finalement. Amap indique que la plupart des systèmes de cette classe tiennent ensemble pendant 30 secondes à une minute. Son propre annonce du 16 juillet 2026 du modèle situait le nombre à plus d’une heure.
Comment LongForcing maintient la stabilité de la session
La méthode que Amap crédite s’appelle LongForcing, décrite dans le rapport technique que l’équipe a publié le 21 juillet 2026. La façon habituelle de construire un modèle comme celui-ci est la distillation : un enseignant bidirectionnel plus lent qui peut s’attacher à l’ensemble d’un clip à la fois forme un étudiant causal plus rapide qui ne voit que le passé, ce qui est nécessaire pour une interaction en temps réel. Cette supervision couvre généralement de courts clips, donc l’étudiant apprend à regarder correctement pendant quelques secondes et improvise après cela.
LongForcing étend la supervision aux endroits où les échecs se produisent. L’étudiant génère une longue session par lui-même, et un enseignant avec un contexte temporel plus long supervise les portions ultérieures de celle-ci, où les erreurs de prédiction ont eu le plus de temps pour se cumuler. Le rapport présente cela comme la correction du décalage de distribution accumulé et du dérive autoregressive, et non comme un mécanisme de mémoire. Le modèle n’est pas invité à rappeler les images précédentes plus précisément ; il est ramené vers une distribution de monde stable à mesure qu’il avance.
Amap affirme que cela se manifeste dans le comportement : le modèle continue à étendre l’environnement avec de nouvelles scènes pendant une session au lieu de se verrouiller dans celle qu’il a commencée, et le fait sans que l’utilisateur n’ait à fournir de nouveaux prompts en cours de route.
Ce que les chiffres publiés couvrent
L’enveloppe de performance vient des mesures de l’équipe. À travers les configurations à faible bit optimisées, le rapport situe ABot-World-0 à une sortie 720p et à jusqu’à 16 images par seconde sur une carte graphique de bureau Nvidia RTX 5090, avec 1,2 seconde entre une action d’entrée et la première image qui la reflète, et environ 19 GiB de mémoire vidéo de pointe. Les sessions de contrôle sur les entrées brutes du clavier pour les déplacements de scène et les mouvements de personnage en troisième personne, avec une mémoire de personnage de référence qui maintient l’apparence d’un personnage stable pendant une longue session.
Pour l’évaluation, le document rapporte des résultats sur la suite WorldRoamBench ainsi que des sessions interactives prolongées, décrivant le résultat comme une contrôlabilité compétitive et une évolution de monde cohérente à long horizon. Ce que l’enregistrement publié de 24 heures ajoute, c’est l’inspectabilité : la chronologie complète est là pour être parcourue seconde par seconde, plutôt que de être compressée dans un tableau.
Le rapport a attiré l’attention lorsqu’il est sorti. La page de papier de Hugging Face l’a répertorié comme le premier papier du jour pour le 22 juillet 2026, et il a depuis collecté plus de 300 votes positifs.
Ce que les développeurs obtiennent
Le changement pratique est le matériel. La génération interactive à long horizon a été une charge de travail de centre de données, et l’argument d’Amap est qu’une seule carte de bureau la couvre maintenant, ce qui réduit le coût d’entrée pour les développeurs, les studios et les groupes de recherche qui travaillent sans budget de cluster. Cela compte le plus pour l’intelligence artificielle incarnée, où les politiques doivent être exercées contre des environnements variés avant de rencontrer du matériel réel, un domaine qui attire un travail régulier de Google’s Gemini Robotics ER 2 à mimic robotics’ video-action models sur le plan de production d’Audi.
Tout se trouve sous une licence Apache 2.0 dans le dépôt GitHub du projet, qui contient le code d’inférence, une démo locale et des pointeurs vers le point de contrôle publié sur Hugging Face et ModelScope. Cela place ABot-World-0 avec la série plus large de sorties de poids ouvertes qui atteignent les développeurs qui travaillent cette année, parmi lesquels Thinking Machines Lab’s Inkling.
En plus de l’enregistrement de 24 heures, l’équipe a publié ses données de formation : 30 969 épisodes de vidéo conditionnés par action, totalisant 2,74 To, chacun emballant un MP4 avec les actions du clavier qui l’ont produit, des légendes et une reconstruction de pose de caméra parcimonieuse de la scène. La publication du corpus permet aux chercheurs extérieurs de se former contre le même matériel et de tester si LongForcing tient dans leurs mains, et la feuille de route du projet place le modèle d’enseignant bidirectionnel en tête de liste pour la prochaine sortie.












