Modelos y plataformas de IA

El modelo de mundo de Amap de Alibaba se ejecuta durante 24 horas en una sola tarjeta gráfica

mm
Añade Unite.AI a tus fuentes preferidas en Google

Amap, la plataforma de servicios basados en la ubicación de Alibaba, afirma que su modelo de mundo interactivo ABot-World-0 puede mantener una sesión continua durante 24 horas en una sola tarjeta gráfica de consumo, y ha publicado toda la ejecución como un registro buscable en lugar de un resumen. La página permite a cualquier persona saltar a cualquier segundo del despliegue de un día, con puntos de entrada fijos en las marcas de seis, doce y dieciocho horas, junto con cinco ejecuciones completas más a través de escenas de pastizales, desierto, ciudad y nieve.

La cifra es digna de mención debido al techo que supera. Un modelo de mundo interactivo genera video marco a marco en respuesta a lo que hace el usuario, por lo que cada nuevo fragmento está condicionado a los marcos que el modelo produjo momentos antes. Los pequeños errores se propagan hacia adelante, y la escena eventualmente se degrada. Amap dice que la mayoría de los sistemas de esta clase se mantienen unidos durante 30 segundos a un minuto. Su propio anuncio del 16 de julio de 2026 del modelo puso la cifra en más de una hora.

Cómo LongForcing mantiene la ejecución estable

El método que Amap acredita se llama LongForcing, descrito en el informe técnico que el equipo publicó el 21 de julio de 2026. La forma habitual de construir un modelo como este es la destilación: un maestro bidireccional más lento que puede atender a todo un clip a la vez entrena a un estudiante causal más rápido que solo ve el pasado, lo que es lo que se requiere para la interacción en tiempo real. Esa supervisión suele cubrir clips cortos, por lo que el estudiante aprende a mirar bien durante unos segundos y improvisa después de eso.

LongForcing extiende la supervisión a donde ocurren los fallos. El estudiante genera una ejecución larga por su cuenta, y un maestro con un contexto temporal más largo supervisa las porciones posteriores de ella, donde los errores de predicción han tenido más tiempo para acumularse. El informe enmarca esto como la corrección del desplazamiento de distribución acumulado y el desplazamiento autoregresivo, no como un mecanismo de memoria. El modelo no se le pide que recuerde los marcos anteriores con más precisión; se le está llevando de regreso hacia una distribución de mundo estable a medida que avanza.

Amap dice que se manifiesta en el comportamiento: el modelo mantiene el entorno expandiéndolo con nuevas escenas durante una ejecución en lugar de bloquearse en la que comenzó, y lo hace sin que el usuario deba introducir nuevos estímulos en el camino.

Qué cubren las cifras informadas

El sobre de rendimiento proviene de las propias mediciones del equipo. A través de configuraciones de bajo bit optimizadas, el informe coloca a ABot-World-0 en una salida de 720p y hasta 16 fotogramas por segundo en una tarjeta de escritorio Nvidia RTX 5090, con 1,2 segundos entre una acción de entrada y el primer fotograma que la refleja, y aproximadamente 19 GiB de memoria de video pico. Las ejecuciones de control en entrada de teclado cruda para tanto el movimiento de escena como el movimiento de personaje en tercera persona, con una memoria de personaje de referencia que mantiene la apariencia del personaje estable a lo largo de una sesión larga.

Para la evaluación, el documento informa resultados en la suite WorldRoamBench junto con ejecuciones interactivas extendidas, describiendo el resultado como una controllabilidad competitiva y una evolución de mundo coherente a largo plazo. Lo que el registro publicado de 24 horas agrega es la inspeccionabilidad: la línea de tiempo completa está allí para ser examinada segundo a segundo, en lugar de comprimirla en una tabla.

El informe atrajo la atención cuando llegó. La página de artículos de Hugging Face lo enumeró como el artículo principal del día para el 22 de julio de 2026, y desde entonces ha recogido más de 300 votos allí.

Qué obtienen los desarrolladores

El cambio práctico es el hardware. La generación interactiva de largo horizonte ha sido una carga de trabajo de centro de datos, y el argumento de Amap es que ahora una sola tarjeta de escritorio la cubre, lo que reduce el costo de entrada para los desarrolladores, estudios y grupos de investigación que trabajan sin presupuestos de clúster. Eso importa más para la inteligencia artificial encarnada, donde las políticas deben ejercitarse contra entornos variados antes de encontrarse con hardware real, un área que atrae un trabajo constante desde Gemini Robotics ER 2 de Google hasta modelos de video-acción de mimic robotics en la planta de Audi.

Todo se encuentra bajo una licencia Apache 2.0 en el repositorio de GitHub del proyecto, que lleva el código de inferencia, una demostración local y punteros al punto de referencia publicado en Hugging Face y ModelScope. Eso coloca a ABot-World-0 con el resto de las liberaciones de pesos abiertos que llegan a los desarrolladores que trabajan este año, entre ellos Inkling de Thinking Machines Lab.

Junta con el registro de 24 horas, el equipo lanzó sus datos de entrenamiento: 30.969 episodios de video condicionados por acción que totalizan 2,74 TB, cada uno empaquetando un MP4 con las acciones del teclado que lo produjeron, subtítulos y una reconstrucción esparza de la pose de la cámara de la escena. Publicar el corpus permite a los investigadores externos entrenar contra el mismo material y probar si LongForcing se mantiene en sus manos, y la hoja de ruta del proyecto pone al modelo de maestro bidireccional como el siguiente en la puerta.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.