Modelos e plataformas de IA
O Amap da Alibaba Executa um Modelo de Mundo por 24 Horas em um único GPU

O Amap, plataforma de serviços baseados em localização da Alibaba, afirma que seu modelo de mundo interativo ABot-World-0 agora sustenta uma única sessão contínua por até 24 horas em um cartão gráfico de consumo, e publicou a sessão completa como um registro buscável em vez de um vídeo de destaque. A página permite que qualquer pessoa salte para qualquer segundo do lançamento de um dia, com pontos de entrada fixos nas marcas de seis, doze e dezoito horas, ao lado de mais cinco execuções completas em cenas de pastagem, deserto, cidade e neve.
O número é digno de nota devido ao teto que ele ultrapassa. Um modelo de mundo interativo gera quadros de vídeo quadro a quadro em resposta ao que o usuário faz, então cada novo pedaço é condicionado em quadros que o modelo produziu momentos antes. Erros pequenos se propagam, e a cena eventualmente se degrada. O Amap diz que a maioria dos sistemas desta classe se mantém coesa por 30 segundos a um minuto. Seu próprio anúncio de 16 de julho de 2026 do modelo colocou o número em mais de uma hora.
Como o LongForcing mantém a execução estável
O método que o Amap credita é chamado de LongForcing, descrito no relatório técnico que a equipe publicou em 21 de julho de 2026. A maneira usual de construir um modelo como este é a destilação: um professor bidirecional mais lento que pode atender a um clipe inteiro de uma vez treina um aluno causal mais rápido que só vê o passado, o que é o que a interação em tempo real exige. Essa supervisão geralmente cobre clipes curtos, então o aluno aprende a olhar certo por alguns segundos e improvisa após isso.
O LongForcing estende a supervisão para onde os fracassos acontecem. O aluno gera um lançamento longo por conta própria, e um professor com um contexto temporal mais longo supervisiona as porções posteriores dele, onde os erros de previsão tiveram mais tempo para se compor. O relatório apresenta isso como corrigir a mudança de distribuição acumulada e o drift autoregressivo, e não como um mecanismo de memória. O modelo não está sendo solicitado a lembrar quadros anteriores com mais precisão; ele está sendo puxado de volta para uma distribuição de mundo estável à medida que avança.
O Amap diz que isso se manifesta no comportamento: o modelo continua expandindo o ambiente com novas cenas durante um lançamento em vez de se bloquear naquela em que começou, e o faz sem que o usuário forneça novos prompts pelo caminho.
O que os números reportados cobrem
O envelope de desempenho vem das próprias medições da equipe. Em configurações de baixo bit otimizadas, o relatório coloca o ABot-World-0 em saída de 720p e até 16 quadros por segundo em um cartão de desktop Nvidia RTX 5090, com 1,2 segundos entre uma ação de entrada e o primeiro quadro que a reflete, e cerca de 19 GiB de memória de vídeo de pico. Execuções de controle em entrada bruta de teclado para navegação de cena e movimento de personagem em terceira pessoa, com uma memória de personagem de referência que mantém a aparência de um personagem estável ao longo de uma sessão longa.
Para avaliação, o artigo relata resultados na suíte WorldRoamBench, juntamente com lançamentos interativos estendidos, descrevendo o resultado como controllabilidade competitiva e evolução de mundo coerente de longo horizonte. O que o registro publicado de 24 horas adiciona é a inspecionabilidade: a linha do tempo completa está lá para ser vasculhada segundo a segundo, em vez de ser comprimida em uma tabela.
O relatório chamou a atenção quando foi publicado. A página de artigos do Hugging Face o listou como o artigo do dia para 22 de julho de 2026, e desde então coletou mais de 300 votos positivos lá.
O que os desenvolvedores obtêm
A mudança prática é o hardware. A geração interativa de longo horizonte foi uma carga de trabalho de data center, e o argumento do Amap é que um cartão de desktop agora a cobre, reduzindo o custo de entrada para desenvolvedores, estúdios e grupos de pesquisa que trabalham sem orçamentos de cluster. Isso importa mais para a inteligência artificial incorporada, onde as políticas devem ser exercidas contra ambientes variados antes de encontrarem hardware real, uma área que recebe trabalho constante do Gemini Robotics ER 2 da Google ao modelo de ação de vídeo da mimic robotics no chão de fábrica da Audi.
Tudo está sob uma licença Apache 2.0 no repositório GitHub do projeto, que carrega o código de inferência, um demonstração local e ponteiros para o checkpoint liberado no Hugging Face e ModelScope. Isso coloca o ABot-World-0 com a série de lançamentos de pesos abertos que atingem desenvolvedores que trabalham este ano, entre eles o Inkling do Thinking Machines Lab.
Além do registro de 24 horas, a equipe liberou seus dados de treinamento: 30.969 episódios de vídeo condicionados por ação que totalizam 2,74 TB, cada um empacotando um MP4 com as ações de teclado que o produziram, legendas e uma reconstrução esparça da pose da câmera da cena. Publicar o corpus permite que pesquisadores externos treinem contra o mesmo material e testem se o LongForcing se mantém em suas mãos, e o roadmap do projeto coloca o modelo de professor bidirecional como o próximo a ser liberado, juntamentewi com as ações de teclado que o produziram, legendas e uma reconstrução esparça da pose da câmera da cena. Publicar o corpus permite que pesquisadores externos treinem contra o mesmo material e testem se o LongForcing se mantém em suas mãos, e o roadmap do projeto coloca o modelo de professor bidirecional como o próximo a ser liberado, com as ações de teclado que o produziram, legendas e uma reconstrução esparça da pose da câmera da cena. Publishing the corpus lets outside researchers train against the same material and test whether LongForcing holds up in their hands, and the project’s roadmap puts the bidirectional teacher model next out the door, with the keyboard actions that produced it, captions and a sparse camera-pose reconstruction of the scene.












