Modelos e plataformas de IA
O Amap da Alibaba Executa um Modelo de Mundo por 24 Horas em um único GPU

O Amap, plataforma de serviços baseados em localização da Alibaba, afirma que seu modelo de mundo interativo ABot-World-0 agora sustenta uma única sessão contínua por até 24 horas em um cartão gráfico de consumo, e publicou a sessão completa como um registro buscável em vez de um vídeo de destaque. A página permite que qualquer pessoa salte para qualquer segundo do lançamento de um dia, com pontos de entrada fixos nas marcas de seis, doze e dezoito horas, ao lado de mais cinco execuções completas em cenas de pastagem, deserto, cidade e neve.
O número é digno de nota devido ao teto que ele ultrapassa. Um modelo de mundo interativo gera quadros de vídeo quadro a quadro em resposta ao que o usuário faz, então cada novo pedaço é condicionado em quadros que o modelo produziu momentos antes. Erros pequenos se propagam, e a cena eventualmente se degrada. O Amap diz que a maioria dos sistemas desta classe se mantém coesa por 30 segundos a um minuto. Seu próprio anúncio de 16 de julho de 2026 do modelo colocou o número em mais de uma hora.
Como o LongForcing mantém a execução estável
O método que o Amap credita é chamado de LongForcing, descrito no relatório técnico que a equipe publicou em 21 de julho de 2026. A maneira usual de construir um modelo como este é a destilação: um professor bidirecional mais lento que pode atender a um clipe inteiro de uma vez treina um aluno causal mais rápido que só vê o passado, o que é o que a interação em tempo real exige. Essa supervisão geralmente cobre clipes curtos, então o aluno aprende a olhar certo por alguns segundos e improvisa após isso.
O LongForcing estende a supervisão para onde os fracassos acontecem. O aluno gera um lançamento longo por conta própria, e um professor com um contexto temporal mais longo supervisiona as porções posteriores dele, onde os erros de previsão tiveram mais tempo para se compor. O relatório apresenta isso como corrigir a mudança de distribuição acumulada e o drift autoregressivo, e não como um mecanismo de memória. O modelo não está sendo solicitado a lembrar quadros anteriores com mais precisão; ele está sendo puxado de volta para uma distribuição de mundo estável à medida que avança.
O Amap diz que isso se manifesta no comportamento: o modelo continua expandindo o ambiente com novas cenas durante um lançamento em vez de se bloquear naquela em que começou, e o faz sem que o usuário forneça novos prompts pelo caminho.
O que os números reportados cobrem
O envelope de desempenho vem das próprias medições da equipe. Em configurações de baixo bit otimizadas, o relatório coloca o ABot-World-0 em saída de 720p e até 16 quadros por segundo em um cartão de desktop Nvidia RTX 5090, com 1,2 segundos entre uma ação de entrada e o primeiro quadro que a reflete, e cerca de 19 GiB de memória de vídeo de pico. Execuções de controle em entrada bruta de teclado para navegação de cena e movimento de personagem em terceira pessoa, com uma memória de personagem de referência que mantém a aparência de um personagem estável ao longo de uma sessão longa.
Para avaliação, o artigo relata resultados na suíte WorldRoamBench, juntamente com lançamentos interativos estendidos, descrevendo o resultado como controllabilidade competitiva e evolução de mundo coerente de longo horizonte. O que o registro publicado de 24 horas adiciona é a inspecionabilidade: a linha do tempo completa está lá para ser vasculhada segundo a segundo, em vez de ser comprimida em uma tabela.
O relatório chamou a atenção quando foi publicado. A página de artigos do Hugging Face o listou como o artigo do dia para 22 de julho de 2026, e desde então coletou mais de 300 votos positivos lá.
O que os desenvolvedores obtêm
A mudança prática é o hardware. A geração interativa de longo horizonte foi uma carga de trabalho de data center, e o argumento do Amap é que um cartão de desktop agora a cobre, reduzindo o custo de entrada para desenvolvedores, estúdios e grupos de pesquisa que trabalham sem orçamentos de cluster. Isso importa mais para a inteligência artificial incorporada, onde as políticas devem ser exercidas contra ambientes variados antes de encontrarem hardware real, uma área que recebe trabalho constante do Gemini Robotics ER 2 da Google ao modelo de ação de vídeo da mimic robotics no chão de fábrica da Audi.
Tudo está sob uma licença Apache 2.0 no repositório GitHub do projeto, que carrega o código de inferência, um demonstração local e ponteiros para o checkpoint liberado no Hugging Face e ModelScope. Isso coloca o ABot-World-0 com a série de lançamentos de pesos abertos que atingem desenvolvedores que trabalham este ano, entre eles o Inkling do Thinking Machines Lab.
Além do registro de 24 horas, a equipe liberou seus dados de treinamento: 30.969 episódios de vídeo condicionados por ações, totalizando 2,74 TB. Cada episódio inclui um MP4, as ações de teclado que o produziram, legendas e uma reconstrução esparsa da pose da câmera na cena. A publicação desse conjunto permite que pesquisadores externos treinem com o mesmo material e testem se o LongForcing funciona em seus próprios experimentos. O roteiro do projeto prevê a divulgação do modelo professor bidirecional como a próxima etapa.












