Modelos e plataformas de IA

O Amap da Alibaba Executa um Modelo de Mundo por 24 Horas em um único GPU

mm
Adicione Unite.AI às suas fontes preferidas no Google

O Amap, plataforma de serviços baseados em localização da Alibaba, afirma que seu modelo de mundo interativo ABot-World-0 agora sustenta uma única sessão contínua por até 24 horas em um cartão gráfico de consumo, e publicou a sessão completa como um registro buscável em vez de um vídeo de destaque. A página permite que qualquer pessoa salte para qualquer segundo do lançamento de um dia, com pontos de entrada fixos nas marcas de seis, doze e dezoito horas, ao lado de mais cinco execuções completas em cenas de pastagem, deserto, cidade e neve.

O número é digno de nota devido ao teto que ele ultrapassa. Um modelo de mundo interativo gera quadros de vídeo quadro a quadro em resposta ao que o usuário faz, então cada novo pedaço é condicionado em quadros que o modelo produziu momentos antes. Erros pequenos se propagam, e a cena eventualmente se degrada. O Amap diz que a maioria dos sistemas desta classe se mantém coesa por 30 segundos a um minuto. Seu próprio anúncio de 16 de julho de 2026 do modelo colocou o número em mais de uma hora.

Como o LongForcing mantém a execução estável

O método que o Amap credita é chamado de LongForcing, descrito no relatório técnico que a equipe publicou em 21 de julho de 2026. A maneira usual de construir um modelo como este é a destilação: um professor bidirecional mais lento que pode atender a um clipe inteiro de uma vez treina um aluno causal mais rápido que só vê o passado, o que é o que a interação em tempo real exige. Essa supervisão geralmente cobre clipes curtos, então o aluno aprende a olhar certo por alguns segundos e improvisa após isso.

O LongForcing estende a supervisão para onde os fracassos acontecem. O aluno gera um lançamento longo por conta própria, e um professor com um contexto temporal mais longo supervisiona as porções posteriores dele, onde os erros de previsão tiveram mais tempo para se compor. O relatório apresenta isso como corrigir a mudança de distribuição acumulada e o drift autoregressivo, e não como um mecanismo de memória. O modelo não está sendo solicitado a lembrar quadros anteriores com mais precisão; ele está sendo puxado de volta para uma distribuição de mundo estável à medida que avança.

O Amap diz que isso se manifesta no comportamento: o modelo continua expandindo o ambiente com novas cenas durante um lançamento em vez de se bloquear naquela em que começou, e o faz sem que o usuário forneça novos prompts pelo caminho.

O que os números reportados cobrem

O envelope de desempenho vem das próprias medições da equipe. Em configurações de baixo bit otimizadas, o relatório coloca o ABot-World-0 em saída de 720p e até 16 quadros por segundo em um cartão de desktop Nvidia RTX 5090, com 1,2 segundos entre uma ação de entrada e o primeiro quadro que a reflete, e cerca de 19 GiB de memória de vídeo de pico. Execuções de controle em entrada bruta de teclado para navegação de cena e movimento de personagem em terceira pessoa, com uma memória de personagem de referência que mantém a aparência de um personagem estável ao longo de uma sessão longa.

Para avaliação, o artigo relata resultados na suíte WorldRoamBench, juntamente com lançamentos interativos estendidos, descrevendo o resultado como controllabilidade competitiva e evolução de mundo coerente de longo horizonte. O que o registro publicado de 24 horas adiciona é a inspecionabilidade: a linha do tempo completa está lá para ser vasculhada segundo a segundo, em vez de ser comprimida em uma tabela.

O relatório chamou a atenção quando foi publicado. A página de artigos do Hugging Face o listou como o artigo do dia para 22 de julho de 2026, e desde então coletou mais de 300 votos positivos lá.

O que os desenvolvedores obtêm

A mudança prática é o hardware. A geração interativa de longo horizonte foi uma carga de trabalho de data center, e o argumento do Amap é que um cartão de desktop agora a cobre, reduzindo o custo de entrada para desenvolvedores, estúdios e grupos de pesquisa que trabalham sem orçamentos de cluster. Isso importa mais para a inteligência artificial incorporada, onde as políticas devem ser exercidas contra ambientes variados antes de encontrarem hardware real, uma área que recebe trabalho constante do Gemini Robotics ER 2 da Google ao modelo de ação de vídeo da mimic robotics no chão de fábrica da Audi.

Tudo está sob uma licença Apache 2.0 no repositório GitHub do projeto, que carrega o código de inferência, um demonstração local e ponteiros para o checkpoint liberado no Hugging Face e ModelScope. Isso coloca o ABot-World-0 com a série de lançamentos de pesos abertos que atingem desenvolvedores que trabalham este ano, entre eles o Inkling do Thinking Machines Lab.

Além do registro de 24 horas, a equipe liberou seus dados de treinamento: 30.969 episódios de vídeo condicionados por ações, totalizando 2,74 TB. Cada episódio inclui um MP4, as ações de teclado que o produziram, legendas e uma reconstrução esparsa da pose da câmera na cena. A publicação desse conjunto permite que pesquisadores externos treinem com o mesmo material e testem se o LongForcing funciona em seus próprios experimentos. O roteiro do projeto prevê a divulgação do modelo professor bidirecional como a próxima etapa.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.