Ângulo de Anderson
Os Modelos de Mundo da IA Podem Realmente Entender Leis Físicas?

A grande esperança para os modelos de IA de visão-linguagem é que eles um dia se tornem capazes de maior autonomia e versatilidade, incorporando princípios de leis físicas de forma semelhante à que desenvolvemos uma compreensão inata desses princípios por meio da experiência precoce.
Por exemplo, os jogos de bola das crianças tendem a desenvolver uma compreensão da cinética do movimento, e do efeito do peso e da textura da superfície na trajetória. Da mesma forma, interações com cenários comuns, como banhos, bebidas derramadas, o oceano, piscinas e outros corpos líquidos diversos, nos darão uma compreensão versátil e escalável das maneiras pelas quais os líquidos se comportam sob a gravidade.
Até mesmo os postulados de fenômenos menos comuns – como combustão, explosões e distribuição de peso arquitetônico sob pressão – são absorvidos inconscientemente por meio da exposição a programas de TV e filmes, ou vídeos do YouTube.
Quando estudamos os princípios por trás desses sistemas, em um nível acadêmico, estamos apenas “reconstruindo” nossos modelos mentais intuitivos (mas desinformados) deles.
Mestres de Um
Atualmente, a maioria dos modelos de IA é, em contraste, mais “especializada”, e muitos deles são ajustados finamente ou treinados do zero em conjuntos de dados de imagem ou vídeo que são bastante específicos para certos casos de uso, em vez de serem projetados para desenvolver uma compreensão geral das leis que governam.
Outros podem apresentar a aparência de uma compreensão das leis físicas; mas eles podem estar reproduzindo apenas exemplos de seus conjuntos de dados de treinamento, em vez de realmente entender os fundamentos de áreas como a física do movimento de forma que possa produzir depictions verdadeiramente novas (e cientificamente plausíveis) a partir de prompts do usuário.
Neste momento delicado da productização e comercialização de sistemas de IA gerativos, cabe a nós, e ao escrutínio dos investidores, distinguir o marketing habilidoso de novos modelos de IA da realidade de suas limitações.
Um dos artigos mais interessantes de novembro, liderado pela Bytedance Research, abordou essa questão, explorando a lacuna entre as capacidades aparentes e reais de modelos gerativos “de propósito geral” como o Sora.
O trabalho concluiu que, no estado atual da arte, a saída gerada por modelos desse tipo é mais provável de estar imitando exemplos de seus conjuntos de dados de treinamento do que realmente demonstrando uma compreensão completa das restrições físicas subjacentes que operam no mundo real.
O artigo afirma*:
‘[Esses] modelos podem ser facilmente tendenciosos por “exemplos enganosos” do conjunto de treinamento, levando-os a generalizar de forma “baseada em casos” sob certas condições. Esse fenômeno, também observado em grandes modelos de linguagem, descreve a tendência de um modelo a se referir a casos de treinamento semelhantes ao resolver novas tarefas.
‘Por exemplo, considere um modelo de vídeo treinado em dados de uma bola em movimento linear uniforme de alta velocidade. Se a ampliação de dados for realizada girando horizontalmente os vídeos, introduzindo assim o movimento de direção reversa, o modelo pode gerar um cenário em que uma bola de baixa velocidade muda de direção após os primeiros quadros, mesmo que esse comportamento não seja fisicamente correto.’
Vamos dar uma olhada mais de perto no artigo – intitulado Avaliando Modelos de Mundo com LLM para Tomada de Decisão – em breve. Mas primeiro, vamos olhar para o contexto dessas limitações aparentes.
Lembranças do Passado
Sem generalização, um modelo de IA treinado é pouco mais do que uma planilha cara de referências a seções de seus conjuntos de dados de treinamento: encontre o termo de busca apropriado, e você pode invocar uma instância desses dados.
Nesse cenário, o modelo está efetivamente agindo como um “mechanismo de busca neural”, pois não pode produzir interpretações abstratas ou “criativas” da saída desejada, mas em vez disso replica alguma variação minorada dos dados que viu durante o treinamento.
Isso é conhecido como memorização – um problema controverso que surge porque modelos de IA verdadeiramente flexíveis e interpretativos tendem a carecer de detalhes, enquanto modelos verdadeiramente detalhados tendem a carecer de originalidade e flexibilidade.
A capacidade de modelos afetados por memorização de reproduzir dados de treinamento é um obstáculo potencial, em casos em que os criadores do modelo não tinham direitos ilimitados para usar esses dados; e onde os benefícios desses dados podem ser demonstrados por meio de um número crescente de métodos de extração.
Devido à memorização, vestígios de dados não autorizados podem persistir, encadeados, por meio de vários sistemas de treinamento, como uma marca d’água indelével e não intencional – mesmo em projetos onde o praticante de aprendizado de máquina tenha tomado cuidado para garantir que “dados seguros” sejam usados.
Modelos de Mundo
No entanto, a questão central de uso com a memorização é que ela tende a transmitir a ilusão de inteligência, ou sugerir que o modelo de IA generalizou leis ou domínios fundamentais, quando na verdade é o grande volume de dados memorizados que fornece essa ilusão (ou seja, o modelo tem tantos exemplos de dados potenciais para escolher que é difícil para um humano determinar se ele está regurgitando conteúdo aprendido ou se tem uma compreensão verdadeiramente abstrata dos conceitos envolvidos na geração).
Essa questão tem implicações para o crescente interesse em modelos de mundo – a perspectiva de sistemas de IA altamente diversificados e caros, que incorporam várias leis conhecidas e são rica e exploráveis.
Modelos de mundo são de particular interesse no espaço de imagem e vídeo gerativos. Em 2023, a RunwayML iniciou uma iniciativa de pesquisa sobre o desenvolvimento e a viabilidade desses modelos; a DeepMind recentemente contratou um dos criadores do aclamado vídeo gerativo Sora para trabalhar em um modelo desse tipo; e startups como a Higgsfield estão investindo significativamente em modelos de mundo para síntese de imagem e vídeo.
Combinações Difíceis
Uma das promessas dos novos desenvolvimentos em sistemas de IA gerativos de vídeo é a perspectiva de que eles possam aprender leis físicas fundamentais, como movimento, cinemática humana (como características de marcha), dinâmica dos fluidos, e outros fenômenos físicos conhecidos que são, pelo menos, visualmente familiares para os humanos.
Se a IA gerativa pudesse alcançar esse marco, ela poderia se tornar capaz de produzir efeitos visuais hiper-realistas que mostrem explosões, inundações e colisões plausíveis em várias direções.
Se, por outro lado, o sistema de IA foi apenas treinado em milhares (ou centenas de milhares) de vídeos que mostram tais eventos, ele poderia ser capaz de reproduzir os dados de treinamento de forma convincente quando foi treinado em um ponto de dados semelhante à consulta do usuário; no entanto, falhar se a consulta combina muitos conceitos que não são representados no conjunto de dados.
Além disso, essas limitações não seriam imediatamente aparentes, até que se pressionasse o sistema com combinações desafiadoras desse tipo.
Isso significa que um novo sistema gerativo pode ser capaz de gerar conteúdo de vídeo viral que, embora impressionante, pode criar uma falsa impressão das capacidades e da profundidade de compreensão do sistema, porque a tarefa que ele representa não é um desafio real para o sistema.
Por exemplo, um evento relativamente comum e bem difundido, como ‘um prédio é demolido’, pode estar presente em vários vídeos em um conjunto de dados usado para treinar um modelo que supostamente tem alguma compreensão de física. Portanto, o modelo poderia presumivelmente generalizar esse conceito bem e até produzir saídas genuinamente novas dentro dos parâmetros aprendidos com vídeos abundantes.
Isso é um exemplo dentro da distribuição, onde o conjunto de dados contém muitos exemplos úteis para o sistema de IA aprender.
No entanto, se alguém solicitasse um exemplo mais bizarro ou questionável, como ‘A Torre Eiffel é explodida por invasores alienígenas’, o modelo precisaria combinar domínios diversos, como ‘propriedades metalúrgicas’, ‘características de explosões’, ‘gravidade’, ‘resistência ao vento’ – e ‘nave espacial alienígena’.
Isso é um exemplo fora da distribuição (OOD), que combina tantos conceitos entrelaçados que o sistema provavelmente falhará em gerar um exemplo convincente, ou irá para o exemplo semântico mais próximo que foi treinado – mesmo que esse exemplo não atenda ao prompt do usuário.
Exceto que o conjunto de dados de origem do modelo contenha efeitos visuais de CGI de Hollywood que mostrem o mesmo ou um evento semelhante, tal representação exigiria absolutamente que o modelo alcance uma compreensão generalizada e flexível das leis físicas.
Restrições Físicas
O novo artigo – uma colaboração entre a Bytedance, a Universidade Tsinghua e a Technion – sugere que não apenas os modelos como o Sora não realmente internalizam leis físicas determinísticas dessa forma, mas que aumentar a escala dos dados (uma abordagem comum nos últimos 18 meses) parece, na maioria dos casos, não produzir nenhuma melhoria real nesse aspecto.
O artigo explora não apenas os limites da extrapolação de leis físicas específicas – como o comportamento de objetos em movimento quando colidem, ou quando seu caminho é obstruído – mas também a capacidade de um modelo para generalização combinatória – instâncias em que as representações de dois princípios físicos diferentes são mescladas em uma única saída gerativa.
Um resumo de vídeo do novo artigo. Fonte: https://x.com/bingyikang/status/1853635009611219019
As três leis físicas selecionadas para estudo pelos pesquisadores foram movimento parabólico; movimento linear uniforme; e colisão perfeitamente elástica.
Como pode ser visto no vídeo acima, os resultados indicam que modelos como o Sora não internalizam realmente as leis físicas, mas tendem a reproduzir os dados de treinamento.
Além disso, os autores descobriram que aspectos como cor e forma se tornam tão entrelaçados no momento da inferência que uma bola gerada provavelmente se transformaria em um quadrado, aparentemente porque um movimento semelhante em um exemplo do conjunto de dados apresentava um quadrado e não uma bola (veja exemplo no vídeo incorporado acima).
O artigo, que notavelmente engajou o setor de pesquisa nas redes sociais, conclui:
‘Nosso estudo sugere que a escala sozinha é insuficiente para que os modelos de geração de vídeo descubram leis físicas fundamentais, apesar de seu papel no sucesso mais amplo do Sora…
‘…[Descobertas] indicam que a escala sozinha não pode resolver o problema OOD, embora melhore o desempenho em outros cenários.
‘Nossa análise aprofundada sugere que a generalização do modelo de vídeo depende mais de se referir a exemplos de treinamento semelhantes do que aprender regras universais. Observamos uma ordem de prioridade de cor > tamanho > velocidade > forma nesse comportamento “baseado em casos”.
‘[Nosso] estudo sugere que a escala ingênua é insuficiente para que os modelos de geração de vídeo descubram leis físicas fundamentais.’
Perguntado se a equipe de pesquisa havia encontrado uma solução para a questão, um dos autores do artigo comentou:
‘Infelizmente, não. Na verdade, isso provavelmente é a missão de toda a comunidade de IA.’
Método e Dados
Os pesquisadores usaram um Autoencoder Variacional (VAE) e DiT arquiteturas para gerar amostras de vídeo. Nesse conjunto, as representações latentes comprimidas produzidas pelo VAE funcionam em conjunto com o modelo de DiT do processo de desruído.
Os vídeos foram treinados sobre o VAE da Estabilização de Difusão V1.5. O esquema foi deixado fundamentalmente inalterado, com apenas melhorias arquitetônicas de fim de processo:
‘[Retemos] a maioria da convolução original 2D, normalização de grupo e mecanismos de atenção nas dimensões espaciais.
‘Para inflar essa estrutura em um autoencoder espacial-temporal, convertemos os últimos blocos de downsampling 2D do codificador e os primeiros blocos de upsampling 2D do decodificador em 3D, e empregamos várias camadas adicionais 1D para melhorar a modelagem temporal.’
Para permitir a modelagem de vídeo, o VAE modificado foi treinado em conjunto com dados de imagem HQ e vídeo, com o componente de Rede Adversária Generativa (GAN) nativo da arquitetura SD1.5 aumentado para 3D.
O conjunto de dados de imagem usado foi a fonte original da Estabilização de Difusão, LAION-Aesthetics, com filtragem, além de DataComp. Para dados de vídeo, um subconjunto foi curado do Vimeo-90K, Panda-70m e HDVG conjuntos de dados.
Os dados foram treinados por um milhão de passos, com recorte aleatório e flip horizontal aleatório aplicados como processos de aumento de dados.
Virando ao Avesso
Como mencionado acima, o processo de flip horizontal aleatório de aumento de dados pode ser um passivo em treinar um sistema projetado para produzir movimento autêntico. Isso ocorre porque a saída do modelo treinado pode considerar ambas direções de um objeto e causar reversões aleatórias à medida que tenta negociar esses dados conflitantes (veja vídeo incorporado acima).
Por outro lado, se alguém desativa o flip horizontal, o modelo é mais provável de produzir saídas que seguem apenas uma direção aprendida com os dados de treinamento.
Portanto, não há uma solução fácil para a questão, exceto que o sistema realmente assimila a totalidade das possibilidades de movimento de ambas as versões nativa e invertida – uma facilidade que as crianças desenvolvem facilmente, mas que é mais um desafio, aparentemente, para os modelos de IA.
Testes
Para o primeiro conjunto de experimentos, os pesquisadores formularam um simulador 2D para produzir vídeos de movimento de objetos e colisões que concordam com as leis da mecânica clássica, que forneceu um conjunto de dados de grande volume e controlado que excluiu as ambiguidades de vídeos do mundo real, para a avaliação dos modelos. O Box2D motor de jogo de física foi usado para criar esses vídeos.
Os três cenários fundamentais mencionados acima foram o foco dos testes: movimento linear uniforme, colisões perfeitamente elásticas e movimento parabólico.
Conjuntos de dados de tamanhos crescentes (variando de 30.000 a três milhões de vídeos) foram usados para treinar modelos de diferentes tamanhos e complexidades (DiT-S para DiT-L), com os três primeiros quadros de cada vídeo usados para condicionamento.

Detalhes dos modelos variados treinados no primeiro conjunto de experimentos. Fonte: https://arxiv.org/pdf/2411.02385
Os pesquisadores descobriram que os resultados dentro da distribuição (ID) escalonam bem com quantidades crescentes de dados, enquanto as gerações OOD não melhoram, indicando limitações na generalização.

Resultados do primeiro round de testes.
Os autores observam:
‘Essas descobertas sugerem a incapacidade da escala de realizar raciocínio em cenários OOD.’
Em seguida, os pesquisadores testaram e treinaram sistemas projetados para exibir uma proficiência para generalização combinatória – onde dois movimentos contrastantes são combinados para (esperançosamente) produzir um movimento coeso que é fiel à lei física por trás de cada um dos movimentos separados.
Para essa fase dos testes, os autores usaram o simulador PHYRE, criando um ambiente 2D que representa vários objetos de formas diferentes em queda livre, colidindo uns com os outros em uma variedade de interações complexas.
Métricas de avaliação para esse segundo teste foram Fréchet Video Distance (FVD); Índice de Similaridade Estrutural (SSIM); Taxa de Sinal para Ruído de Pico (PSNR); Métricas de Similaridade Perceptual Aprendidas (LPIPS); e um estudo humano (denotado como ‘anormal’ nos resultados).
Três escalas de conjuntos de dados de treinamento foram criados, em 100.000 vídeos, 0,6 milhão de vídeos e 3-6 milhões de vídeos. Modelos DiT-B e DiT-XL foram usados, devido à complexidade aumentada dos vídeos, com o primeiro quadro usado para condicionamento.
Os modelos foram treinados por um milhão de passos em resolução 256×256, com 32 quadros por vídeo.

Resultados do segundo round de testes.
O resultado desse teste sugere que simplesmente aumentar o volume de dados é uma abordagem inadequada:
O artigo afirma:
‘Esses resultados sugerem que tanto a capacidade do modelo quanto a cobertura do espaço de combinação são cruciais para a generalização combinatória. Essa percepção implica que as leis de escala para a geração de vídeo devem se concentrar em aumentar a diversidade de combinação, em vez de simplesmente aumentar o volume de dados.’
Finalmente, os pesquisadores realizaram testes adicionais para tentar determinar se um modelo de geração de vídeo pode realmente assimilar leis físicas, ou se ele simplesmente memoriza e reproduz dados de treinamento no momento da inferência.
Aqui, eles examinaram o conceito de ‘generalização baseada em casos’, onde os modelos tendem a imitar exemplos de treinamento específicos ao enfrentar situações novas, bem como exemplos de movimento uniforme – especificamente, como a direção do movimento nos dados de treinamento influencia as previsões do modelo treinado.
Dois conjuntos de dados de treinamento, para movimento uniforme e colisão, foram curados, cada um consistindo em vídeos de movimento uniforme que mostram velocidades entre 2,5 e 4 unidades, com os três primeiros quadros usados como condicionamento. Valores latentes, como velocidade, foram omitidos, e, após o treinamento, os testes foram realizados em cenários vistos e não vistos.
Abaixo, vemos os resultados para o teste de geração de movimento uniforme:

Resultados para testes de geração de movimento uniforme, onde a variável ‘velocidade’ é omitida durante o treinamento.
Os autores afirmam:
‘[Com] uma grande lacuna no conjunto de treinamento, o modelo tende a gerar vídeos em que a velocidade é alta ou baixa para se assemelhar aos dados de treinamento quando os primeiros quadros mostram velocidades de faixa média.’
Para os testes de colisão, muitas mais variáveis estão envolvidas, e o modelo é obrigado a aprender uma função não linear bidimensional.

Colisão: resultados do terceiro e último round de testes.
Os autores observam que a presença de ‘exemplos enganosos’, como movimento reverso (ou seja, uma bola que ricocheteia em uma superfície e reverte seu curso), pode enganar o modelo e fazê-lo gerar previsões fisicamente incorretas.
Conclusão
Se um algoritmo não de IA (ou seja, um método “baked”, procedural) contém regras matemáticas para o comportamento de fenômenos físicos, como fluidos, objetos sob gravidade ou pressão, há um conjunto de constantes imutáveis disponíveis para renderização precisa.
No entanto, as descobertas do novo artigo indicam que nenhuma relação equivalente ou compreensão intrínseca das leis físicas clássicas é desenvolvida durante o treinamento de modelos gerativos, e que aumentar a quantidade de dados não resolve o problema, mas o obscurece – porque um maior número de vídeos de treinamento está disponível para o sistema imitar no momento da inferência.
* Minha conversão das citações em linha dos autores para hiperlinks.
Publicado pela primeira vez na terça-feira, 26 de novembro de 2024












