Ãngulo de Anderson
ÂŋPueden los Modelos de Mundo de IA Comprender Realmente las Leyes FÃsicas?

La gran esperanza para los modelos de visiÃģn-lenguaje de IA es que eventualmente se vuelvan capaces de una mayor autonomÃa y versatilidad, incorporando principios de leyes fÃsicas de la misma manera que desarrollamos una comprensiÃģn innata de estos principios a travÃĐs de la experiencia temprana.
Por ejemplo, los juegos de pelota de los niÃąos tienden a desarrollar una comprensiÃģn de la cinÃĐtica del movimiento, y del efecto del peso y la textura de la superficie en la trayectoria. De manera similar, las interacciones con escenarios comunes como baÃąos, bebidas derramadas, el ocÃĐano, piscinas y otros cuerpos lÃquidos diversos nos darÃĄn una comprensiÃģn versÃĄtil y escalable de las formas en que el lÃquido se comporta bajo la gravedad.
Incluso los postulados de fenÃģmenos menos comunes, como la combustiÃģn, las explosiones y la distribuciÃģn de peso arquitectÃģnico bajo presiÃģn, se absorben inconscientemente a travÃĐs de la exposiciÃģn a programas de televisiÃģn y pelÃculas, o videos de redes sociales.
Cuando estudiemos los principios detrÃĄs de estos sistemas, a un nivel acadÃĐmico, simplemente estaremos âretrofitandoâ nuestros modelos mentales intuitivos (pero no informados) de ellos.
Maestros de Uno
Actualmente, la mayorÃa de los modelos de IA son, por contraste, mÃĄs âespecializadosâ, y muchos de ellos estÃĄn ajustados o entrenados desde cero en conjuntos de datos de imÃĄgenes o videos que son bastante especÃficos para ciertos casos de uso, en lugar de diseÃąados para desarrollar una comprensiÃģn general de las leyes que rigen.
Otros pueden presentar la apariencia de una comprensiÃģn de las leyes fÃsicas; pero pueden estar reproduciendo muestras de sus datos de entrenamiento, en lugar de realmente comprender los conceptos bÃĄsicos de ÃĄreas como la fÃsica del movimiento de una manera que pueda producir depicciones verdaderamente novedosas (y cientÃficamente plausibles) a partir de las solicitudes de los usuarios.
En este momento delicado en la productizaciÃģn y comercializaciÃģn de los sistemas de IA generativa, nos corresponde a nosotros, y a la escrutinio de los inversores, distinguir el marketing elaborado de los nuevos modelos de IA de la realidad de sus limitaciones.
Uno de los artÃculos mÃĄs interesantes de noviembre, liderado por Bytedance Research, abordÃģ este problema, explorando la brecha entre las capacidades aparentes y reales de los modelos generativos âde propÃģsito generalâ como Sora.
El trabajo concluyÃģ que, en el estado actual del arte, la salida generada de modelos de este tipo es mÃĄs probable que estÃĐ imitando ejemplos de sus datos de entrenamiento que demostrando una comprensiÃģn completa de las restricciones fÃsicas subyacentes que operan en el mundo real.
El artÃculo establece*:
â[Estos] modelos pueden ser fÃĄcilmente sesgados por âejemplos engaÃąososâ del conjunto de entrenamiento, lo que los lleva a generalizar de manera âbasada en casosâ bajo ciertas condiciones. Este fenÃģmeno, tambiÃĐn observado en grandes modelos de lenguaje, describe la tendencia de un modelo a hacer referencia a casos de entrenamiento similares al resolver nuevas tareas.
âPor ejemplo, considere un modelo de video entrenado en datos de una pelota en movimiento en una trayectoria lineal uniforme. Si se realiza una augmentaciÃģn de datos mediante la inversiÃģn horizontal de los videos, introduciendo asà un movimiento en direcciÃģn opuesta, el modelo puede generar un escenario en el que una pelota de baja velocidad invierte su direcciÃģn despuÃĐs de los primeros cuadros, aunque este comportamiento no es fÃsicamente correcto.â
MÃĄs adelante, examinaremos el artÃculo â titulado Evaluating World Models with LLM for Decision Making â mÃĄs de cerca. Pero primero, veamos el contexto de estas limitaciones aparentes.
Recuerdo de Cosas Pasadas
Sin generalizaciÃģn, un modelo de IA entrenado es poco mÃĄs que una costosa hoja de cÃĄlculo de referencias a secciones de sus datos de entrenamiento: encuentra el tÃĐrmino de bÚsqueda adecuado, y puede invocar una instancia de esos datos.
En ese escenario, el modelo estÃĄ actuando efectivamente como un âmotor de bÚsqueda neuronalâ, ya que no puede producir interpretaciones abstractas o âcreativasâ de la salida deseada, sino que reproduce alguna variaciÃģn menor de los datos que vio durante el proceso de entrenamiento.
Esto se conoce como memorizaciÃģn â un problema controvertido que surge porque los modelos de IA verdaderamente flexibles y interpretativos tienden a carecer de detalles, mientras que los modelos verdaderamente detallados tienden a carecer de originalidad y flexibilidad.
La capacidad de los modelos afectados por la memorizaciÃģn para reproducir los datos de entrenamiento es un obstÃĄculo legal potencial, en casos en los que los creadores del modelo no tenÃan derechos ilimitados para utilizar esos datos; y donde se pueden demostrar beneficios de esos datos a travÃĐs de un nÚmero creciente de mÃĐtodos de extracciÃģn.
Debido a la memorizaciÃģn, las trazas de datos no autorizados pueden persistir, encadenadas, a travÃĐs de mÚltiples sistemas de entrenamiento, como una marca de agua indelible e involuntaria â incluso en proyectos donde el practicante de aprendizaje automÃĄtico ha tenido cuidado de asegurarse de que se utilicen âdatos segurosâ.
Modelos de Mundo
Sin embargo, el problema central de uso con la memorizaciÃģn es que tiende a transmitir la ilusiÃģn de inteligencia, o sugiere que el modelo de IA ha generalizado leyes o dominios fundamentales, cuando en realidad es el gran volumen de datos memorizados lo que proporciona esta ilusiÃģn (es decir, el modelo tiene tantos ejemplos de datos potenciales para elegir que es difÃcil para un ser humano determinar si estÃĄ regurgitando contenido aprendido o si tiene una comprensiÃģn verdaderamente abstracta de los conceptos involucrados en la generaciÃģn).
Este problema tiene ramificaciones para el creciente interÃĐs en modelos de mundo â la perspectiva de sistemas de IA altamente diversos y costosamente entrenados que incorporen mÚltiples leyes conocidas y son ricos en exploraciÃģn.
Los modelos de mundo son de particular interÃĐs en el espacio de la generaciÃģn de imÃĄgenes y videos. En 2023, RunwayML iniciÃģ una iniciativa de investigaciÃģn sobre el desarrollo y la viabilidad de dichos modelos; DeepMind recientemente contratÃģ a uno de los originadores del aclamado modelo de video generativo Sora para trabajar en un modelo de este tipo; y startups como Higgsfield estÃĄn invirtiendo significativamente en modelos de mundo para la sÃntesis de imÃĄgenes y videos.
Combinaciones DifÃciles
Una de las promesas de los nuevos desarrollos en los sistemas de IA generativa de video es la perspectiva de que puedan aprender leyes fÃsicas fundamentales, como el movimiento, la cinemÃĄtica humana (como caracterÃsticas de la marcha), dinÃĄmica de fluidos, y otros fenÃģmenos fÃsicos conocidos que son, por lo menos, visualmente familiares para los humanos.
Si la IA generativa pudiera lograr este hito, podrÃa convertirse en capaz de producir efectos visuales hiperrealistas que representen explosiones, inundaciones y eventos de colisiÃģn plausibles en mÚltiples tipos de objetos.
Si, por otro lado, el sistema de IA simplemente ha sido entrenado en miles (o cientos de miles) de videos que representan dichos eventos, podrÃa ser capaz de reproducir los datos de entrenamiento de manera bastante convincente cuando se entrenÃģ en un punto de datos similar a la consulta del usuario; sin embargo, fallarÃa si la consulta combina demasiados conceptos que no estÃĄn representados en la combinaciÃģn en los datos.
AdemÃĄs, estas limitaciones no serÃan inmediatamente aparentes, hasta que se presione el sistema con combinaciones desafiantes de este tipo.
Esto significa que un nuevo sistema generativo puede ser capaz de generar contenido de video viral que, aunque impresionante, puede crear una falsa impresiÃģn de las capacidades y la profundidad de comprensiÃģn del sistema, porque la tarea que representa no es un desafÃo real para el sistema.
Por ejemplo, un evento relativamente comÚn y bien difundido, como âun edificio es demolidoâ, podrÃa estar presente en mÚltiples videos en un conjunto de datos utilizado para entrenar un modelo que se supone que tiene alguna comprensiÃģn de la fÃsica. Por lo tanto, el modelo podrÃa presumiblemente generalizar este concepto bien y producir incluso una salida novedosa dentro de los parÃĄmetros aprendidos de los videos abundantes.
Esto es un ejemplo dentro de la distribuciÃģn, donde el conjunto de datos contiene muchos ejemplos Útiles para que el sistema de IA aprenda.
Sin embargo, si se solicita un ejemplo mÃĄs extraÃąo o especioso, como âLa Torre Eiffel es destruida por invasores alienÃgenasâ, el modelo tendrÃa que combinar dominios diversos como âpropiedades metalÚrgicasâ, âcaracterÃsticas de las explosionesâ, âgravedadâ, âresistencia al vientoâ â y ânave espacial alienÃgenaâ.
Esto es un ejemplo fuera de la distribuciÃģn (OOD), que combina tantos conceptos entrelazados que el sistema probablemente fallarÃĄ al generar un ejemplo convincente o se limitarÃĄ al ejemplo semÃĄntico mÃĄs cercano en el que se entrenÃģ â incluso si ese ejemplo no se ajusta a la solicitud del usuario.
Excepto que el conjunto de datos de origen del modelo contenÃa efectos visuales de CGI de estilo de Hollywood que representaban el mismo o un evento similar, dicha representaciÃģn requerirÃa absolutamente que logre una comprensiÃģn generalizada y flexible de las leyes fÃsicas.
Restricciones FÃsicas
El nuevo artÃculo â una colaboraciÃģn entre Bytedance, la Universidad Tsinghua y el Technion â sugiere que no solo los modelos como Sora no internalizan realmente las leyes fÃsicas deterministas de esta manera, sino que escalar los datos (un enfoque comÚn en los Últimos 18 meses) parece, en la mayorÃa de los casos, no producir ninguna mejora real en este respecto.
El artÃculo explora no solo los lÃmites de la extrapolaciÃģn de leyes fÃsicas especÃficas â como el comportamiento de los objetos en movimiento cuando chocan, o cuando su camino es obstruido â sino tambiÃĐn la capacidad del modelo para generalizaciÃģn combinatoria â instancias en las que las representaciones de dos principios fÃsicos diferentes se fusionan en una sola salida generativa.
Un resumen de video del nuevo artÃculo. Fuente: https://x.com/bingyikang/status/1853635009611219019
Las tres leyes fÃsicas seleccionadas para el estudio por los investigadores fueron movimiento parabÃģlico; movimiento lineal uniforme; y colisiÃģn perfectamente elÃĄstica.
Como se puede ver en el video anterior, los hallazgos indican que los modelos como Sora no internalizan realmente las leyes fÃsicas, sino que tienden a reproducir los datos de entrenamiento.
AdemÃĄs, los autores encontraron que aspectos como el color y la forma se vuelven tan entrelazados en el momento de inferencia que una pelota generada probablemente se convertirÃa en un cuadrado, aparentemente porque un movimiento similar en un ejemplo del conjunto de datos presentaba un cuadrado y no una pelota (ver ejemplo en el video incrustado anterior).
El artÃculo concluye*:
âNuestro estudio sugiere que la escalada sola es insuficiente para que los modelos de generaciÃģn de video descubran leyes fÃsicas fundamentales, a pesar de su papel en el ÃĐxito mÃĄs amplio de SoraâĶ
ââĶ[Los hallazgos] indican que la escalada sola no puede abordar el problema de fuera de la distribuciÃģn, aunque mejora el rendimiento en otros escenarios.
âNuestro anÃĄlisis en profundidad sugiere que la generalizaciÃģn del modelo de video se basa mÃĄs en hacer referencia a ejemplos de entrenamiento similares que en aprender reglas universales. Observamos un orden de priorizaciÃģn de color > tamaÃąo > velocidad > forma en este comportamiento âbasado en casosâ.
â[Nuestro] estudio sugiere que la escalada ingenua es insuficiente para que los modelos de generaciÃģn de video descubran leyes fÃsicas fundamentales.â
Se preguntÃģ al equipo de investigaciÃģn si habÃan encontrado una soluciÃģn al problema, y uno de los autores del artÃculo comentÃģ:
âDesafortunadamente, no. De hecho, esto probablemente es la misiÃģn de toda la comunidad de IA.â
MÃĐtodo y Datos
Los investigadores utilizaron un Autoencoder Variacional (VAE) y DiT arquitecturas para generar muestras de video. En esta configuraciÃģn, las representaciones latentes comprimidas producidas por el VAE trabajan en conjunto con la modelizaciÃģn de DiT del proceso de desenoise.
Los videos se entrenaron en la VAE de difusiÃģn estable V1.5. El esquema se dejÃģ fundamentalmente sin cambios, con solo mejoras arquitectÃģnicas al final del proceso:
â[Retenemos] la mayorÃa de la convoluciÃģn 2D original, la normalizaciÃģn de grupos y los mecanismos de atenciÃģn en las dimensiones espaciales.
âPara inflar esta estructura en un autoencoder espacial-temporal, convertimos los Últimos bloques de downsampling 2D del codificador y los primeros bloques de upsampling 2D del decodificador en 3D, y empleamos varias capas adicionales 1D para mejorar la modelizaciÃģn temporal.â
Para permitir la modelizaciÃģn de video, el VAE modificado se entrenÃģ conjuntamente con datos de imÃĄgenes HQ y video, con el componente GAN de 2D nativo de la arquitectura SD1.5 aumentado para 3D.
El conjunto de datos de imÃĄgenes utilizado fue la fuente original de Stable Diffusion, LAION-Aesthetics, con filtrado, ademÃĄs de DataComp. Para los datos de video, se curÃģ un subconjunto de Vimeo-90K, Panda-70m y HDVG conjuntos de datos.
Los datos se entrenaron durante un millÃģn de pasos, con recorte aleatorio y volteo horizontal aleatorio aplicado como procesos de augmentaciÃģn de datos.
Volteando
Como se mencionÃģ anteriormente, el proceso de volteo horizontal aleatorio puede ser una limitaciÃģn en el entrenamiento de un sistema diseÃąado para producir movimiento autÃĐntico. Esto se debe a que la salida del modelo entrenado puede considerar ambas direcciones de un objeto y causar reversales aleatorios a medida que intenta negociar estos datos en conflicto (ver video incrustado anterior).
Por otro lado, si se desactiva el volteo horizontal, el modelo es mÃĄs probable que produzca una salida que se adhiere a una sola direcciÃģn aprendida de los datos de entrenamiento.
Asà que no hay una soluciÃģn fÃĄcil al problema, excepto que el sistema realmente asimile la totalidad de posibilidades de movimiento desde ambas versiones nativa y volteada â una facilidad que los niÃąos desarrollan fÃĄcilmente, pero que es mÃĄs un desafÃo, aparentemente, para los modelos de IA.
Pruebas
Para el primer conjunto de experimentos, los investigadores formularon un simulador 2D para producir videos del movimiento de objetos y colisiones que se ajustan a las leyes de la mecÃĄnica clÃĄsica, lo que proporcionÃģ un conjunto de datos de alto volumen y controlado que excluyÃģ las ambigÞedades de los videos del mundo real, para la evaluaciÃģn de los modelos. El motor de juego de fÃsica Box2D se utilizÃģ para crear estos videos.
Los tres escenarios fundamentales mencionados anteriormente fueron el enfoque de las pruebas: movimiento lineal uniforme, colisiones perfectamente elÃĄsticas y movimiento parabÃģlico.
Se utilizaron conjuntos de datos de tamaÃąos crecientes (que van desde 30,000 hasta tres millones de videos) para entrenar modelos de diferentes tamaÃąos y complejidad (DiT-S a DiT-L), con los primeros tres cuadros de cada video utilizados para la condicionamiento.

Detalles de los modelos variados entrenados en el primer conjunto de experimentos. Fuente: https://arxiv.org/pdf/2411.02385
Los investigadores encontraron que los resultados de distribuciÃģn (ID) se escalan bien con cantidades crecientes de datos, mientras que las generaciones de fuera de la distribuciÃģn no mejoran, lo que indica deficiencias en la generalizaciÃģn.

Resultados del primer conjunto de pruebas.
Los autores observan:
âEstos hallazgos sugieren la incapacidad de la escalada para realizar razonamiento en escenarios de fuera de la distribuciÃģn.â
A continuaciÃģn, los investigadores probaron y entrenaron sistemas diseÃąados para exhibir una habilidad para la generalizaciÃģn combinatoria, en la que dos movimientos contrastantes se combinan para (con suerte) producir un movimiento coherente que sea fiel a la ley fÃsica detrÃĄs de cada uno de los movimientos separados.
Para esta fase de las pruebas, los autores utilizaron el simulador PHYRE, creando un entorno 2D que representa mÚltiples objetos con formas diversas en caÃda libre, chocando entre sà en una variedad de interacciones complejas.
Las mÃĐtricas de evaluaciÃģn para esta segunda prueba fueron FrÃĐchet Video Distance (FVD); Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); y un estudio de humanos (denominado como âanormalâ en los resultados).
Se crearon tres escalas de conjuntos de datos de entrenamiento, a 100,000 videos, 0,6 millones de videos y 3-6 millones de videos. Se utilizaron modelos DiT-B y DiT-XL, debido a la complejidad aumentada de los videos, con el primer cuadro utilizado para la condicionamiento.
Los modelos se entrenaron durante un millÃģn de pasos a una resoluciÃģn de 256Ã256, con 32 cuadros por video.

Resultados del segundo conjunto de pruebas.
El resultado de esta prueba sugiere que simplemente aumentar el volumen de datos es un enfoque inadecuado:
El artÃculo establece:
âEstos resultados sugieren que tanto la capacidad del modelo como la cobertura del espacio de combinaciÃģn son cruciales para la generalizaciÃģn combinatoria. Esta idea implica que las leyes de escalada para la generaciÃģn de video deben centrarse en aumentar la diversidad de combinaciÃģn, en lugar de simplemente escalar el volumen de datos.â
Finalmente, los investigadores realizaron pruebas adicionales para intentar determinar si un modelo de generaciÃģn de video puede realmente asimilar leyes fÃsicas, o si simplemente memoriza y reproduce los datos de entrenamiento en el momento de inferencia.
Aquà examinaron el concepto de âgeneralizaciÃģn basada en casosâ, donde los modelos tienden a imitar ejemplos de entrenamiento especÃficos cuando se enfrentan a situaciones nuevas, asà como ejemplos de movimiento uniforme â especÃficamente, cÃģmo la direcciÃģn del movimiento en los datos de entrenamiento influye en las predicciones del modelo entrenado.
Se curaron dos conjuntos de datos de entrenamiento, para movimiento uniforme y colisiÃģn, cada uno consistente en videos de movimiento uniforme que representan velocidades entre 2,5 y 4 unidades, con los primeros tres cuadros utilizados como condicionamiento. Se omitieron valores latentes como velocidad, y, despuÃĐs del entrenamiento, se realizÃģ una prueba en escenarios vistos y no vistos.
A continuaciÃģn, vemos los resultados para la prueba de generaciÃģn de movimiento uniforme:

Resultados para las pruebas de generaciÃģn de movimiento uniforme, donde la variable âvelocidadâ se omite durante el entrenamiento.
Los autores establecen:
â[Con] una gran brecha en el conjunto de entrenamiento, el modelo tiende a generar videos donde la velocidad es alta o baja para parecerse a los datos de entrenamiento cuando los primeros cuadros muestran velocidades de rango medio.â
Para las pruebas de colisiÃģn, estÃĄn involucradas muchas mÃĄs variables, y el modelo debe aprender una funciÃģn no lineal bidimensional.

ColisiÃģn: resultados del tercer y Último conjunto de pruebas.
Los autores observan que la presencia de âejemplos engaÃąososâ, como el movimiento invertido (es decir, una pelota que rebota en una superficie y cambia de direcciÃģn), puede engaÃąar al modelo y hacer que genere predicciones fÃsicamente incorrectas.
ConclusiÃģn
Si un algoritmo no de IA (es decir, un mÃĐtodo âpreparadoâ, procedimental) contiene reglas matemÃĄticas para el comportamiento de fenÃģmenos fÃsicos como fluidos, o objetos bajo gravedad, o bajo presiÃģn, hay un conjunto de constantes invariables disponibles para una representaciÃģn precisa.
Sin embargo, los hallazgos del nuevo artÃculo indican que no se desarrolla una relaciÃģn equivalente o una comprensiÃģn intrÃnseca de las leyes fÃsicas clÃĄsicas durante el entrenamiento de los modelos generativos, y que aumentar la cantidad de datos no resuelve el problema, sino que lo oculta â porque hay mÃĄs videos de entrenamiento disponibles para que el sistema los imite en el momento de inferencia.
Â
* Mi conversiÃģn de las citas en lÃnea de los autores a enlaces.
Publicado por primera vez el martes 26 de noviembre de 2024












