Ángulo de Anderson

ÂŋPueden los Modelos de Mundo de IA Comprender Realmente las Leyes Físicas?

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
Image produced by ChatGPT-4o, depicting diverse objects exhibiting aberrant physical properties. The prompt was developed conversationally

La gran esperanza para los modelos de visiÃģn-lenguaje de IA es que eventualmente se vuelvan capaces de una mayor autonomía y versatilidad, incorporando principios de leyes físicas de la misma manera que desarrollamos una comprensiÃģn innata de estos principios a travÃĐs de la experiencia temprana.

Por ejemplo, los juegos de pelota de los niÃąos tienden a desarrollar una comprensiÃģn de la cinÃĐtica del movimiento, y del efecto del peso y la textura de la superficie en la trayectoria. De manera similar, las interacciones con escenarios comunes como baÃąos, bebidas derramadas, el ocÃĐano, piscinas y otros cuerpos líquidos diversos nos darÃĄn una comprensiÃģn versÃĄtil y escalable de las formas en que el líquido se comporta bajo la gravedad.

Incluso los postulados de fenÃģmenos menos comunes, como la combustiÃģn, las explosiones y la distribuciÃģn de peso arquitectÃģnico bajo presiÃģn, se absorben inconscientemente a travÃĐs de la exposiciÃģn a programas de televisiÃģn y películas, o videos de redes sociales.

Cuando estudiemos los principios detrÃĄs de estos sistemas, a un nivel acadÃĐmico, simplemente estaremos “retrofitando” nuestros modelos mentales intuitivos (pero no informados) de ellos.

Maestros de Uno

Actualmente, la mayoría de los modelos de IA son, por contraste, mÃĄs “especializados”, y muchos de ellos estÃĄn ajustados o entrenados desde cero en conjuntos de datos de imÃĄgenes o videos que son bastante específicos para ciertos casos de uso, en lugar de diseÃąados para desarrollar una comprensiÃģn general de las leyes que rigen.

Otros pueden presentar la apariencia de una comprensiÃģn de las leyes físicas; pero pueden estar reproduciendo muestras de sus datos de entrenamiento, en lugar de realmente comprender los conceptos bÃĄsicos de ÃĄreas como la física del movimiento de una manera que pueda producir depicciones verdaderamente novedosas (y científicamente plausibles) a partir de las solicitudes de los usuarios.

En este momento delicado en la productizaciÃģn y comercializaciÃģn de los sistemas de IA generativa, nos corresponde a nosotros, y a la escrutinio de los inversores, distinguir el marketing elaborado de los nuevos modelos de IA de la realidad de sus limitaciones.

Uno de los artículos mÃĄs interesantes de noviembre, liderado por Bytedance Research, abordÃģ este problema, explorando la brecha entre las capacidades aparentes y reales de los modelos generativos “de propÃģsito general” como Sora.

El trabajo concluyÃģ que, en el estado actual del arte, la salida generada de modelos de este tipo es mÃĄs probable que estÃĐ imitando ejemplos de sus datos de entrenamiento que demostrando una comprensiÃģn completa de las restricciones físicas subyacentes que operan en el mundo real.

El artículo establece*:

‘[Estos] modelos pueden ser fÃĄcilmente sesgados por “ejemplos engaÃąosos” del conjunto de entrenamiento, lo que los lleva a generalizar de manera “basada en casos” bajo ciertas condiciones. Este fenÃģmeno, tambiÃĐn observado en grandes modelos de lenguaje, describe la tendencia de un modelo a hacer referencia a casos de entrenamiento similares al resolver nuevas tareas.

‘Por ejemplo, considere un modelo de video entrenado en datos de una pelota en movimiento en una trayectoria lineal uniforme. Si se realiza una augmentaciÃģn de datos mediante la inversiÃģn horizontal de los videos, introduciendo así un movimiento en direcciÃģn opuesta, el modelo puede generar un escenario en el que una pelota de baja velocidad invierte su direcciÃģn despuÃĐs de los primeros cuadros, aunque este comportamiento no es físicamente correcto.’

MÃĄs adelante, examinaremos el artículo – titulado Evaluating World Models with LLM for Decision Making – mÃĄs de cerca. Pero primero, veamos el contexto de estas limitaciones aparentes.

Recuerdo de Cosas Pasadas

Sin generalizaciÃģn, un modelo de IA entrenado es poco mÃĄs que una costosa hoja de cÃĄlculo de referencias a secciones de sus datos de entrenamiento: encuentra el tÃĐrmino de bÚsqueda adecuado, y puede invocar una instancia de esos datos.

En ese escenario, el modelo estÃĄ actuando efectivamente como un “motor de bÚsqueda neuronal”, ya que no puede producir interpretaciones abstractas o “creativas” de la salida deseada, sino que reproduce alguna variaciÃģn menor de los datos que vio durante el proceso de entrenamiento.

Esto se conoce como memorizaciÃģn – un problema controvertido que surge porque los modelos de IA verdaderamente flexibles y interpretativos tienden a carecer de detalles, mientras que los modelos verdaderamente detallados tienden a carecer de originalidad y flexibilidad.

La capacidad de los modelos afectados por la memorizaciÃģn para reproducir los datos de entrenamiento es un obstÃĄculo legal potencial, en casos en los que los creadores del modelo no tenían derechos ilimitados para utilizar esos datos; y donde se pueden demostrar beneficios de esos datos a travÃĐs de un nÚmero creciente de mÃĐtodos de extracciÃģn.

Debido a la memorizaciÃģn, las trazas de datos no autorizados pueden persistir, encadenadas, a travÃĐs de mÚltiples sistemas de entrenamiento, como una marca de agua indelible e involuntaria – incluso en proyectos donde el practicante de aprendizaje automÃĄtico ha tenido cuidado de asegurarse de que se utilicen “datos seguros”.

Modelos de Mundo

Sin embargo, el problema central de uso con la memorizaciÃģn es que tiende a transmitir la ilusiÃģn de inteligencia, o sugiere que el modelo de IA ha generalizado leyes o dominios fundamentales, cuando en realidad es el gran volumen de datos memorizados lo que proporciona esta ilusiÃģn (es decir, el modelo tiene tantos ejemplos de datos potenciales para elegir que es difícil para un ser humano determinar si estÃĄ regurgitando contenido aprendido o si tiene una comprensiÃģn verdaderamente abstracta de los conceptos involucrados en la generaciÃģn).

Este problema tiene ramificaciones para el creciente interÃĐs en modelos de mundo – la perspectiva de sistemas de IA altamente diversos y costosamente entrenados que incorporen mÚltiples leyes conocidas y son ricos en exploraciÃģn.

Los modelos de mundo son de particular interÃĐs en el espacio de la generaciÃģn de imÃĄgenes y videos. En 2023, RunwayML iniciÃģ una iniciativa de investigaciÃģn sobre el desarrollo y la viabilidad de dichos modelos; DeepMind recientemente contratÃģ a uno de los originadores del aclamado modelo de video generativo Sora para trabajar en un modelo de este tipo; y startups como Higgsfield estÃĄn invirtiendo significativamente en modelos de mundo para la síntesis de imÃĄgenes y videos.

Combinaciones Difíciles

Una de las promesas de los nuevos desarrollos en los sistemas de IA generativa de video es la perspectiva de que puedan aprender leyes físicas fundamentales, como el movimiento, la cinemÃĄtica humana (como características de la marcha), dinÃĄmica de fluidos, y otros fenÃģmenos físicos conocidos que son, por lo menos, visualmente familiares para los humanos.

Si la IA generativa pudiera lograr este hito, podría convertirse en capaz de producir efectos visuales hiperrealistas que representen explosiones, inundaciones y eventos de colisiÃģn plausibles en mÚltiples tipos de objetos.

Si, por otro lado, el sistema de IA simplemente ha sido entrenado en miles (o cientos de miles) de videos que representan dichos eventos, podría ser capaz de reproducir los datos de entrenamiento de manera bastante convincente cuando se entrenÃģ en un punto de datos similar a la consulta del usuario; sin embargo, fallaría si la consulta combina demasiados conceptos que no estÃĄn representados en la combinaciÃģn en los datos.

AdemÃĄs, estas limitaciones no serían inmediatamente aparentes, hasta que se presione el sistema con combinaciones desafiantes de este tipo.

Esto significa que un nuevo sistema generativo puede ser capaz de generar contenido de video viral que, aunque impresionante, puede crear una falsa impresiÃģn de las capacidades y la profundidad de comprensiÃģn del sistema, porque la tarea que representa no es un desafío real para el sistema.

Por ejemplo, un evento relativamente comÚn y bien difundido, como ‘un edificio es demolido’, podría estar presente en mÚltiples videos en un conjunto de datos utilizado para entrenar un modelo que se supone que tiene alguna comprensiÃģn de la física. Por lo tanto, el modelo podría presumiblemente generalizar este concepto bien y producir incluso una salida novedosa dentro de los parÃĄmetros aprendidos de los videos abundantes.

Esto es un ejemplo dentro de la distribuciÃģn, donde el conjunto de datos contiene muchos ejemplos Útiles para que el sistema de IA aprenda.

Sin embargo, si se solicita un ejemplo mÃĄs extraÃąo o especioso, como ‘La Torre Eiffel es destruida por invasores alienígenas’, el modelo tendría que combinar dominios diversos como ‘propiedades metalÚrgicas’, ‘características de las explosiones’, ‘gravedad’, ‘resistencia al viento’ – y ‘nave espacial alienígena’.

Esto es un ejemplo fuera de la distribuciÃģn (OOD), que combina tantos conceptos entrelazados que el sistema probablemente fallarÃĄ al generar un ejemplo convincente o se limitarÃĄ al ejemplo semÃĄntico mÃĄs cercano en el que se entrenÃģ – incluso si ese ejemplo no se ajusta a la solicitud del usuario.

Excepto que el conjunto de datos de origen del modelo contenía efectos visuales de CGI de estilo de Hollywood que representaban el mismo o un evento similar, dicha representaciÃģn requeriría absolutamente que logre una comprensiÃģn generalizada y flexible de las leyes físicas.

Restricciones Físicas

El nuevo artículo – una colaboraciÃģn entre Bytedance, la Universidad Tsinghua y el Technion – sugiere que no solo los modelos como Sora no internalizan realmente las leyes físicas deterministas de esta manera, sino que escalar los datos (un enfoque comÚn en los Últimos 18 meses) parece, en la mayoría de los casos, no producir ninguna mejora real en este respecto.

El artículo explora no solo los límites de la extrapolaciÃģn de leyes físicas específicas – como el comportamiento de los objetos en movimiento cuando chocan, o cuando su camino es obstruido – sino tambiÃĐn la capacidad del modelo para generalizaciÃģn combinatoria – instancias en las que las representaciones de dos principios físicos diferentes se fusionan en una sola salida generativa.

Un resumen de video del nuevo artículo. Fuente: https://x.com/bingyikang/status/1853635009611219019

Las tres leyes físicas seleccionadas para el estudio por los investigadores fueron movimiento parabÃģlico; movimiento lineal uniforme; y colisiÃģn perfectamente elÃĄstica.

Como se puede ver en el video anterior, los hallazgos indican que los modelos como Sora no internalizan realmente las leyes físicas, sino que tienden a reproducir los datos de entrenamiento.

AdemÃĄs, los autores encontraron que aspectos como el color y la forma se vuelven tan entrelazados en el momento de inferencia que una pelota generada probablemente se convertiría en un cuadrado, aparentemente porque un movimiento similar en un ejemplo del conjunto de datos presentaba un cuadrado y no una pelota (ver ejemplo en el video incrustado anterior).

El artículo concluye*:

‘Nuestro estudio sugiere que la escalada sola es insuficiente para que los modelos de generaciÃģn de video descubran leyes físicas fundamentales, a pesar de su papel en el ÃĐxito mÃĄs amplio de Soraâ€Ķ

‘â€Ķ[Los hallazgos] indican que la escalada sola no puede abordar el problema de fuera de la distribuciÃģn, aunque mejora el rendimiento en otros escenarios.

‘Nuestro anÃĄlisis en profundidad sugiere que la generalizaciÃģn del modelo de video se basa mÃĄs en hacer referencia a ejemplos de entrenamiento similares que en aprender reglas universales. Observamos un orden de priorizaciÃģn de color > tamaÃąo > velocidad > forma en este comportamiento “basado en casos”.

‘[Nuestro] estudio sugiere que la escalada ingenua es insuficiente para que los modelos de generaciÃģn de video descubran leyes físicas fundamentales.’

Se preguntÃģ al equipo de investigaciÃģn si habían encontrado una soluciÃģn al problema, y uno de los autores del artículo comentÃģ:

‘Desafortunadamente, no. De hecho, esto probablemente es la misiÃģn de toda la comunidad de IA.’

MÃĐtodo y Datos

Los investigadores utilizaron un Autoencoder Variacional (VAE) y DiT arquitecturas para generar muestras de video. En esta configuraciÃģn, las representaciones latentes comprimidas producidas por el VAE trabajan en conjunto con la modelizaciÃģn de DiT del proceso de desenoise.

Los videos se entrenaron en la VAE de difusiÃģn estable V1.5. El esquema se dejÃģ fundamentalmente sin cambios, con solo mejoras arquitectÃģnicas al final del proceso:

‘[Retenemos] la mayoría de la convoluciÃģn 2D original, la normalizaciÃģn de grupos y los mecanismos de atenciÃģn en las dimensiones espaciales.

‘Para inflar esta estructura en un autoencoder espacial-temporal, convertimos los Últimos bloques de downsampling 2D del codificador y los primeros bloques de upsampling 2D del decodificador en 3D, y empleamos varias capas adicionales 1D para mejorar la modelizaciÃģn temporal.’

Para permitir la modelizaciÃģn de video, el VAE modificado se entrenÃģ conjuntamente con datos de imÃĄgenes HQ y video, con el componente GAN de 2D nativo de la arquitectura SD1.5 aumentado para 3D.

El conjunto de datos de imÃĄgenes utilizado fue la fuente original de Stable Diffusion, LAION-Aesthetics, con filtrado, ademÃĄs de DataComp. Para los datos de video, se curÃģ un subconjunto de Vimeo-90K, Panda-70m y HDVG conjuntos de datos.

Los datos se entrenaron durante un millÃģn de pasos, con recorte aleatorio y volteo horizontal aleatorio aplicado como procesos de augmentaciÃģn de datos.

Volteando

Como se mencionÃģ anteriormente, el proceso de volteo horizontal aleatorio puede ser una limitaciÃģn en el entrenamiento de un sistema diseÃąado para producir movimiento autÃĐntico. Esto se debe a que la salida del modelo entrenado puede considerar ambas direcciones de un objeto y causar reversales aleatorios a medida que intenta negociar estos datos en conflicto (ver video incrustado anterior).

Por otro lado, si se desactiva el volteo horizontal, el modelo es mÃĄs probable que produzca una salida que se adhiere a una sola direcciÃģn aprendida de los datos de entrenamiento.

Así que no hay una soluciÃģn fÃĄcil al problema, excepto que el sistema realmente asimile la totalidad de posibilidades de movimiento desde ambas versiones nativa y volteada – una facilidad que los niÃąos desarrollan fÃĄcilmente, pero que es mÃĄs un desafío, aparentemente, para los modelos de IA.

Pruebas

Para el primer conjunto de experimentos, los investigadores formularon un simulador 2D para producir videos del movimiento de objetos y colisiones que se ajustan a las leyes de la mecÃĄnica clÃĄsica, lo que proporcionÃģ un conjunto de datos de alto volumen y controlado que excluyÃģ las ambigÞedades de los videos del mundo real, para la evaluaciÃģn de los modelos. El motor de juego de física Box2D se utilizÃģ para crear estos videos.

Los tres escenarios fundamentales mencionados anteriormente fueron el enfoque de las pruebas: movimiento lineal uniforme, colisiones perfectamente elÃĄsticas y movimiento parabÃģlico.

Se utilizaron conjuntos de datos de tamaÃąos crecientes (que van desde 30,000 hasta tres millones de videos) para entrenar modelos de diferentes tamaÃąos y complejidad (DiT-S a DiT-L), con los primeros tres cuadros de cada video utilizados para la condicionamiento.

Detalles de los modelos variados entrenados en el primer conjunto de experimentos. Fuente: https://arxiv.org/pdf/2411.02385

Detalles de los modelos variados entrenados en el primer conjunto de experimentos. Fuente: https://arxiv.org/pdf/2411.02385

Los investigadores encontraron que los resultados de distribuciÃģn (ID) se escalan bien con cantidades crecientes de datos, mientras que las generaciones de fuera de la distribuciÃģn no mejoran, lo que indica deficiencias en la generalizaciÃģn.

Resultados del primer conjunto de pruebas.

Resultados del primer conjunto de pruebas.

Los autores observan:

‘Estos hallazgos sugieren la incapacidad de la escalada para realizar razonamiento en escenarios de fuera de la distribuciÃģn.’

A continuaciÃģn, los investigadores probaron y entrenaron sistemas diseÃąados para exhibir una habilidad para la generalizaciÃģn combinatoria, en la que dos movimientos contrastantes se combinan para (con suerte) producir un movimiento coherente que sea fiel a la ley física detrÃĄs de cada uno de los movimientos separados.

Para esta fase de las pruebas, los autores utilizaron el simulador PHYRE, creando un entorno 2D que representa mÚltiples objetos con formas diversas en caída libre, chocando entre sí en una variedad de interacciones complejas.

Las mÃĐtricas de evaluaciÃģn para esta segunda prueba fueron FrÃĐchet Video Distance (FVD); Structural Similarity Index (SSIM); Peak Signal-to-Noise Ratio (PSNR); Learned Perceptual Similarity Metrics (LPIPS); y un estudio de humanos (denominado como ‘anormal’ en los resultados).

Se crearon tres escalas de conjuntos de datos de entrenamiento, a 100,000 videos, 0,6 millones de videos y 3-6 millones de videos. Se utilizaron modelos DiT-B y DiT-XL, debido a la complejidad aumentada de los videos, con el primer cuadro utilizado para la condicionamiento.

Los modelos se entrenaron durante un millÃģn de pasos a una resoluciÃģn de 256×256, con 32 cuadros por video.

Resultados del segundo conjunto de pruebas.

Resultados del segundo conjunto de pruebas.

El resultado de esta prueba sugiere que simplemente aumentar el volumen de datos es un enfoque inadecuado:

El artículo establece:

‘Estos resultados sugieren que tanto la capacidad del modelo como la cobertura del espacio de combinaciÃģn son cruciales para la generalizaciÃģn combinatoria. Esta idea implica que las leyes de escalada para la generaciÃģn de video deben centrarse en aumentar la diversidad de combinaciÃģn, en lugar de simplemente escalar el volumen de datos.’

Finalmente, los investigadores realizaron pruebas adicionales para intentar determinar si un modelo de generaciÃģn de video puede realmente asimilar leyes físicas, o si simplemente memoriza y reproduce los datos de entrenamiento en el momento de inferencia.

Aquí examinaron el concepto de ‘generalizaciÃģn basada en casos’, donde los modelos tienden a imitar ejemplos de entrenamiento específicos cuando se enfrentan a situaciones nuevas, así como ejemplos de movimiento uniforme – específicamente, cÃģmo la direcciÃģn del movimiento en los datos de entrenamiento influye en las predicciones del modelo entrenado.

Se curaron dos conjuntos de datos de entrenamiento, para movimiento uniforme y colisiÃģn, cada uno consistente en videos de movimiento uniforme que representan velocidades entre 2,5 y 4 unidades, con los primeros tres cuadros utilizados como condicionamiento. Se omitieron valores latentes como velocidad, y, despuÃĐs del entrenamiento, se realizÃģ una prueba en escenarios vistos y no vistos.

A continuaciÃģn, vemos los resultados para la prueba de generaciÃģn de movimiento uniforme:

Resultados para las pruebas de generaciÃģn de movimiento uniforme, donde la variable 'velocidad' se omite durante el entrenamiento.

Resultados para las pruebas de generaciÃģn de movimiento uniforme, donde la variable ‘velocidad’ se omite durante el entrenamiento.

Los autores establecen:

‘[Con] una gran brecha en el conjunto de entrenamiento, el modelo tiende a generar videos donde la velocidad es alta o baja para parecerse a los datos de entrenamiento cuando los primeros cuadros muestran velocidades de rango medio.’

Para las pruebas de colisiÃģn, estÃĄn involucradas muchas mÃĄs variables, y el modelo debe aprender una funciÃģn no lineal bidimensional.

ColisiÃģn: resultados del tercer y Último conjunto de pruebas.

ColisiÃģn: resultados del tercer y Último conjunto de pruebas.

Los autores observan que la presencia de ‘ejemplos engaÃąosos’, como el movimiento invertido (es decir, una pelota que rebota en una superficie y cambia de direcciÃģn), puede engaÃąar al modelo y hacer que genere predicciones físicamente incorrectas.

ConclusiÃģn

Si un algoritmo no de IA (es decir, un mÃĐtodo “preparado”, procedimental) contiene reglas matemÃĄticas para el comportamiento de fenÃģmenos físicos como fluidos, o objetos bajo gravedad, o bajo presiÃģn, hay un conjunto de constantes invariables disponibles para una representaciÃģn precisa.

Sin embargo, los hallazgos del nuevo artículo indican que no se desarrolla una relaciÃģn equivalente o una comprensiÃģn intrínseca de las leyes físicas clÃĄsicas durante el entrenamiento de los modelos generativos, y que aumentar la cantidad de datos no resuelve el problema, sino que lo oculta – porque hay mÃĄs videos de entrenamiento disponibles para que el sistema los imite en el momento de inferencia.

 

* Mi conversiÃģn de las citas en línea de los autores a enlaces.

Publicado por primera vez el martes 26 de noviembre de 2024

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]