Ángulo de Anderson

¿Por qué la entrelazamiento de conceptos significa que no puedes tener video de IA “a tu manera”?

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-1.5) depicting a man trying to fit disparate Legos together.

Las herramientas de video de IA prometen un control total, pero la “entrelazamiento de conceptos” oculta une identidades, expresiones y comportamientos, lo que fuerza a hacks y trucos de plantillas que hacen añicos el mito de la magia GenAI sin esfuerzo.

 

Opinión Desde que me sumergí en el tema con profundidad hace cinco años, el problema de entrelazamiento de conceptos en sistemas de IA entrenados se ha extendido a un rango mucho más amplio de usuarios, sin ser realmente comprendido mejor en sus propios términos.

En ese momento, sistemas de autoencoder de deepfakes (es decir, el ahora desaparecido DeepFaceLab y el menos centrado en la pornografía FaceSwap, ambos derivados del código de Reddit de 2017 que fue desacreditado y casi inmediatamente prohibido) eran los únicos en el juego para crear deepfakes de personas relativamente fotorealistas.

Estos sistemas dependían de extensos conjuntos de datos de entrenamiento faciales que estaban destinados a proporcionar al modelo de IA información sobre A) cómo se veía la persona en reposo (un embedding de referencia canónico) y B) cómo se veía bajo las diversas situaciones que una cara puede reflejar, desde sueño hasta risa, horror, aburrimiento, cínismo, tristeza, etc.

La identidad no viene sola, sino junto con expresiones faciales. Además, ciertas emociones pueden tener solo datos de cara disponibles desde ángulos extremos, lo que tenderá a asociar el ángulo con la emoción y viceversa.

La identidad no viene sola, sino junto con expresiones faciales. Además, ciertas emociones pueden tener solo datos de cara disponibles desde ángulos extremos, lo que tenderá a asociar el ángulo con la emoción y viceversa.

El problema era que la identidad canónica generalmente tenía que inferirse de capturas faciales que no eran en sí mismas ‘neutrales’, por lo que la preponderancia de sonrisas y risas obtenidas cuando se raspaban los conjuntos de datos de stock desplazarían la distribución hacia un ‘predeterminado sonriente’. Esto se debía al gran volumen de fotos de alfombra roja y paparazzi en los datos de entrenamiento web-raspados que informan estos modelos, así como a cualquier otra razón igualmente especiosa por la que un conjunto de datos podría estar sesgado hacia un tipo de imagen.

En otras palabras, el sistema de autoencoder tendría que intentar extraer un concepto de identidad ‘neutral’ de miles de imágenes donde las características faciales estaban contorsionadas por expresiones faciales normales.

También tendría que intentar desentrañar conceptos faciales semánticos de diferentes emociones desde los ángulos en que se tomaron las caras. Esto significaba que si las únicas expresiones faciales ‘aterrorizadas’ disponibles se tomaron desde una vista de perfil, el sistema entrenado solo podría reproducir esa emoción de manera óptima desde ese punto de vista.

Mirando hacia adelante

A medida que los enfoques basados en difusión tomaron el relevo de la escena de la imagen (y más tarde, video) de GenAI desde 2022, los sistemas generativos se volvieron mucho mejores para extrapolar expresiones faciales precisas cuando se les proporcionaban datos faciales limitados.

Incluso el desafío muy espinoso de crear vistas de perfil convincentes ha sido casi superado, en el estado actual de la técnica, mientras que los datos de expresión se han desvinculado bastante efectivamente de la identidad – hasta el punto de que el tipo de Marioneta de deepfake en vivo pionera por el sistema de transmisión DeepFaceLive tiene muchas aplicaciones offline efectivas, con la puesta en escena en tiempo real como un desarrollo futuro probable:

Haz clic para reproducir. Del proyecto ‘FlashPortrait’, ejemplos diversos de conducción de avatares a través de videos de origen. En este caso, no importa qué lado se siente el ‘dominio realista’, si es que hay alguno. Fuente 

Sin embargo, a medida que la paleta de GenAI se ha ampliado y la salida se ha vuelto más sofisticada, el problema de entrelazamiento simplemente se ha extendido a múltiples otras áreas – y actualmente se está ‘arreglando’ con algunos trucos bastante baratos y bastante antiguos. Si no sabes qué trucos son, es posible que tengas una opinión más positiva sobre cómo evoluciona rápidamente la imagen y el video de IA y supera sus viejos problemas.

Gatos parlanchines

Esperemos que quede claro por qué la identidad y la emoción resultaron difíciles de separar para los antiguos sistemas de autoencoder de 2017. Fue porque a) Había demasiados datos de un tipo, O demasiada una versión específica de un tipo de datos importantes, cualquiera de los cuales causaría un sesgo de distribución; y/o B) la arquitectura del modelo no estaba a la altura de la tarea de separar estas cualidades, y tendía a ‘pegarlas’ juntas en el momento de la inferencia, a menos que el usuario tomara un cuidado extraordinario para garantizar el equilibrio en su conjunto de datos.

Por la misma razón, problemas similares han surgido en una serie de modelos de video de código abierto y propietarios en los últimos años, aunque han sido eclipsados por niveles más altos de crítica en torno a alucinaciones, falta de censura y diversos otros temas.

Por ejemplo, en el sistema Wan2.+, muchos usuarios han encontrado que es muy difícil evitar que sus personajes generados hablen incesantemente, y a menudo también es difícil evitar que miren a la cámara.

El último problema (mirar a la cámara, o romper la cuarta pared) precede a la aparición de sistemas de síntesis de video, ya que surgió en varios sistemas de difusión de imagen, debido a la prevalencia de fotos ‘mirando a la cámara’ en conjuntos de datos web-raspados como LAION.

El problema de los personajes ‘parlanchines’ proviene de la fácil abundancia de videos de ‘influencer’ en YouTube, que naturalmente ofrecen miles de horas de discurso directo a la lente, a menudo curados en conjuntos de datos donde los científicos de investigación pueden lavar el raspado web proporcionando un contexto académico.

Pero a menos que los curadores originales o posteriores tomen cuidado para limitar la cantidad de videos de este tipo, y equilibrarlos contra más tipos diferentes de metraje, se desarrolla un sesgo severo en el modelo de video, que necesitará abordarse a través de remedios basados en recordatorios y sistemas auxiliares de terceros.

Enfrentado con el problema de ‘parlanchinería’ de Wan, el usuario de Reddit u/Several-Estimate-681 encontró un solución alternativa que aprovecha una configuración en el sistema Infinite Talk V2V de Wan 2.1 – un marco diseñado para fomentar la locuacidad al estilo de los influencers – que permite al usuario silenciar al personaje renderizado:

Haz clic para reproducir: Solo escucha – una solución alternativa para lograr que el personaje sea atento en Wan2.+. Fuente 

Claramente, soluciones alternativas de este tipo no representan soluciones arquitectónicas de bajo nivel, y, ausentes soluciones verdaderas que sean encontradas e implementadas por los creadores de modelos de base (porque los aficionados casuales no suelen tener millones de dólares para recrear o ajustar dicho trabajo), esto significa que el juego de ‘golpea y muere’ de entrelazamiento es probable que se reinicie a cero en la próxima versión.

Barato y frágil

No hay nada en la arquitectura de difusión en sí que haga que estos problemas sean inevitables; de hecho, si hubiera alguna manera de aplicar una curación, triage y anotación de alta calidad realmente efectiva a conjuntos de datos hiperscale con puntos de datos que se cuentan por millones, casi todos estos problemas probablemente desaparecerían.

Sin embargo, ese nivel de atención al detalle sería similar al Proyecto Manhattan en términos de logística, alcance, recursos necesarios y esfuerzo a largo plazo. En un clima donde una nueva arquitectura, o incluso una nueva versión de arquitectura, podría deshacer el alcance de tal esfuerzo, no hay actualmente voluntad de hacer este tipo de compromiso.

En consecuencia, en la medida en que es concordante con la obtención de modelos utilizables, los enfoques más baratos siguen siendo preferidos. Un ejemplo de ‘tacañería’ es la ampliación de datos, que, cuando se aplica de manera iliberal y a los tipos incorrectos de videoclips de conjunto de datos, puede tener resultados hilarantes:

Debido a que la ampliación de datos a menudo invierte la dirección de los videos de origen en el conjunto de datos, el modelo de IA puede ocasionalmente aprender algunos ‘movimientos imposibles’. Fuente

Sin embargo, en conjunto, las rocas que ruedan cuesta arriba y las personas que rompen el personaje al activar el ‘modo influencer’ tienden a considerarse instancias de daño colateral en sistemas generativos que, a pesar de estos errores persistentes y talones de Aquiles, pueden ser coaccionados para producir resultados impresionantes y encabezados lo suficientemente asombrados.

Soluciones de plantilla

En el período actual, cientos de dominios de video generativos, casi todos los cuales de alguna manera rompen la nueva serie de leyes y reacción en contra de GenAI, están disfrutando de su tiempo en la fuente antes de que la aplicación de la ley, las listas de bloqueo u otros tipos de desplataformación eliminen estos servicios comerciales.

Los sitios más grandes y mejor conocidos de este tipo, como Kling y Grok, tienden a adherirse a algún tipo de autocensura (eventualmente), o a responder a la crítica cambiando los tipos de contenido que sus plataformas facilitan a los usuarios.

Pero detrás de esos grandes nombres hay cientos de otras operaciones de ‘vuela y desaparece’, que constantemente atienden la demanda de nuevos (y a menudo más extremos) tipos de contenido.

Este tipo de provisión de bajo esfuerzo precluye el costo y el esfuerzo extremadamente altos de entrenar modelos de base desde cero. A menudo, incluso el ajuste, que cuesta mucho menos, se excluye.

Por lo tanto, estos sitios ofrecen ‘plantillas’, que se comportan en la práctica de manera idéntica a LoRAs personalizados, que han sido utilizados por aficionados a la IA durante más de cuatro años ahora, para entrenar cualquier identidad, estilo, objeto y (en el caso de LoRAs de video) movimiento o acción en un complemento LoRA dedicado.

Con el LoRA interposición entre el usuario y el modelo de base, los resultados obtenidos serán muy específicos de lo que el LoRA fue entrenado, y, por lo general, el rendimiento más amplio del modelo se ve socavado por la influencia de flexión de peso del LoRA, que reproducirá su propio sujeto muy bien, pero también interpondrá ese material en cualquier solicitud whatsoever (si los sitios de video de GenAI de ‘vuela y desaparece’ permitieran este nivel de control – no lo hacen; simplemente ofrecen una [ACCION DE SU ELECCIÓN] plantilla, e interpretan su texto de entrada / imagen / video en la forma más probable de resultar en una aplicación exitosa de la plantilla).

Por razones obvias, no puedo incrustar ejemplos de sitios web en este artículo; pero la literatura de investigación ha ofrecido recientemente algunos ejemplos análogos. Aquí, por ejemplo, el proyecto EffectMaker muestra el principio en acción, mediante el cual una acción específica se aplica a una imagen proporcionada por el usuario:

Haz clic para reproducir. En EffectMaker, efectos específicos ajustados se pueden aplicar a la entrada personalizada. Fuente 

Aun en estas circunstancias altamente curadas y dirigidas, los usuarios a menudo se quejan de que se necesitan múltiples intentos que queman tokens para obtener un buen resultado, y no debemos tal vez atribuir a la avaricia del proveedor o prácticas astutas lo que es más probablemente la falla de los marcos de GenAI ‘hit-and-miss’ DiT.

El público en general, podría argumentarse, obtiene su impresión de las capacidades de GenAI de ejemplos seleccionados que no son representativos de lo que un usuario casual y principiante probablemente obtendría.  Si un usuario quema seis intentos de una plantilla (es decir, un LoRA suministrado por el sitio web de IA), tenderá a publicar y alabar el mejor de estos, transmitiendo la impresión de que se podrían obtener tales resultados al consultar el modelo base – y transmitiendo la impresión de que los modelos de base generativos son mucho más desentrañados de lo que realmente son.

Conclusión

La literatura sigue examinando el problema del entrelazamiento, que primero se manifestó seriamente alrededor de 2020, en la colaboración Max Planck/Google Una mirada sobria a la aprendizaje no supervisado de representaciones desentrañadas y su evaluación.

Además, varios sucesores de Desentrañamiento a través del contraste (DisCo) surgen periódicamente, y la escena sigue siendo animada con una conciencia del problema que supera con creces la conciencia pública de lo que la IA no puede hacer en este respecto.

Un estudio chino de 2024 sugiere que una resolución del entrelazamiento puede no ser necesaria en absoluto para resolver los problemas que plantea. Históricamente, esto suena cierto, ya que muchos problemas intratables en visión por computadora se superaron no resolviéndolos, sino superándolos a través de técnicas y enfoques completamente nuevos.

Hasta que surja un competidor discreto, parece que seguiremos necesitando aplicar soluciones provisionales y vendas a las limitaciones y carencias de GenAI, y soportar la sobreestimación pública de la flexibilidad y ductilidad de los modelos de base.

 

Publicado por primera vez el lunes 23 de marzo de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai