Modelos y plataformas de IA
El auge de los deepfakes de video Hunyuan

Debido a la naturaleza de algunos de los materiales discutidos aquí, este artículo contendrá menos enlaces de referencia y ilustraciones de lo habitual.
Algo digno de mención está sucediendo actualmente en la comunidad de síntesis de AI, aunque su importancia puede tardar un tiempo en ser clara. Los aficionados están entrenando modelos de video de AI generativos para reproducir las similitudes de personas, utilizando LoRAs basados en video en el marco de video Hunyuan de Tencent, recientemente lanzado como código abierto.*
Haga clic para reproducir. Resultados diversos de personalizaciones de Hunyuan basadas en LoRA disponibles gratuitamente en la comunidad Civit. Al entrenar modelos de adaptación de bajo rango (LoRAs), los problemas de estabilidad temporal, que han plagado la generación de video de AI durante dos años, se reducen significativamente. Fuentes: civit.ai
En el video mostrado arriba, las similitudes de las actrices Natalie Portman, Christina Hendricks y Scarlett Johansson, junto con el líder tecnológico Elon Musk, han sido entrenadas en archivos de complemento relativamente pequeños para el sistema de video generativo Hunyuan, que se puede instalar sin filtros de contenido (como filtros NSFW) en la computadora del usuario.
El creador de la LoRA de Christina Hendricks mostrada arriba afirma que solo se necesitaron 16 imágenes de la serie de televisión Mad Men para desarrollar el modelo (que es una descarga de solo 307mb); múltiples publicaciones de la comunidad Stable Diffusion en Reddit y Discord confirman que las LoRAs de este tipo no requieren grandes cantidades de datos de entrenamiento ni tiempos de entrenamiento largos en la mayoría de los casos.
Clic para reproducir. Arnold Schwarzenegger es traído a la vida en una LoRA de video Hunyuan que se puede descargar en Civit. Consulte https://www.youtube.com/watch?v=1D7B9g9rY68 para más ejemplos de Arnie, de la comunidad de entusiastas de la IA Bob Doyle.
Las LoRAs de Hunyuan se pueden entrenar en imágenes estáticas o en videos, aunque el entrenamiento en videos requiere más recursos de hardware y tiempo de entrenamiento.
El modelo de video Hunyuan cuenta con 13 mil millones de parámetros, superando los 12 mil millones de parámetros de Sora, y superando con creces al modelo menos capaz Hunyuan-DiT lanzado como código abierto en el verano de 2024, que solo tiene 1,5 mil millones de parámetros.
Como sucedió hace dos años y medio con Stable Diffusion y LoRA (consulte ejemplos de celebridades ‘nativas’ de Stable Diffusion 1.5 aquí), el modelo base en cuestión tiene una comprensión mucho más limitada de las personalidades de las celebridades, en comparación con el nivel de fidelidad que se puede obtener a través de implementaciones de LoRA ‘inyectadas de ID’.
En efecto, una LoRA personalizada y enfocada en la personalidad obtiene un ‘paseo gratis’ en las capacidades de síntesis significativas del modelo base Hunyuan, ofreciendo una síntesis humana notablemente más efectiva que la que se puede obtener mediante autoencoders de deepfakes de 2017 o intentando agregar movimiento a imágenes estáticas a través de sistemas como el LivePortrait galardonado.
Todas las LoRAs mostradas aquí se pueden descargar gratuitamente desde la comunidad Civit, mientras que el número más abundante de LoRAs personalizadas ‘de imagen estática’ también pueden potencialmente crear ‘imágenes de semilla’ para el proceso de creación de video (es decir, imagen a video, una versión pendiente de Hunyuan Video, aunque se pueden encontrar soluciones alternativas por ahora).
Haga clic para reproducir. Muestras de arriba de una LoRA ‘estática’ de Flux; abajo, ejemplos de una LoRA de video Hunyuan con la música de Taylor Swift. Ambas LoRAs están disponibles gratuitamente en la comunidad Civit.
Al escribir esto, el sitio web de Civit ofrece 128 resultados de búsqueda para ‘Hunyuan’*. Casi todos ellos son de algún modo modelos NSFW; 22 representan a celebridades; 18 están diseñados para facilitar la generación de pornografía hardcore; y solo siete de ellos representan a hombres en lugar de mujeres.
¿Qué hay de nuevo?
Debido a la naturaleza evolutiva del término deepfake, y la limitada comprensión pública de las (muy severas) limitaciones de los marcos de síntesis de video de AI humanos hasta la fecha, la importancia de la LoRA de Hunyuan no es fácil de entender para una persona que sigue casualmente la escena de la IA generativa. Veamos algunas de las diferencias clave entre las LoRAs de Hunyuan y los enfoques anteriores para la generación de video de AI basada en identidad.
1: Instalación local sin restricciones
El aspecto más importante del video de Hunyuan es el hecho de que se puede descargar localmente, y que pone un sistema de generación de video de AI muy poderoso y sin censurar en manos del usuario casual, así como de la comunidad de VFX (en la medida en que las licencias lo permitan en diferentes regiones geográficas).
La última vez que sucedió esto fue con el lanzamiento de la versión de código abierto del modelo de Stable Diffusion de Stability.ai en el verano de 2022. En ese momento, el modelo DALL-E2 de OpenAI había capturado la imaginación del público, aunque DALLE-2 era un servicio de pago con restricciones notables (que crecieron con el tiempo).
Cuando se lanzó Stable Diffusion, y la adaptación de bajo rango hizo posible generar imágenes de la identidad de cualquier persona (celebridad o no), el gran interés de los desarrolladores y los consumidores ayudó a que Stable Diffusion eclipsara la popularidad de DALLE-2; aunque este último era un sistema más capaz en su momento, sus rutinas de censura fueron vistas como onerosas por muchos de sus usuarios, y la personalización no era posible.
Probablemente, el mismo escenario se aplica ahora entre Sora y Hunyuan – o, más precisamente, entre sistemas de video generativos de propietario de grado Sora y rivales de código abierto, de los cuales Hunyuan es el primero – pero probablemente no el último (aquí, considere que Flux eventualmente ganaría terreno significativo sobre Stable Diffusion).
Los usuarios que deseen crear salidas de LoRA de Hunyuan, pero que carezcan de equipos efectivamente potentes, pueden, como siempre, descargar el aspecto de GPU del entrenamiento a servicios de cómputo en línea como RunPod. Esto no es lo mismo que crear videos de AI en plataformas como Kaiber o Kling, ya que no se entiende la filtración semántica o basada en imágenes (censura) al alquilar una GPU en línea para respaldar un flujo de trabajo local.
2: No hay necesidad de videos ‘anfitriones’ y esfuerzo alto
Cuando los deepfakes surgieron en la escena a fines de 2017, el código publicado de forma anónima evolucionaría en las bifurcaciones principales DeepFaceLab y FaceSwap (así como el sistema de deepfaking en tiempo real DeepFaceLive).
Este método requería la curación minuciosa de miles de imágenes de rostro de cada identidad para ser intercambiada; el esfuerzo menor invertido en esta etapa, menos efectivo sería el modelo. Además, los tiempos de entrenamiento variaban entre 2-14 días, dependiendo del hardware disponible, estresando incluso los sistemas capaces a largo plazo.
Cuando el modelo finalmente estuvo listo, solo podía imponer caras en video existente, y generalmente necesitaba un ‘objetivo’ (es decir, identidad real) que fuera similar en apariencia a la identidad superpuesta.
Más recientemente, ROOP, LivePortrait y numerosos marcos similares han proporcionado funcionalidad similar con mucho menos esfuerzo, y a menudo con resultados superiores – pero sin capacidad para generar deepfakes de cuerpo completo precisos – o cualquier elemento aparte de las caras.

Ejemplos de ROOP Unleashed y LivePortrait (inset inferior izquierdo), de la transmisión de contenido de Bob Doyle en YouTube. Fuentes: https://www.youtube.com/watch?v=i39xeYPBAAM y https://www.youtube.com/watch?v=QGatEItg2Ns
Por el contrario, las LoRAs de Hunyuan (y los sistemas similares que inevitablemente seguirán) permiten la creación sin restricciones de mundos enteros, incluyendo la simulación de cuerpo completo de la identidad de LoRA entrenada por el usuario.
3: Consistencia temporal mejorada
La consistencia temporal ha sido el Santo Grial de la difusión de video durante varios años. El uso de una LoRA, junto con promtps apropiados, da a la generación de video de Hunyuan una referencia de identidad constante a la que adherirse. En teoría (estos son días tempranos), uno podría entrenar múltiples LoRAs de una identidad particular, cada una con ropa específica.
Bajo esas circunstancias, la ropa también es menos probable que ‘mutar’ a lo largo del curso de una generación de video (ya que el sistema generativo basa el siguiente cuadro en una ventana muy limitada de cuadros anteriores).
(Alternativamente, al igual que con los sistemas de LoRA basados en imágenes, uno puede aplicar simplemente múltiples LoRAs, como identidad + LoRAs de traje, a una sola generación de video)
4: Acceso al ‘experimento humano’
Como observé recientemente, el sector de IA generativa de propietario ahora parece estar tan preocupado por la posible crítica relacionada con las capacidades de síntesis humana de sus proyectos, que las personas reales rara vez aparecen en las páginas del proyecto para anuncios y lanzamientos importantes. En su lugar, la literatura de publicidad relacionada tiende cada vez más a mostrar sujetos ‘bonitos’ y ‘no amenazantes’ en resultados sintetizados.
Con el advenimiento de las LoRAs de Hunyuan, por primera vez, la comunidad tiene la oportunidad de empujar los límites de la síntesis de video de humanos basada en LDM en un sistema altamente capaz (en lugar de marginal), y explorar completamente el tema que más le interesa a la mayoría de nosotros – las personas.
Implicaciones
Dado que una búsqueda de ‘Hunyuan’ en la comunidad Civit muestra principalmente LoRAs de celebridades y ‘hardcore’, la implicación central del advenimiento de las LoRAs de Hunyuan es que se utilizarán para crear videos pornográficos de AI (o difamatorios) de personas reales – celebridades y desconocidos por igual.
Para fines de cumplimiento, los aficionados que crean LoRAs de Hunyuan y que experimentan con ellos en servidores de Discord y subreddits relacionados son cuidadosos al prohibir ejemplos de personas reales que se publiquen. La realidad es que incluso los deepfakes de imagen ahora están altamente armados; y la perspectiva de agregar videos realistas a la mezcla puede justificar finalmente los temores crecientes que han sido recurrentes en los medios durante los últimos siete años, y que han provocado nuevas regulaciones.
La fuerza impulsora
Como siempre, la pornografía sigue siendo la fuerza impulsora de la tecnología. Cualquiera que sea nuestra opinión sobre este uso, este motor implacable de impulso impulsa avances en el estado de la técnica que pueden beneficiar finalmente a una adopción más convencional.
En este caso, es posible que el precio sea más alto de lo habitual, ya que la divulgación de la creación de video hiperrealista tiene implicaciones obvias para el uso criminal, político y ético.
Un grupo de Reddit (que no nombraré aquí) dedicado a la generación de video NSFW de IA tiene un servidor de Discord asociado donde los usuarios están perfeccionando flujos de trabajo de ComfyUI para la generación de video pornográfico basado en Hunyuan. Diariamente, los usuarios publican ejemplos de clips NSFW – muchos de los cuales pueden razonablemente ser calificados de ‘extremos’, o al menos estirar las restricciones establecidas en las reglas del foro.
Esta comunidad también mantiene un repositorio de GitHub sustancial y bien desarrollado que cuenta con herramientas que pueden descargar y procesar videos pornográficos, para proporcionar datos de entrenamiento para nuevos modelos.
Desde que el entrenador de LoRA más popular, Kohya-ss, ahora admite el entrenamiento de LoRA de Hunyuan, las barreras para la entrada de entrenamiento de video generativo sin límites están disminuyendo diariamente, junto con los requisitos de hardware para el entrenamiento y la generación de video de Hunyuan.
El aspecto crucial de los esquemas de entrenamiento dedicados para la pornografía de IA (en lugar de modelos de identidad, como las celebridades) es que un modelo base estándar como Hunyuan no se entrena específicamente en resultados NSFW, y puede no realizar bien cuando se le pide generar contenido NSFW, o fallar en disociar conceptos y asociaciones aprendidos de una manera convincente.
Al desarrollar modelos base y LoRAs de NSFW afinados, será cada vez más posible proyectar identidades entrenadas en un dominio de video ‘porno’ dedicado; después de todo, esto es solo la versión de video de algo que ya ha sucedido para imágenes estáticas en los últimos dos años y medio.
VFX
El gran aumento en la consistencia temporal que ofrecen las LoRAs de video de Hunyuan es una ventaja obvia para la industria de efectos visuales de IA, que se basa mucho en la adaptación de software de código abierto.
Aunque una LoRA de video de Hunyuan genera un cuadro completo y un entorno, las empresas de VFX han comenzado casi con certeza a experimentar con la isolación de las caras humanas temporalmente consistentes que se pueden obtener mediante este método, para superponer o integrar caras en metraje de fuente real.
Al igual que la comunidad de aficionados, las empresas de VFX deben esperar a que se lance la funcionalidad de imagen a video y video a video de Hunyuan, que es potencialmente el puente más útil entre el contenido de ‘deepfake’ basado en LoRA e ID; o improvisar y usar el intervalo para sondear las capacidades externas del marco y de las adaptaciones potenciales, e incluso bifurcaciones de Hunyuan Video.
Aunque los términos de la licencia para Hunyuan Video técnicamente permiten la representación de individuos reales siempre que se dé el permiso, prohíben su uso en la UE, el Reino Unido y Corea del Sur. En el principio de ‘lo que sucede en Las Vegas, se queda en Las Vegas’, esto no necesariamente significa que Hunyuan Video no se utilizará en estas regiones; sin embargo, la perspectiva de auditorías de datos externas para hacer cumplir las regulaciones en crecimiento sobre la IA generativa podría hacer que este uso ilícito sea arriesgado.
Otra área potencialmente ambigua de los términos de la licencia establece:
‘Si, en la fecha de lanzamiento de la versión de Tencent Hunyuan, los usuarios activos mensuales de todos los productos o servicios puestos a disposición por o para el Licenciatario son más de 100 millones de usuarios activos mensuales en el mes calendario anterior, debe solicitar una licencia a Tencent, que Tencent puede otorgar a su sola discreción, y no está autorizado a ejercer ninguno de los derechos bajo este Acuerdo a menos que o hasta que Tencent otorgue expresamente dichos derechos.’
Esta cláusula está claramente dirigida a la multitud de empresas que probablemente ‘intermediarán’ Hunyuan Video para un cuerpo relativamente iletrado de usuarios, y que se les requerirá que incluyan a Tencent en la acción, por encima de un techo de usuarios.
Si la redacción amplia también podría cubrir el uso indirecto (es decir, a través de la provisión de salida de efectos visuales de Hunyuan en películas y programas de televisión populares) puede necesitar aclaración.
Conclusión
Dado que los deepfakes de video han existido durante mucho tiempo, sería fácil subestimar la importancia de la LoRA de video de Hunyuan como un enfoque para la síntesis de identidad y el deepfaking; y asumir que los desarrollos que actualmente se manifiestan en la comunidad Civit y en los Discords y subreddits relacionados representan solo un pequeño impulso hacia la síntesis de video de humanos verdaderamente controlable.
Más probable es que los esfuerzos actuales representen solo una fracción del potencial de Hunyuan Video para crear deepfakes de cuerpo completo y entorno completamente convincentes; una vez que se lance el componente de imagen a video (que se rumorea que ocurrirá este mes), un nivel de generación mucho más granular estará disponible para las comunidades de aficionados y profesionales.
Cuando Stability.ai lanzó Stable Diffusion en 2022, muchos observadores no podían determinar por qué la empresa simplemente regalaría lo que era, en ese momento, un sistema generativo tan valioso y poderoso. Con Hunyuan Video, el motivo de lucro está incorporado directamente en la licencia – aunque puede resultar difícil para Tencent determinar cuándo una empresa activa el esquema de participación en las ganancias.
En cualquier caso, el resultado es el mismo que en 2022: las comunidades de desarrollo dedicadas se han formado de inmediato y con fervor intenso alrededor del lanzamiento. Algunos de los caminos que estos esfuerzos tomarán en los próximos 12 meses seguramente generarán nuevos titulares.
* Hasta 136 para el momento de la publicación.
Publicado por primera vez el martes 7 de enero de 2025












