Ángulo de Anderson
HunyuanCustom Trae Videos de Deepfakes de Imagen Única, Con Audio y Sincronización Labial

Este artículo discute un nuevo lanzamiento de un modelo de mundo de video multimodal Hunyuan llamado ‘HunyuanCustom’. La amplitud de cobertura del nuevo artículo, combinada con varios problemas en muchos de los ejemplos de video proporcionados en la página del proyecto*, nos limita a una cobertura más general de lo habitual, y a una reproducción limitada de la gran cantidad de material de video que acompaña a este lanzamiento (ya que muchos de los videos requieren una importante reedición y procesamiento para mejorar la legibilidad del diseño).
Además, tenga en cuenta que el artículo se refiere al sistema generativo basado en API llamado Kling como ‘Keling’. Para claridad, me refiero a ‘Kling’ en todo momento.
Tencent está en el proceso de lanzar una nueva versión de su modelo de video Hunyuan, titulado HunyuanCustom. El nuevo lanzamiento es aparentemente capaz de hacer que los modelos LoRA de Hunyuan sean redundantes, al permitir al usuario crear personalizaciones de video de estilo ‘deepfake’ a través de una única imagen:
Haz clic para reproducir. Prompt: ‘Un hombre está escuchando música y cocinando fideos de caracol en la cocina’. El nuevo método se compara con métodos de código abierto y cerrado, incluyendo Kling, que es un oponente significativo en este espacio. Fuente: https://hunyuancustom.github.io/ (advertencia: sitio web intensivo en CPU/memoria!)
En la columna más a la izquierda del video anterior, vemos la imagen de origen única suministrada a HunyuanCustom, seguida de la interpretación del sistema de la prompt en la segunda columna, junto a ella. Las columnas restantes muestran los resultados de varios sistemas propietarios y de código abierto: Kling; Vidu; Pika; Hailuo; y el Wan-basado SkyReels-A2.
En el video a continuación, vemos renderizados de tres escenarios esenciales para este lanzamiento: respectivamente, persona + objeto; emulación de personaje único; y prueba virtual (persona + ropa):
Haz clic para reproducir. Tres ejemplos editados del material en el sitio de apoyo para Hunyuan Video.
Podemos notar algunas cosas en estos ejemplos, la mayoría relacionadas con el sistema que se basa en una imagen de origen única, en lugar de múltiples imágenes del mismo sujeto.
En el primer clip, el hombre es esencialmente estático frente a la cámara. Inclina la cabeza hacia abajo y hacia los lados en no más de 20-25 grados de rotación, pero, en una inclinación en exceso de eso, el sistema realmente tendría que empezar a adivinar cómo se ve en perfil. Esto es difícil, probablemente imposible de medir con precisión a partir de una sola imagen frontal.
En el segundo ejemplo, vemos que la niña pequeña sonríe en el video renderizado como lo hace en la imagen estática de origen. Nuevamente, con esta sola imagen como referencia, HunyuanCustom tendría que hacer una suposición relativamente informada sobre cómo se ve su ‘rostro en reposo’. Además, su rostro no se desvía de la postura frente a la cámara por más de lo que lo hace el ejemplo anterior (‘hombre comiendo patatas fritas’).
En el último ejemplo, vemos que como el material de origen – la mujer y la ropa que se le pide que use – no son imágenes completas, el renderizado ha recortado el escenario para que quepa – lo que en realidad es una buena solución a un problema de datos!
El punto es que aunque el nuevo sistema puede manejar múltiples imágenes (como persona + patatas fritas, o persona + ropa), no aparentemente permite múltiples ángulos o vistas alternativas de un personaje único, para que se puedan acomodar expresiones diversas o ángulos inusuales. En este sentido, el sistema puede tener dificultades para reemplazar el creciente ecosistema de modelos LoRA que han surgido alrededor de HunyuanVideo desde su lanzamiento en diciembre, ya que estos pueden ayudar a HunyuanVideo a producir personajes coherentes desde cualquier ángulo y con cualquier expresión facial representada en el conjunto de datos de entrenamiento (20-60 imágenes es típico).
Conectado al Sonido
Para el audio, HunyuanCustom aprovecha el sistema LatentSync (notoriamente difícil para los aficionados configurarlo y obtener buenos resultados) para obtener movimientos de labios que coinciden con el audio y el texto que el usuario suministra:
Características de audio. Haz clic para reproducir. Varios ejemplos de sincronización de labios del sitio complementario de HunyuanCustom, editados juntos.
En el momento de escribir, no hay ejemplos en inglés, pero estos parecen ser bastante buenos – aún más si el método de crearlos es fácilmente instalable y accesible.
Edición de Video Existente
El nuevo sistema ofrece lo que parecen ser resultados muy impresionantes para la edición de video a video (V2V, o Vid2Vid), donde un segmento de un video existente (real) se mascara y se reemplaza inteligentemente por un sujeto dado en una imagen de referencia única. A continuación se muestra un ejemplo del sitio de materiales complementarios:
Haz clic para reproducir. Solo el objeto central es objetivo, pero lo que queda alrededor también se altera en un pase de vid2vid de HunyuanCustom.
Como podemos ver, y como es estándar en un escenario de vid2vid, el video completo se altera en cierta medida por el proceso, aunque la mayoría se altera en la región objetivo, es decir, el juguete de peluche. Presumiblemente, se podrían desarrollar pipelines para crear tales transformaciones bajo un enfoque de garbage matte que deje la mayoría del contenido del video idéntico al original. Esto es lo que hace Adobe Firefly bajo la capucha, y lo hace bastante bien – pero es un proceso poco estudiado en la escena generativa de código abierto.
Dicho esto, la mayoría de los ejemplos alternativos proporcionados hacen un mejor trabajo de dirigir estas integraciones, como podemos ver en la compilación ensamblada a continuación:
Haz clic para reproducir. Diversos ejemplos de contenido interjectado utilizando vid2vid en HunyuanCustom, exhibiendo un notable respeto por el material no objetivo.
¿Un Nuevo Comienzo?
Esta iniciativa es un desarrollo del proyecto de video Hunyuan, no un giro brusco lejos de ese flujo de desarrollo. Las mejoras del proyecto se introducen como inserciones arquitectónicas discretas en lugar de cambios estructurales significativos, con el objetivo de permitir que el modelo mantenga la fidelidad de identidad a través de los fotogramas sin depender de ajustes finos específicos del sujeto ajustes finos, como con los enfoques LoRA o de inversión textual.
Para ser claro, por lo tanto, HunyuanCustom no se entrena desde cero, sino que es un ajuste fino del modelo de video Hunyuan de diciembre de 2024.
Aquellos que han desarrollado LoRAs de HunyuanVideo pueden preguntarse si seguirán funcionando con esta nueva edición, o si tendrán que reinventar la rueda LoRA nuevamente si desean más capacidades de personalización que las incorporadas en este nuevo lanzamiento.
En general, un lanzamiento de un modelo de hipercala ajustado finamente altera los pesos del modelo lo suficiente como para que los LoRAs creados para el modelo anterior no funcionen correctamente, o en absoluto, con el modelo refinado.
A veces, sin embargo, la popularidad de un ajuste fino puede desafiar sus orígenes: un ejemplo de un ajuste fino que se convierte en un fork efectivo, con un ecosistema y seguidores dedicados, es el ajuste de Pony Diffusion del Stable Diffusion XL (SDXL). Pony actualmente tiene 592,000+ descargas en el dominio de CivitAI, con una amplia gama de LoRAs que han utilizado Pony (y no SDXL) como modelo base, y que requieren Pony en el momento de inferencia.
Lanzamiento
La página del proyecto para el nuevo artículo (que se titula HunyuanCustom: Una arquitectura impulsada por multimodal para la generación de video personalizado) presenta enlaces a un sitio de GitHub que, en el momento de escribir, acaba de ser funcional, y parece contener todo el código y los pesos necesarios para la implementación local, junto con una propuesta de cronograma (donde lo único importante que aún está por venir es la integración de ComfyUI).
En el momento de escribir, la presencia del proyecto en Hugging Face es aún un 404. Sin embargo, hay una versión basada en API del sistema, donde aparentemente se puede demostrar el sistema, siempre y cuando se pueda proporcionar un código de escaneo de WeChat.
Rara vez he visto un uso tan elaborado y extenso de una variedad tan amplia de proyectos en una sola asamblea, como es evidente en HunyuanCustom – y presumiblemente algunas de las licencias obligarían de todos modos a un lanzamiento completo.
Se anuncian dos modelos en la página de GitHub: una versión de 720px1280px que requiere 8 GB de memoria de pico de GPU, y una versión de 512px896px que requiere 60 GB de memoria de pico de GPU.
El repositorio establece ‘La memoria de GPU mínima requerida es de 24 GB para 720px1280px129f, pero es muy lento… Recomendamos usar una GPU con 80 GB de memoria para una mejor calidad de generación’ – e itera que el sistema solo se ha probado hasta ahora en Linux.
El modelo anterior de video Hunyuan ha sido cuantizado hacia tamaños donde se puede ejecutar con menos de 24 GB de VRAM, y parece razonable asumir que el nuevo modelo también se adaptará a formas más amigables para el consumidor por parte de la comunidad, y que se adaptará rápidamente para su uso en sistemas Windows también.
Debido a limitaciones de tiempo y a la cantidad abrumadora de información que acompaña a este lanzamiento, solo podemos echar un vistazo más amplio, en lugar de uno en profundidad, a este lanzamiento. Sin embargo, veamos un poco bajo el capó de HunyuanCustom.
Un Vistazo al Artículo
La tubería de datos para HunyuanCustom, aparentemente compatible con el marco de GDPR, incorpora tanto conjuntos de datos de video sintetizados como de código abierto, incluyendo OpenHumanVid, con ocho categorías básicas representadas: humanos, animales, plantas, paisajes, vehículos, objetos, arquitectura, y anime.

Del artículo de lanzamiento, una visión general de los paquetes diversos que contribuyen a la construcción de datos de HunyuanCustom. Fuente: https://arxiv.org/pdf/2505.04512
La filtración inicial comienza con PySceneDetect, que segmenta los videos en clips de un solo tiro. TextBPN-Plus-Plus se utiliza luego para eliminar videos que contienen texto en pantalla excesivo, subtítulos, marcas de agua o logotipos.
Para abordar las inconsistencias en resolución y duración, los clips se estandarizan a cinco segundos de duración y se redimensionan a 512 o 720 píxeles en el lado corto. La filtración estética se maneja utilizando Koala-36M, con un umbral personalizado de 0,06 aplicado para el conjunto de datos personalizado curado por los investigadores del nuevo artículo.
El proceso de extracción del sujeto combina el modelo de lenguaje grande Qwen7B (LLM), el marco de reconocimiento de objetos YOLO11X y la popular arquitectura InsightFace, para identificar y validar identidades humanas.
Para sujetos no humanos, QwenVL y Grounded SAM 2 se utilizan para extraer cajas delimitadoras relevantes, que se descartan si son demasiado pequeñas.

Ejemplos de segmentación semántica con Grounded SAM 2, utilizados en el proyecto Hunyuan Control. Fuente: https://github.com/IDEA-Research/Grounded-SAM-2
La extracción de múltiples sujetos utiliza Florence2 para la anotación de cajas delimitadoras, y Grounded SAM 2 para la segmentación, seguido de clustering y segmentación temporal de los fotogramas de entrenamiento.
Los clips procesados se mejoran aún más a través de la anotación, utilizando un sistema de etiquetado estructurado propietario desarrollado por el equipo de Hunyuan, y que proporciona metadatos en capas como descripciones y pistas de movimiento de cámara.
Las estrategias de aumento de máscara se aplicaron durante el entrenamiento para reducir sobreajuste y asegurar que el modelo se adapte a diversas formas de objetos.
Los datos de audio se sincronizaron utilizando el mencionado LatentSync, y los clips se descartaron si las puntuaciones de sincronización caen por debajo de un umbral mínimo.
El marco de evaluación de la calidad de la imagen ciega HyperIQA se utilizó para excluir videos que obtuvieron una puntuación inferior a 40 (en la escala personalizada de HyperIQA). Las pistas de audio válidas se procesaron luego con Whisper para extraer características para tareas posteriores.
Los autores incorporan el modelo de asistente de lenguaje LLaVA durante la fase de anotación, y enfatizan la posición central que este marco tiene en HunyuanCustom. LLaVA se utiliza para generar subtítulos de imagen y ayudar a alinear el contenido visual con las prompts de texto, apoyando la construcción de una señal de entrenamiento coherente a través de modalidades:

El marco de HunyuanCustom admite la generación de video coherente con la identidad condicionada en texto, imagen, audio y entradas de video.
Al aprovechar las capacidades de alineación de visión-lenguaje de LLaVA, la tubería gana una capa adicional de coherencia semántica entre los elementos visuales y sus descripciones textuales – especialmente valiosa en escenarios de múltiples sujetos o escenas complejas.
Video Personalizado
Para permitir la generación de video basada en una imagen de referencia y una prompt, se crearon dos módulos centrados en LLaVA, primero adaptando la estructura de entrada de HunyuanVideo para que pudiera aceptar una imagen junto con texto.
Esto implicó formatear la prompt de una manera que incruste la imagen directamente o la etiquete con una descripción de identidad breve. Se utilizó un token de separador para evitar que la incrustación de la imagen abrumara el contenido de la prompt.
Dado que el codificador visual de LLaVA tiende a comprimir o descartar detalles espaciales finos durante el alineamiento de características de imagen y texto (particularmente cuando se traduce una sola imagen de referencia en una incrustación semántica general), se incorporó un módulo de mejora de identidad. Dado que casi todos los modelos de difusión de video latente tienen dificultades para mantener una identidad sin un LoRA, incluso en un clip de cinco segundos, el rendimiento de este módulo en las pruebas de la comunidad puede resultar significativo.
En cualquier caso, la imagen de referencia se redimensiona y se codifica utilizando el 3D-VAE causal del modelo de video Hunyuan original, y su latente se inserta en el latente de video a lo largo del eje temporal, con un desplazamiento espacial aplicado para evitar que la imagen se reproduzca directamente en la salida, mientras aún guía la generación.
El modelo se entrenó utilizando Flow Matching, con muestras de ruido extraídas de una distribución logit-normal – y la red se entrenó para recuperar el video correcto a partir de estos latentes ruidosos. LLaVA y el generador de video se ajustaron finamente juntos para que la imagen y la prompt puedan guiar la salida de manera más fluida y mantener la identidad del sujeto coherente.
Para prompts de múltiples sujetos, cada par de imagen-texto se incrustó por separado y se le asignó una posición temporal distinta, lo que permitió distinguir identidades y apoyar la generación de escenas que involucran múltiples sujetos interactuantes.
Sonido y Visión
HunyuanCustom condiciona la generación de audio/habla utilizando tanto el audio de entrada del usuario como una prompt de texto, lo que permite a los personajes hablar dentro de escenas que reflejan el entorno descrito.
Para apoyar esto, un módulo de AudioNet con desacoplamiento de identidad introduce características de audio sin perturbar las señales de identidad incrustadas desde la imagen de referencia y la prompt. Estas características se alinean con la línea de tiempo de video comprimida, se dividen en segmentos de nivel de fotograma y se inyectan utilizando un mecanismo de atención cruzada espacial que mantiene aislado cada fotograma, preservando la coherencia del sujeto y evitando interferencia temporal.
Un segundo módulo de inyección temporal proporciona un control más fino sobre el tiempo y el movimiento, trabajando en conjunto con AudioNet, asignando características de audio a regiones específicas de la secuencia latente y utilizando un Perceptrón Multicapa (MLP) para convertirlos en desplazamientos de movimiento tokenizados. Esto permite que los gestos y los movimientos faciales sigan el ritmo y el énfasis de la entrada de habla con mayor precisión.
HunyuanCustom permite que los sujetos en videos existentes se editen directamente, reemplazando o insertando personas u objetos en una escena sin necesidad de reconstruir todo el clip desde cero. Esto lo hace útil para tareas que involucran alterar la apariencia o el movimiento de una manera dirigida.
Haz clic para reproducir. Un ejemplo adicional del sitio complementario.
Para facilitar la sustitución eficiente de sujetos en videos existentes, el nuevo sistema evita el enfoque intensivo en recursos de los métodos recientes como el actualmente popular VACE, o aquellos que fusionan secuencias de video completas, favoreciendo en su lugar la compresión de un video de referencia utilizando el 3D-VAE causal preentrenado – alineándolo con los latentes de video internos de la tubería de generación, y luego sumándolos. Esto mantiene el proceso relativamente ligero, mientras aún permite que el contenido de video externo guíe la salida.
Una pequeña red neuronal maneja el alineamiento entre el video de entrada limpio y los latentes ruidosos utilizados en la generación. El sistema prueba dos formas de inyectar esta información: fusionando los dos conjuntos de características antes de comprimirlas nuevamente; y sumando las características fotograma a fotograma. El segundo método funciona mejor, según encontraron los autores, y evita la pérdida de calidad mientras mantiene la carga computacional sin cambios.
Datos y Pruebas
En las pruebas, las métricas utilizadas fueron: el módulo de coherencia de identidad en ArcFace, que extrae incrustaciones faciales de la imagen de referencia y de cada fotograma del video generado, y luego calcula la similitud coseno promedio entre ellos; similitud de sujeto, a través del envío de segmentos de YOLO11x a Dino 2 para comparación; CLIP-B, alineación de texto- video, que mide la similitud entre la prompt y el video generado; CLIP-B nuevamente, para calcular la similitud entre cada fotograma y tanto sus fotogramas vecinos como el primer fotograma, así como la coherencia temporal; y grado dinámico, según lo definido por VBench.
Como se indicó anteriormente, los competidores de código cerrado de referencia fueron Hailuo; Vidu 2.0; Kling (1.6); y Pika. Los marcos de código abierto competidores fueron VACE y SkyReels-A2.

Evaluación del rendimiento del modelo comparando HunyuanCustom con los principales métodos de personalización de video en ID de coherencia (Face-Sim), similitud de sujeto (DINO-Sim), alineación de texto- video (CLIP-B-T), coherencia temporal (Temp-Consis), e intensidad de movimiento (DD). Los resultados óptimos y subóptimos se muestran en negrita y subrayados, respectivamente.
De estos resultados, los autores afirman:
‘Nuestro [HunyuanCustom] logra la mejor coherencia de ID y coherencia de sujeto. También logra resultados comparables en el seguimiento de la prompt y la coherencia temporal. [Hailuo] tiene la mejor puntuación de clip porque puede seguir instrucciones de texto bien con solo coherencia de ID, sacrificando la coherencia de sujetos no humanos (la peor DINO-Sim). En términos de grado dinámico, [Vidu] y [VACE] se desempeñan mal, lo que puede deberse al tamaño pequeño del modelo.’
Aunque el sitio del proyecto está saturado de videos de comparación (el diseño de los cuales parece haber sido diseñado para la estética del sitio web en lugar de una comparación fácil), no cuenta actualmente con un video equivalente a los resultados estáticos apiñados en el PDF, en cuanto a las pruebas cualitativas iniciales. Aunque lo incluyo aquí, animo al lector a examinar de cerca los videos en el sitio del proyecto, ya que dan una mejor impresión de los resultados:

De la comparación en el artículo sobre personalización de video centrada en objetos. Aunque el espectador debería (como siempre) referirse al PDF de origen para una mejor resolución, los videos en el sitio del proyecto podrían ser un recurso más iluminador en este caso.
Los autores comentan aquí:
‘Se puede ver que [Vidu], [Skyreels A2] y nuestro método logran resultados relativamente buenos en la alineación de la prompt y la coherencia del sujeto, pero nuestra calidad de video es mejor que la de Vidu y Skyreels, gracias al buen rendimiento de generación de video de nuestro modelo base, es decir, [Hunyuanvideo-13B].
‘Entre los productos comerciales, aunque [Kling] tiene una buena calidad de video, el primer fotograma del video tiene un problema de copia-pegado, y a veces el sujeto se mueve demasiado rápido y se desenfoca, lo que lleva a una mala experiencia de visualización.’
Los autores comentan además que Pika se desempeña mal en términos de coherencia temporal, introduciendo artefactos de subtítulos (efectos de una mala curación de datos, donde los elementos de texto en los clips de video se han permitido contaminar los conceptos centrales).
Hailuo mantiene la identidad facial, afirman, pero no logra preservar la coherencia corporal completa. Entre los métodos de código abierto, VACE, los investigadores afirman, es incapaz de mantener la coherencia de identidad, mientras que sostienen que HunyuanCustom produce videos con una fuerte preservación de la identidad, manteniendo al mismo tiempo la calidad y la diversidad.
A continuación, se realizaron pruebas para personalización de video de múltiples sujetos, contra los mismos contendientes. Al igual que en el ejemplo anterior, los resultados planos del PDF no son equivalentes de impresión de los videos disponibles en el sitio del proyecto, pero son únicos entre los resultados presentados:

Comparaciones utilizando personalizaciones de video de múltiples sujetos. Por favor, consulte el PDF para más detalles y resolución.
El artículo establece:
‘[Pika] puede generar los sujetos especificados pero exhibe inestabilidad en los fotogramas de video, con instancias de un hombre que desaparece en un escenario y una mujer que no logra abrir una puerta según lo indicado. [Vidu] y [VACE] capturan parcialmente la identidad humana pero pierden detalles significativos de objetos no humanos, lo que indica una limitación en la representación de sujetos no humanos.
‘[SkyReels A2] experimenta una inestabilidad de fotogramas severa, con cambios notables en chips y numerosos artefactos en el escenario correcto.
‘En contraste, nuestro HunyuanCustom captura efectivamente tanto identidades humanas como no humanas, genera videos que se adhieren a las prompts dadas y mantiene una alta calidad visual y estabilidad.’
Una prueba adicional fue ‘publicidad de humanos virtuales’, donde los marcos se encargaron de integrar un producto con una persona:

De la ronda de pruebas cualitativas, ejemplos de ‘colocación de productos’ neural. Por favor, consulte el PDF para más detalles y resolución.
Para esta ronda, los autores afirman:
‘Los resultados demuestran que HunyuanCustom mantiene efectivamente la identidad del humano mientras preserva los detalles del producto objetivo, incluido el texto en él.
‘Además, la interacción entre el humano y el producto parece natural, y el video se adhiere estrechamente a la prompt dada, destacando el gran potencial de HunyuanCustom en la generación de videos publicitarios.’
Un área donde los resultados de video habrían sido muy útiles fue la ronda cualitativa para la personalización de sujeto impulsada por audio, donde el personaje habla el audio correspondiente de una escena y postura descrita en el texto.

Resultados parciales dados para la ronda de audio – aunque los resultados de video habrían sido preferibles en este caso. Solo se reproduce la mitad superior de la figura del PDF, ya que es grande y difícil de acomodar en este artículo. Por favor, consulte el PDF de origen para más detalles y resolución.
Los autores afirman:
‘Los métodos de animación humana impulsados por audio anteriores ingresan una imagen humana y un audio, donde la postura, el atuendo y el entorno del humano permanecen consistentes con la imagen dada y no pueden generar videos en otros gestos y entornos, lo que puede restringir su aplicación.
‘…[Nuestro] HunyuanCustom permite la personalización humana impulsada por audio, donde el personaje habla el audio correspondiente en una escena y postura descrita en el texto, lo que permite una animación humana más flexible y controlable.’
Pruebas adicionales (por favor, consulte el PDF para todos los detalles) incluyeron una ronda que enfrentó al nuevo sistema contra VACE y Kling 1.6 para la sustitución de sujetos en video:

Pruebas de sustitución de sujetos en modo de video a video. Por favor, consulte el PDF de origen para más detalles y resolución.
De estas, las últimas pruebas presentadas en el nuevo artículo, los investigadores opinan:
‘VACE sufre de artefactos de límite debido a la adhesión estricta a las máscaras de entrada, lo que resulta en formas de sujeto poco naturales y continuidad de movimiento interrumpida. [Kling], en cambio, exhibe un efecto de copia-pegado, donde los sujetos se superponen directamente al video, lo que lleva a una mala integración con el fondo.
‘En comparación, HunyuanCustom evita efectivamente los artefactos de límite, logra una integración perfecta con el fondo del video y mantiene una fuerte preservación de la identidad – demostrando su rendimiento superior en tareas de edición de video.’
Conclusión
Este es un lanzamiento fascinante, no menos porque aborda algo que la escena de aficionados cada vez más insatisfechos ha estado quejándose más últimamente – la falta de sincronización labial, para que el realismo aumentado capaz en sistemas como Hunyuan Video y Wan 2.1 pueda dársele una nueva dimensión de autenticidad.
Aunque el diseño de casi todos los ejemplos de video comparativos en el sitio del proyecto hace que sea bastante difícil comparar las capacidades de HunyuanCustom con las de los contendientes anteriores, debe tenerse en cuenta que muy pocos proyectos en el espacio de síntesis de video tienen el coraje de enfrentarse en pruebas contra Kling, la API de difusión de video comercial que siempre está cerca o en la cima de las clasificaciones; Tencent parece haber hecho avances contra este titular en una manera bastante impresionante.
* El problema es que algunos de los videos son tan anchos, cortos y de alta resolución que no se reproducen en reproductores de video estándar como VLC o Windows Media Player, mostrando pantallas negras.
Publicado por primera vez el jueves 8 de mayo de 2025












