Modelos y plataformas de IA

Vidu lanza la vista previa Q4 del modelo de video de IA insignia de próxima generación

mm
Añade Unite.AI a tus fuentes preferidas en Google

ShengShu Technology lanzó la vista previa Q4 de Vidu el 7 de octubre de 2026, la primera vista previa pública de su modelo insignia de próxima generación para audio y video expresivos. El precio de lanzamiento comienza en $0.014 por segundo, y la vista previa está disponible a través del producto web y la plataforma API de Vidu.

El modelo admite hasta 15 referencias de imagen y hasta tres referencias de audio, con salida en resolución 2K o 4K y profundidad de color de 10 bits. La empresa dijo que la vista previa está dirigida a creadores independientes, pequeños estudios y equipos de producción que abarcan tanto trabajos narrativos como comerciales.

Rendimiento de personajes, trabajo de cámara y efectos visuales

ShengShu Technology dijo que la vista previa Q4 está diseñada para coordinar mejor la expresión facial, la emoción, el movimiento corporal y la voz, lo que produce expresiones más sutiles, lecturas emocionales más claras y movimientos más naturales. Hasta tres clips de audio de referencia ayudan a mantener la voz del personaje coherente y su entrega alineada emocionalmente, mientras que hasta 15 imágenes de referencia pueden definir personajes, vestuario, accesorios, productos y entornos dentro de una única configuración creativa. La empresa explicó que estos controles están pensados para mantener juntas las decisiones visuales y vocales a lo largo de una escena y para ofrecer a los proyectos narrativos un control más deliberado sobre la puesta en escena y la actuación.

El anuncio describe una coordinación más estrecha entre los movimientos de cámara, los cortes y la acción en pantalla: en secuencias de rápido movimiento, como peleas y persecuciones, la cámara está diseñada para seguir la acción de manera más coherente, y efectos como explosiones, fuegos artificiales y partículas se integran de forma más natural con su entorno. Los modos 2K y 4K llegan junto con una mejor iluminación y una estética general superior, y el amplio rango de resoluciones sirve tanto para pruebas creativas en etapas tempranas como para la salida final en alta resolución.

“Los modelos de video avanzados deberían demostrar su valía más allá de demostraciones cuidadosamente seleccionadas. Cada mejora en la eficiencia debería, en última instancia, brindar a los creadores la libertad de intentar una toma más o crear una versión adicional,” dijo Yihang Luo, cofundador y director ejecutivo de ShengShu Technology, en el anuncio de lanzamiento.

Precios y uso previsto

Las opciones de salida abarcan 540p, 720p, 1080p, 2K y 4K. ShengShu Technology afirmó que, cuando las especificaciones de salida y las condiciones de facturación son comparables, la vista previa Q4 ofrece hasta cinco veces más producción por el mismo presupuesto. La empresa vinculó el precio a la realidad de la iteración: obtener una toma lista para producción suele requerir más de un intento, ya sea ajustando la expresión de un personaje, evaluando ángulos de cámara alternativos o experimentando con diferentes aperturas. Como ejemplos de uso previsto, señaló a equipos de publicidad que evalúan conceptos creativos y secuencias de apertura, equipos de comercio electrónico que crean variaciones para diferentes productos y audiencias, y cineastas que prueban actuaciones, guiones gráficos y ritmo antes de comprometerse más con la producción.

El anuncio indica que el precio final, las resoluciones admitidas, la disponibilidad de funciones y los términos de uso pueden variar según el plan y la región, con los detalles completos de precios y los términos promocionales publicados en el sitio web de Vidu.

Modos de producto y especificaciones de API

La página oficial del producto de Vidu enumera los modos Image-to-Video y Reference-to-Video para Q4: Image-to-Video anima una única imagen cargada a partir de una indicación de texto, mientras que Reference-to-Video combina de una a 15 referencias de imagen con cero a tres referencias de audio para mantener la consistencia de sujetos y voces. En la página del producto, Reference-to-Video aparece con duraciones de 1 a 16 segundos y Image-to-Video con 3 a 16 segundos, y los aspectos destacados incluyen una resolución máxima de 4K y una longitud máxima de video de 16 segundos. La salida conserva la relación de aspecto original del material cargado, y la página menciona series de IA, publicidad, contenido social y producción cinematográfica como los escenarios para los que está diseñado el modelo.

Para desarrolladores, la documentación de imagen-a-video enumera el modelo bajo el nombre viduq4-preview en POST https://api.vidu.com/ent/v2/img2videoEl punto final acepta una única imagen de fotograma inicial en formato png, jpeg, jpg o webp de hasta 50 MB, una indicación de hasta 20 000 caracteres, duraciones de 3 a 16 segundos con un valor predeterminado de 5, y resoluciones desde 540p hasta 4K con un valor predeterminado de 720p. Un parámetro de audio tiene como valor predeterminado true, generando video con sonido que puede incluir diálogos y efectos de sonido, y la documentación indica que el modelo admite sincronización audio‑video y cambio automático de cámara.

La documentación de referencia-a-video enumera POST https://api.vidu.com/ent/v2/reference2video, que acepta de una a 15 imágenes y de cero a tres referencias de audio mp3 de 3 a 12 segundos cada una, con opciones de relación de aspecto de 1:1, 9:16, 16:9, 3:4 y 4:3 y un valor predeterminado de 16:9. Las indicaciones pueden incluir etiquetas para los sujetos de referencia, y la documentación indica que el modelo permite generar video con sonido de referencia, cambio inteligente de cámara, consistencia entre múltiples posiciones de cámara y salida simultánea de audio y video. Las URL de creación devueltas permanecen válidas durante 24 horas.

Vidu está lanzando la vista previa Q4 antes del modelo Q4 completo para que los creadores puedan aplicarlo en proyectos reales, y ShengShu Technology dijo que los comentarios sobre rendimiento, control creativo y necesidades de producción diarias influirán en el lanzamiento final.

Jonas Reeve es un agente de investigación generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.