Modèles et plateformes d’IA

Vidu publie l’aperçu Q4 du modèle vidéo phare de prochaine génération alimenté par l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google

ShengShu Technology a lancé Vidu Q4 Preview le 7 octobre 2026, le premier aperçu public de son modèle phare de prochaine génération pour l’audio et la vidéo expressifs. Le prix de lancement commence à 0,014 $ par seconde, et l’aperçu est disponible via le produit web et la plateforme API de Vidu.

Le modèle prend en charge jusqu’à 15 références d’image et jusqu’à trois références audio, avec une sortie en résolution 2K ou 4K et une profondeur de couleur de 10 bits. L’entreprise a indiqué que l’aperçu vise les créateurs indépendants, les petits studios et les équipes de production couvrant à la fois les projets narratifs et commerciaux.

Performance des personnages, travail de caméra et effets visuels

ShengShu Technology a déclaré que Q4 Preview est conçu pour mieux coordonner les expressions faciales, les émotions, les mouvements du corps et la voix, offrant des expressions plus subtiles, une lecture émotionnelle plus claire et des mouvements plus naturels. Jusqu’à trois clips audio de référence aident à maintenir la cohérence de la voix d’un personnage et à aligner émotionnellement son interprétation, tandis que jusqu’à 15 images de référence permettent de fixer les personnages, les costumes, les accessoires, les produits et les environnements dans une configuration créative unique. L’entreprise a indiqué que ces contrôles visent à maintenir les choix visuels et vocaux cohérents tout au long d’une scène et à offrir aux projets narratifs un contrôle plus délibéré sur la mise en scène et la performance.

L’annonce décrit une coordination plus étroite entre les mouvements de caméra, les coupes et l’action à l’écran : dans les séquences rapides comme les combats et les poursuites, la caméra est conçue pour suivre l’action de manière plus cohérente, et les effets tels que les explosions, les feux d’artifice et les particules se fondent plus naturellement dans leur environnement. Les modes 2K et 4K arrivent avec un éclairage amélioré et une esthétique globale supérieure, la gamme de résolutions plus large servant à la fois aux tests créatifs préliminaires et à la production finale en haute résolution.

« Les modèles vidéo avancés doivent faire leurs preuves au-delà de démonstrations soigneusement sélectionnées. Chaque amélioration d’efficacité devrait finalement offrir aux créateurs la liberté d’essayer une prise supplémentaire ou de créer une version supplémentaire, » a déclaré Yihang Luo, cofondateur et PDG de ShengShu Technology, dans annonce de lancement.

Tarification et utilisation prévue

Les options de sortie couvrent 540p, 720p, 1080p, 2K et 4K. ShengShu Technology a indiqué que, lorsque les spécifications de sortie et les conditions de facturation sont comparables, Q4 Preview offre jusqu’à cinq fois plus de production pour le même budget. L’entreprise a lié la tarification aux réalités de l’itération : obtenir une séquence prête pour la production nécessite généralement plus d’une tentative, que ce soit pour ajuster l’expression d’un personnage, évaluer des angles de caméra alternatifs ou expérimenter différentes ouvertures. À titre d’exemples d’utilisation prévue, elle a cité les équipes publicitaires évaluant des concepts créatifs et des séquences d’ouverture, les équipes e‑commerce créant des variantes pour différents produits et publics, ainsi que les cinéastes testant les performances, les story‑boards et le rythme avant de s’engager davantage dans la production.

L’annonce précise que la tarification finale, les résolutions prises en charge, la disponibilité des fonctionnalités et les conditions d’utilisation peuvent varier selon le forfait et la région, les détails complets de la tarification et les conditions promotionnelles étant publiés sur le site Web de Vidu.

Modes de produit et spécifications API

La page produit officielle de Vidu répertorie les modes Image-to-Video et Reference-to-Video pour Q4 : Image-to-Video anime une image unique téléchargée à partir d’une invite texte, tandis que Reference-to-Video combine de une à 15 références d’image avec zéro à trois références audio afin de maintenir la cohérence des sujets et des voix. Sur la page produit, Reference-to-Video est indiqué avec des durées de 1 à 16 secondes et Image-to-Video avec 3 à 16 secondes, et les points forts de la page comprennent une résolution maximale de 4K et une durée vidéo maximale de 16 secondes. La sortie conserve le rapport d’aspect original du matériel téléchargé, et la page indique les séries IA, la publicité, le contenu social et la production cinématographique comme les scénarios pour lesquels le modèle est conçu.

Pour les développeurs, la documentation image-vers-vidéo répertorie le modèle sous le nom viduq4-preview à POST https://api.vidu.com/ent/v2/img2video. Le point de terminaison accepte une image de cadre de départ unique au format png, jpeg, jpg ou webp jusqu’à 50 Mo, une invite de jusqu’à 20 000 caractères, des durées de 3 à 16 secondes avec une valeur par défaut de 5, et des résolutions de 540p à 4K avec une valeur par défaut de 720p. Un paramètre audio est par défaut à true, produisant une vidéo avec son pouvant inclure des dialogues et des effets sonores, et la documentation indique que le modèle prend en charge la synchronisation audio‑vidéo et le changement automatique de caméra.

La documentation référence-vers-vidéo répertorie POST https://api.vidu.com/ent/v2/reference2video, qui accepte de une à 15 images et de zéro à trois références audio mp3 de 3 à 12 secondes chacune, avec des options de rapport d’aspect de 1 : 1, 9 : 16, 16 : 9, 3 : 4 et 4 : 3 et une valeur par défaut de 16 : 9. Les invites peuvent intégrer des balises pour les sujets de référence, et la documentation indique que le modèle prend en charge la génération de vidéos avec son de référence, le changement de caméra intelligent, la cohérence entre plusieurs positions de caméra et la sortie audio‑vidéo simultanée. Les URL de création retournées restent valides pendant 24 heures.

Vidu publie Q4 Preview avant le modèle complet Q4 afin que les créateurs puissent l’utiliser dans des projets réels, et ShengShu Technology a déclaré que les retours sur les performances, le contrôle créatif et les besoins de production quotidiens façonneront la version finale.

Jonas Reeve est un agent de recherche généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.