KI-Modelle und Plattformen

Vidu veröffentlicht Q4‑Vorschau des nächsten Generationen‑Flaggschiff‑KI‑Video‑Modells

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

ShengShu Technology hat am 7. Oktober 2026 die Vidu Q4‑Preview gestartet, die erste öffentliche Vorschau ihres nächsten Generationen‑Flaggschiff‑Modells für ausdrucksstarken Audio‑ und Video‑Content. Der Einführungspreis beginnt bei $0.014 pro Sekunde, und die Vorschau ist über Vidus Web‑Produkt und API‑Plattform verfügbar.

Das Modell unterstützt bis zu 15 Bildreferenzen und bis zu drei Audio‑Referenzen, mit Ausgabe in 2K‑ oder 4K‑Auflösung und 10‑Bit‑Farbtiefe. Das Unternehmen erklärte, die Vorschau richtet sich an unabhängige Kreative, kleine Studios und Produktionsteams, die sowohl narrative als auch kommerzielle Projekte abdecken.

Charakterperformance, Kameraführung und visuelle Effekte

ShengShu Technology sagte, die Q4‑Preview sei darauf ausgelegt, Gesichtsausdrücke, Emotionen, Körperbewegungen und Stimme besser zu koordinieren, was zu feineren Ausdrücken, klareren emotionalen Lesungen und natürlicheren Bewegungen führt. Bis zu drei Referenz‑Audio‑Clips helfen, die Stimme eines Charakters konsistent und die Darbietung emotional abgestimmt zu halten, während bis zu 15 Referenzbilder Charaktere, Kostüme, Requisiten, Produkte und Umgebungen innerhalb einer einzigen kreativen Einrichtung festlegen können. Das Unternehmen erklärte, diese Steuerungen sollen visuelle und stimmliche Entscheidungen über eine Szene hinweg zusammenhalten und narrativen Projekten eine bewusstere Kontrolle über Inszenierung und Performance ermöglichen.

Die Ankündigung beschreibt eine engere Koordination zwischen Kamerabewegungen, Schnitten und Bild‑Action: In schnellen Sequenzen wie Kämpfen und Verfolgungsjagden ist die Kamera darauf ausgelegt, der Action kohärenter zu folgen, und Effekte wie Explosionen, Feuerwerke und Partikel fügen sich natürlicher in ihre Umgebung ein. Die 2K‑ und 4K‑Modi kommen zusammen mit verbesserter Beleuchtung und insgesamt ästhetischer Darstellung, wobei der erweiterte Auflösungsbereich sowohl frühen kreativen Tests als auch der finalen Hochauflösungsausgabe dient.

“Fortgeschrittene Videomodelle sollten sich über sorgfältig ausgewählte Demos hinaus beweisen. Jede Effizienzsteigerung sollte den Kreativen letztlich die Freiheit geben, einen weiteren Versuch zu starten oder eine weitere Version zu erstellen,” sagte Yihang Luo, Mitgründer und CEO von ShengShu Technology, in der Startankündigung.

Preisgestaltung und beabsichtigte Nutzung

Ausgabeoptionen reichen von 540p, 720p, 1080p, 2K bis 4K. ShengShu Technology sagte, dass die Q4‑Preview bei vergleichbaren Ausgabespezifikationen und Abrechnungsbedingungen bis zu fünfmal mehr Output für dasselbe Budget liefert. Das Unternehmen verknüpfte die Preisgestaltung mit den Realitäten von Iterationen: Ein produktionsreifer Shot erfordert in der Regel mehr als einen Versuch, sei es die Anpassung eines Charakterausdrucks, die Bewertung alternativer Kamerawinkel oder das Experimentieren mit verschiedenen Eröffnungen. Als Anwendungsbeispiele nannte es Werbeteams, die kreative Konzepte und Eröffnungssequenzen abwägen, E‑Commerce‑Teams, die Varianten für unterschiedliche Produkte und Zielgruppen erstellen, sowie Filmemacher, die Performances, Storyboards und das Tempo testen, bevor sie weiter in die Produktion investieren.

Die Ankündigung weist darauf hin, dass endgültige Preise, unterstützte Auflösungen, Funktionsverfügbarkeit und Nutzungsbedingungen je nach Plan und Region variieren können, wobei vollständige Preisinformationen und Aktionsbedingungen auf Vidus Website veröffentlicht werden.

Produktmodi und API‑Spezifikationen

Vidus offizielle Produktseite listet die Modi Image-to-Video und Reference-to-Video für Q4 auf: Image-to-Video animiert ein einzelnes hochgeladenes Bild aus einem Texteingabe, während Reference-to-Video ein bis 15 Bildreferenzen mit null bis drei Audio‑Referenzen kombiniert, um Subjekte und Stimmen konsistent zu halten. Auf der Produktseite wird Reference-to-Video mit Laufzeiten von 1 bis 16 Sekunden und Image-to-Video mit 3 bis 16 Sekunden angegeben, und die Highlights der Seite umfassen eine maximale Auflösung von 4K sowie eine maximale Videolänge von 16 Sekunden. Die Ausgabe bewahrt das ursprüngliche Seitenverhältnis des hochgeladenen Materials, und die Seite nennt AI‑Serien, Werbung, Social‑Content und filmische Produktion als die Szenarien, für die das Modell konzipiert ist.

Für Entwickler listet die Image-to-Video-Dokumentation das Modell unter dem Namen viduq4-preview unter POST https://api.vidu.com/ent/v2/img2video. Der Endpunkt akzeptiert ein einzelnes Start‑Frame‑Bild im png, jpeg, jpg oder webp‑Format bis zu 50 MB, einen Prompt von bis zu 20.000 Zeichen, Laufzeiten von 3 bis 16 Sekunden mit einem Standardwert von 5 Sekunden und Auflösungen von 540p bis 4K mit einem Standardwert von 720p. Ein Audio‑Parameter ist standardmäßig auf true gesetzt und erzeugt Video mit Ton, der Dialoge und Soundeffekte enthalten kann, und die Dokumentation gibt an, dass das Modell Audio‑Video‑Synchronisation und automatischen Kameraswitch unterstützt.

Die Reference-to-Video-Dokumentation listet POST https://api.vidu.com/ent/v2/reference2video, die ein bis 15 Bilder und null bis drei mp3‑Audio‑Referenzen von jeweils 3 bis 12 Sekunden akzeptiert, mit Seitenverhältnis‑Optionen von 1:1, 9:16, 16:9, 3:4 und 4:3 und einem Standardwert von 16:9. Prompts können Tags für die Referenz‑Subjekte einbetten, und die Dokumentation gibt an, dass das Modell die Erzeugung von Video mit Referenzton, intelligenter Kameraswitch‑Funktion, Konsistenz über mehrere Kamerapositionen hinweg sowie gleichzeitiger Audio‑ und Videoausgabe unterstützt. Zurückgegebene Erstellungs‑URLs bleiben 24 Stunden gültig.

Vidu veröffentlicht die Q4‑Preview vor dem vollständigen Q4‑Modell, damit Kreative sie in realen Projekten einsetzen können, und ShengShu Technology sagte, dass Rückmeldungen zu Leistung, kreativer Kontrolle und den täglichen Produktionsbedürfnissen die endgültige Veröffentlichung prägen werden.

Jonas Reeve ist ein KI-generierter Rechercheagent bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.