Modele i platformy AI
Vidu udostępnia podgląd Q4 najnowszego flagowego modelu AI wideo

ShengShu Technology wprowadziła Vidu Q4 Preview 7 października 2026 r., pierwszą publiczną wersję podglądową swojego najnowszego flagowego modelu do ekspresyjnego dźwięku i wideo. Cena początkowa wynosi 0,014 $ za sekundę, a podgląd jest dostępny poprzez internetowy produkt i platformę API Vidu.
Model obsługuje do 15 odwołań do obrazów oraz do trzech odwołań do dźwięku, a wyjście dostępne jest w rozdzielczości 2K lub 4K oraz przy głębi koloru 10 bitów. Firma podała, że podgląd jest skierowany do niezależnych twórców, małych studiów oraz zespołów produkcyjnych zajmujących się zarówno narracją, jak i pracą komercyjną.
Wydajność postaci, praca kamery i efekty wizualne
ShengShu Technology oświadczyła, że Q4 Preview został zaprojektowany tak, aby lepiej koordynować mimikę twarzy, emocje, ruchy ciała i głos, co daje subtelniejsze wyrazy, jaśniejsze odczyty emocjonalne i bardziej naturalny ruch. Do trzech klipów dźwiękowych referencyjnych może pomóc utrzymać spójność głosu postaci i emocjonalne dopasowanie wypowiedzi, natomiast do 15 obrazów referencyjnych może określić postacie, garderobę, rekwizyty, produkty i otoczenia w ramach jednego kreatywnego zestawu. Firma podkreśliła, że te kontrolki mają na celu utrzymanie wyborów wizualnych i wokalnych razem w całej scenie oraz zapewnienie projektom narracyjnym bardziej precyzyjnej kontroli nad scenografią i występem.
W komunikacie opisano ściślejszą koordynację ruchów kamery, cięć i akcji na ekranie: w szybkich sekwencjach, takich jak walki i pościgi, kamera została zaprojektowana tak, aby płynniej podążać za akcją, a efekty takie jak wybuchy, fajerwerki i cząsteczki lepiej wkomponowują się w otoczenie. Tryby 2K i 4K pojawiają się wraz z lepszym oświetleniem i ogólną estetyką, a szerszy zakres rozdzielczości służy zarówno wczesnym testom kreatywnym, jak i ostatecznemu wyjściu w wysokiej rozdzielczości.
“Zaawansowane modele wideo powinny udowodnić swoją wartość poza starannie wybranymi demonstracjami. Każda poprawa efektywności powinna ostatecznie dawać twórcom wolność do wypróbowania jeszcze jednego ujęcia lub stworzenia jeszcze jednej wersji,” powiedział Yihang Luo, współzałożyciel i CEO ShengShu Technology, w ogłoszeniu o uruchomieniu.
Cennik i przeznaczenie
Opcje wyjściowe obejmują 540p, 720p, 1080p, 2K i 4K. ShengShu Technology poinformowała, że gdy specyfikacje wyjścia i warunki rozliczeniowe są porównywalne, Q4 Preview zapewnia do pięciokrotnie większą wydajność przy tym samym budżecie. Firma powiązała cenę z realiami iteracji: uzyskanie gotowego do produkcji ujęcia zazwyczaj wymaga więcej niż jednego podejścia, niezależnie od tego, czy chodzi o dostosowanie wyrazu postaci, ocenę alternatywnych kątów kamery czy eksperymentowanie z różnymi otwarciami. Jako przykłady zastosowań wymieniono zespoły reklamowe oceniające koncepcje kreatywne i sekwencje otwierające, zespoły e‑commerce tworzące warianty dla różnych produktów i odbiorców oraz filmowców testujących występy, storyboardy i tempo przed dalszym zaangażowaniem w produkcję.
W komunikacie zauważono, że ostateczne ceny, obsługiwane rozdzielczości, dostępność funkcji i warunki użytkowania mogą różnić się w zależności od planu i regionu, a pełne szczegóły cenowe oraz warunki promocyjne są publikowane na stronie internetowej Vidu.
Tryby produktu i specyfikacje API
Na oficjalnej strony produktu Vidu wymieniono tryby Image-to-Video i Reference-to-Video dla Q4: Image-to-Video animuje pojedynczy przesłany obraz na podstawie podpowiedzi tekstowej, natomiast Reference-to-Video łączy od jednego do 15 odwołań do obrazów z zerem do trzech odwołań do dźwięku, aby utrzymać spójność podmiotów i głosów. Na stronie produktu Reference-to-Video podano jako długość od 1 do 16 sekund, a Image-to-Video od 3 do 16 sekund; wyróżnione cechy to maksymalna rozdzielczość 4K oraz maksymalna długość wideo 16 sekund. Wyjście zachowuje pierwotny współczynnik proporcji przesłanego materiału, a strona wymienia serie AI, reklamę, treści społecznościowe i produkcję filmową jako scenariusze, dla których model został zaprojektowany.
Dla programistów, dokumentacja image-to-video wymienia model pod nazwą viduq4-preview pod adresem POST https://api.vidu.com/ent/v2/img2video. Punkt końcowy przyjmuje pojedynczy obraz startowy w formacie png, jpeg, jpg lub webp o wielkości do 50 MB, podpowiedź do 20 000 znaków, długości od 3 do 16 sekund z domyślną wartością 5 oraz rozdzielczości od 540p do 4K z domyślną 720p. Parametr audio domyślnie ustawiony jest na true, co generuje wideo z dźwiękiem, który może zawierać dialogi i efekty dźwiękowe, a dokumentacja stwierdza, że model obsługuje synchronizację audio-wideo oraz automatyczne przełączanie kamery.
Na dokumentacji reference-to-video wymieniono POST https://api.vidu.com/ent/v2/reference2video, który przyjmuje od jednego do 15 obrazów oraz od zera do trzech odwołań do plików mp3 o długości od 3 do 12 sekund każdy, z opcjami proporcji obrazu 1:1, 9:16, 16:9, 3:4 i 4:3 oraz domyślną wartością 16:9. Podpowiedzi mogą zawierać tagi dla referencyjnych podmiotów, a dokumentacja stwierdza, że model obsługuje generowanie wideo z dźwiękiem referencyjnym, inteligentne przełączanie kamery, spójność przy wielu pozycjach kamery oraz jednoczesne wyjście audio i wideo. Zwrócone adresy URL tworzeń pozostają ważne przez 24 godziny.
Vidu udostępnia podgląd Q4 przed pełnym modelem Q4, aby twórcy mogli zastosować go w rzeczywistych projektach, a ShengShu Technology oświadczyła, że opinie na temat wydajności, kontroli twórczej i codziennych potrzeb produkcyjnych wpłyną na ostateczną wersję.












