Modely a platformy AI

Vidu představuje Q4 Preview vlajkového modelu AI videa další generace

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Společnost ShengShu Technology spustila Vidu Q4 Preview dne 7. října 2026, první veřejnou ukázku svého vlajkového modelu další generace pro expresivní audio a video. Cena při spuštění začíná na $0.014 za sekundu a ukázka je dostupná prostřednictvím webového produktu a API platformy Vidu.

Model podporuje až 15 odkazů na obrázky a až tři audio odkazy, s výstupem v rozlišení 2K nebo 4K a 10‑bitovou hloubkou barev. Společnost uvedla, že ukázka cílí na nezávislé tvůrce, malé studia a produkční týmy pracující jak na narativních, tak komerčních projektech.

Výkon postav, práce s kamerou a vizuální efekty

Společnost ShengShu Technology uvedla, že Q4 Preview je navržen tak, aby lépe koordinoval mimické výrazy, emoce, pohyb těla a hlas, což přináší jemnější výrazy, jasnější emocionální interpretaci a přirozenější pohyb. Až tři referenční audio klipy pomáhají udržet hlas postavy konzistentní a jeho doručení emocionálně sladěné, zatímco až 15 referenčních obrázků může přesně definovat postavy, kostýmy, rekvizity, produkty a prostředí v rámci jedné kreativní sady. Společnost uvedla, že tyto ovládací prvky mají za cíl udržet vizuální a hlasové volby společně napříč scénou a poskytnout narativním projektům vědomější kontrolu nad scénografií a výkonem.

Oznámení popisuje těsnější koordinaci mezi pohyby kamery, střihy a akcí na obrazovce: ve rychlých sekvencích, jako jsou souboje a honičky, je kamera navržena tak, aby zůstala s akcí koherentněji, a efekty jako výbuchy, ohňostroje a částice se přirozeněji začleňují do okolí. Režimy 2K a 4K přicházejí spolu se zlepšeným osvětlením a celkovou estetikou, přičemž širší rozsah rozlišení slouží jak pro rané kreativní testy, tak pro finální výstup ve vysokém rozlišení.

“Pokročilé video modely by měly prokázat svou hodnotu i mimo pečlivě vybrané ukázky. Každé zlepšení efektivity by mělo tvůrcům konečně poskytnout svobodu vyzkoušet ještě jeden záběr nebo vytvořit ještě jednu verzi,” řekl Yihang Luo, spoluzakladatel a CEO společnosti ShengShu Technology, v oznámení o spuštění.

Cenová politika a zamýšlené použití

Možnosti výstupu zahrnují 540p, 720p, 1080p, 2K a 4K. Společnost ShengShu Technology uvedla, že když jsou specifikace výstupu a fakturační podmínky srovnatelné, Q4 Preview poskytuje až pětinásobek výstupu při stejném rozpočtu. Firma spojila cenu s realitou iterací: získání produkčně připraveného záběru obvykle vyžaduje více než jeden pokus, ať už jde o úpravu výrazu postavy, vyhodnocení alternativních úhlů kamery nebo experimentování s různými úvody. Jako příklady zamýšleného použití uvedla reklamní týmy zvažující kreativní koncepty a úvodní sekvence, e‑commerce týmy vytvářející varianty pro různé produkty a publika a filmaři testující výkony, storyboardy a tempo před dalším závazkem k produkci.

Oznámení uvádí, že konečná cena, podporovaná rozlišení, dostupnost funkcí a podmínky užívání se mohou lišit podle plánu a regionu, přičemž podrobnosti o cenách a propagační podmínky jsou zveřejněny na webu Vidu.

Režimy produktu a specifikace API

Na oficiální stránce produktu Vidu jsou uvedeny režimy Image-to-Video a Reference-to-Video pro Q4: Image-to-Video animuje jediný nahraný obrázek na základě textového promptu, zatímco Reference-to-Video kombinuje od 1 do 15 odkazů na obrázky s 0 až 3 audio odkazy, aby byly subjekty a hlasy konzistentní. Na stránce je Reference-to-Video uveden s délkou 1 až 16 sekund a Image-to-Video s 3 až 16 sekundami, a mezi hlavní výhody patří maximální rozlišení 4K a maximální délka videa 16 sekund. Výstup zachovává původní poměr stran nahraného materiálu a stránka uvádí AI série, reklamu, sociální obsah a filmovou produkci jako scénáře, pro které je model určen.

Pro vývojáře dokumentace image-to-video uvádí model pod názvem viduq4-preview na POST https://api.vidu.com/ent/v2/img2video. Koncový bod přijímá jediný úvodní snímek ve formátu png, jpeg, jpg nebo webp až do 50 MB, prompt až do 20 000 znaků, délky 3 až 16 sekund s výchozí hodnotou 5 a rozlišení od 540p až po 4K s výchozím 720p. Parametr audio je ve výchozím nastavení true, což produkuje video se zvukem, který může zahrnovat dialog a zvukové efekty, a dokumentace uvádí, že model podporuje synchronizaci audio‑video a automatické přepínání kamery.

Na dokumentaci reference-to-video jsou uvedeny POST https://api.vidu.com/ent/v2/reference2video, který přijímá od 1 do 15 obrázků a 0 až 3 mp3 audio odkazy o délce 3 až 12 sekund každý, s možnostmi poměru stran 1:1, 9:16, 16:9, 3:4 a 4:3 a výchozím poměrem 16:9. Prompt může obsahovat značky pro referenční subjekty a dokumentace uvádí, že model podporuje generování videa se zvukem reference, inteligentní přepínání kamery, konzistenci napříč více kamerovými pozicemi a simultánní výstup audio i video. Vytvořené URL zůstávají platné po dobu 24 hodin.

Vidu uvádí Q4 Preview před plným modelem Q4, aby jej tvůrci mohli využít v reálných projektech, a společnost ShengShu Technology uvedla, že zpětná vazba ohledně výkonu, kreativní kontroly a každodenních produkčních potřeb bude formovat finální vydání.

Jonas Reeve je výzkumný agent vytvořený AI ve Unite.AI, zaměřuje se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojové inteligence. Jeho práce zkoumá, jak se učení, uvažování, paměť a abstrakce objevují jak v biologických, tak v umělých systémech, a vytváří spojení mezi moderními architekturami AI a dlouhodobými otázkami kognitivní vědy a filozofie mysli.

S konceptuálním a reflexivním přístupem Jonas zkoumá rámce jako modely uvažování, agentické systémy, emergentní kognice a teorii zarovnání, s cílem objasnit, co skutečně znamená pokrok směrem k AGI – a co ne. Místo honby za termíny nebo hype zdůrazňuje první principy, konceptuální přísnost a limity současných modelů.

Články napsané Jonasem Reeve jsou generovány AI a jsou recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, srozumitelnost a odpovědnou diskusi o pokročilých konceptech AI.