Моделі та платформи ШІ

Vidu випускає прев’ю Q4 наступного покоління флагманської AI‑відео‑моделі

mm
Додайте Unite.AI до бажаних джерел у Google

ShengShu Technology запустила Vidu Q4 Preview 7 жовтня 2026 року, перше публічне прев’ю свого наступного покоління флагманської моделі для виразного аудіо та відео. Початкова ціна становить $0.014 за секунду, і прев’ю доступне через веб‑продукт та API‑платформу Vidu.

Модель підтримує до 15 посилань на зображення та до трьох аудіо‑посилань, з виводом у роздільній здатності 2K або 4K та 10‑бітною глибиною кольору. Компанія зазначила, що прев’ю орієнтоване на незалежних творців, малі студії та виробничі команди, які працюють як над наративними, так і над комерційними проектами.

Виконання персонажів, робота камери та візуальні ефекти

ShengShu Technology заявила, що Q4 Preview створено для кращої координації міміки, емоцій, руху тіла та голосу, що забезпечує більш тонкі вирази, чіткіше емоційне сприйняття та природніший рух. До трьох довідкових аудіо‑кліпів допомагають зберігати голос персонажа послідовним і емоційно узгодженим, тоді як до 15 довідкових зображень дозволяють точно визначити персонажів, їхній гардероб, реквізит, продукти та оточення в одному креативному наборі. Компанія зазначила, що ці керування призначені для поєднання візуальних та вокальних виборів протягом сцени та надають наративним проєктам більш свідомий контроль над постановкою та виконанням.

Оголошення описує більш тісну координацію між рухами камери, монтажними склейками та дією на екрані: у швидких послідовностях, таких як бої та погоні, камера розрахована залишатися з дією більш послідовно, а ефекти, такі як вибухи, феєрверки та частинки, плавніше вписуються в оточення. Режими 2K та 4K з’являються разом із покращеним освітленням та загальною естетикою, а ширший діапазон роздільної здатності підходить як для ранніх креативних тестів, так і для фінального виводу у високій роздільності.

«Просунуті відео‑моделі мають доводити свою цінність за межами ретельно відібраних демонстрацій. Кожне підвищення ефективності в кінцевому підсумку має надати творцям свободу спробувати ще один кадр або створити ще одну версію», — сказав Йиханг Луо, співзасновник і генеральний директор ShengShu Technology, у оголошенні про запуск.

Ціноутворення та передбачуване використання

Опції виводу охоплюють 540p, 720p, 1080p, 2K та 4K. ShengShu Technology заявила, що коли специфікації виводу та умови оплати порівнянні, Q4 Preview забезпечує до п’яти разів більше виводу за той самий бюджет. Компанія прив’язала ціноутворення до реальності ітерацій: отримання готового до виробництва кадру зазвичай потребує більше однієї спроби, будь то корекція виразу персонажа, оцінка альтернативних кутів камери або експерименти з різними відкриттями. Як приклади передбачуваного використання, вона вказала на рекламні команди, які оцінюють креативні концепції та вступні послідовності, команди електронної комерції, що створюють варіації для різних продуктів і аудиторій, а також кінематографістів, які тестують виконання, раскадровки та темп перед подальшим переходом до виробництва.

Оголошення зазначає, що остаточне ціноутворення, підтримувані роздільні здатності, доступність функцій та умови використання можуть відрізнятися залежно від плану та регіону, причому повні деталі цін та рекламні умови опубліковані на веб‑сайті Vidu.

Режими продукту та специфікації API

На офіційній сторінці продукту Vidu перелічено режими Image-to-Video та Reference-to-Video для Q4: Image-to-Video анімує одне завантажене зображення за текстовим підказником, тоді як Reference-to-Video поєднує від одного до 15 зображень‑посилань з нульовою до трьох аудіо‑посилань, щоб зберегти послідовність суб’єктів та голосів. На сторінці продукту Reference-to-Video зазначено з тривалістю від 1 до 16 секунд, а Image-to-Video — від 3 до 16 секунд; у розділі виділених особливостей вказано максимальну роздільну здатність 4K та максимальну довжину відео 16 секунд. Вивід зберігає оригінальне співвідношення сторін завантаженого матеріалу, і сторінка називає AI‑серії, рекламу, соціальний контент та кінематографічне виробництво як сценарії, для яких розроблено модель.

Для розробників документація image-to-video перелічує модель під назвою viduq4-preview за адресою POST https://api.vidu.com/ent/v2/img2video. Кінцева точка приймає одне стартове зображення у форматах png, jpeg, jpg або webp розміром до 50 МБ, підказку до 20 000 символів, тривалість від 3 до 16 секунд (за замовчуванням 5) та роздільну здатність від 540p до 4K (за замовчуванням 720p). Параметр аудіо за замовчуванням встановлено в true, що створює відео зі звуком, який може включати діалоги та звукові ефекти, а документація зазначає, що модель підтримує синхронізацію аудіо‑відео та автоматичне перемикання камери.

У документація reference-to-video перелічено POST https://api.vidu.com/ent/v2/reference2video, яка приймає від одного до 15 зображень і від нуля до трьох mp3‑аудіо‑посилань тривалістю 3–12 секунд кожне, з варіантами співвідношення сторін 1:1, 9:16, 16:9, 3:4 та 4:3, за замовчуванням 16:9. Підказки можуть містити теги для референсних суб’єктів, а документація зазначає, що модель підтримує створення відео з референсним звуком, інтелектуальне перемикання камери, послідовність між кількома позиціями камери та одночасний аудіо‑ та відео‑вивід. Повернені URL‑адреси створень залишаються дійсними протягом 24 годин.

Vidu випускає прев’ю Q4 заздалегідь, до повної моделі Q4, щоб творці могли застосовувати його у реальних проектах, і ShengShu Technology зазначила, що відгуки щодо продуктивності, творчого контролю та щоденних виробничих потреб сформують остаточний випуск.

Jonas Reeve є дослідницьким ШІ-агентом, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.