Модели и платформы ИИ
Vidu выпускает предварительный просмотр Q4 нового поколения флагманского AI‑видеомоделя

ShengShu Technology запустила Vidu Q4 Preview 7 октября 2026 года, первый публичный предварительный просмотр её нового флагманского модели для выразительного аудио и видео. Стоимость запуска начинается от $0.014 за секунду, а предварительный просмотр доступен через веб‑продукт и API‑платформу Vidu.
Модель поддерживает до 15 ссылок на изображения и до трёх аудиоссылок, выводя видео в разрешении 2K или 4K и 10‑битной глубине цвета. Компания заявила, что предварительный просмотр ориентирован на независимых создателей, небольшие студии и производственные команды, работающие как над повествовательными, так и над коммерческими проектами.
Производительность персонажей, работа камеры и визуальные эффекты
ShengShu Technology заявила, что Q4 Preview создана для лучшей координации мимики, эмоций, движений тела и голоса, обеспечивая более тонкие выражения, более чёткое восприятие эмоций и более естественное движение. До трёх референсных аудиоклипов помогают сохранять голос персонажа постоянным и эмоционально согласованным, тогда как до 15 референсных изображений позволяют зафиксировать персонажей, их одежду, реквизит, продукты и окружение в единой креативной настройке. Компания отметила, что эти элементы управления предназначены для объединения визуальных и звуковых решений в пределах сцены и предоставляют повествовательным проектам более осознанный контроль над постановкой и выступлением.
В объявлении описывается более тесная координация движений камеры, нарезок и действий на экране: в быстрых сценах, таких как боевые схватки и погоня, камера спроектирована так, чтобы более согласованно следовать за действием, а эффекты, такие как взрывы, фейерверки и частицы, естественнее вписываются в окружение. Режимы 2K и 4K появляются вместе с улучшенным освещением и общей эстетикой, а более широкий диапазон разрешений обслуживает как ранние креативные тесты, так и финальный вывод в высоком разрешении.
“Продвинутые видеомодели должны доказывать свою ценность за пределами тщательно отобранных демонстраций. Каждое улучшение эффективности в конечном итоге должно давать создателям возможность попробовать ещё один дубль или создать ещё одну версию,” сказал Ииханг Луо, соучредитель и генеральный директор ShengShu Technology, в анонсе запуска.
Ценообразование и предполагаемое использование
Опции вывода охватывают 540p, 720p, 1080p, 2K и 4K. ShengShu Technology заявила, что при сопоставимых спецификациях вывода и условиях оплаты Q4 Preview обеспечивает до пяти раз больший объём при том же бюджете. Компания привязала ценообразование к реальности итераций: получение готового к производству кадра обычно требует более одной попытки, будь то корректировка выражения персонажа, оценка альтернативных ракурсов камеры или эксперименты с различными открывающими сценами. В качестве примеров предполагаемого использования она указала рекламные команды, оценивающие креативные концепции и открывающие последовательности, команды e‑commerce, создающие варианты для разных продуктов и аудиторий, а также кинематографистов, тестирующих выступления, раскадровки и темп повествования перед дальнейшим переходом к производству.
В объявлении отмечается, что окончательная цена, поддерживаемые разрешения, доступность функций и условия использования могут различаться в зависимости от плана и региона, а полные детали ценообразования и рекламные условия опубликованы на веб‑сайте Vidu.
Режимы продукта и спецификации API
На официальной странице продукта Vidu перечислены режимы Image-to-Video и Reference-to-Video для Q4: Image-to-Video анимирует единственное загруженное изображение по текстовому запросу, тогда как Reference-to-Video сочетает от одного до 15 изображений‑референсов с нулём‑тремя аудиореференсами, чтобы поддерживать согласованность субъектов и голосов. На странице режим Reference-to-Video указан с длительностью от 1 до 16 секунд, а Image-to-Video — от 3 до 16 секунд; среди основных особенностей указаны максимальное разрешение 4K и максимальная длительность видео 16 секунд. Вывод сохраняет исходное соотношение сторон загруженного материала, а страница перечисляет серии AI, рекламу, социальный контент и кинематографическое производство как сценарии, для которых разработана модель.
Для разработчиков документация по image-to-video перечисляет модель под именем viduq4-preview по адресу POST https://api.vidu.com/ent/v2/img2video. Конечная точка принимает единственное стартовое изображение в формате png, jpeg, jpg или webp размером до 50 МБ, запрос длиной до 20 000 символов, длительность от 3 до 16 секунд со значением по умолчанию 5 и разрешения от 540p до 4K со значением по умолчанию 720p. Параметр аудио по умолчанию установлен в true, создавая видео со звуком, который может включать диалоги и звуковые эффекты, а документация указывает, что модель поддерживает синхронизацию аудио‑видео и автоматическую смену камеры.
В документация по reference-to-video перечислены POST https://api.vidu.com/ent/v2/reference2video, которые принимают от одного до 15 изображений и от нуля до трёх mp3‑аудиореференсов длительностью от 3 до 12 секунд каждый, с вариантами соотношения сторон 1:1, 9:16, 16:9, 3:4 и 4:3, по умолчанию 16:9. Промпты могут включать теги для референсных субъектов, и документация указывает, что модель поддерживает генерацию видео с референсным звуком, интеллектуальную смену камеры, согласованность при нескольких позициях камеры и одновременный вывод аудио и видео. Сгенерированные URL‑адреса остаются действительными в течение 24 часов.
Vidu выпускает предварительный просмотр Q4 до полной модели Q4, чтобы создатели могли применять её в реальных проектах, и ShengShu Technology заявила, что отзывы о производительности, творительном контроле и ежедневных потребностях производства сформируют окончательный релиз.












