Modelos e plataformas de IA
Vidu lança Q4 Preview do modelo de vídeo de IA de última geração

ShengShu Technology lançou Vidu Q4 Preview em 7 de outubro de 2026, a primeira pré-visualização pública de seu modelo de destaque de última geração para áudio e vídeo expressivos. O preço de lançamento começa em $0.014 por segundo, e a pré-visualização está disponível através do produto web e da plataforma API da Vidu.
O modelo suporta até 15 referências de imagem e até três referências de áudio, com saída em resolução 2K ou 4K e profundidade de cor de 10 bits. A empresa afirmou que a pré-visualização tem como alvo criadores independentes, pequenos estúdios e equipes de produção que abrangem tanto trabalhos narrativos quanto comerciais.
Desempenho de Personagens, Trabalho de Câmera e Efeitos Visuais
A ShengShu Technology afirmou que o Q4 Preview foi desenvolvido para coordenar melhor a expressão facial, emoção, movimento corporal e voz, resultando em expressões mais sutis, leituras emocionais mais claras e movimentos mais naturais. Até três clipes de áudio de referência ajudam a manter a voz de um personagem consistente e sua entrega alinhada emocionalmente, enquanto até 15 imagens de referência podem definir personagens, figurinos, objetos, produtos e ambientes dentro de uma única configuração criativa. A empresa declarou que esses controles visam manter as escolhas visuais e vocais unidas ao longo de uma cena e proporcionar aos projetos narrativos um controle mais deliberado sobre a encenação e a performance.
O anúncio descreve uma coordenação mais estreita entre movimentos de câmera, cortes e ação em tela: em sequências rápidas, como lutas e perseguições, a câmera foi projetada para acompanhar a ação de forma mais coerente, e efeitos como explosões, fogos de artifício e partículas se mesclam de maneira mais natural ao ambiente. Os modos 2K e 4K chegam juntamente com iluminação aprimorada e estética geral, com a faixa de resolução mais ampla atendendo tanto a testes criativos iniciais quanto à saída final em alta resolução.
“Modelos avançados de vídeo devem provar seu valor além de demonstrações cuidadosamente selecionadas. Cada melhoria na eficiência deve, em última análise, dar aos criadores a liberdade de tentar mais uma tomada ou fazer mais uma versão,” disse Yihang Luo, cofundador e CEO da ShengShu Technology, no anúncio de lançamento.
Preço e Uso Pretendido
As opções de saída abrangem 540p, 720p, 1080p, 2K e 4K. A ShengShu Technology afirmou que, quando as especificações de saída e as condições de cobrança são comparáveis, o Q4 Preview oferece até cinco vezes mais produção para o mesmo orçamento. A empresa vinculou o preço às realidades da iteração: obter uma tomada pronta para produção geralmente requer mais de uma tentativa, seja ajustando a expressão de um personagem, avaliando ângulos de câmera alternativos ou experimentando diferentes aberturas. Como exemplos de uso pretendido, citou equipes de publicidade avaliando conceitos criativos e sequências de abertura, equipes de comércio eletrônico criando variações para diferentes produtos e públicos, e cineastas testando performances, storyboards e ritmo antes de avançar na produção.
O anúncio observa que o preço final, as resoluções suportadas, a disponibilidade de recursos e os termos de uso podem variar conforme o plano e a região, com detalhes completos de preços e termos promocionais publicados no site da Vidu.
Modos de Produto e Especificações da API
A página oficial do produto da Vidu lista os modos Image-to-Video e Reference-to-Video para o Q4: Image-to-Video anima uma única imagem enviada a partir de um prompt de texto, enquanto Reference-to-Video combina de uma a 15 referências de imagem com zero a três referências de áudio para manter sujeitos e vozes consistentes. Na página do produto, Reference-to-Video aparece com durações de 1 a 16 segundos e Image-to-Video com 3 a 16 segundos, e os destaques da página incluem resolução máxima de 4K e duração máxima de vídeo de 16 segundos. A saída preserva a proporção original do material enviado, e a página indica séries de IA, publicidade, conteúdo social e produção cinematográfica como os cenários para os quais o modelo foi projetado.
Para desenvolvedores, a documentação de imagem-para-vídeo lista o modelo sob o nome viduq4-preview em POST https://api.vidu.com/ent/v2/img2video. O endpoint aceita uma única imagem de quadro inicial em formato png, jpeg, jpg ou webp de até 50 MB, um prompt de até 20.000 caracteres, durações de 3 a 16 segundos com padrão de 5, e resoluções de 540p até 4K com padrão de 720p. Um parâmetro de áudio tem valor padrão true, produzindo vídeo com som que pode incluir diálogos e efeitos sonoros, e a documentação afirma que o modelo suporta sincronização áudio‑vídeo e troca automática de câmera.
O documentação de referência-para-vídeo lista POST https://api.vidu.com/ent/v2/reference2video, que aceita de uma a 15 imagens e de zero a três referências de áudio mp3 de 3 a 12 segundos cada, com opções de proporção de aspecto de 1:1, 9:16, 16:9, 3:4 e 4:3 e padrão de 16:9. Os prompts podem incorporar tags para os sujeitos de referência, e a documentação afirma que o modelo suporta gerar vídeo com som de referência, troca inteligente de câmera, consistência entre múltiplas posições de câmera e saída simultânea de áudio e vídeo. URLs de criação retornados permanecem válidos por 24 horas.
A Vidu está lançando o Q4 Preview antes do modelo Q4 completo para que criadores possam utilizá‑lo em projetos reais, e a ShengShu Technology afirmou que o feedback sobre desempenho, controle criativo e necessidades de produção do dia a dia moldará o lançamento final.












