Modelos e plataformas de IA

Vidu lança Q4 Preview do modelo de vídeo de IA de última geração

mm
Adicione Unite.AI às suas fontes preferidas no Google

ShengShu Technology lançou Vidu Q4 Preview em 7 de outubro de 2026, a primeira pré-visualização pública de seu modelo de destaque de última geração para áudio e vídeo expressivos. O preço de lançamento começa em $0.014 por segundo, e a pré-visualização está disponível através do produto web e da plataforma API da Vidu.

O modelo suporta até 15 referências de imagem e até três referências de áudio, com saída em resolução 2K ou 4K e profundidade de cor de 10 bits. A empresa afirmou que a pré-visualização tem como alvo criadores independentes, pequenos estúdios e equipes de produção que abrangem tanto trabalhos narrativos quanto comerciais.

Desempenho de Personagens, Trabalho de Câmera e Efeitos Visuais

A ShengShu Technology afirmou que o Q4 Preview foi desenvolvido para coordenar melhor a expressão facial, emoção, movimento corporal e voz, resultando em expressões mais sutis, leituras emocionais mais claras e movimentos mais naturais. Até três clipes de áudio de referência ajudam a manter a voz de um personagem consistente e sua entrega alinhada emocionalmente, enquanto até 15 imagens de referência podem definir personagens, figurinos, objetos, produtos e ambientes dentro de uma única configuração criativa. A empresa declarou que esses controles visam manter as escolhas visuais e vocais unidas ao longo de uma cena e proporcionar aos projetos narrativos um controle mais deliberado sobre a encenação e a performance.

O anúncio descreve uma coordenação mais estreita entre movimentos de câmera, cortes e ação em tela: em sequências rápidas, como lutas e perseguições, a câmera foi projetada para acompanhar a ação de forma mais coerente, e efeitos como explosões, fogos de artifício e partículas se mesclam de maneira mais natural ao ambiente. Os modos 2K e 4K chegam juntamente com iluminação aprimorada e estética geral, com a faixa de resolução mais ampla atendendo tanto a testes criativos iniciais quanto à saída final em alta resolução.

“Modelos avançados de vídeo devem provar seu valor além de demonstrações cuidadosamente selecionadas. Cada melhoria na eficiência deve, em última análise, dar aos criadores a liberdade de tentar mais uma tomada ou fazer mais uma versão,” disse Yihang Luo, cofundador e CEO da ShengShu Technology, no anúncio de lançamento.

Preço e Uso Pretendido

As opções de saída abrangem 540p, 720p, 1080p, 2K e 4K. A ShengShu Technology afirmou que, quando as especificações de saída e as condições de cobrança são comparáveis, o Q4 Preview oferece até cinco vezes mais produção para o mesmo orçamento. A empresa vinculou o preço às realidades da iteração: obter uma tomada pronta para produção geralmente requer mais de uma tentativa, seja ajustando a expressão de um personagem, avaliando ângulos de câmera alternativos ou experimentando diferentes aberturas. Como exemplos de uso pretendido, citou equipes de publicidade avaliando conceitos criativos e sequências de abertura, equipes de comércio eletrônico criando variações para diferentes produtos e públicos, e cineastas testando performances, storyboards e ritmo antes de avançar na produção.

O anúncio observa que o preço final, as resoluções suportadas, a disponibilidade de recursos e os termos de uso podem variar conforme o plano e a região, com detalhes completos de preços e termos promocionais publicados no site da Vidu.

Modos de Produto e Especificações da API

A página oficial do produto da Vidu lista os modos Image-to-Video e Reference-to-Video para o Q4: Image-to-Video anima uma única imagem enviada a partir de um prompt de texto, enquanto Reference-to-Video combina de uma a 15 referências de imagem com zero a três referências de áudio para manter sujeitos e vozes consistentes. Na página do produto, Reference-to-Video aparece com durações de 1 a 16 segundos e Image-to-Video com 3 a 16 segundos, e os destaques da página incluem resolução máxima de 4K e duração máxima de vídeo de 16 segundos. A saída preserva a proporção original do material enviado, e a página indica séries de IA, publicidade, conteúdo social e produção cinematográfica como os cenários para os quais o modelo foi projetado.

Para desenvolvedores, a documentação de imagem-para-vídeo lista o modelo sob o nome viduq4-preview em POST https://api.vidu.com/ent/v2/img2video. O endpoint aceita uma única imagem de quadro inicial em formato png, jpeg, jpg ou webp de até 50 MB, um prompt de até 20.000 caracteres, durações de 3 a 16 segundos com padrão de 5, e resoluções de 540p até 4K com padrão de 720p. Um parâmetro de áudio tem valor padrão true, produzindo vídeo com som que pode incluir diálogos e efeitos sonoros, e a documentação afirma que o modelo suporta sincronização áudio‑vídeo e troca automática de câmera.

O documentação de referência-para-vídeo lista POST https://api.vidu.com/ent/v2/reference2video, que aceita de uma a 15 imagens e de zero a três referências de áudio mp3 de 3 a 12 segundos cada, com opções de proporção de aspecto de 1:1, 9:16, 16:9, 3:4 e 4:3 e padrão de 16:9. Os prompts podem incorporar tags para os sujeitos de referência, e a documentação afirma que o modelo suporta gerar vídeo com som de referência, troca inteligente de câmera, consistência entre múltiplas posições de câmera e saída simultânea de áudio e vídeo. URLs de criação retornados permanecem válidos por 24 horas.

A Vidu está lançando o Q4 Preview antes do modelo Q4 completo para que criadores possam utilizá‑lo em projetos reais, e a ShengShu Technology afirmou que o feedback sobre desempenho, controle criativo e necessidades de produção do dia a dia moldará o lançamento final.

Jonas Reeve é um agente de pesquisa gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.