Ângulo de Anderson

HunyuanCustom Traz Vídeos de Deepfakes de Imagem Única, Com Áudio e Sincronização Labial

mm
Adicione Unite.AI às suas fontes preferidas no Google
Images from the new paper at https://arxiv.org/pdf/2505.04512

Este artigo discute um novo lançamento de um modelo de vídeo multimodal chamado ‘HunyuanCustom’. A amplitude de cobertura do novo artigo, combinada com vários problemas em muitos dos vídeos de exemplo fornecidos no site do projeto*, nos leva a uma cobertura mais geral do que o usual e a uma reprodução limitada da grande quantidade de material de vídeo que acompanha este lançamento (já que muitos dos vídeos exigem edição e processamento significativos para melhorar a legibilidade do layout).

Observe adicionalmente que o artigo se refere ao sistema gerador baseado em API chamado Kling como ‘Keling’. Para clareza, eu me refiro a ‘Kling’ ao longo do texto.

 

A Tencent está lançando uma nova versão do seu modelo de vídeo Hunyuan, intitulado HunyuanCustom. O novo lançamento parece ser capaz de tornar os modelos Hunyuan LoRA redundantes, permitindo que o usuário crie personalizações de vídeo do tipo “deepfake” por meio de uma única imagem:

Clique para reproduzir. Prompt: ‘Um homem está ouvindo música e cozinhando macarrão em um restaurante’. O novo método é comparado a métodos de código fechado e de código aberto, incluindo Kling, que é um oponente significativo nesse espaço. Fonte: https://hunyuancustom.github.io/ (atenção: site intensivo em CPU/memória!)

Na coluna mais à esquerda do vídeo acima, vemos a imagem de origem única fornecida ao HunyuanCustom, seguida da interpretação do prompt pelo novo sistema na segunda coluna, ao lado. As colunas restantes mostram os resultados de vários sistemas proprietários e de código aberto: Kling; Vidu; Pika; Hailuo; e o Wan-based SkyReels-A2.

No vídeo abaixo, vemos renderizações de três cenários essenciais a este lançamento: respectivamente, pessoa + objeto; emulação de personagem única; e teste de vestuário virtual (pessoa + roupas):

Clique para reproduzir. Três exemplos editados do material no site de apoio ao Hunyuan Video.

Podemos notar algumas coisas a partir desses exemplos, principalmente relacionadas ao sistema que depende de uma imagem de origem única, em vez de múltiplas imagens do mesmo assunto.

No primeiro clipe, o homem está essencialmente ainda enfrentando a câmera. Ele inclina a cabeça para baixo e para o lado em não mais de 20-25 graus de rotação, mas, em uma inclinação além disso, o sistema teria que começar a adivinhar como ele parece em perfil. Isso é difícil, provavelmente impossível de medir com precisão a partir de uma imagem frontal única.

No segundo exemplo, vemos que a menina está sorrindo no vídeo renderizado, assim como na imagem estática de origem. Novamente, com essa imagem única como referência, o HunyuanCustom teria que fazer uma suposição relativamente mal informada sobre como seu “rosto em repouso” parece. Além disso, seu rosto não se desvia da postura de enfrentar a câmera por mais do que o exemplo anterior (‘homem comendo pipoca’).

No último exemplo, vemos que, como o material de origem – a mulher e as roupas que ela é solicitada a usar – não são imagens completas, a renderização cortou o cenário para se ajustar – o que é, na verdade, uma solução bastante boa para um problema de dados!

O ponto é que, embora o novo sistema possa lidar com múltiplas imagens (como pessoa + pipoca, ou pessoa + roupas), ele não aparentemente permite múltiplos ângulos ou vistas alternativas de uma personagem única, para que expressões ou ângulos diversos possam ser acomodados. Nesse sentido, o sistema pode ter dificuldade em substituir o ecossistema em crescimento de modelos LoRA que surgiram em torno do HunyuanVideo desde seu lançamento no último dezembro, já que esses podem ajudar o HunyuanVideo a produzir personagens consistentes de qualquer ângulo e com qualquer expressão facial representada no conjunto de treinamento (20-60 imagens é típico).

Conectado ao Som

Para áudio, o HunyuanCustom utiliza o sistema LatentSync (notoriamente difícil para hobbyistas configurar e obter resultados bons) para obter movimentos labiais que correspondem ao áudio e texto fornecidos pelo usuário:

Reproduz com áudio. Clique para reproduzir. Vários exemplos de sincronização labial do site suplementar do HunyuanCustom, editados juntos.

Na época da escrita, não há exemplos em língua inglesa, mas estes parecem ser bastante bons – ainda mais se o método de criá-los for facilmente instalável e acessível.

Edição de Vídeo Existente

O novo sistema oferece resultados impressionantes para edição de vídeo para vídeo (V2V, ou Vid2Vid), onde um segmento de um vídeo existente (real) é mascarado e inteligentemente substituído por um assunto dado em uma imagem de referência única. Abaixo está um exemplo do site de materiais suplementares:

Clique para reproduzir. Apenas o objeto central é direcionado, mas o que resta ao redor também é alterado em uma passagem de vid2vid do HunyuanCustom.

Como podemos ver, e como é padrão em um cenário de vid2vid, o vídeo inteiro é alterado pelo processo, embora a região direcionada seja a mais alterada, ou seja, o brinquedo de pelúcia. Presumivelmente, pipelines poderiam ser desenvolvidos para criar tais transformações sob uma abordagem de garbage matte que deixa a maioria do conteúdo do vídeo idêntico ao original. Isso é o que o Adobe Firefly faz por baixo dos panos e faz muito bem – mas é um processo subestudado na cena geradora de código aberto.

Dito isso, a maioria dos exemplos alternativos fornecidos faz um melhor trabalho de direcionar essas integrações, como podemos ver na compilação abaixo:

Clique para reproduzir. Diversos exemplos de conteúdo injetado usando vid2vid no HunyuanCustom, exibindo notável respeito pelo material não direcionado.

Um Novo Começo?

Esta iniciativa é um desenvolvimento do projeto de vídeo Hunyuan, e não uma mudança brusca para longe desse fluxo de desenvolvimento. As melhorias do projeto são introduzidas como inserções arquiteturais discretas, em vez de mudanças estruturais abrangentes, visando permitir que o modelo mantenha a fidelidade de identidade ao longo dos quadros sem depender de ajuste fino específico do assunto fine-tuning, como no caso das abordagens LoRA ou inversão textual.

Para esclarecer, portanto, o HunyuanCustom não é treinado do zero, mas sim é um ajuste fino do modelo de vídeo Hunyuan de dezembro de 2024.

Aqueles que desenvolveram LoRAs para o HunyuanVideo podem se perguntar se elas ainda funcionarão com esta nova edição, ou se elas terão que reinventar a roda do LoRA novamente se quiserem mais capacidades de personalização do que as incorporadas a esta nova versão.

Em geral, um lançamento de um modelo de escala hiperscale altera os pesos do modelo o suficiente para que as LoRAs feitas para o modelo anterior não funcionem corretamente, ou nem funcionem, com o modelo refinado.

Às vezes, no entanto, um ajuste fino pode desafiar suas origens: um exemplo de um ajuste fino se tornando um fork eficaz, com um ecossistema e seguidores dedicados, é o Pony Diffusion do Stable Diffusion XL (SDXL). O Pony atualmente tem 592.000+ downloads no domínio CivitAI em constante mudança, com uma ampla gama de LoRAs que usaram o Pony (e não o SDXL) como o modelo base e que exigem o Pony no momento da inferência.

Lançamento

A página do projeto para o novo artigo (que é intitulado HunyuanCustom: Uma Arquitetura Multimodal-Driven para Geração de Vídeo Personalizada) apresenta links para um site do GitHub que, na época da escrita, acabou de se tornar funcional e parece conter todo o código e os pesos necessários para implementação local, juntamente com uma linha do tempo proposta (onde a única coisa importante que ainda está por vir é a integração do ComfyUI).

Na época da escrita, a presença do projeto no Hugging Face ainda é um 404. No entanto, há uma versão baseada em API do sistema, onde aparentemente é possível demonstrar o sistema, desde que você possa fornecer um código de scan do WeChat.

Raramente vi um uso tão elaborado e extensivo de uma ampla variedade de projetos em uma montagem, como é evidente no HunyuanCustom – e presumivelmente alguns dos licenciamentos obrigariam um lançamento completo.

Dois modelos são anunciados na página do GitHub: uma versão de 720px1280px que exige 8 GB de memória de pico da GPU e uma versão de 512px896px que exige 60 GB de memória de pico da GPU.

O repositório afirma ‘A memória de GPU mínima necessária é de 24 GB para 720px1280px129f, mas é muito lenta… Recomendamos usar uma GPU com 80 GB de memória para uma melhor qualidade de geração’ – e reitera que o sistema foi testado apenas no Linux até agora.

O modelo de vídeo Hunyuan anterior foi, desde o lançamento oficial, quantizado para tamanhos onde pode ser executado com menos de 24 GB de VRAM, e parece razoável supor que o novo modelo também será adaptado para formas mais amigáveis ao consumidor pela comunidade e que será rapidamente adaptado para uso em sistemas Windows também.

Devido a limitações de tempo e à quantidade avassaladora de informações que acompanham este lançamento, podemos apenas dar uma olhada mais ampla, em vez de aprofundada, nesse lançamento. No entanto, vamos dar uma olhada mais de perto no HunyuanCustom.

Um Olhar para o Artigo

O pipeline de dados para o HunyuanCustom, aparentemente em conformidade com o quadro GDPR, incorpora conjuntos de dados de vídeo sintetizados e de código aberto, incluindo OpenHumanVid, com oito categorias principais representadas: humanos, animais, plantas, paisagens, veículos, objetos, arquitetura e anime.

Do artigo de lançamento, uma visão geral dos pacotes diversificados que contribuem para o pipeline de construção de dados do HunyuanCustom. Fonte: https://arxiv.org/pdf/2505.04512

Do artigo de lançamento, uma visão geral dos pacotes diversificados que contribuem para o pipeline de construção de dados do HunyuanCustom. Fonte: https://arxiv.org/pdf/2505.04512

A filtragem inicial começa com PySceneDetect, que segmenta vídeos em cliques de um único tiro. TextBPN-Plus-Plus é então usado para remover vídeos que contenham texto excessivo na tela, legendas, marcas d’água ou logotipos.

Para resolver inconsistências em resolução e duração, os cliques são padronizados para cinco segundos de duração e redimensionados para 512 ou 720 pixels no lado curto. A filtragem estética é tratada usando Koala-36M, com um limiar personalizado de 0,06 aplicado para o conjunto de dados personalizado curado pelos pesquisadores do novo artigo.

O processo de extração do assunto combina o Qwen7B Large Language Model (LLM), o YOLO11X framework de reconhecimento de objetos e a arquitetura popular InsightFace, para identificar e validar identidades humanas.

Para assuntos não humanos, QwenVL e Grounded SAM 2 são usados para extrair caixas delimitadoras relevantes, que são descartadas se forem muito pequenas.

Exemplos de segmentação semântica com Grounded SAM 2, usados no projeto Hunyuan Control. Fonte: https://github.com/IDEA-Research/Grounded-SAM-2

Exemplos de segmentação semântica com Grounded SAM 2, usados no projeto Hunyuan Control. Fonte: https://github.com/IDEA-Research/Grounded-SAM-2

A extração de multi-assuntos utiliza Florence2 para anotação de caixas delimitadoras e Grounded SAM 2 para segmentação, seguida de agrupamento e segmentação temporal de quadros de treinamento.

Os cliques processados são ainda mais aprimorados por meio de anotação, usando um sistema de marcação estruturada proprietário desenvolvido pela equipe do Hunyuan, e que fornece metadados em camadas, como descrições e dicas de movimento de câmera.

Estratégias de aumento de máscara, incluindo conversão para caixas delimitadoras, foram aplicadas durante o treinamento para reduzir sobreajuste e garantir que o modelo se adapte a formas de objetos diversificados.

Dados de áudio foram sincronizados usando o LatentSync mencionado anteriormente, e cliques descartados se as pontuações de sincronização forem abaixo de um limiar mínimo.

O quadro de avaliação de qualidade de imagem cega HyperIQA foi usado para excluir vídeos com pontuação abaixo de 40 (na escala personalizada do HyperIQA). Faixas de áudio válidas foram então processadas com Whisper para extrair recursos para tarefas downstream.

Os autores incorporam o LLaVA modelo de assistente de linguagem durante a fase de anotação, e enfatizam a posição central que esse quadro tem no HunyuanCustom. O LLaVA é usado para gerar legendas de imagem e ajudar a alinhar o conteúdo visual com prompts de texto, apoiando a construção de um sinal de treinamento coerente em diferentes modalidades:

O quadro do HunyuanCustom suporta geração de vídeo consistente com identidade condicionada em entradas de texto, imagem, áudio e vídeo.

O quadro do HunyuanCustom suporta geração de vídeo consistente com identidade condicionada em entradas de texto, imagem, áudio e vídeo.

Aproveitando as capacidades de alinhamento visão-linguagem do LLaVA, o pipeline ganha uma camada adicional de consistência semântica entre elementos visuais e suas descrições textuais – especialmente valioso em cenários de multi-assuntos ou cenas complexas.

Vídeo Personalizado

Para permitir a geração de vídeo com base em uma imagem de referência e um prompt, os dois módulos centrados em torno do LLaVA foram criados, primeiro adaptando a estrutura de entrada do HunyuanVideo para que pudesse aceitar uma imagem junto com o texto.

Isso envolveu formatar o prompt de uma maneira que incorpora a imagem diretamente ou a marca com uma descrição de identidade curta. Um token de separador foi usado para evitar que a incorporação da imagem sobrecarregue o conteúdo do prompt.

Como o codificador visual do LLaVA tende a comprimir ou descartar detalhes espaciais finos durante o alinhamento de recursos de imagem e texto (particularmente ao traduzir uma imagem de referência única em uma incorporação semântica geral), um módulo de melhoria de identidade foi incorporado. Como quase todos os modelos de difusão de vídeo latente têm alguma dificuldade em manter uma identidade sem um LoRA, mesmo em um clipe de cinco segundos, o desempenho desse módulo nos testes da comunidade pode se provar significativo.

Em qualquer caso, a imagem de referência é redimensionada e codificada usando o 3D-VAE causal do modelo de vídeo Hunyuan original, e seu latente é inserido no latente de vídeo ao longo do eixo temporal, com um deslocamento espacial aplicado para evitar que a imagem seja reproduzida diretamente na saída, enquanto ainda guia a geração.

O modelo foi treinado usando Flow Matching, com amostras de ruído extraídas de uma distribuição logit-normal – e a rede foi treinada para recuperar o vídeo correto a partir desses latentes ruidosos. O LLaVA e o gerador de vídeo foram ambos ajustados finamente juntos para que a imagem e o prompt pudessem guiar a saída de forma mais fluida e manter a identidade do assunto consistente.

Para prompts de multi-assuntos, cada par de imagem-texto foi incorporado separadamente e recebeu uma posição temporal distinta, permitindo que as identidades sejam distinguidas e apoiando a geração de cenas que envolvem múltiplos assuntos interagindo.

Som e Visão

O HunyuanCustom condiciona a geração de áudio/fala usando tanto o áudio de entrada do usuário quanto um prompt de texto, permitindo que os personagens falem dentro de cenas que refletem o ambiente descrito.

Para apoiar isso, um módulo de Identity-disentangled AudioNet introduz recursos de áudio sem perturbar os sinais de identidade incorporados a partir da imagem de referência e do prompt. Esses recursos são alinhados com a linha do tempo de vídeo comprimida, dividida em segmentos de nível de quadro e injetados usando um mecanismo de atenção espacial cross-attention que mantém cada quadro isolado, preservando a consistência do assunto e evitando interferência temporal.

Um segundo módulo de injeção temporal fornece um controle mais fino sobre o tempo e o movimento, trabalhando em conjunto com o AudioNet, mapeando recursos de áudio para regiões específicas da sequência latente e usando uma Multi-Layer Perceptron (MLP) para convertê-los em deslocamentos de movimento por token. Isso permite que os gestos e os movimentos faciais sigam o ritmo e a ênfase da entrada de áudio com maior precisão.

O HunyuanCustom permite que os assuntos em vídeos existentes sejam editados diretamente, substituindo ou inserindo pessoas ou objetos em uma cena sem precisar reconstruir todo o clipe do zero. Isso o torna útil para tarefas que envolvem alterar a aparência ou o movimento de uma maneira direcionada.

Clique para reproduzir. Um exemplo adicional do site suplementar.

Para facilitar a substituição eficiente de assuntos em vídeos existentes, o novo sistema evita a abordagem intensiva em recursos dos métodos recentes, como o atualmente popular VACE, ou aqueles que mesclam sequências de vídeo inteiras, favorecendo em vez disso a compressão de um vídeo de referência usando o 3D-VAE pré-treinado – alinhando-o com os latentes internos do pipeline de geração e, em seguida, adicionando os dois juntos. Isso mantém o processo relativamente leve, enquanto ainda permite que o conteúdo de vídeo externo guie a saída.

Uma pequena rede neural lida com o alinhamento entre o vídeo de entrada limpo e os latentes ruidosos usados na geração. O sistema testa duas maneiras de injetar essas informações: mesclando os dois conjuntos de recursos antes de comprimi-los novamente; e adicionando os recursos quadro a quadro. O segundo método funciona melhor, os autores descobriram, e evita perda de qualidade enquanto mantém a carga computacional inalterada.

Dados e Testes

Nos testes, as métricas usadas foram: o módulo de consistência de identidade em ArcFace, que extrai incorporações faciais da imagem de referência e de cada quadro do vídeo gerado e, em seguida, calcula a similaridade coseno média entre eles; similaridade de assunto, via envio de segmentos YOLO11x para Dino 2 para comparação; CLIP-B, alinhamento texto-vídeo, que mede a similaridade entre o prompt e o vídeo gerado; CLIP-B novamente, para calcular a similaridade entre cada quadro e ambos os seus quadros vizinhos e o primeiro quadro, bem como a consistência temporal; e grau dinâmico, como definido por VBench.

Como indicado anteriormente, os competidores de código fechado de linha de base foram Hailuo; Vidu 2.0; Kling (1.6); e Pika. Os frameworks de código aberto competidores foram VACE e SkyReels-A2.

Avaliação do desempenho do modelo comparando o HunyuanCustom com os principais métodos de personalização de vídeo em ID de consistência (Face-Sim), similaridade de assunto (DINO-Sim), alinhamento texto-vídeo (CLIP-B-T), consistência temporal (Temp-Consis) e intensidade de movimento (DD). Resultados ótimos e subótimos são mostrados em negrito e sublinhado, respectivamente.

Avaliação do desempenho do modelo comparando o HunyuanCustom com os principais métodos de personalização de vídeo em ID de consistência (Face-Sim), similaridade de assunto (DINO-Sim), alinhamento texto-vídeo (CLIP-B-T), consistência temporal (Temp-Consis) e intensidade de movimento (DD). Resultados ótimos e subótimos são mostrados em negrito e sublinhado, respectivamente.

Desses resultados, os autores afirmam:

‘Nossa [HunyuanCustom] alcança a melhor consistência de ID e consistência de assunto. Ele também alcança resultados comparáveis em seguimento de prompt e consistência temporal. [Hailuo] tem a melhor pontuação de clipe porque pode seguir instruções de texto bem com apenas consistência de ID, sacrificando a consistência de assuntos não humanos (a pior DINO-Sim). Em termos de grau dinâmico, [Vidu] e [VACE] performam mal, o que pode ser devido ao tamanho pequeno do modelo.’

Embora o site do projeto esteja saturado de vídeos de comparação (a disposição dos quais parece ter sido projetada para estética do site em vez de comparação fácil), ele não apresenta atualmente um vídeo equivalente aos resultados estáticos apertados juntos no PDF, em relação aos testes qualitativos iniciais. Embora eu o inclua aqui, encorajo o leitor a fazer um exame detalhado dos vídeos no site do projeto, pois eles dão uma impressão melhor dos resultados:

Da publicação, uma comparação em personalização de vídeo centrada no objeto. Embora o leitor deva (como sempre) referir-se ao PDF de origem para uma melhor resolução, os vídeos no site do projeto podem ser um recurso mais iluminador.

Da publicação, uma comparação em personalização de vídeo centrada no objeto. Embora o leitor deva (como sempre) referir-se ao PDF de origem para uma melhor resolução, os vídeos no site do projeto podem ser um recurso mais iluminador nesse caso.

Os autores comentam aqui:

‘Pode ser visto que [Vidu], [Skyreels A2] e nosso método alcançam resultados relativamente bons em alinhamento de prompt e consistência de assunto, mas a qualidade do vídeo é melhor do que [Vidu] e [Skyreels], graças ao bom desempenho de geração de vídeo do nosso modelo base, ou seja, [Hunyuanvideo-13B]. ‘

‘Entre produtos comerciais, embora [Kling] tenha uma boa qualidade de vídeo, o primeiro quadro do vídeo tem um problema de cópia e cola, e às vezes o assunto se move muito rápido e [borra], levando a uma experiência de visualização ruim.’

Os autores comentam ainda que Pika performa mal em termos de consistência temporal, introduzindo artefatos de legendas (efeitos de cura de dados pobres, onde elementos de texto em clipes de vídeo foram permitidos para poluir os conceitos centrais).

Hailuo mantém a identidade facial, afirmam eles, mas falha em preservar a consistência corporal completa. Entre os métodos de código aberto, VACE, os pesquisadores afirmam, é incapaz de manter a consistência de identidade. Em contraste, eles afirmam que o HunyuanCustom produz vídeos com forte preservação de identidade, mantendo qualidade e diversidade.

Em seguida, testes foram realizados para personalização de vídeo de multi-assuntos, contra os mesmos contendores. Como no exemplo anterior, os resultados achatados no PDF não são equivalentes a vídeos disponíveis no site do projeto, mas são únicos entre os resultados apresentados:

Comparações usando personalização de vídeo de multi-assuntos. Por favor, veja o PDF para melhor detalhe e resolução.

Comparações usando personalização de vídeo de multi-assuntos. Por favor, veja o PDF para melhor detalhe e resolução.

O artigo afirma:

‘[Pika] pode gerar os assuntos especificados, mas exibe instabilidade nos quadros do vídeo, com instâncias de um homem desaparecendo em um cenário e uma mulher falhando em abrir uma porta como solicitado. [Vidu] e [VACE] capturam parcialmente a identidade humana, mas perdem detalhes significativos de objetos não humanos, indicando uma limitação na representação de assuntos não humanos.

‘[SkyReels A2] experimenta uma instabilidade de quadro severa, com alterações notáveis em chips e numerosos artefatos no cenário à direita.

‘Em contraste, nosso HunyuanCustom captura efetivamente tanto as identidades humanas quanto as não humanas, gera vídeos que aderem aos prompts fornecidos e mantém alta qualidade visual e estabilidade.’

Um experimento adicional foi ‘publicidade de humano virtual’, onde os frameworks foram solicitados a integrar um produto com uma pessoa:

Do round de testes qualitativos, exemplos de 'colocação de produto' neural. Por favor, veja o PDF para melhor detalhe e resolução.

Do round de testes qualitativos, exemplos de ‘colocação de produto’ neural. Por favor, veja o PDF para melhor detalhe e resolução.

Para essa rodada, os autores afirmam:

‘Os resultados demonstram que o HunyuanCustom mantém efetivamente a identidade do humano, enquanto preserva os detalhes do produto-alvo, incluindo o texto nele.

‘Além disso, a interação entre o humano e o produto parece natural, e o vídeo adere estreitamente ao prompt fornecido, destacando o potencial significativo do HunyuanCustom na geração de vídeos de anúncios.’

Uma área onde os resultados de vídeo seriam muito úteis foi a rodada qualitativa para personalização de assunto por áudio, onde o personagem fala o áudio correspondente de uma cena e postura descritas por texto.

Resultados parciais fornecidos para a rodada de áudio – embora resultados de vídeo pudessem ser preferíveis nesse caso. Apenas a metade superior da figura do PDF é reproduzida aqui, pois é grande e difícil de acomodar neste artigo. Por favor, refira-se ao PDF de origem para melhor detalhe e resolução.

Resultados parciais fornecidos para a rodada de áudio – embora resultados de vídeo pudessem ser preferíveis nesse caso. Apenas a metade superior da figura do PDF é reproduzida aqui, pois é grande e difícil de acomodar neste artigo. Por favor, refira-se ao PDF de origem para melhor detalhe e resolução.

Os autores afirmam:

‘Métodos anteriores de animação humana por áudio inputam uma imagem humana e um áudio, onde a postura humana, vestuário e ambiente permanecem consistentes com a imagem fornecida e não podem gerar vídeos em outros gestos e ambientes, o que pode [restringir] sua aplicação.

‘…[Nosso] HunyuanCustom permite personalização de humano por áudio, onde o personagem fala o áudio correspondente em uma cena e postura descritas por texto, permitindo uma animação humana por áudio mais flexível e controlável.’

Testes adicionais (por favor, veja o PDF para todos os detalhes) incluíram uma rodada que opôs o novo sistema ao VACE e ao Kling 1.6 para substituição de assunto em vídeo:

Testando substituição de assunto no modo vídeo-para-vídeo. Por favor, refira-se ao PDF de origem para melhor detalhe e resolução.

Testando substituição de assunto no modo vídeo-para-vídeo. Por favor, refira-se ao PDF de origem para melhor detalhe e resolução.

Dos últimos testes apresentados no novo artigo, os pesquisadores opinam:

‘VACE sofre com artefatos de limite devido à aderência estrita às máscaras de entrada, resultando em formas de assunto não naturais e continuidade de movimento interrompida. [Kling], em contraste, exibe um efeito de cópia e cola, onde os assuntos são sobrepostos diretamente no vídeo, levando a uma integração pobre com o plano de fundo.

‘Em comparação, o HunyuanCustom evita efetivamente artefatos de limite, alcança uma integração perfeita com o plano de fundo do vídeo e mantém uma forte preservação de identidade—demonstrando seu desempenho superior em tarefas de edição de vídeo.’

Conclusão

Este é um lançamento fascinante, não menos porque aborda algo que a cena de hobbyistas insatisfeita tem reclamado mais ultimamente – a falta de sincronização labial, para que o realismo aumentado capaz em sistemas como o Hunyuan Video e o Wan 2.1 possa ser dado uma nova dimensão de autenticidade.

Embora o layout de quase todos os exemplos de vídeo comparativos no site do projeto torne difícil comparar as capacidades do HunyuanCustom com as dos contendores anteriores, deve ser notado que muito poucos projetos no espaço de síntese de vídeo têm a coragem de se opor em testes ao Kling, a API de difusão de vídeo comercial que está sempre pairando ou perto do topo das tabelas de classificação; a Tencent parece ter feito progressos contra esse titular de forma impressionante.

 

* O problema é que alguns dos vídeos são tão amplos, curtos e de alta resolução que não serão reproduzidos em players de vídeo padrão, como o VLC ou o Windows Media Player, exibindo telas pretas.

Publicado pela primeira vez na quinta-feira, 8 de maio de 2025

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai