Ângulo de Anderson
O Surgimento dos Deepfakes de Vídeo Hunyuan

Devido à natureza de alguns dos materiais discutidos aqui, este artigo conterá menos links de referência e ilustrações do que o usual.
Algo notável está acontecendo atualmente na comunidade de síntese de IA, embora sua significância possa levar um tempo para se tornar clara. Os hobistas estão treinando modelos de IA de vídeo gerativos para reproduzir as semelhanças de pessoas, usando LoRAs baseados em vídeo no framework de vídeo Hunyuan recentemente lançado em código aberto pela Tencent.*
Clique para reproduzir. Resultados diversos de personalizações de Hunyuan baseadas em LoRA disponíveis gratuitamente na comunidade Civit. Ao treinar modelos de adaptação de baixa classificação (LoRAs), os problemas de estabilidade temporal, que têm atormentado a geração de vídeo de IA por dois anos, são significativamente reduzidos. Fontes: civit.ai
No vídeo acima, as semelhanças das atrizes Natalie Portman, Christina Hendricks e Scarlett Johansson, juntamente com o líder de tecnologia Elon Musk, foram treinadas em arquivos adicionais relativamente pequenos para o sistema de vídeo gerativo Hunyuan, que pode ser instalado sem filtros de conteúdo (como filtros NSFW) no computador do usuário.
O criador da LoRA de Christina Hendricks mostrada acima afirma que apenas 16 imagens do show de TV Mad Men foram necessárias para desenvolver o modelo (que é um download de apenas 307mb); múltiplos posts da comunidade Stable Diffusion no Reddit e Discord confirmam que LoRAs desse tipo não requerem grandes quantidades de dados de treinamento ou tempos de treinamento longos, na maioria dos casos.
Clique para reproduzir. Arnold Schwarzenegger é trazido à vida em uma LoRA de vídeo Hunyuan que pode ser baixada no Civit. Veja https://www.youtube.com/watch?v=1D7B9g9rY68 para mais exemplos de Arnie, do entusiasta de IA Bob Doyle.
As LoRAs Hunyuan podem ser treinadas em imagens estáticas ou vídeos, embora o treinamento em vídeos exija recursos de hardware maiores e tempo de treinamento aumentado.
O modelo de vídeo Hunyuan apresenta 13 bilhões de parâmetros, excedendo os 12 bilhões de parâmetros da Sora e muito mais do que o modelo menos capaz Hunyuan-DiT lançado em código aberto no verão de 2024, que tem apenas 1,5 bilhão de parâmetros.
Como foi o caso há dois anos e meio com a Stable Diffusion e a LoRA (veja exemplos de celebridades ‘nativas’ da Stable Diffusion 1.5 aqui), o modelo de base em questão tem uma compreensão muito mais limitada das personalidades de celebridades, em comparação com o nível de fidelidade que pode ser obtido por meio de implementações de LoRA ‘injetadas de ID’.
Em essência, uma LoRA personalizada e focada na personalidade obtém uma ‘carona gratuita’ nas significativas capacidades de síntese do modelo de base Hunyuan, oferecendo uma síntese humana notavelmente mais eficaz do que pode ser obtida por meio de autoencoders de deepfakes de 2017 ou tentando adicionar movimento a imagens estáticas por meio de sistemas como o LivePortrait.
Todas as LoRAs mostradas aqui podem ser baixadas gratuitamente da comunidade Civit, enquanto o número mais abundante de LoRAs personalizadas ‘de imagem estática’ também pode potencialmente criar ‘sementes’ de imagens para o processo de criação de vídeo (ou seja, imagem-para-vídeo, uma versão pendente para o Hunyuan Video, embora workarounds sejam possíveis, por enquanto).
Clique para reproduzir. Acima, amostras de uma LoRA ‘estática’ Flux; abaixo, exemplos de uma LoRA de vídeo Hunyuan com a música Taylor Swift. Ambas as LoRAs estão disponíveis gratuitamente na comunidade Civit.
Quando escrevo, o site Civit oferece 128 resultados de busca para ‘Hunyuan’*. Quase todos eles são de algum modo NSFW; 22 retratam celebridades; 18 são projetados para facilitar a geração de pornografia hardcore; e apenas sete deles retratam homens em vez de mulheres.
O que há de novo?
Devido à evolução do termo deepfake e à limitada compreensão pública das (muito severas) limitações dos frameworks de síntese de vídeo de IA até o momento, a significância da LoRA Hunyuan não é fácil de entender para alguém que segue casualmente a cena de IA gerativa. Vamos revisar algumas das principais diferenças entre as LoRAs Hunyuan e as abordagens anteriores para geração de vídeo de IA baseada em identidade.
1: Instalação Local Desimpedida
O aspecto mais importante do Hunyuan Video é o fato de que ele pode ser baixado localmente e coloca um sistema de geração de vídeo de IA muito poderoso e sem censura nas mãos do usuário casual, bem como da comunidade de VFX (na medida em que as licenças permitam em diferentes regiões).
A última vez que isso aconteceu foi com o lançamento em código aberto do modelo Stable Diffusion da Stability.ai no verão de 2022. Naquela época, o DALL-E2 da OpenAI havia capturado a imaginação pública, embora o DALLE-2 fosse um serviço pago com restrições notáveis (que cresceram com o tempo).
Quando a Stable Diffusion se tornou disponível, e a adaptação de baixa classificação tornou possível gerar imagens da identidade de qualquer pessoa (celebridade ou não), o grande locus de interesse de desenvolvedores e consumidores ajudou a Stable Diffusion a eclipsar a popularidade do DALLE-2; embora o último fosse um sistema mais capaz fora da caixa, suas rotinas de censura eram vistas como onerosas por muitos de seus usuários, e a personalização não era possível.
Argumenta-se que o mesmo cenário agora se aplica entre a Sora e a Hunyuan – ou, mais precisamente, entre sistemas de vídeo gerativo da classe Sora proprietários e rivais de código aberto, dos quais a Hunyuan é a primeira – mas provavelmente não a última (aqui, considere que o Flux eventualmente ganharia terreno significativo sobre a Stable Diffusion).
Os usuários que desejam criar saída de LoRA Hunyuan, mas que carecem de equipamentos eficazmente robustos, podem, como sempre, offloadar o aspecto de GPU do treinamento para serviços de computação online como o RunPod. Isso não é o mesmo que criar vídeos de IA em plataformas como Kaiber ou Kling, desde que não há filtragem semântica ou baseada em imagem (censura) envolvida em alugar uma GPU online para suportar um fluxo de trabalho local.
2: Sem necessidade de vídeos ‘hospedeiros’ e alto esforço
Quando os deepfakes surgiram no final de 2017, o código postado anonimamente evoluiria para os forks principais DeepFaceLab e FaceSwap (além do sistema de DeepFaceLive de deepfaking em tempo real).
Esse método exigia a curadoria minuciosa de milhares de imagens de face de cada identidade a ser trocada; o menos esforço aplicado a essa etapa, menos eficaz o modelo seria. Além disso, os tempos de treinamento variavam entre 2-14 dias, dependendo do hardware disponível, estressando mesmo sistemas capazes a longo prazo.
Quando o modelo finalmente estava pronto, ele só podia impor faces em vídeo existente e geralmente precisava de um ‘alvo’ (ou seja, identidade real) que fosse próximo em aparência à identidade superposta.
Mais recentemente, ROOP, LivePortrait e numerosos frameworks semelhantes forneceram funcionalidades semelhantes com muito menos esforço e frequentemente com resultados superiores – mas sem capacidade de gerar deepfakes de corpo inteiro precisos – ou qualquer elemento além de faces.

Exemplos de ROOP Unleashed e LivePortrait (inset lower left), do conteúdo de Bob Doyle no YouTube. Fontes: https://www.youtube.com/watch?v=i39xeYPBAAM e https://www.youtube.com/watch?v=QGatEItg2Ns
Em contraste, as LoRAs Hunyuan (e os sistemas semelhantes que inevitavelmente seguirão) permitem a criação desimpedida de mundos inteiros, incluindo simulação de corpo inteiro da identidade LoRA treinada pelo usuário.
3: Consistência Temporal Massivamente Melhorada
A consistência temporal tem sido o Santo Graal da difusão de vídeo por vários anos agora. O uso de uma LoRA, juntamente com prompts apropriados, dá à geração de vídeo Hunyuan uma referência de identidade constante para aderir. Em teoria (estes são dias iniciais), poderia ser possível treinar múltiplas LoRAs de uma identidade específica, cada uma usando roupas específicas.
Sob essas condições, as roupas também são menos propensas a ‘mutar’ ao longo do curso de uma geração de vídeo (já que o sistema gerativo baseia o próximo frame em uma janela limitada de frames anteriores).
(Alternativamente, como nos sistemas de LoRA baseados em imagem, pode-se simplesmente aplicar múltiplas LoRAs, como identidade + LoRAs de traje, a uma geração de vídeo)
4: Acesso ao ‘Experimento Humano’
Como observei recentemente, o setor de IA gerativa proprietário e de nível FAANG agora parece ser tão cauteloso em relação à capacidade de síntese humana de seus projetos que as pessoas reais raramente aparecem em páginas de projetos para anúncios e lançamentos importantes. Em vez disso, a literatura de publicidade relacionada tende a mostrar sujeitos ‘fofos’ e ‘não ameaçadores’ em resultados sintetizados.
Com o advento das LoRAs Hunyuan, pela primeira vez, a comunidade tem a oportunidade de impulsionar os limites da síntese de vídeo humano baseada em LDM em um sistema altamente capaz (em vez de marginal) e explorar completamente o assunto que mais interessa à maioria de nós – as pessoas.
Implicações
Uma vez que uma busca por ‘Hunyuan’ na comunidade Civit mostra principalmente LoRAs de celebridades e ‘hardcore’, a implicação central do advento das LoRAs Hunyuan é que elas serão usadas para criar vídeos pornográficos de IA (ou difamatórios) de pessoas reais – celebridades e desconhecidos.
Para fins de conformidade, os hobistas que criam LoRAs Hunyuan e que experimentam com elas em servidores Discord diversos são cuidadosos para proibir exemplos de pessoas reais de serem postados. A realidade é que até mesmo imagens de deepfakes agora são severamente armadas; e a perspectiva de adicionar vídeos realistas ao mix pode finalmente justificar os medos aumentados que têm sido recorrentes na mídia nos últimos sete anos e que têm promovido novas regulamentações.
A Força Motriz
Como sempre, a pornografia permanece a força motriz para a tecnologia. Qualquer que seja nossa opinião sobre esse uso, esse motor implacável de impulso impulsiona avanços no estado da arte que podem beneficiar eventualmente a adoção mais mainstream.
Nesse caso, é possível que o preço seja maior do que o usual, desde que a disponibilização em código aberto de criação de vídeo hiper-realista tem implicações óbvias para uso criminoso, político e ético.
Um grupo do Reddit (que não vou nomear aqui) dedicado à geração de vídeo NSFW de IA tem um servidor Discord aberto associado, onde os usuários estão aprimorando fluxos de trabalho ComfyUI para geração de vídeo pornográfico baseado em Hunyuan. Diariamente, os usuários postam exemplos de clipes NSFW – muitos dos quais podem ser razoavelmente considerados ‘extremos’, ou pelo menos esticando as restrições declaradas nas regras do fórum.
Essa comunidade também mantém um repositório GitHub substancial e bem desenvolvido com ferramentas que podem baixar e processar vídeos pornográficos, para fornecer dados de treinamento para novos modelos.
Desde que o treinador de LoRA mais popular, Kohya-ss, agora suporta o treinamento de LoRA Hunyuan, as barreiras de entrada para o treinamento de vídeo gerativo ilimitado estão diminuindo diariamente, juntamente com os requisitos de hardware para o treinamento e geração de vídeo Hunyuan.
O aspecto crucial dos esquemas de treinamento dedicados para IA pornográfica (em vez de modelos baseados em identidade, como celebridades) é que um modelo de base padrão como o Hunyuan não é treinado especificamente em saída NSFW e pode, portanto, realizar mal quando solicitado a gerar conteúdo NSFW ou falhar em desvincular conceitos e associações aprendidos de maneira performática ou convincente.
Ao desenvolver modelos de base NSFW e LoRAs ajustados, será cada vez mais possível projetar identidades treinadas em um domínio de vídeo ‘pornográfico’ dedicado; afinal, isso é apenas a versão de vídeo de algo que já ocorreu para imagens estáticas nos últimos dois anos e meio.
VFX
O aumento enorme na consistência temporal que as LoRAs de vídeo Hunyuan oferecem é um óbvio benefício para a indústria de efeitos visuais de IA, que depende muito da adaptação de software de código aberto.
Embora a abordagem de LoRA de vídeo Hunyuan gere um quadro e um ambiente inteiros, as empresas de VFX quase certamente começaram a experimentar com a isolamento de faces humanas temporalmente consistentes que podem ser obtidas por esse método, para superpor ou integrar faces em footage de mundo real.
Como a comunidade de hobistas, as empresas de VFX devem esperar até que o Hunyuan Video libere sua funcionalidade de imagem-para-vídeo e vídeo-para-vídeo, que é potencialmente a ponte mais útil entre o conteúdo de ‘deepfake’ baseado em LoRA e ID; ou improvisar e usar o intervalo para sondar as capacidades externas do framework e de adaptações potenciais, e até mesmo forks de Hunyuan Video.
Embora os termos de licença para o Hunyuan Video tecnicamente permitam a representação de indivíduos reais, desde que a permissão seja dada, eles proíbem seu uso na UE, Reino Unido e na Coreia do Sul. No princípio de ‘o que acontece em Vegas, fica em Vegas’, isso não significa necessariamente que o Hunyuan Video não será usado nessas regiões; no entanto, a perspectiva de auditorias de dados externas para aplicar regulamentações crescentes em torno de IA gerativa pode tornar esse uso ilícito arriscado.
Outra área potencialmente ambígua dos termos de licença afirma:
‘Se, na data de lançamento da versão do Tencent Hunyuan, o número de usuários ativos mensais de todos os produtos ou serviços disponibilizados pelo Licenciado for maior que 100 milhões de usuários ativos mensais no mês de calendário anterior, você deve solicitar uma licença à Tencent, que a Tencent pode conceder a você a seu exclusivo critério, e você não está autorizado a exercer nenhum dos direitos sob este Acordo, a menos que e até que a Tencent conceda expressamente esses direitos a você.’
Essa cláusula é claramente direcionada às inúmeras empresas que provavelmente ‘intermediarão’ o Hunyuan Video para um corpo de usuários relativamente tecnologicamente analfabetos, e que serão obrigadas a incluir a Tencent na ação, acima de um certo teto de usuários.
Se a redação ampla também pode cobrir o uso indireto (ou seja, por meio da provisão de saída de efeitos visuais de Hunyuan habilitados em filmes e programas de TV populares) pode precisar de esclarecimento.
Conclusão
Desde que os deepfakes de vídeo existem há muito tempo, seria fácil subestimar a significância da LoRA de vídeo Hunyuan como uma abordagem para síntese de identidade e deepfaking; e supor que os esforços atuais manifestados na comunidade Civit e em servidores Discord e subreddits relacionados representam apenas um pequeno impulso incremental em direção à síntese de vídeo humano verdadeiramente controlável.
Mais provável é que os esforços atuais representem apenas uma fração do potencial do Hunyuan Video para criar deepfakes de corpo inteiro e ambiente completamente convincentes; uma vez que o componente de imagem-para-vídeo for lançado (rumorado para ocorrer este mês), um nível muito mais granular de poder gerativo estará disponível para as comunidades de hobistas e profissionais.
Quando a Stability.ai lançou a Stable Diffusion em 2022, muitos observadores não podiam determinar por que a empresa simplesmente daria um sistema gerativo tão valioso e poderoso. Com o Hunyuan Video, o motivo do lucro está construído diretamente na licença – embora possa provar ser difícil para a Tencent determinar quando uma empresa dispara o esquema de compartilhamento de lucros.
Em qualquer caso, o resultado é o mesmo que em 2022: comunidades de desenvolvimento dedicadas se formaram imediatamente e com fervor intenso em torno do lançamento. Alguns dos caminhos que esses esforços tomarão nos próximos 12 meses estão certamente prestes a gerar novos títulos.
* Até 136 na data de publicação.
Publicado pela primeira vez na terça-feira, 7 de janeiro de 2025












