Ângulo de Anderson

Usando IA para Simular Granulação de Filme

mm
Adicione Unite.AI às suas fontes preferidas no Google
Varying grain levels in 'Jaws' (1976) – source: https://ipolcore.ipol.im/demo/clientApp/demo.html?id=192 and https://www.britannica.com/topic/Jaws-film-by-Spielberg

Faça a América Granulada Novamente: uma nova ferramenta de IA pode remover a granulação de filme de velhas filmagens, comprimir o vídeo em uma fração do tamanho e, em seguida, colocar a granulação de volta para que os espectadores nunca notem. Ela funciona com padrões de vídeo existentes e reduz a largura de banda em até 90%, mantendo a aparência vintage.

 

Para muitos de nós que assistem a filmes ou programas de TV antigos, o “chiado” da granulação de filme é reconfortante; mesmo quando não registramos conscientemente, a granulação nos diz que o que estamos assistindo foi feito com produtos químicos, não com código, e liga a experiência ao mundo físico: à escolha de estoque, exposição, processos de laboratório e eras passadas:

A abordagem de Hollywood em relação à granulação mudou ao longo das mudanças culturais e métodos de produção. Durante a década de 1960, as câmeras em estoque e práticas fotográficas evoluíram e contribuíram para a identidade visual distinta da década. Mais tarde, diretores trabalhando em digital reintroduziram a granulação deliberadamente. No meio da década de 1980, o diretor James Cameron selecionou um estoque Kodak particularmente grosso para Aliens (1986, inferior direito na imagem acima), provavelmente para realçar a atmosfera e ajudar a esconder fios de efeitos visuais práticos em miniatura. Fonte: https://archive.is/3ZSjN (meu artigo mais recente sobre este tópico)

A abordagem de Hollywood em relação à granulação mudou ao longo das mudanças culturais e métodos de produção. Durante a década de 1960, as câmeras em estoque e práticas fotográficas evoluíram e contribuíram para a identidade visual distinta da década. Mais tarde, diretores trabalhando em digital reintroduziram a granulação deliberadamente. No meio da década de 1980, o diretor James Cameron selecionou um estoque Kodak particularmente grosso para Aliens (1986, inferior direito na imagem acima), provavelmente para realçar a atmosfera e ajudar a esconder fios de efeitos visuais práticos em miniatura. Fonte: https://archive.is/3ZSjN (meu artigo mais recente sobre este tópico)

A textura analógica vem de uma época em que produzir mídia custava dinheiro de verdade, o acesso era limitado e havia pelo menos uma sensação de que apenas os mais capazes ou determinados poderiam passar, atuando como um atalho para realismo e credibilidade – e, quando as tecnologias de captura de alta resolução eliminaram isso, nostalgia.

Christopher Nolan nunca mudou. Enquanto a maior parte da indústria abraçou a digital por sua velocidade e flexibilidade, o diretor aclamado insistiu em celulose como disciplina e estética.

Denis Villeneuve, trabalhando dentro de pipelines digitais, ainda processa suas filmagens por meio de processos fotoquímicos. Para os filmes de Duna, filmados digitalmente, as filmagens foram impressas em estoque de filme e, em seguida, digitalizadas novamente, apenas por atmosfera e efeito.

Granulação Falsa

Aficionados de filme e TV de qualidade associam granulação visível com alta resolução, onde a taxa de bits (a quantidade de dados sendo inserida em cada quadro) é tão alta que mesmo os menores detalhes, como grãos de halide, são preservados.

No entanto, se as redes de streaming realmente fizessem esse tipo de taxa de bits disponível, isso colocaria uma grande pressão sobre a capacidade da rede e provavelmente causaria buffering e stuttering. Portanto, plataformas como a Netflix criam versões AV1 otimizadas de seu conteúdo e usam as capacidades do codec AV1 para adicionar granulação ao filme ou episódio de forma inteligente e apropriada, economizando 30% de largura de banda no processo.

O AV1 é projetado para incorporar granulação de filme artificial, como nestes exemplos. Fonte: https://waveletbeam.com/index.php/av1-film-grain-synthesis

O AV1 é projetado para incorporar granulação de filme artificial, como nestes exemplos. Fonte: https://waveletbeam.com/index.php/av1-film-grain-synthesis

A “fetichização da granulação” é um equivalente digital relativamente raro a tendências atávicas, como a revivificação do vinil, e é difícil dizer se é usada por streamers para fazer com que o vídeo altamente otimizado pareça como “vídeo bruto” de alta qualidade (para os espectadores que associaram inconscientemente essas características); ou para desviar a queda da qualidade perceptual que os antigos shows 4:3 tomariam quando os provedores de streaming cortam-nos para proporções de tela widescreen; ou apenas para atender à estética “Nolan” retro em geral.

Granulação Siloada

O problema é que a granulação também é ruído. Os sistemas digitais odeiam ruído e os codecs de streaming, como o AV1, os removem para economizar largura de banda, a menos que as configurações de granulação sejam explicitamente configuradas. Da mesma forma, os aumentadores de imagem AI, como a série Topaz Gigapixel, tratam a granulação como um defeito a ser corrigido.

No campo da síntese de imagem baseada em difusão, a granulação é extremamente desafiadora de gerar, pois representa detalhes extremos, e, portanto, normalmente só apareceria em modelos superajustados, pois toda a arquitetura do modelo de difusão latente (LDM) é projetada para desmontar o ruído (como a granulação) em imagens claras, em vez de tratar os grãos de granulação como propriedades implícitas na mídia.

Portanto, pode ser desafiador criar granulação convincente usando aprendizado de máquina. E, mesmo que alguém pudesse fazer isso, renderizá-la diretamente em um vídeo otimizado apenas inflaria o tamanho do arquivo do vídeo novamente.

Devido a essa consideração logística, os codecs de vídeo de ponta, como o Versatile Video Coding (VVC) oferecem granulação como um tipo de “serviço de sidecar”.

O VVC comprime o vídeo limpo, sem granulação, e descarta a granulação. Em vez de desperdiçar dados tentando preservar padrões de granulação de alta frequência aleatórios, ele analisa a granulação separadamente e codifica um pequeno conjunto de parâmetros (por exemplo, amplitude, frequência e modo de mistura) que descrevem como regenerar granulação semelhante durante a reprodução.

Esses parâmetros são armazenados em um FGC-SEI (Suplemento de Informações de Características de Granulação de Filme) fluxo, que acompanha o fluxo principal. Após a decodificação, um módulo de síntese usa essas instruções para reaplicar granulação sintética que imita a original.

Isso preserva a “aparência” de emulsão de alta taxa de bits, rica em granulação, enquanto mantém a taxa de bits real baixa, pois o codificador não é forçado a gastar recursos preservando padrões de ruído imprevisíveis.

Além disso, como nos arquivos de legendas discretos, esse conteúdo de “granulação” falso é específico do vídeo em questão; aplicar genericamente filtros de granulação em plataformas como o Photoshop ou o After Effects, ou em pipelines de processamento automatizado, não resultaria em “granulação ajustada”, mas sim em uma camada de ruído não relacionada:

Esquerda: imagem original. Centro: Granulação do Camera Raw do Photoshop aplicada uniformemente em todos os canais. Direita: o mesmo filtro de granulação aplicado individualmente a cada canal em sequência. Imagem de fonte (CC0): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (via meu artigo anterior)

Esquerda: imagem original. Centro: Granulação do Camera Raw do Photoshop aplicada uniformemente em todos os canais. Direita: o mesmo filtro de granulação aplicado individualmente a cada canal em sequência. Imagem de fonte (CC0): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (via meu artigo anterior)

O filtro de “Granulação” do Photoshop adiciona ruído aleatório uniforme; mas a granulação de filme real vem de cristais de halide de tamanhos variados. Aplicar o filtro a cada canal separadamente (veja a imagem acima) apenas cria mais caos, não realismo. A granulação de filme real reflete como a luz atinge camadas de emulsões no momento da exposição. Simular isso exigiria estimar como diferentes áreas de uma imagem teriam ativado cada camada de halide, e não apenas dividir o efeito em camadas RGB.

FGA-NN

Nessa busca espúria, entra um novo artigo de pesquisa da França – uma saída breve, mas interessante, que oferece um método quantitativa e qualitativamente superior de analisar e recriar granulação:

Comparação entre a granulação real e os resultados de vários métodos de análise e síntese. Fonte: https://arxiv.org/pdf/2506.14350

Comparação entre a granulação real e os resultados de vários métodos de análise e síntese. Fonte: https://arxiv.org/pdf/2506.14350

O novo sistema, intitulado FGA-NN, não se afasta do uso convencional da síntese de granulação baseada em Gaussian por meio do método padrão VVC, Versatile Film Grain Synthesis (VFGS). O que o sistema muda é a análise, usando uma rede neural para estimar os parâmetros de síntese com mais precisão

Portanto, a granulação final ainda é sintetizada usando o mesmo modelo Gaussian convencional – mas a rede alimenta melhor os metadados para um gerador baseado em regras padrão, obtendo um modelo de ponta.

O novo artigo é intitulado FGA-NN: Film Grain Analysis Neural Network e vem de três pesquisadores do InterDigital (IDCC ) R&D, Cesson-Sévigné. Embora o artigo não seja longo, vamos dar uma olhada em alguns dos principais aspectos dos avanços que o novo método oferece.

Método

Para recapitular: o sistema FGA-NN recebe um vídeo com granulação como entrada e extrai uma descrição compacta da granulação, produzindo parâmetros no formato FGC-SEI padrão usado por vários codecs modernos. Esses parâmetros são transmitidos ao lado do vídeo, permitindo que o decodificador reconstrua a granulação usando o VFGS, em vez de codificar a granulação diretamente.

O esquema para analisar e reaplicar granulação de filme na distribuição de vídeo, usando FGA-NN para extração de parâmetros e VFGS para síntese.

O esquema para analisar e reaplicar granulação de filme na distribuição de vídeo, usando FGA-NN para extração de parâmetros e VFGS para síntese.

Para treinar a rede, os autores precisavam de pares de vídeos com granulação e metadados FGC-SEI correspondentes. Como a maioria das filmagens com granulação não tem esse tipo de metadados, os pesquisadores criaram seu próprio conjunto de dados gerando parâmetros FGC-SEI, aplicando granulação sintética a vídeos limpos e usando-os como exemplos de treinamento.

Os dados de treinamento para o FGA-NN foram criados aplicando granulação sintética a filmagens limpas dos conjuntos de dados BVI-DVC e DIV2K. Parâmetros FGC-SEI aleatorizados foram gerados e usados com a ferramenta de síntese VFGS, permitindo que cada vídeo com granulação fosse emparelhado com metadados conhecidos.

O modelo de frequência suportado pelos padrões de vídeo atuais foi usado, com faixas de parâmetros restritas para manter a plausibilidade visual em canais luma e croma.

Os dados de treinamento para a nova coleção foram criados aplicando granulação sintética a filmagens limpas dos conjuntos de dados BVI-DVC e DIV2K. Parâmetros FGC-SEI aleatorizados foram gerados e usados com a ferramenta de síntese Versatile Film Grain Synthesis (VFGS), permitindo que cada vídeo com granulação fosse emparelhado com metadados conhecidos.

Visão geral das faixas de parâmetros FGC-SEI aleatorizados usados para gerar granulação sintética para treinamento, aplicada a filmagens limpas dos conjuntos de dados BVI-DVC e DIV2K. Parâmetros foram restritos para garantir resultados visuais plausíveis em canais luma e croma.

Visão geral das faixas de parâmetros FGC-SEI aleatorizados usados para gerar granulação sintética para treinamento, aplicada a filmagens limpas dos conjuntos de dados BVI-DVC e DIV2K. Parâmetros foram restritos para garantir resultados visuais plausíveis em canais luma e croma.

O modelo de filtragem de frequência, o único método de síntese atualmente suportado em implementações de codec, como o VVC Test Model (VTM), foi usado em todo o processo. As faixas de parâmetros foram restritas para preservar a plausibilidade visual em canais luma e croma.

Efeito de Rede

O FGA-NN apresenta dois modelos coordenados, para luma e croma, respectivamente, cada um projetado para prever os parâmetros específicos necessários para recriar granulação de filme realista.

Para cada imagem de entrada, o sistema estima um conjunto de intervalos de intensidade, os fatores de escala vinculados a cada intervalo, as frequências de corte horizontal e vertical e um ajuste de escala geral conhecido como fator Log2Scale. Para isso, o modelo usa um extrator de recursos compartilhado que processa a entrada com granulação e alimenta quatro ramos de saída separados, cada um responsável por uma tarefa de previsão diferente:

Arquitetura da versão luma do FGA-NN. Um backbone compartilhado extrai recursos da entrada com granulação, seguido de quatro ramos de saída personalizados para tarefas de previsão específicas: limites de intervalo, fatores de escala, frequências de corte e ajuste global Log2Scale. A rede croma usa a mesma estrutura com dimensões de entrada e saída ajustadas.

Arquitetura da versão luma do FGA-NN. Um backbone compartilhado extrai recursos da entrada com granulação, seguido de quatro ramos de saída personalizados para tarefas de previsão específicas: limites de intervalo, fatores de escala, frequências de corte e ajuste global Log2Scale. A rede croma usa a mesma estrutura com dimensões de entrada e saída ajustadas.

Os limites de intervalo são previstos usando regressão, enquanto os fatores de escala, as frequências de corte e o ajuste de escala global são tratados como problemas de classificação.

A arquitetura é ajustada para refletir a complexidade de cada tarefa, com camadas internas maiores usadas para previsões mais detalhadas; especificamente, o modelo croma espelha a estrutura luma, mas se adapta às características diferentes dos dados de cor.

Treinamento e Testes

O FGA-NN foi treinado usando quatro funções de objetivo, cada uma alinhada com uma de suas tarefas de previsão. Para as saídas de classificação, uma perda de entropia cruzada categórica foi usada para reduzir a lacuna entre rótulos previstos e verdadeiros.

Os limites de intervalo foram normalizados para uma faixa de 0 a 1 e otimizados usando uma perda combinada: uma perda L1 escalonada exponencialmente (expL1) que penalizava erros maiores mais fortemente, e uma penalidade de monotonicidade que desencorajava tendências descendentes. Todas as quatro perdas foram combinadas, com pesos altos atribuídos a fatores de corte e escala, enquanto os limites de intervalo e o ajuste Log2Scale foram ponderados em 1 e 0,1.

O treinamento foi realizado sob o otimizador Adam, com uma taxa de aprendizado de 5e-4, durante 10.000 iterações, com um tamanho de lote de 64.

A única ferramenta comparável adequada para testes comparativos foi o FGA-CONVENT, que também produz valores no formato FGC-SEI e é usado para processamento de granulação. Ambos os sistemas foram testados em sequências UHD do conjunto de avaliação subjetiva JVET, usando filmagens que contêm granulação de filme real.

Linhas verticais tracejadas indicam limites de intervalo de intensidade, enquanto o ganho Log2Scale é anotado no rótulo do eixo.

Linhas verticais tracejadas indicam limites de intervalo de intensidade, enquanto o ganho Log2Scale é anotado no rótulo do eixo.

Na imagem acima, vemos quadros idênticos gerados pelo VFGS usando parâmetros de cada método, comparados com o original. As estimativas de luma correspondentes também são plotadas contra os valores de verdade absoluta definidos manualmente usando o VFGS, que aqui traça a intensidade do pixel no eixo X (0–255), os fatores de escala no eixo Y azul (0–255) e as frequências de corte no eixo Y verde (2–14).

Os autores afirmam:

‘Um pode observar que o FGA-NN captura com precisão a tendência geral do padrão de granulação de filme de verdade e amplitude, resultando em imagens sintetizadas com granulação de filme perceptualmente semelhante à das imagens de verdade.’

‘Por outro lado, o FGA-CONVENT prevê um fator de escala menor, compensado por um fator Log2Scale correspondentemente menor como resultado de seu design, e tende a gerar um padrão de granulação de filme mais grosso do que a referência, resultando em uma aparência distinta, mas visualmente consistente.’

Eles observam que a comparação direta com parâmetros de granulação de verdade é pouco confiável, pois a escala e o Log2Scale podem compensar um ao outro, e erros menores geralmente têm pouco impacto visual.

Teste de Fé

A fidelidade da granulação de filme foi avaliada em quatro fluxos de trabalho: FGA-NN com VFGS; FGA-CONVENT mais VFGS; Style-FG; e 3R-INN. Os testes usaram os conjuntos de dados FGC-SEI e FilmGrainStyle740k, comparando a saída com a verdade usando Métricas de Similaridade Perceptual Aprendidas (LPIPS); JSD-NSS; e divergência de Kullback-Leibler (KL).

Resultados de benchmark no conjunto de dados FilmGrainStyle740k. Style-FG e 3R-INN superam os outros devido ao treinamento nesse conjunto, com o FGA-NN seguindo de perto. O FGA-CONVENT tem um desempenho subótimo, refletindo sua dependência de análise de múltiplos quadros e regiões homogêneas – condições não atendidas pelas pequenas entradas ricas em textura usadas neste caso.

Resultados de benchmark no conjunto de dados FilmGrainStyle740k. Style-FG e 3R-INN superam os outros devido ao treinamento nesse conjunto, com o FGA-NN seguindo de perto. O FGA-CONVENT tem um desempenho subótimo, refletindo sua dependência de análise de múltiplos quadros e regiões homogêneas – condições não atendidas pelas pequenas entradas ricas em textura usadas neste caso.

Desses resultados, os autores afirmam:

‘No conjunto de teste FilmGrainStyle740k, o Style-FG e o 3R-INN alcançam os melhores resultados, pois esses métodos foram treinados especificamente nesse conjunto de dados, com o FGA-NN seguindo de perto. O desempenho do FGA-CONVENT combinado com o VFGS é subótimo em ambos os conjuntos de teste. ‘

‘Isso ocorre porque a análise depende de regiões homogêneas e explora informações de múltiplos quadros em um caso de uso real de análise de granulação de filme, enquanto na avaliação atual a análise é fornecida com uma única imagem de baixa resolução (256×256 a um máximo de 768×512), que frequentemente contém textura significativa. ‘

‘Isso complica ainda mais o desafio para o método de análise convencional, tornando impossível aplicar o FGA-CONVENT a imagens tão pequenas.’

Finalmente, os autores observam que, embora os métodos baseados em aprendizado, como o 3R-INN e o Style-FG, produzam resultados visuais fortes em conjuntos de dados curados, seu alto custo computacional os torna inadequados para implantação em dispositivos de usuário final.

Comparação de quadros de baixa taxa de bits melhorados usando diferentes fluxos de trabalho de análise e síntese (terceira a última coluna).

Comparação de quadros de baixa taxa de bits melhorados usando diferentes fluxos de trabalho de análise e síntese (terceira a última coluna).

Em comparação, a abordagem proposta no novo artigo combina o módulo de análise leve FGA-NN com o método de síntese eficiente em hardware VFGS, que os autores descrevem como uma solução mais viável e implantável para reintroduzir granulação de filme em vídeo comprimido.

Eles afirmam ainda que os benefícios do FGA-NN são potencialmente consideráveis em escala:

‘[Codificando] vídeos UHD com granulação de filme em taxas de bits médias a baixas usando nossa abordagem de análise e síntese de granulação de filme permite economia de taxa de bits de até 90% em comparação com a codificação de alta taxa de bits.’

Conclusão

A obsessão com a granulação de filme é uma das concepções mais estranhas e curiosas da era pós-analógica, e é interessante notar que o que uma vez foi considerado uma limitação do meio agora se tornou um totem de verossimilhança e autenticidade em si mesmo, mesmo (talvez subconscientemente) para uma nova geração de espectadores nascidos após o declínio efetivo da emulsão.

Deve-se notar que nenhuma das metodologias de recriação de granulação de ponta, incluindo esta última inovação, pode capturar exatamente o efeito real da forma como a luz afeta camadas de halides em um processo fotoquímico verdadeiro, em uma variedade de condições. Primeiramente publicado na quarta-feira, 18 de junho de 2025.

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai