Andersons vinkel

Bruk av AI til å simulere filmkorn

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Varying grain levels in 'Jaws' (1976) – source: https://ipolcore.ipol.im/demo/clientApp/demo.html?id=192 and https://www.britannica.com/topic/Jaws-film-by-Spielberg

Lag Amerika kornig igjen: et nytt AI-verktøy kan fjerne filmkorn fra gamle opptak, komprimere videoen til en brøkdel av størrelsen, og så legge kornet tilbake så seerne ikke merker noen forskjell. Det fungerer med eksisterende video-standarder og reduserer båndbredde med opptil 90 prosent, samtidig som det beholder det vintage-utseendet.

 

For mange av oss som ser på filmer eller gamle TV-serier, er “suset” av filmkorn en trøst; selv om vi ikke bevisst registrerer det, forteller kornet oss at det vi ser, er laget med kjemikalier, ikke kode, og binder opplevelsen til den fysiske verden: til valg av film, eksponering, laboratorieprosesser og gamle epoker:

Hollywoods tilnærming til korn har skiftet i takt med endringer i kultur og produksjonsmetoder. På 1960-tallet bidro utviklingen av kamerafilm og fotografiske teknikker til åretets distinkte visuelle identitet. Senere begynte regissører som arbeidet med digitalt å gjeninnføre korn med vilje. I midten av 1980-årene valgte regissør James Cameron en spesielt grov Kodak-film til Aliens (1986, nederst til høyre i bildet over), sannsynligvis for å forbedre atmosfæren og også hjelpe med å skjule ledninger fra praktiske VFX-miniatyrarbeid. Kilde: https://archive.is/3ZSjN (min egen siste artikkel om dette emnet)

Hollywoods tilnærming til korn har skiftet i takt med endringer i kultur og produksjonsmetoder. På 1960-tallet bidro utviklingen av kamerafilm og fotografiske teknikker til åretets distinkte visuelle identitet. Senere begynte regissører som arbeidet med digitalt å gjeninnføre korn med vilje. I midten av 1980-årene valgte regissør James Cameron en spesielt grov Kodak-film til Aliens (1986, nederst til høyre i bildet over), sannsynligvis for å forbedre atmosfæren og også hjelpe med å skjule ledninger fra praktiske VFX-miniatyrarbeid. Kilde: https://archive.is/3ZSjN (min egen siste artikkel om dette emnet)

Analog tekstur kommer fra en tid da produksjon av media kostet ekte penger, tilgang var begrenset, og det var minst en løs forståelse av at bare de mest kapable eller bestemte kunne komme gjennom, og fungerer som en forkortelse for realisme og troverdighet – og når høyoppløselige opptaksteknologier eliminerte det, nostalgi.

Christopher Nolan gikk aldri over. Mens mesteparten av industrien tok til seg digitalt for sin hastighet og fleksibilitet, insisterte den anerkjente regissøren på celluloid både som en disiplin og en estetikk.

Denis Villeneuve, som arbeider innenfor digitale rørledninger, parser likevel sin footage gjennom foto-kjemiske prosesser. For Dune-filmene, som ble filmet digitalt, ble footage trykt på film og deretter scannet tilbake til digitalt, utelukkende for atmosfære og effekt.

Fake Korn

Enthusiaster for film- og TV-kvalitet assosierer synlig korn med høyoppløselige, hvor bitraten (mengden data som presses inn i hver ramme) er så høy at selv de minste detaljene, som halidkorn, er bevart.

Men hvis strømmingtjenester virkelig gjorde denne type bitrate tilgjengelig, ville det legge en alvorlig belastning på nettverkskapasiteten, og ville sannsynligvis forårsake buffering og stuttering. Derfor lager plattformer som Netflix optimaliserte AV1-versjoner av innholdet og bruker AV1-kodens muligheter til å legge til korn til filmen eller episoden på en intelligent og passende måte, og spar 30% av båndbredde i prosessen.

AV1 er designet for å inkorporere kunstig filmkorn, som i disse eksemplene. Kilde: https://waveletbeam.com/index.php/av1-film-grain-synthesis

AV1 er designet for å inkorporere kunstig filmkorn, som i disse eksemplene. Kilde: https://waveletbeam.com/index.php/av1-film-grain-synthesis

‘Korn-fetisjen’ er en relativt sjelden digital ekvivalent til atavistiske trender som vinyl-gjenopplivingen, og det er vanskelig å si om det brukes av strømmingtjenester for å gjøre høyt optimert video til å se ut som virkelig dyrt ‘råvideo’ (for seere som har underbevisst assosiert disse egenskapene), og gjøre bitrate til å se høyere ut enn det er; eller for å avlede den perceptuelle kvalitetsnedgangen som gamle 4:3-serier ellers ville tatt når strømmingtjenestene kropper dem til widescreen-aspektforhold; eller bare for å tilpasse seg den retro ‘Nolan-estetikken’ generelt.

Korn Siloet

Problemet er at korn også er støy. Digitale systemer hater støy, og strømmingkodek som AV1 fjerner støy for å spare båndbredde, med mindre korninnstillinger er eksplisitt konfigurert. Liksom AI-opp-skalerte som Topaz Gigapixel-serien, behandler korn som en feil som skal korrigeres.

I feltet for diffusjonsbasert bilde-syntese, er korn ekstremt utfordrende å generere, siden det representerer ekstrem detalj, og ville vanligvis bare dukke opp i massivt overfitted modeller, fordi hele den latente diffusjonsmodell (LDM) arkitekturen er designet til å dekonstruere støy (som korn) til klart bilde, snarere enn å behandle kornflekker som implisitte egenskaper i media.

Derfor kan det være utfordrende å lage overbevisende korn med maskinlæring. Og selv om en kunne gjøre det, ville å rendre det rett tilbake til en optimalisert video bare å øke videoens filstørrelse tilbake opp.

På grunn av denne sistnevnte logistiske overvegelsen, tilbyr state-of-the-art video-kodek som Versatile Video Coding (VVC) korn som en slags ‘sidecar-tjeneste’.

VVC komprimerer det rene, av-støyete videoen og kaster bort kornet. I stedet for å sløse bort data på å prøve å bevare tilfeldige høyfrekvente kornmønster, analyserer det kornet separat og koder en liten mengde parametre (f.eks. amplitude, frekvens og blandingsmodus) som beskriver hvordan å regenerere lignende korn under avspilling.

Disse parameterne lagres i en FGC-SEI (Film Grain Characteristics Supplemental Enhancement Information) strøm, som følger med hovedbitstrømmen. Etter avkoding, bruker en syntese-modul disse instruksjonene til å påføre syntetisk korn som ligner det opprinnelige.

Dette bevarer ‘utseendet’ til høy-bitrate, korn-rikt emulsjon, samtidig som det holder den faktiske bitrate lav, siden encoderen ikke er tvunget til å bruke ressurser på å bevare uforutsigbar støy.

I tillegg, som med separate undertekstfiler, er dette falske ‘korn’-innholdet spesifikt for videoen i question; å tilfeldig påføre generiske kornfilter i plattformer som Photoshop eller After Effects, eller i automatiserte prosesseringsrørledninger, ville ikke resultere i ’tilpasset’ korn, men i stedet en urelatert overlagring av støy:

Venstre: originalbilde. Midten: Photoshop Camera Raw Grain påført jevnt over alle kanaler. Høyre: samme Grain-filter påført hver kanal separat. Kildebilde (CC0): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (via min egen tidligere artikkel)

Venstre: originalbilde. Midten: Photoshop Camera Raw Grain påført jevnt over alle kanaler. Høyre: samme Grain-filter påført hver kanal separat. Kildebilde (CC0): https://stocksnap.io/photo/woman-beach-FJCOO6JWDP (via min egen tidligere artikkel)

Photoshops ‘Grain’-filter legger til jevnt tilfeldig støy; men ekte filmkorn kommer fra halidkristaller av varierende størrelser. Å påføre filteret til hver kanal separat (se bildet over) skaper bare mer kaos, ikke realisme. Ekte filmkorn reflekterer hvordan lys treffer lagdelte emulsjoner ved eksponeringsøyeblikket. Å simulere det ville kreve å estimere hvordan ulike områder av et bilde ville ha aktivert hver halidlag, ikke bare å splitte effekten over RGB-lagene.

FGA-NN

Inn i denne tvilsomme jakten kommer en ny forskningsartikkel fra Frankrike – en kort, men interessant utgivelse som tilbyr en kvantitativt og kvalitativt overlegen metode for å analysere og gjenskape korn:

Sammenligning mellom bakgrunnskorn og resultater fra ulike analyse- og syntesemetoder. Kilde: https://arxiv.org/pdf/2506.14350

Sammenligning mellom bakgrunnskorn og resultater fra ulike analyse- og syntesemetoder. Kilde: https://arxiv.org/pdf/2506.14350

Det nye systemet, tittelen FGA-NN, avviker ikke fra den konvensjonelle bruken av konvensjonell Gaussian-basert korn-syntese gjennom den standard VVC-kompatible metoden, Versatile Film Grain Synthesis (VFGS). Hva systemet endrer, er analysen, ved å bruke et neuralt nettverk til å estimere syntese-parameterne mer nøyaktig

Derfor er det endelige kornet fortsatt syntetisert ved hjelp av samme konvensjonelle Gaussian-modell – men nettverket gir bedre metadata til en standard, regelbasert generator, og oppnår en state-of-the-art-modell.

Den nye artikkelen er tittelen FGA-NN: Film Grain Analysis Neural Network, og kommer fra tre forskere ved InterDigital (IDCC ) R&D, Cesson-Sévigné. Selv om artikkelen ikke er lang, skal vi ta en titt på noen av de viktigste aspektene ved de fremskrittene som den nye metoden tilbyr.

Metode

For å gjenta: FGA-NN-systemet tar et korn-rikt video som innputt og trekker ut en kompakt beskrivelse av kornet, og utgangsparametre i den standardiserte FGC-SEI-formatet som brukes av diverse moderne kodek. Disse parameterne overføres sammen med videoen, og lar avkoderen gjenopprette kornet ved hjelp av VFGS, i stedet for å kode kornet direkte.

Skjema for å analysere og gjenopprette filmkorn i video-distribusjon, ved å bruke FGA-NN til parameter-uttrekk og VFGS til syntese.

Skjema for å analysere og gjenopprette filmkorn i video-distribusjon, ved å bruke FGA-NN til parameter-uttrekk og VFGS til syntese.

Til å trene nettverket, trengte forfatterne par av korn-rike videoer og tilhørende FGC-SEI-metadata. Ettersom de fleste korn-rike opptak mangler denne type metadata, skapte forskerne sin egen datasett ved å generere FGC-SEI-parametre, påføre syntetisk korn til rene videoer, og bruke disse som treningseksempler.

Treningdata for FGA-NN ble skapt ved å påføre syntetisk korn til rene opptak fra BVI-DVC– og DIV2K-datasettene. Tilfeldige FGC-SEI-parametre ble generert og brukt med VFGS-syntese-verktøyet, og hver korn-rik video ble paret med kjent metadata.

Frekvensbasert modell støttet av gjeldende video-standarder ble brukt, med parameter-områder begrenset for å opprettholde visuell plausibilitet over luma- og chroma-kanaler.

Treningdata for den nye samlingen ble skapt ved å påføre syntetisk korn til rene opptak fra BVI-DVC– og DIV2K-datasettene. Tilfeldige FGC-SEI-parametre ble generert og brukt med Versatile Film Grain Synthesis (VFGS)-verktøyet, og hver korn-rik video ble paret med kjent metadata.

Oversikt over tilfeldige FGC-SEI-parameter-områder brukt til å generere syntetisk korn for trening, påført rene opptak fra BVI-DVC- og DIV2K-datasettene. Parametre ble begrenset for å sikre visuell plausibilitet over både luma- og chroma-kanaler.

Oversikt over tilfeldige FGC-SEI-parameter-områder brukt til å generere syntetisk korn for trening, påført rene opptak fra BVI-DVC- og DIV2K-datasettene. Parametre ble begrenset for å sikre visuell plausibilitet over både luma- og chroma-kanaler.

Frekvensfilter-modellen, den eneste syntese-metoden som for tiden støttes i kodek- implementasjoner som VVC Test Model (VTM), ble brukt gjennom hele prosessen. Parameter-områder ble begrenset for å opprettholde visuell plausibilitet over både luma- og chroma-kanaler.

Nettverkseffekt

FGA-NN har to koordinerte modeller, for luma og chroma, hver designet for å forutsi de spesifikke parameterne som trengs for å gjenopprette realistisk filmkorn.

For hver innputt-bilde, estimerer systemet en mengde intensitetsintervaller, skaleringsfaktorene koblet til hver interval, de horisontale og vertikale avkorting-frekvensene, og en generell skala-justering kjent som Log2Scale-faktoren. For å håndtere dette, bruker modellen en felles funksjons-ekstraktor som prosesserer det korn-rike innputt og matet inn i fire separate utgangs-grener, hver ansvarlig for en annen prediksjonsoppgave:

Arkitektur for luma-versjonen av FGA-NN. En felles ryggbenk ekstraherer funksjoner fra korn-rike innputt-rammer, etterfulgt av fire utgangs-grener tilpasset spesifikke parameter-prediksjonsoppgaver: interval-grenser, skaleringsfaktorer, avkorting-frekvenser og global Log2Scale. Chroma-nettverket bruker samme struktur med justerte inn- og utgangs-dimensjoner.

Arkitektur for luma-versjonen av FGA-NN. En felles ryggbenk ekstraherer funksjoner fra korn-rike innputt-rammer, etterfulgt av fire utgangs-grener tilpasset spesifikke parameter-prediksjonsoppgaver: interval-grenser, skaleringsfaktorer, avkorting-frekvenser og global Log2Scale. Chroma-nettverket bruker samme struktur med justerte inn- og utgangs-dimensjoner.

Interval-grenser predikeres ved hjelp av regresjon, mens skaleringsfaktorer, avkorting-frekvenser og den globale skala-innstillingen behandles som klassifiseringsproblemer.

Arkitekturen er tilpasset for å reflektere kompleksiteten av hver oppgave, med større interne lag brukt for mer fin-granedde prediksjoner; spesielt, chroma-modellen speiler luma-strukturen, men tilpasser seg de forskjellige egenskapene til farge-data.

Trening og tester

FGA-NN ble trent ved hjelp av fire objektive funksjoner, hver av dem tilpasset en av dens prediksjonsoppgaver. For klassifiseringsutgangene ble en kategorisk cross-entropy-tap brukt for å redusere gapet mellom predikerte etiketter og bakgrunns-sannheten.

Interval-grenser ble normalisert til et 0-til-1-område og optimert ved hjelp av en kombinerings-tap: en eksponentielt skalert L1 tap (expL1) som straffet større feil mer hardt, og en monotone-straff som diskurerte nedadgående trender. Alle fire tap ble kombinert, med høye vekter tildelt avkorting- og skaleringsfaktorer, mens interval-grenser og Log2Scale ble vektert på 1 og 0,1.

Trening ble utført under Adam-optimatoren, med en læringshastighet på 5e-4, over 10 000 iterasjoner, med en batch-størrelse på 64.

Den eneste sammenlignbare verktøyet som var egnet for sammenlignende tester, var FGA-CONVENT, som også produserer verdier i FGC-SEI-formatet, og brukes til korn-behandling. Begge systemene ble testet på UHD-sekvenser fra JVET-subjektive evalueringssettet, ved å bruke følsomme perceptuelle likhets-mål (LPIPS); JSD-NSS; og Kullback–Leibler (KL) divergens.

Lodrette streker indikerer intensitets-interval-grenser, mens Log2Scale-gevinsten er notert i akse-etiketten.

Lodrette streker indikerer intensitets-interval-grenser, mens Log2Scale-gevinsten er notert i akse-etiketten.

I bildet over ser vi identiske avkortede rammeverk generert av VFGS ved hjelp av parametre fra hver metode, sammenlignet med det opprinnelige. Deres respektive luma-estimater er også plottet mot bakgrunns-sannheter satt manuelt ved hjelp av VFGS, som her diagrammerer piksel-intensitet på X-aksen (0–255), skaleringsfaktorer på blå Y-aksen (0–255), og avkorting-frekvenser på grønn Y-aksen (2–14).

Forfatterne slår fast:

‘En kan observere at FGA-NN nøyaktig fanger den generelle trenden av bakgrunns-korn-mønsteret og -amplituden, og resulterer i syntetiserte bilder med perceptuelt like filmkorn som de bakgrunns-sannheter.’

‘På den andre siden, forutsier FGA-CONVENT en lavere skaleringsfaktor, kompensert av en tilsvarende lavere Log2Scale-faktor som et resultat av sin design, og tenderer til å generere et grovere filmkorn-mønster enn referansen, og resulterer i en distinkt, men visuelt konsistent, utseende.’

De noterer at direkte sammenligning med bakgrunns-korn-parametre er uansvarlig, siden skalerings- og Log2Scale-faktorer kan kompensere for hverandre, og mindre feil ofte har liten visuell innvirkning.

Test av tro

Filmkorn-trofasthet ble målt over fire arbeidsflyter: FGA-NN med VFGS; FGA-CONVENT pluss VFGS; Style-FG; og 3R-INN. Tester brukte både FGC-SEI- og FilmGrainStyle740k-datasettene, og sammenlignet utgang med bakgrunns-sannheter ved hjelp av LPIPS; JSD-NSS; og Kullback–Leibler (KL) divergens.

Benchmark-resultater på FilmGrainStyle740k-datasettet. Style-FG og 3R-INN overgår andre på grunn av at de er trent på dette settet, med FGA-NN like etter. FGA-CONVENT underpresterer, og reflekterer sin avhengighet av multi-ramme-analyse og homogene regioner – betingelser som ikke er møtt av de små, tekstur-rike innputtene som brukes i denne sammenhengen.

Benchmark-resultater på FilmGrainStyle740k-datasettet. Style-FG og 3R-INN overgår andre på grunn av at de er trent på dette settet, med FGA-NN like etter. FGA-CONVENT underpresterer, og reflekterer sin avhengighet av multi-ramme-analyse og homogene regioner – betingelser som ikke er møtt av de små, tekstur-rike innputtene som brukes i denne sammenhengen.

Av disse resultater slår forfatterne fast:

‘På FilmGrainStyle740k-testsettet, oppnår Style-FG og 3R-INN de beste resultater, siden disse metodene ble spesifikt trent på dette settet, med FGA-NN like etter. FGA-CONVENTs ytelse er underoptimal på begge testsettene.

‘Dette skyldes bare det faktum at analysen avhenger av homogene regioner og utnytter informasjon fra flere rammeverk i en virkelig filmkorn-analyse-sak, mens i denne evalueringen analysen får en enkelt lav-oppløselig bilde (256×256 til maksimalt 768×512), som ofte inneholder betydelig tekstur.

‘Dette vanskeliggjør utfordringen for konvensjonell analyse-metode, og gjør det umulig å bruke FGA-CONVENT på slike små bilder.’

Til slutt noterer forfatterne at mens læring-baserte metoder som 3R-INN og Style-FG produserer sterke visuelle resultater på kurerte datasett, er deres høye beregningskostnad ikke egnet for distribusjon på sluttbruker-enheter.

Sammenligning av lav-bitrate-rammer forbedret med ulike analyse- og syntese-arbeidsflyter (tredje til siste kolonner).

Sammenligning av lav-bitrate-rammer forbedret med ulike analyse- og syntese-arbeidsflyter (tredje til siste kolonner).

Sammenlignet med dette, parer den nye artikkelen den lette FGA-NN-analyse-modulen med den hånd-ter-effektive VFGS-syntese-metoden, som forfatterne beskriver som en mer levedyktig og distribuerbar løsning for å gjeninnføre filmkorn i komprimert video.

De slår fast videre at fordelene med FGA-NN er potensielt betydelige, i skala:

‘[Koding] UHD-videoer med filmkorn ved medium til lav bitrate ved hjelp av vår filmkorn-analyse- og syntese-arbeidsflyt, muliggjør bitrate-besparelser på opptil 90% sammenlignet med høy-bitrate-koding.’

Konklusjon

Besettelsen med filmkorn er en av de merkelige og kurøse konseptene i den post-analoge tiden, og det er interessant å notere at det som en gang ble ansett som en begrensning av mediumet, nå har blitt et symbol på autentisitet og realisme i seg selv, selv (kanskje underbevisst) for en ny generasjon av seere født etter den effektive nedgangen i emulsjon.

Det bør noteres at ingen av de state-of-the-art korn-gjenskapingsmetodene, inkludert denne siste innovasjonen, kan nøyaktig fange den sanne effekten av hvordan lys påvirker lag av halider i en ekte foto-kjemisk prosess, over en rekke betingelser.

 

Først publisert onsdag, 18. juni 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai