Andersons vinkel

Å lære AI til å gi bedre video-kritikk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

Mens store visuelt-språklige modeller (LVLMs) kan være nyttige hjelpemidler i å tolke noen av de mer arcane eller utfordrende bidragene i datavisjonslitteraturen, er det ett område der de er begrenset: å bestemme fortjenesten og den subjektive kvaliteten på noen videoeksempler som følger med nye artikler*.

Dette er et kritisk aspekt av et bidrag, siden vitenskapelige artikler ofte søker å generere begeistring gjennom overbevisende tekst eller visuelt materiale – eller begge deler.

Men i tilfeller der prosjekter involverer video-syntese, må forfatterne vise faktisk video-utgang eller risikere å få arbeidet forkastet; og det er i disse demonstrasjonene at gapet mellom dristige påstander og virkelig ytelse oftest blir tydelig.

Jeg leste boken, men så ikke filmen

For tiden vil de fleste populære API-baserte store språkmodeller (LLM) og store visuelt-språklige modeller (LVLMs) ikke engasjere seg i direkte analyse av video-innhold på noen måte, kvalitativt eller annet. I stedet kan de bare analysere relaterte transkripter – og kanskje kommentar-tråder og annet rent tekst-basert tilleggs-materiale.

De forskjellige innvendingene til GPT-4o, Google Gemini og Perplexity, når de ble bedt om å direkte analysere video, uten å bruke transkripter eller andre tekst-baserte kilder.

De forskjellige innvendingene til GPT-4o, Google Gemini og Perplexity, når de ble bedt om å direkte analysere video, uten å bruke transkripter eller andre tekst-baserte kilder.

Likevel kan en LLM skjule eller benekte sin evne til å faktisk se videoer, med mindre du konfronterer dem med det:

Etter å ha blitt bedt om å gi en subjektiv vurdering av en ny forskningsartikkel assosiert videoer, og etter å ha forfalsket en ekte mening, innrømmer ChatGPT-4o til slutt at det ikke kan faktisk se videoer direkte.

Etter å ha blitt bedt om å gi en subjektiv vurdering av en ny forskningsartikkel assosiert videoer, og etter å ha forfalsket en ekte mening, innrømmer ChatGPT-4o til slutt at det ikke kan faktisk se videoer direkte.

Selv om modeller som ChatGPT-4o er multimodale, og kan i det minste analysere enkelte bilder (slik som en uttrukket ramme fra en video, se bildet over), er det noen problemer også med dette: først og fremst er det liten grunn til å gi troverdighet til en LLMs kvalitative mening, ikke minst fordi LLMs er utsatt for ‘menneske-vennlig’ snarere enn ærlig diskurs.

For det andre er mange, hvis ikke de fleste av en generert videos problemer sannsynligvis å ha en temporal aspekt som helt går tapt i en ramme-grab – og så er undersøkelsen av enkelte ramer uten mening.

Til slutt kan LLM bare gi en påstått ‘verdi-dømming’ basert (igjen) på å ha absorbert tekst-basert kunnskap, for eksempel i forhold til deepfake-bilder eller kunsthistorie. I et slikt tilfelle tillater trent domene-kunnskap LLM å korrelere analyserte visuelle kvaliteter av et bilde med lært innkapsling basert på menneskelig innsikt:

FakeVLM-prosjektet tilbyr målrettet deepfake-oppdaging via en spesialisert multi-modal visuelt-språklig modell. Kilde: https://arxiv.org/pdf/2503.14905

FakeVLM-prosjektet tilbyr målrettet deepfake-oppdaging via en spesialisert multi-modal visuelt-språklig modell. Kilde: https://arxiv.org/pdf/2503.14905

Dette betyr ikke at en LLM ikke kan få informasjon direkte fra en video; for eksempel, med hjelp av hjelpe-AI-systemer som YOLO, kunne en LLM identifisere objekter i en video – eller kunne gjøre dette direkte, hvis den var trent for en over-gjennomsnittlig mengde multimodale funksjoner.

Men den eneste måten en LLM kunne muligens vurderer en video subjektivt (dvs. ‘Det ser ikke ut til å være ekte for meg’) er gjennom å bruke en tap-funksjon-basert metode som enten er kjent for å reflektere menneskelig mening godt, eller som er direkte informert av menneskelig mening.

Tap-funksjoner er matematiske verktøy som brukes under trening til å måle hvor langt en modells prediksjoner er fra de riktige svarene. De gir tilbakemelding som guider modellens læring: jo større feilen, jo høyere tapet. Etterhvert som treningen skjer, justerer modellen sine parametre for å redusere dette tapet, og forbedrer gradvis sin evne til å gi nøyaktige prediksjoner.

Tap-funksjoner brukes både til å regulere treningen av modeller, og også til å kalibrere algoritmer som er designet til å vurdere utgangen av AI-modeller (slik som evaluering av simulerter fotorealistiske innhold fra en generativ video-modell).

Betinget visjon

En av de mest populære metrikker/tap-funksjoner er Fréchet Inception Distance (FID), som vurderer kvaliteten på genererte bilder ved å måle likheten mellom deres distribusjon (hvor bilder er fordelt eller gruppert etter visuelle egenskaper) og den til ekte bilder.

Spesifikt beregner FID den statistiske forskjellen, ved hjelp av midler og kovarianser, mellom egenskaper trukket fra både sett av bilder ved hjelp av (ofte kritisert) Inception v3-klassifiseringsnettverk. En lavere FID-score indikerer at de genererte bildene er mer likt ekte bilder, og antyder bedre visuell kvalitet og mangfold.

Likevel er FID i seg selv sammenlignende, og kan argumenteres for å være selv-referensiell i natur. For å rette opp dette, er den senere Conditional Fréchet Distance (CFD, 2021)-tilnærmingen forskjellig fra FID ved å sammenligne genererte bilder med ekte bilder, og vurderer en score basert på hvor godt begge sett møter en ekstra betingelse, slik som en (uunngåelig subjektiv) klasse-etikett eller inngangs-bilde.

På denne måten tar CFID hensyn til hvor nøyaktig bildene møter de ønskede betingelsene, ikke bare deres overordnede realisme eller mangfold blant seg selv.

Eksempler fra 2021 CFD-utgaven. Kilde: https://github.com/Michael-Soloveitchik/CFID/

Eksempler fra 2021 CFD-utgaven. Kilde: https://github.com/Michael-Soloveitchik/CFID/

CFD følger en ny trend mot å bake kvalitative menneskelige tolkninger inn i tap-funksjoner og metrikker. Selv om en slik menneske-sentrert tilnærming garanterer at den resulterende algoritmen ikke vil være ‘sjælløs’ eller mekanisk, presenterer det samtidig en rekke problemer: muligheten for fordommer; byrden av å oppdatere algoritmen i tråd med nye praksiser, og det faktum at dette vil fjerne muligheten for konsistente sammenligningsstandarder over en periode på flere år og prosjekter; og budsjetterings-begrensninger (færre menneskelige bidragsytere vil gjøre bestemmelsene mer tvilsomme, mens en høyere antall kunne forhindre nyttige oppdateringer på grunn av kostnader).

cFreD

Dette bringer oss til en ny artikkel fra USA som tilsynelatende tilbyr Conditional Fréchet Distance (cFreD), en ny tilnærming til CFD som er designet til å bedre reflektere menneskelige preferanser ved å vurderer både visuell kvalitet og tekst-bilde-justering

Delvis resultater fra den nye artikkelen: bilde-rangeringer (1–9) ved forskjellige metrikker for prompten

Delvis resultater fra den nye artikkelen: bilde-rangeringer (1–9) ved forskjellige metrikker for prompten “Et viktig rom med en sofa og en laptop datamaskin som hviler på sofaen.” Grønne markeringer viser den øverste menneske-vurderte modellen (FLUX.1-dev), lilla den laveste (SDv1.5). Bare cFreD matcher menneske-rangeringer. Vennligst se kilde-artikkelen for fullstendige resultater, som vi ikke har plass til å gjengi her. Kilde: https://arxiv.org/pdf/2503.21721

Forfatterne argumenterer for at eksisterende vurderingsmetoder for tekst-til-bilde-syntese, slik som Inception Score (IS) og FID, dårlig sammenfaller med menneskelig dømming fordi de bare måler bilde-kvalitet uten å vurdere hvordan bildene matcher deres prompter:

‘For eksempel, betrakt en datasett med to bilder: ett av en hund og ett av en katt, hver parret med deres respektive prompt. En perfekt tekst-til-bilde-modell som feilaktig bytter disse koblingene (dvs. genererer en katt for hund-prompt og vice versa) ville oppnå nesten null FID siden den overordnede distribusjonen av katter og hunder opprettholdes, til tross for misjusteringen med de ønskede promptene.

‘Vi viser at cFreD fanger bedre bilde-kvalitetsvurdering og betingelse på inngangs-tekst og resulterer i forbedret sammenfall med menneskelige preferanser.’

Artikkelenes tester indikerer at forfatternes foreslåtte metrik, cFreD, konsistent oppnår høyere sammenfall med menneskelige preferanser enn FID, FDDINOv2, CLIPScore og CMMD på tre benchmark-datasett (PartiPrompts, HPDv2 og COCO).

Artikkelenes tester indikerer at forfatternes foreslåtte metrik, cFreD, konsistent oppnår høyere sammenfall med menneskelige preferanser enn FID, FDDINOv2, CLIPScore og CMMD på tre benchmark-datasett (PartiPrompts, HPDv2 og COCO).

Konsept og metode

Forfatterne bemerker at den nåværende gullstandarden for å vurdere tekst-til-bilde-modeller innebærer å samle inn menneskelige preferansedata gjennom crowdsourcet sammenligninger, lignende metoder brukt for store språkmodeller (slik som LMSys Arena).

For eksempel bruker PartiPrompts Arena 1 600 engelske prompeter, og presenterer deltakerne med par av bilder fra forskjellige modeller og ber dem velge deres foretrukne bilde.

Lignende Text-to-Image Arena Leaderboard bruker bruker-sammenligninger av modell-utgang til å generere rangeringer via ELO-poeng. Likevel er det kostbart og treg å samle inn denne type menneskelig vurderingsdata, noe som har ført til at noen plattformer – som PartiPrompts Arena – har stoppet oppdateringene helt.

Artificial Analysis Image Arena Leaderboard, som rangerer de nåværende estimerte lederne i generativ visuell AI. Kilde: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Artificial Analysis Image Arena Leaderboard, som rangerer de nåværende estimerte lederne i generativ visuell AI. Kilde: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Selv om alternative metoder trent på historiske menneskelige preferansedata eksisterer, er deres effektivitet for å vurdere fremtidige modeller usikker, fordi menneskelige preferanser kontinuerlig utvikler seg. Derfor synes automatiske metrikker som FID, CLIPScore og forfatternes foreslåtte cFreD sannsynligvis å forbli viktige vurderingsverktøy.

Forfatterne antar at både ekte og genererte bilder betinget av en prompt følger Gaussian distribusjoner, hver definert av betingede midler og kovarianser. cFreD måler den forventede Fréchet-avstanden over prompeter mellom disse betingede distribusjonene. Dette kan formuleres enten direkte i termer av betingede statistikker eller ved å kombinere ubetingede statistikker med kryss-kovarianser som involverer prompten.

Ved å inkorporere prompten på denne måten, er cFreD i stand til å vurdere både realisme av bildene og deres konsistens med den gitte teksten.

Data og tester

For å vurdere hvor godt cFreD sammenfaller med menneskelige preferanser, brukte forfatterne bilde-rangeringer fra flere modeller promptet med samme tekst. Deres vurdering ble basert på to kilder: Human Preference Score v2 (HPDv2) testsettet, som inkluderer ni genererte bilder og ett COCO grunn-sannhets-bilde per prompt; og den ovennevnte PartiPrompts Arena, som inneholder utgang fra fire modeller over 1 600 prompeter.

Forfatterne samlet de spredte Arena-dataene inn i ett enkelt datasett; i tilfeller hvor det ekte bildet ikke rangerte høyest i menneskelige vurderinger, brukte de det øverste vurderede bildet som referansen.

For å teste nyere modeller, samplet de 1 000 prompeter fra COCOs trenings- og valideringssett, og sikret at det ikke var noen overlap med HPDv2, og genererte bilder ved hjelp av ni modeller fra Arena Leaderboard. De originale COCO-bildene tjente som referanser i denne delen av vurderingen.

cFreD-tilnærmingen ble vurderet gjennom fire statistiske metrikker: FID; FDDINOv2; CLIPScore; og CMMD. Den ble også vurderet mot fire lært metrikker trent på menneskelige preferansedata: Aesthetic Score; ImageReward; HPSv2; og MPS.

Forfatterne vurderer sammenfall med menneskelig dømming fra både en rangering- og en scoring-perspektiv: for hver metrikk, ble modell-scorer rapportert og rangeringer beregnet for deres sammenfall med menneskelig vurderingsresultater, med cFreD som bruker DINOv2-G/14 for bilde-innkapslinger og OpenCLIP ConvNext-B Tekst-Encoder for tekst-innkapslinger†.

Tidligere arbeid på å lære menneskelige preferanser målte ytelse ved hjelp av per-item-rangeringsnøyaktighet, som beregner rangeringsnøyaktighet for hver bilde-tekst-par før gjennomsnittlig resultater.

Forfatterne vurderer i stedet cFreD ved hjelp av en global rangeringsnøyaktighet, som vurderer den overordnede rangeringsytelsen over hele datasettet; for statistiske metrikker ble rangeringer direkte avledet fra rå-scorer; og for metrikker trent på menneskelige preferanser, ble rangeringene først gjennomsnittlig over alle prøver, og deretter bestemt den endelige rangeringen fra disse gjennomsnittene.

Initielle tester brukte ti rammer: GLIDE; COCO; FuseDream; DALLE 2; VQGAN+CLIP; CogView2; Stable Diffusion V1.4; VQ-Diffusion; Stable Diffusion V2.0; og LAFITE.

Modell-rangeringer og -scorer på HPDv2-testsettet ved statistiske metrikker (FID, FDDINOv2, CLIPScore, CMMD og cFreD) og menneske-preferans-trent metrikker (Aesthetic Score, ImageReward, HPSv2 og MPS). Beste resultater er vist i fet skrift, andre beste er understreket.

Modell-rangeringer og -scorer på HPDv2-testsettet ved statistiske metrikker (FID, FDDINOv2, CLIPScore, CMMD og cFreD) og menneske-preferans-trent metrikker (Aesthetic Score, ImageReward, HPSv2 og MPS). Beste resultater er vist i fet skrift, andre beste er understreket.

Av de initielle resultater, kommenterer forfatterne:

‘cFreD oppnår den høyeste sammenfallen med menneskelige preferanser, med en korrelasjon på 0,97. Blant statistiske metrikker oppnår cFreD den høyeste korrelasjonen og er sammenlignbar med HPSv2 (0,94), en modell som uttrykkelig er trent på menneskelige preferanser. Gitt at HPSv2 ble trent på HPSv2-treningsettet, som inkluderer fire modeller fra testsettet, og brukte de samme annotatorene, koder den innebygget bestemte menneskelige preferanser-bias i samme setting.

‘I motsetning oppnår cFreD en sammenlignbar eller overlegen korrelasjon med menneskelig vurdering uten noen menneskelig preferans-trening.

‘Disse resultater demonstrerer at cFreD gir mer pålitelige rangeringer over diverse modeller sammenlignet med standard automatisk metrikker og metrikker trent uttrykkelig på menneskelige preferansedata.’

Blant alle vurderede metrikker, oppnår cFreD den høyeste rangeringsnøyaktigheten (91,1%), og demonstrerer – ifølge forfatterne – en sterk sammenfall med menneskelig dømming.

HPSv2 fulgte med 88,9%, mens FID og FDDINOv2 produserte konkurrerende scorer på 86,7%. Selv om metrikker trent på menneskelige preferanser generelt sammenfalt godt med menneskelig vurdering, viste cFreD seg å være den mest robuste og pålitelige overall.

Nedenfor ser vi resultater fra den andre test-runden, denne gangen på PartiPrompts Arena, ved å bruke SDXL; Kandinsky 2; Würstchen; og Karlo V1.0.

Modell-rangeringer og -scorer på PartiPrompt ved statistiske metrikker (FID, FDDINOv2, CLIPScore, CMMD og cFreD) og menneske-preferans-trent metrikker (Aesthetic Score, ImageReward og MPS). Beste resultater er i fet skrift, andre beste er understreket.

Modell-rangeringer og -scorer på PartiPrompt ved statistiske metrikker (FID, FDDINOv2, CLIPScore, CMMD og cFreD) og menneske-preferans-trent metrikker (Aesthetic Score, ImageReward og MPS). Beste resultater er i fet skrift, andre beste er understreket.

Her sier artikkelen:

‘Blant statistiske metrikker oppnår cFreD den høyeste korrelasjonen med menneskelig vurdering (0,73), med FID og FDDINOv2 begge når en korrelasjon på 0,70. I motsetning viser CLIP-scoren en svært lav korrelasjon (0,12) med menneskelig dømming.

‘I menneske-preferans-trent-kategorien oppnår HPSv2 den sterkeste sammenfallen, med en korrelasjon på 0,83, etterfulgt av ImageReward (0,81) og MPS (0,65). Disse resultaterene fremhever at mens cFreD er en robust automatisk metrikk, står HPSv2 ut som den mest effektive i å fange menneskelig vurderings-trender i PartiPrompts Arena.’

Til slutt gjennomførte forfatterne en vurdering på COCO-datasettet ved å bruke ni moderne tekst-til-bilde-modeller: FLUX.1[dev]; Playgroundv2.5; Janus Pro; og Stable Diffusion-variantene SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 og 1.5.

Menneske-preferans-rangeringer ble hentet fra Text-to-Image Leaderboard, og gitt som ELO-poeng:

Modell-rangeringer på tilfeldig valgte COCO-prompeter ved automatisk metrikker (FID, FDDINOv2, CLIPScore, CMMD og cFreD) og menneske-preferans-trent metrikker (Aesthetic Score, ImageReward, HPSv2 og MPS). En rangeringsnøyaktighet under 0,5 indikerer mer diskordant enn konsonant par, og beste resultater er i fet skrift, andre beste er understreket.

Modell-rangeringer på tilfeldig valgte COCO-prompeter ved automatisk metrikker (FID, FDDINOv2, CLIPScore, CMMD og cFreD) og menneske-preferans-trent metrikker (Aesthetic Score, ImageReward, HPSv2 og MPS). En rangeringsnøyaktighet under 0,5 indikerer mer diskordant enn konsonant par, og beste resultater er i fet skrift, andre beste er understreket.

Med hensyn til denne runden, sier forskerne:

‘Blant statistiske metrikker (FID, FDDINOv2, CLIP, CMMD og vår foreslåtte cFreD), er det bare cFreD som viser en sterk korrelasjon med menneskelige preferanser, med en korrelasjon på 0,33 og en ikke-triviell rangeringsnøyaktighet på 66,67%. ‘Dette resultatet plasserer cFreD som den tredje mest sammenfallende metrikken overall, overgått bare av menneske-preferans-trent metrikker ImageReward, HPSv2 og MPS.

‘Notabelt viser alle andre statistiske metrikker en svært svakere sammenfall med ELO-rangeringer, og som følge av dette, inverterer rangeringene, noe som resulterer i en rangeringsnøyaktighet under 0,5.

‘Disse funnene fremhever at cFreD er følsom for både visuell troverdighet og prompt-konsistens, og styrker dens verdi som en praktisk, trening-fri alternativ for å benchmark tekst-til-bilde-generering.’

Forfatterne testet også Inception V3 som en rygg, og påpekte dets utbredelse i litteraturen, og fant at InceptionV3 performerte rimelig, men ble overgått av transformer-baserte rygger som DINOv2-L/14 og ViT-L/16, som mer konsistent sammenfalt med menneskelige rangeringer – og de hevder at dette støtter erstattning av InceptionV3 i moderne vurderingssett.

Vin-rater som viser hvor ofte hver bilde-ryggs rangeringer sammenfalt med de sanne menneske-avledede rangeringer på COCO-datasettet.

Vin-rater som viser hvor ofte hver bilde-ryggs rangeringer sammenfalt med de sanne menneske-avledede rangeringer på COCO-datasettet.

Konklusjon

Det er tydelig at mens menneske-i-løkken-løsninger er den optimale tilnærmingen til utvikling av metrikk og tap-funksjoner, vil skalaen og hyppigheten av oppdateringer nødvendige for slike skjema fortsatt gjøre dem upraktiske – kanskje frem til en tid når vidt utbredt offentlig deltakelse i vurderinger generelt er incentivert; eller, som har vært tilfelle med CAPTCHAs, påtvunget.

Troverdigheten av forfatternes nye system avhenger fortsatt av dens sammenfall med menneskelig dømming, om enn på ett trinn mer enn mange nyere menneske-deltakende tilnærminger; og cFreDs legitimitet forblir derfor fortsatt i menneskelig preferans-data (selvsagt, siden uten en slik benchmark ville påstanden om at cFreD reflekterer menneske-liknende vurdering være ubevist).

Argumenterbart kan det være en feil å innkodere våre nåværende kriterier for ‘realisme’ i generativ utgang i en metrikk-funksjon, siden vår definisjon av dette konseptet nå er under angrep fra den nye bølgen av generative AI-systemer, og er satt for hyppige og betydelige revisjoner.

 

* På dette punktet ville jeg vanligvis inkludere et eksemplarisk illustrativt video-eksempel, kanskje fra en nylig akademisk innlevering; men det ville være ondskapsfullt – noen som har tilbragt mer enn 10-15 minutter med å bla gjennom Arxivs generative AI-utgang, vil allerede ha kommet over supplerende videoer hvis subjektivt dårlige kvalitet indikerer at den relaterte innleveringen ikke vil bli hyllet som et landemerke-papir.

En total på 46 bilde-rygg-modeller ble brukt i eksperimentene, ikke alle av dem er vist i de grafiske resultater. Vennligst se artikkelenes appendiks for en fullstendig liste; de som er vist i tabellene og figurene er listet.

 

Først publisert tirsdag, 1. april 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai