Andersons vinkel

Att lära AI att ge bättre videokritik

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

Medan stora vision-språkmodeller (LVLM) kan vara användbara hjälpmedel för att tolka vissa av de mer svåra eller utmanande bidragen i datorseende-litteraturen, finns det ett område där de är begränsade: att bestämma förtjänsten och den subjektiva kvaliteten på några videosexempel som åtföljer nya artiklar*.

Detta är ett kritiskt aspekt av en insändning, eftersom vetenskapliga artiklar ofta syftar till att generera entusiasm genom övertygande text eller visuella element – eller båda.

Men i fallet med projekt som involverar video-syntes måste författarna visa faktisk video-utdata eller riskera att deras arbete förkastas; och det är i dessa demonstrationer som gapet mellan djärva påståenden och verklig prestanda oftast blir uppenbar.

Jag läste boken, såg inte filmen

För närvarande kommer de flesta populära API-baserade stora språkmodeller (LLM) och stora vision-språkmodeller (LVLM) inte att engagera sig i direkt analys av video-innehåll på något sätt, kvalitativt eller annars. Istället kan de bara analysera relaterade transkriptioner – och kanske kommentars-trådar och annat strikt text-baserat material.

De olika invändningarna från GPT-4o, Google Gemini och Perplexity, när de tillfrågades att direkt analysera video, utan tillgång till transkriptioner eller andra text-baserade källor.

De olika invändningarna från GPT-4o, Google Gemini och Perplexity, när de tillfrågades att direkt analysera video, utan tillgång till transkriptioner eller andra text-baserade källor.

Men en LLM kan dölja eller förneka sin oförmåga att faktiskt titta på videor, såvida du inte konfronterar dem med det:

Efter att ha tillfrågats att ge en subjektiv utvärdering av en ny forskningsartikels associerade videor, och ha fejkat en riktig åsikt, erkänner ChatGPT-4o slutligen att den inte kan titta på video direkt.

Efter att ha tillfrågats att ge en subjektiv utvärdering av en ny forskningsartikels associerade videor, och ha fejkat en riktig åsikt, erkänner ChatGPT-4o slutligen att den inte kan titta på video direkt.

Även om modeller som ChatGPT-4o är multimodala och kan åtminstone analysera enskilda foton (såsom en uttagen ram från en video, se bild ovan), finns det vissa problem även med detta: först och främst finns det knappast någon grund för att ge legitimitet åt en LLM:s kvalitativa åsikt, inte minst för att LLM är benägna att “gilla människor” snarare än äkta diskurs.

Andra, många, om inte de flesta av en genererad videos problem är troligen att ha en temporär aspekt som är helt förlorad i en ram-grabb – och således tjänar examinationen av enskilda ramar inget syfte.

Slutligen kan LLM endast ge en påstådd “värdebedömning” baserad (återigen) på att ha absorberat text-baserad kunskap, till exempel i fråga om deepfake-bilder eller konsthistoria. I ett sådant fall tillåter tränad domänkunskap LLM att korrelera analyserade visuella kvaliteter på en bild med inlärda inbäddningar baserade på mänsklig insikt:

FakeVLM-projektet erbjuder riktad deepfake-detektion via en specialiserad multimodal vision-språkmodell. Källa: https://arxiv.org/pdf/2503.14905

FakeVLM-projektet erbjuder riktad deepfake-detektion via en specialiserad multimodal vision-språkmodell. Källa: https://arxiv.org/pdf/2503.14905

Detta betyder inte att en LLM inte kan erhålla information direkt från en video; till exempel, med hjälp av adjungerade AI-system som YOLO, kunde en LLM identifiera objekt i en video – eller kunde göra detta direkt, om den tränats för ett ovanligt stort antal multimodala funktioner.

Men det enda sättet som en LLM skulle kunna utvärdera en video subjektivt (dvs. ‘Det ser inte riktigt ut för mig’) är genom att tillämpa en förlustfunktion-baserad metric som antingen är känd för att återspegla mänsklig åsikt väl eller som direkt informeras av mänsklig åsikt.

Förlustfunktioner är matematiska verktyg som används under träning för att mäta hur långt en modells förutsägelser är från de korrekta svaren. De tillhandahåller feedback som vägleder modellens inlärning: ju större felet är, desto högre förlusten. När träningen fortskrider justerar modellen sina parametrar för att minska denna förlust, gradvis förbättrar sin förmåga att göra precisa förutsägelser.

Förlustfunktioner används både för att reglera träningen av modeller och för att kalibrera algoritmer som är utformade för att utvärdera utdata från AI-modeller (såsom utvärdering av simulerad fotorealistisk innehåll från en generativ videomodell).

Villkorlig syn

En av de mest populära metric/förlustfunktionerna är Fréchet Inception Distance (FID), som utvärderar kvaliteten på genererade bilder genom att mäta likheten mellan deras distribution (vilket här betyder ‘hur bilder är spridda eller grupperade av visuella funktioner’) och den för verkliga bilder.

Specifikt beräknar FID den statistiska skillnaden, med hjälp av medelvärden och kovarianser, mellan funktioner som extraheras från båda uppsättningarna av bilder med hjälp av (den ofta kritiserade) Inception v3-klassificeringsnätverket. En lägre FID-poäng indikerar att de genererade bilderna är mer lika verkliga bilder, vilket innebär bättre visuell kvalitet och mångfald.

Men FID är i princip jämförande och kan anses vara självrefererande till sin natur. För att åtgärda detta skiljer sig den senare Villkorlig Fréchet Distance (CFD, 2021) från FID genom att jämföra genererade bilder med verkliga bilder och utvärdera en poäng baserad på hur väl båda uppsättningarna matchar en ytterligare villkor, såsom en (oundvikligen subjektiv) klass-etikett eller inmatningsbild.

På detta sätt tar CFD hänsyn till hur väl bilder uppfyller de avsedda villkoren, inte bara deras övergripande realism eller mångfald i sig själva.

Exempel från 2021 års CFD-utgåva. Källa: https://github.com/Michael-Soloveitchik/CFID/

Exempel från 2021 års CFD-utgåva. Källa: https://github.com/Michael-Soloveitchik/CFID/

CFD följer en sen trend mot att integrera kvalitativ mänsklig tolkning i förlustfunktioner och metric-algoritmer. Även om ett sådant mänskligt centrerat tillvägagångssätt garanterar att den resulterande algoritmen inte kommer att vara “själlös” eller enbart mekanisk, presenterar det samtidigt ett antal problem: möjligheten till fördomar; bördan att uppdatera algoritmen i linje med nya metoder, och det faktum att detta kommer att ta bort möjligheten till konsekventa jämförande standarder under en period av år över projekt; och budgetbegränsningar (färre mänskliga bidragsgivare kommer att göra bestämmandena mer tvivelaktiga, medan ett högre antal kan förhindra användbara uppdateringar på grund av kostnad).

cFreD

Detta leder oss till en ny artikel från USA som tydligen erbjuder Villkorlig Fréchet Distance (cFreD), en ny tolkning av CFD som är utformad för att bättre återspegla mänskliga preferenser genom att utvärdera både visuell kvalitet och text-bild-alignment

Delvisa resultat från den nya artikeln: bild-rankningar (1–9) med olika metric för prompten

Delvisa resultat från den nya artikeln: bild-rankningar (1–9) med olika metric för prompten “Ett vardagsrum med en soffa och en laptop-dator som vilar på soffan.” Gröna markeringar den högst rankade modellen (FLUX.1-dev), lila den lägst rankade (SDv1.5). Endast cFreD matchar mänskliga rankningar. Vänligen se käll-artikeln för fullständiga resultat, som vi inte har utrymme att återge här. Källa: https://arxiv.org/pdf/2503.21721

Författarna hävdar att befintliga utvärderingsmetoder för text-till-bild-syntes, såsom Inception Score (IS) och FID, inte stämmer överens med mänsklig bedömning eftersom de endast mäter bildkvalitet utan att beakta hur väl bilderna matchar sina prompt:

‘Till exempel, överväg en datamängd med två bilder: en av en hund och en av en katt, var och en parad med sin motsvarande prompt. En perfekt text-till-bild-modell som av misstag byter ut dessa mappningar (dvs. genererar en katt för en hund-prompt och vice versa) skulle uppnå en nästan noll FID eftersom den övergripande fördelningen av katter och hundar upprätthålls, trots att den inte stämmer överens med de avsedda prompten.

‘Vi visar att cFreD fångar bättre bildkvalitet och villkor på inmatnings-text och resulterar i förbättrad korrelation med mänskliga preferenser.’

Artikelns tester visar att författarnas föreslagna metric, cFreD, konsekvent uppnår högre korrelation med mänskliga preferenser än FID, FDDINOv2, CLIPScore och CMMD på tre benchmark-datamängder (PartiPrompts, HPDv2 och COCO).

Artikelns tester visar att författarnas föreslagna metric, cFreD, konsekvent uppnår högre korrelation med mänskliga preferenser än FID, FDDINOv2, CLIPScore och CMMD på tre benchmark-datamängder (PartiPrompts, HPDv2 och COCO).

Koncept och metod

Författarna noterar att den nuvarande guldstandarden för att utvärdera text-till-bild-modeller innebär att man samlar in mänskliga preferensdata genom crowd-sourced jämförelser, liknande metoder som används för stora språkmodeller (såsom LMSys Arena).

Exempelvis använder PartiPrompts Arena 1 600 engelska prompter, presenterar deltagarna med par av bilder från olika modeller och ber dem att välja sin föredragna bild.

Likaså använder Text-to-Image Arena Leaderboard användar-jämförelser av modell-utdata för att generera rankningar via ELO-poäng. Men att samla in denna typ av mänsklig utvärderingsdata är dyrt och långsamt, vilket har lett till att vissa plattformar – som PartiPrompts Arena – har upphört med uppdateringar helt och hållet.

Artificial Analysis Image Arena Leaderboard, som rankar de för närvarande uppskattade ledarna inom generativ visuell AI. Källa: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Artificial Analysis Image Arena Leaderboard, som rankar de för närvarande uppskattade ledarna inom generativ visuell AI. Källa: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Även om alternativa metoder som tränats på historiska mänskliga preferensdata finns, är deras effektivitet för att utvärdera framtida modeller osäker, eftersom mänskliga preferenser kontinuerligt utvecklas. Följaktligen verkar automatiserade metric som FID, CLIPScore och författarnas föreslagna cFreD sannolikt att förbli viktiga utvärderingsverktyg.

Författarna antar att både verkliga och genererade bilder som är villkorade på en prompt följer Gaussiska distributioner, var och en definierad av villkorade medelvärden och kovarianser. cFreD mäter den förväntade Fréchet-avståndet över prompter mellan dessa villkorade distributioner. Detta kan formuleras antingen direkt i termer av villkorade statistik eller genom att kombinera ovillkorade statistik med cross-kovarianser som involverar prompten.

Genom att integrera prompten på detta sätt kan cFreD utvärdera både realismen i bilderna och deras konsekvens med den givna texten.

Data och tester

För att utvärdera hur väl cFreD korrelerar med mänskliga preferenser använde författarna bild-rankningar från flera modeller som fick samma text. Deras utvärdering drog på två källor: Human Preference Score v2 (HPDv2) testmängd, som innehåller nio genererade bilder och en COCO grund-sanning-bild per prompt; och den ovannämnda PartiPrompts Arena, som innehåller utdata från fyra modeller över 1 600 prompter.

Författarna samlade de spridda Arena-data-punkterna i en enda datamängd; i fall där den verkliga bilden inte rankades högst i mänskliga utvärderingar, använde de den högst rankade bilden som referens.

För att testa nya modeller sampade de 1 000 prompter från COCO:s tränings- och validerings-mängder, säkerställde att det inte fanns någon överlappning med HPDv2, och genererade bilder med hjälp av nio modeller från Arena Leaderboard. De ursprungliga COCO-bilderna fungerade som referenser i denna del av utvärderingen.

cFreD-ansatsen utvärderades genom fyra statistiska metric: FID; FDDINOv2; CLIPScore; och CMMD. Den utvärderades också mot fyra inlärda metric som tränats på mänskliga preferensdata: Aesthetic Score; ImageReward; HPSv2; och MPS.

Författarna utvärderade korrelationen med mänsklig bedömning från både en ranknings- och en poäng-perspektiv: för varje metric rapporterades modell-poäng och rankningar beräknades för deras överensstämmelse med mänskliga utvärderingsresultat, med cFreD som använde DINOv2-G/14 för bild-inbäddningar och OpenCLIP ConvNext-B Text Encoder för text-inbäddningar†.

Tidigare arbete med att lära mänskliga preferenser mätte prestanda med hjälp av per-item-rank-accuracyn, som beräknar rank-accuracyn för varje bild-text-par innan den genomsnittligar resultaten.

Författarna utvärderade cFreD med hjälp av en global rank-accuracyn, som bedömer den övergripande rankningsprestandan över hela datamängden; för statistiska metric beräknades rankningar direkt från rå-poäng; och för metric som tränats på mänskliga preferenser beräknades rankningarna först genom att genomsnitta rankningarna som tilldelats varje modell över alla prover, och sedan bestämdes den slutliga rankningen från dessa genomsnitt.

Initiala tester använde tio ramverk: GLIDE; COCO; FuseDream; DALLE 2; VQGAN+CLIP; CogView2; Stable Diffusion V1.4; VQ-Diffusion; Stable Diffusion V2.0; och LAFITE.

Modell-rankningar och poäng på HPDv2-testmängden med hjälp av statistiska metric (FID, FDDINOv2, CLIPScore, CMMD och cFreD) och mänskligt tränade metric (Aesthetic Score, ImageReward, HPSv2 och MPS). Bästa resultat visas i fetstil, näst bästa är understrukna.

Modell-rankningar och poäng på HPDv2-testmängden med hjälp av statistiska metric (FID, FDDINOv2, CLIPScore, CMMD och cFreD) och mänskligt tränade metric (Aesthetic Score, ImageReward, HPSv2 och MPS). Bästa resultat visas i fetstil, näst bästa är understrukna.

Av de initiala resultaten kommenterar författarna:

‘cFreD uppnår den högsta överensstämmelsen med mänskliga preferenser, med en korrelation på 0,97. Bland statistiska metric uppnår cFreD den högsta korrelationen och är jämförbar med HPSv2 (0,94), en modell som tränats explicit på mänskliga preferenser. Eftersom HPSv2 tränades på HPSv2-träningsmängden, som innehåller fyra modeller från testmängden, och använde samma annotatorer, kodar den implicit mänskliga preferens-biaser från samma inställning.

‘I kontrast uppnår cFreD en jämförbar eller överlägsen korrelation med mänsklig utvärdering utan någon mänsklig preferens-träning.

‘Dessa resultat visar att cFreD tillhandahåller mer tillförlitliga rankningar över diverse modeller jämfört med standard-automatiska metric och metric som tränats explicit på mänskliga preferensdata.’

Bland alla utvärderade metric uppnår cFreD den högsta rank-accuracyn (91,1%), vilket – enligt författarna – visar en stark överensstämmelse med mänskliga bedömningar.

HPSv2 följde med 88,9%, medan FID och FDDINOv2 producerade konkurrenskraftiga poäng på 86,7%. Även om metric som tränats på mänskliga preferenser i allmänhet stämde överens väl med mänskliga utvärderingar, visade sig cFreD vara den mest robusta och tillförlitliga overall.

Nedan ser vi resultaten från den andra testomgången, denna gång på PartiPrompts Arena, med SDXL; Kandinsky 2; Würstchen; och Karlo V1.0.

Modell-rankningar och poäng på PartiPrompt med hjälp av statistiska metric (FID, FDDINOv2, CLIPScore, CMMD och cFreD) och mänskligt tränade metric (Aesthetic Score, ImageReward och MPS). Bästa resultat visas i fetstil, näst bästa är understrukna.

Modell-rankningar och poäng på PartiPrompt med hjälp av statistiska metric (FID, FDDINOv2, CLIPScore, CMMD och cFreD) och mänskligt tränade metric (Aesthetic Score, ImageReward och MPS). Bästa resultat visas i fetstil, näst bästa är understrukna.

Här påstår artikeln:

‘Bland statistiska metric uppnår cFreD den högsta korrelationen med mänskliga utvärderingar (0,73), med FID och FDDINOv2 som båda når en korrelation på 0,70. I kontrast visar CLIP-poängen en mycket låg korrelation (0,12) med mänskliga bedömningar.

‘I kategorin mänskligt tränade metric uppnår HPSv2 den starkaste överensstämmelsen, med den högsta korrelationen (0,83), följt av ImageReward (0,81) och MPS (0,65). Dessa resultat visar att cFreD är en robust automatisk metric, men HPSv2 utmärker sig som den mest effektiva i att fånga mänskliga utvärderingstrender i PartiPrompts Arena.’

Slutligen genomförde författarna en utvärdering på COCO-datamängden med nio moderna text-till-bild-modeller: FLUX.1[dev]; Playgroundv2.5; Janus Pro; och Stable Diffusion-variationer SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 och 1.5.

Mänskliga preferens-rankningar hämtades från Text-to-Image Leaderboard och angavs som ELO-poäng:

Modell-rankningar på slumpmässigt utvalda COCO-prompter med hjälp av automatiska metric (FID, FDDINOv2, CLIPScore, CMMD och cFreD) och mänskligt tränade metric (Aesthetic Score, ImageReward, HPSv2 och MPS). En rank-accuracyn under 0,5 indikerar mer diskordant än konsonant par, och bästa resultat visas i fetstil, näst bästa är understrukna.

Modell-rankningar på slumpmässigt utvalda COCO-prompter med hjälp av automatiska metric (FID, FDDINOv2, CLIPScore, CMMD och cFreD) och mänskligt tränade metric (Aesthetic Score, ImageReward, HPSv2 och MPS). En rank-accuracyn under 0,5 indikerar mer diskordant än konsonant par, och bästa resultat visas i fetstil, näst bästa är understrukna.

Med avseende på denna omgång påstår forskarna:

‘Bland statistiska metric (FID, FDDINOv2, CLIP, CMMD och vår föreslagna cFreD) uppnår endast cFreD en stark korrelation med mänskliga preferenser, med en korrelation på 0,33 och en icke-trivial rank-accuracyn på 66,67%. ‘Detta resultat placerar cFreD som den tredje mest överensstämmande metricen totalt, överträffad endast av de mänskligt tränade metricerna ImageReward, HPSv2 och MPS.

‘Noterbart är att alla andra statistiska metric visar betydligt svagare överensstämmelse med ELO-rankningar och, som ett resultat, inverterar rankningarna, vilket resulterar i en Rank Acc. under 0,5.

‘Dessa fynd visar att cFreD är känslig för både visuell trohet och prompt-konsekvens, vilket stärker dess värde som en praktisk, träningsfri alternativ för benchmarking av text-till-bild-generering.’

Författarna testade också Inception V3 som en backbone, och drog uppmärksamhet till dess allmänpresence i litteraturen, och fann att InceptionV3 presterade skäligt, men blev överträffad av transformer-baserade backbones som DINOv2-L/14 och ViT-L/16, som mer konsekvent stämde överens med mänskliga rankningar – och de hävdar att detta stöder ersättning av InceptionV3 i moderna utvärderingsinställningar.

Vin-ratios som visar hur ofta varje bild-backbone-rankning matchade de verkliga mänskligt-derivade rankningarna på COCO-datamängden.

Vin-ratios som visar hur ofta varje bild-backbone-rankning matchade de verkliga mänskligt-derivade rankningarna på COCO-datamängden.

Slutsats

Det är tydligt att mänskliga-i-loopen-lösningar är den optimala metoden för utveckling av metric och förlustfunktioner, men omfattningen och frekvensen av uppdateringar som krävs för sådana system kommer att fortsätta att göra dem opraktiska – kanske tills allmänna deltagande i utvärderingar generellt uppmuntras; eller, som har varit fallet med CAPTCHAs, tvingas.

Trovärdigheten hos författarnas nya system beror fortfarande på dess överensstämmelse med mänsklig bedömning, fast på ett steg längre bort än många nyligen mänskligt-deltagande tillvägagångssätt; och cFreD:s legitimitet förblir därför fortfarande i mänsklig preferensdata (uppenbarligen, eftersom utan en sådan benchmark skulle påståendet att cFreD återspeglar mänsklig bedömning vara obevisbart).

Man kan hävda att att förankra våra nuvarande kriterier för “realism” i genererad utdata i en metric-funktion kan vara ett misstag på lång sikt, eftersom vår definition av detta begrepp för närvarande är under attack från den nya vågen av generativa AI-system, och är inställd på att genomgå frekventa och betydande revisioner.

 

* Vid det här laget skulle jag normalt inkludera ett exempel på en illustrativ video, kanske från en nyligen akademisk insändning; men det skulle vara elakt – vem som helst som har tillbringat mer än 10-15 minuter med att bläddra igenom Arxivs generativa AI-utdata har redan stött på videor vars subjektivt dåliga kvalitet indikerar att den relaterade insändningen inte kommer att hyllas som en banbrytande artikel.

Sammanlagt 46 bild-backbone-modeller användes i experimenten, inte alla av dem är med i de grafiska resultaten. Vänligen se artikeln för en fullständig lista; de som visas i tabellerna och figurerna har listats.

 

Publicerad första gången tisdagen den 1 april 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai