Andersonin kulma

Opettaminen AI:lle antamaan parempia videoarvosteluita

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

Vaikka suuret visuaalis-verkkomallit (LVLM) voivat olla hyödyllisiä apuvälineitä tulkittaessa jotkut tietokonegrafiikan kirjallisuuden haasteellisista julkaisuista, on yksi alue, jossa ne ovat rajoittuneita: määrittämään videoesimerkkien ansioita ja subjektiivista laatua, jotka liittyvät uusiin julkaisuihin*.

Tämä on kriittinen julkaisun osa, sillä tieteelliset artikkelit usein pyrkivät herättämään innostusta viehättävällä tekstillä tai visuaalisuudella – tai molemmilla.

Mutta video-synteesiprojekteissa kirjoittajien on näytettävä todellista video-ulosottoa tai heidän työnsä voidaan hylätä; ja näissä esityksissä ero rohkeiden väittämien ja todellisen suorituskyvyn välillä ilmenee usein selkeimmin.

Lukin kirjan, en nähnyt elokuvaa

Tällä hetkellä useimmat suositut API-pohjaiset suuret kielen mallit (LLM) ja suuret visuaalis-verkkomallit (LVLM) eivät osallistu suoraan video-sisällön analysointiin millään tavalla, laadullisesti tai muulla tavoin. Sen sijaan ne voivat vain analysoida liittyviä transkriptejä – ja ehkä kommentti- ja muita tekstipohjaisia materiaaleja.

GPT-4o:n, Google Gemini:n ja Perplexity:n moninaiset vastalauseet, kun heiltä pyydettiin analysoimaan video suoraan, ilman transkriptejä tai muita tekstipohjaisia lähteitä.

GPT-4o:n, Google Gemini:n ja Perplexity:n moninaiset vastalauseet, kun heiltä pyydettiin analysoimaan video suoraan, ilman transkriptejä tai muita tekstipohjaisia lähteitä.

Kuitenkin LLM voi piilottaa tai kieltää kyvyttömyytensä todella katsella videoita, ellette haasta sitä:

Kun ChatGPT-4o:sta pyydettiin antamaan subjektiivinen arvio uuden tutkimusartikkelin liittyvistä videoista ja kun se lopulta myönsi, ettei se voi todella katsella videoita suoraan.

Kun ChatGPT-4o:sta pyydettiin antamaan subjektiivinen arvio uuden tutkimusartikkelin liittyvistä videoista ja kun se lopulta myönsi, ettei se voi todella katsella videoita suoraan.

Vaikka mallit kuten ChatGPT-4o ovat monimodalisia ja voivat analysoida yksittäisiä valokuvia (kuten videosta poistettua kehystä, ks. yllä oleva kuva), on joitakin ongelmia myös tässä:

Toiseksi, useimmat, ellei useimmat, generoidun videon ongelmista ovat todennäköisesti aikaperspektiivissä olevia, jotka häviävät täysin kehyskaappauksessa – ja siten yksittäisten kehysten tarkastelu ei palvele mitään tarkoitusta.

Lopulta, LLM voi antaa vain oletetun “arvon” tuomion perustuen (taas kerran) tekstipohjaiseen tietämykseen, esimerkiksi syvänvalheen kuvissa tai taidehistoriassa. Tällaisessa tapauksessa koulutettu alueen tietämys sallii LLM:lle korreloida analysoidun kuvan visuaalisia laatuja oppimista ihmisen näkemykseen perustuvilla upotuksilla:

FakeVLM-projekti tarjoaa kohdennettua syvänvalheen havaitsemista erikoistuneella monimodaalisella visuaalis-verkkomallilla. Lähde: https://arxiv.org/pdf/2503.14905

FakeVLM-projekti tarjoaa kohdennettua syvänvalheen havaitsemista erikoistuneella monimodaalisella visuaalis-verkkomallilla. Lähde: https://arxiv.org/pdf/2503.14905

Tämä ei tarkoita, ettei LLM voi hankkia tietoa suoraan videosta; esimerkiksi käyttämällä apu-AI-järjestelmiä, kuten YOLO, LLM voi tunnistaa objekteja videossa – tai tehdä sen suoraan, jos se on koulutettu keskimääräistä monimodaalista toimintoa varten.

Mutta ainoa tapa, jolla LLM voi arvioida videota subjektiivisesti (ts. “Tämä ei näytä minulle aidolta”), on soveltamalla häviöfunktiota, joka perustuu ihmisen mielipiteeseen.

Häviöfunktiot ovat matemaattisia työkaluja, joita käytetään koulutuksen aikana mallin ennusteiden ja oikeiden vastausten välisen etäisyyden mittaamiseen. Ne tarjoavat palautetta, joka ohjaa mallin oppimista: mitä suurempi virhe, sitä suurempi häviö. Koulutuksen edetessä malli säätää parametrejaan vähentääkseen tätä häviötä ja parantaakseen kykyään tehdä tarkkoja ennusteita.

Häviöfunktiot käytetään sekä mallien koulutuksen säätelemiseen että algoritmien kalibrointiin, jotka on suunniteltu arvioimaan tekoälymallien tuloksia (kuten simuloitujen fotorealististen sisältöjen arviointi generatiivisesta videomallista).

Ehdollinen visio

Yksi suosituimmista mittareista/häviöfunktiosta on Fréchet Inception Distance (FID), joka arvioi generoityjen kuvien laatua mittaamalla niiden jakautumisen ja todellisten kuvien jakautumisen välisen tilastollisen eron.

Erityisesti FID laskee tilastollisen eron, käyttäen keskiarvoja ja kovariansseja, piirteistä, jotka on poimittu molemmista kuvista (usein kritisoitu) Inception v3 -luokittelumalli. Alempi FID-arvo osoittaa, että generoidut kuvat ovat enemmän samanlaisia kuin todelliset kuvat, mikä viittaa parempaan visuaaliseen laatuun ja monimuotoisuuteen.

Kuitenkin FID on perustaltaan vertailukelpoinen ja itseensä viittaava. Tätä varten myöhempi Ehdollinen Fréchet-etäisyys (CFD, 2021) -lähestymistapa eroaa FID:stä siten, että se vertaa generoituja kuvia todellisiin kuviin ja arvioi tuloksen perustuen siihen, miten hyvin molemmat kuvat vastaavat lisäehtoa, kuten (välttämättä subjektiivista) luokan nimeä tai syötteen kuvaa.

Tällä tavoin CFD ottaa huomioon, miten kuvat täyttävät aiotut ehdot, eikä ainoastaan niiden realismin tai monimuotoisuuden itsessään.

Esimerkkejä vuoden 2021 CFD:stä. Lähde: https://github.com/Michael-Soloveitchik/CFID/

Esimerkkejä vuoden 2021 CFD:stä. Lähde: https://github.com/Michael-Soloveitchik/CFID/

CFD seuraa viimeaikaisen trendin jälkeen, jossa pyritään sisällyttämään laadullinen ihmisen tulkinta häviöfunktioiden ja mittausalgoritmien kehittämiseen. Vaikka tällainen ihmiskeskeinen lähestymistapa takaa, että tuloksesta tulee “sielullinen” eikä ainoastaan mekaaninen, se aiheuttaa samalla useita ongelmia: mahdollisuus harhaanjohtavuuteen; tarve päivittää algoritmia uusien käytännön mukaisesti, ja se, että se poistaa mahdollisuuden johdonmukaisiin vertailustandardeihin useiden vuosien ajan eri projekteissa; ja taloudelliset rajoitukset (vähemmän ihmisten osallistuminen tekee päätökset epäilyttäviksi, kun taas suurempi määrä voisi estää hyödylliset päivitykset kustannusten vuoksi).

cFreD

Tästä johtuu uusi tutkimus Yhdysvalloista, joka tarjoaa Ehdollisen Fréchet-etäisyyden (cFreD), uuden CFD:n, joka on suunniteltu heijastamaan paremmin ihmisten preferenssejä arvioimalla sekä visuaalista laatua että teksti-kuvan vastaavuutta

Osa tuloksista uudesta tutkimuksesta: kuvien arviointi (1-9) eri mittareilla “Olohuone, jossa on sohva ja kannettava tietokone sohvan päällä” -aiheesta. Lähde: https://arxiv.org/pdf/2503.21721

Tutkijat väittävät, että olemassa olevat teksti-kuvan synteesin arviointimenetelmät, kuten Inception Score (IS) ja FID, eivät vastaa ihmisten mielipidettä, koska ne mittavat ainoastaan kuvan laatua ilman huomioon ottamista, miten kuvat vastaavat aiheita:

‘Esimerkiksi tarkastellaan tietokokoelmaa, jossa on kaksi kuvaa: yksi koirasta ja yksi kissasta, kumpikin pariutettu vastaavaan aiheeseen. Täydellinen teksti-kuvan malli, joka väärin yhdistää nämä pariutukset (ts. kissan kuvan koira-aiheeseen ja päinvastoin), saavuttaa lähes nollan FID:in, koska koirien ja kissojen kokonaisjakauma säilyy, vaikka aiheiden kanssa ei ole vastaavuutta.’

‘Osoitamme, että cFreD havaitsee kuvan laadun arvioinnin ja ehdotukseen perustuvan ehdotuksen paremmin ja johtaa parannettuun yhteyteen ihmisten preferenssien kanssa.’

Tutkimuksen testit osoittavat, että tutkijoiden ehdottama mittari, cFreD, saavuttaa jatkuvasti korkeamman yhteyden ihmisten preferenssien kanssa kuin FID, FDDINOv2, CLIPScore ja CMMD kolmella vertailukohderyhmällä (PartiPrompts, HPDv2 ja COCO).

Tutkimuksen testit osoittavat, että tutkijoiden ehdottama mittari, cFreD, saavuttaa jatkuvasti korkeamman yhteyden ihmisten preferenssien kanssa kuin FID, FDDINOv2, CLIPScore ja CMMD kolmella vertailukohderyhmällä (PartiPrompts, HPDv2 ja COCO).

Käsite ja menetelmä

Tutkijat toteavat, että teksti-kuvan mallien arvioinnin nykyinen kultainen standardi perustuu ihmisten preferenssien keräämiseen joukkoarvioinnin kautta, samalla tavalla kuin suurten kielen mallien (kuten LMSys Arena) menetelmissä.

Esimerkiksi PartiPrompts Arena käyttää 1 600 englanninkielistä aihetta, joissa osallistujat saavat kaksi kuvaa eri malleista ja pyydetään valitsemaan mieluisin kuva.

Samoin Teksti-kuvan Arena Leaderboard käyttää käyttäjien vertailuja mallien tuloksista ELO-lukujen kautta. Kuitenkin tällaisen ihmisten arviointidatakeräilyn kokoaminen on kallista ja hidasta, mikä on johtanut joitakin alustoja – kuten PartiPrompts Arena – lopettamaan päivitykset kokonaan.

Artificial Analysis Image Arena Leaderboard, joka listaa generatiivisen visuaalisen AI:n johtavat arviot. Lähde: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Artificial Analysis Image Arena Leaderboard, joka listaa generatiivisen visuaalisen AI:n johtavat arviot. Lähde: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Vaikka vaihtoehtoiset menetelmät, jotka perustuvat historiallisiin ihmisten preferenssien tietoihin, ovat olemassa, niiden tehokkuus tulevien mallien arvioinnissa on epävarmaa, koska ihmisten preferenssit jatkuvasti kehittyvät. Tämän vuoksi automaattiset mittarit, kuten FID, CLIPScore ja tutkijoiden ehdottama cFreD, ovat todennäköisesti jäävät tärkeiksi arviointityökaluiksi.

Tutkijat olettavat, että sekä todelliset että generoidut kuvat, jotka perustuvat aiheeseen, seuraavat Gaussin jakautumista, joita määritellään ehdollisten keskiarvojen ja kovarianssien avulla. cFreD mittaa odotetun Fréchet-etäisyyden aiheiden välillä näiden ehdollisten jakautumisten välillä. Tämä voidaan muodostaa joko suoraan ehdollisten tilastojen avulla tai yhdistämällä ehdottomat tilastot aiheen kanssa.

Sisällyttämällä aiheen tähän, cFreD pystyy arvioimaan sekä kuvien realismin että niiden yhdenmukaisuuden annetun tekstin kanssa.

Data ja testit

Arvioidakseen, miten hyvin cFreD vastaa ihmisten preferenssejä, tutkijat käyttivät kuvien arviointeja useista malleista, joissa käytettiin samaa aihetta. Heidän arviointinsa perustui kahteen lähteeseen: Human Preference Score v2 (HPDv2) -testiryhmään, joka sisälsi yhdeksän generoituja kuvaa ja yhden COCO -peruskuvan kullekin aiheelle; ja edellä mainittuun PartiPrompts Arenaan, joka sisälsi neljän mallin tuloksia 1 600 aiheesta.

Tutkijat keräsivät hajanaiset Arena-tiedot yhteen tietokantaan; tapauksissa, joissa todellinen kuva ei ollut korkein ihmisten arvioissa, he käyttivät korkeimmin arvioitua kuvaa vertailukohtana.

Uusimpien mallien testaamiseksi he otin 1 000 aihetta COCO:n koulutus- ja validointiryhmistä, varmistamalla, ettei niitä ollut HPDv2:ssa, ja generoivat kuvia yhdeksällä mallilla Arena Leaderboardista. Alkuperäiset COCO-kuvat toimivat vertailukohdina tässä arvioinnin osassa.

cFreD-lähestymistapaa arvioitiin neljällä tilastollisella mittarilla: FID; FDDINOv2; CLIPScore; ja CMMD. Se arvioitiin myös neljällä oppimismittarilla, jotka perustuivat ihmisten preferenssien tietoihin: Aesthetic Score; ImageReward; HPSv2; ja MPS.

Tutkijat arvioivat yhteyttä ihmisten arvioihin sekä arviointi- että pisteytysnäkökulmasta: kunkin mittarin osalla mallin pisteytys laskettiin ja arviointijärjestys laskettiin sen mukaisesti, miten se sopi ihmisten arviointituloksiin, cFreD käytti DINOv2-G/14:ää kuvan upotuksina ja OpenCLIP ConvNext-B Teksti-encoderia teksti-upotuksina†.

Aiemmat tutkimukset ihmisten preferenssien oppimisesta mittasivat suorituskyvyn kunkin kohteen arviointitarkkuuden avulla, joka laskee arviointitarkkuuden kullekin kuvateksti-parille ennen keskiarvon laskemista.

Tutkijat arvioivat cFreD:ää globaalilla arviointitarkkuudella; tilastollisille mittareille he johtivat arviointijärjestyksen suoraan raakapisteistä; ja mittareille, jotka perustuivat ihmisten preferensseihin, he ensin keskiarvoivat arviointijärjestykset, jotka oli annettu kullekin mallille kaikissa näytteissä, ja määrittivät lopullisen järjestyksen näistä keskiarvoista.

Alkuvaiheen testit käyttivät kymmentä kehyksistä: GLIDE; COCO; FuseDream; DALLE 2; VQGAN+CLIP; CogView2; Stable Diffusion V1.4; VQ-Diffusion; Stable Diffusion V2.0; ja LAFITE.

<img class=" wp-image-214905" src="https://www.unite.ai/wp-content/uploads/2025/04/table-1.jpg" alt="Mallien arviointijärjestykset ja pisteytykset HPDv2-testiryhmällä tilastollisilla mittareilla (FID, FDDINOv2, CLIPScore, CMMD ja cFreD) ja ihmisten preferensseihin perustuvilla mittareilla (Aesthetic Score, ImageReward, HPSv2 ja MPS). Parhaat tulokset on esitetty lihavoituina, toiseksi parhaat alhaalla.

Tutkijat toteavat alkutuloksista:

‘cFreD saavuttaa korkeimman yhteyden ihmisten preferenssien kanssa, saavuttaen 0,97:n korrelaation. Tilastollisista mittareista cFreD saavuttaa korkeimman korrelaation ja on vertailukelpoinen HPSv2:een (0,94), joka on malli, joka on koulutettu ihmisten preferenssien perusteella. Koska HPSv2 oli koulutettu HPSv2-koulutusjoukossa, joka sisälsi neljä mallia testijoukosta, ja käytti samojen annotoijien, se sisältää sisäänrakennettuja ihmisten preferenssien harhaa samassa asetelmassa.

‘Toisaalta cFreD saavuttaa vertailukelpoisen tai jopa paremman korrelaation ihmisten arvioihin ilman koulutusta ihmisten preferenssien perusteella.

‘Nämä tulokset osoittavat, että cFreD tarjoaa luotettavampia arviointijärjestyksiä monimuotoisempien mallien osalta verrattuna perinteisiin automaattisiin mittareihin ja mittareihin, jotka on koulutettu ihmisten preferenssien perusteella.’

Kaikista arvioiduista mittareista cFreD saavutti korkeimman arviointijärjestyksen (91,1 %), mikä osoittaa vahvan yhteyden ihmisten arviointien kanssa, tutkijoiden mukaan.

HPSv2 seurasi 88,9 %:lla, kun taas FID ja FDDINOv2 tuottivat kilpailukykyisiä tuloksia 86,7 %:lla. Vaikka mittarit, jotka perustuivat ihmisten preferensseihin, yleensä sopivat hyvin ihmisten arviointeihin, cFreD osoittautui kaikkein kestävimmäksi ja luotettavimmaksi.

Toisessa testikierroksessa tutkijat arvioivat SDXL; Kandinsky 2; Würstchen; ja Karlo V1.0 PartiPrompts Arenalla.

<img class=" wp-image-214906" src="https://www.unite.ai/wp-content/uploads/2025/04/table-2.jpg" alt="Mallien arviointijärjestykset ja pisteytykset PartiPromptilla tilastollisilla mittareilla (FID, FDDINOv2, CLIPScore, CMMD ja cFreD) ja ihmisten preferensseihin perustuvilla mittareilla (Aesthetic Score, ImageReward ja MPS). Parhaat tulokset on esitetty lihavoituina, toiseksi parhaat alhaalla.

Tässä yhteydessä tutkimus toteaa:

‘Tilastollisista mittareista cFreD saavuttaa korkeimman korrelaation ihmisten arvioihin (0,73), kun taas FID ja FDDINOv2 saavuttavat korrelaation 0,70. Toisaalta CLIP-pisteet osoittavat erittäin alhaisen korrelaation (0,12) ihmisten arviointien kanssa.

‘Toisaalta ihmisten preferensseihin perustuvassa luokassa HPSv2 saavuttaa vahvimman yhteyden, saavuttaen korkeimman korrelaation (0,83), seurattuna ImageRewardilla (0,81) ja MPS:llä (0,65). Nämä tulokset korostavat, että vaikka cFreD on kestävä automaattinen mittari, HPSv2 erottuu parhaana ihmisten arviointitrendien havaitsemisessa PartiPrompts Arenalla.’

Lopulta tutkijat suorittivat arvioinnin COCO-tietokannalla yhdeksällä modernilla teksti-kuvan mallilla: FLUX.1[dev]; Playgroundv2.5; Janus Pro; ja Stable Diffusion -versiot SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 ja 1.5.

Ihmisten preferenssijärjestykset haettiin Teksti-kuvan Leaderboardista ja annettiin ELO-pisteinä:

<img class=" wp-image-214907" src="https://www.unite.ai/wp-content/uploads/2025/04/table-3.jpg" alt="Mallien arviointijärjestykset satunnaisesti valituilla COCO-aiheilla automaattisilla mittareilla (FID, FDDINOv2, CLIPScore, CMMD ja cFreD) ja ihmisten preferensseihin perustuvilla mittareilla (Aesthetic Score, ImageReward, HPSv2 ja MPS). Arviointijärjestyksen tarkkuus alle 0,5 osoittaa enemmän epäyhtenäisiä kuin yhtenäisiä pareja, ja parhaat tulokset on esitetty lihavoituina, toiseksi parhaat alhaalla.

Tästä kierroksesta tutkijat toteavat:

‘Tilastollisista mittareista (FID, FDDINOv2, CLIP, CMMD ja ehdottamamme cFreD) ainoastaan cFreD osoittaa vahvan yhteyden ihmisten preferenssien kanssa, saavuttaen korrelaation 0,33 ja merkittävän arviointijärjestyksen tarkkuuden 66,67 %. ‘Tämä sijoittaa cFreD:n kolmanneksi parhaaksi mittariksi yhteensä, jääden vain ihmisten preferensseihin perustuvien mittareiden ImageRewardin, HPSv2:n ja MPS:n jälkeen.

‘Muut tilastolliset mittarit osoittavat huomattavasti heikomman yhteyden ELO-arviointien kanssa ja kääntävät järjestykset, mikä johtaa arviointijärjestyksen tarkkuuden alle 0,5.

‘Nämä tulokset korostavat, että cFreD on herkkä sekä visuaalisen laadun että aiheen yhdenmukaisuuden suhteen, vahvistaen sen käytännön vaihtoehtona teksti-kuvan synteesin vertailuun.’

Tutkijat testasivat myös Inception V3:n rungon, korostamalla sen yleisyyttä kirjallisuudessa, ja totesivat, että InceptionV3 suoritti kohtuullisesti, mutta transformer-pohjaiset rungot, kuten DINOv2-L/14 ja ViT-L/16, olivat yleisemmin yhteydessä ihmisten arviointijärjestyksiin – ja he väittävät, että tämä tukee InceptionV3:n korvaamista modernissa arviointijärjestelmissä.

Voittoprosentit, jotka osoittavat, miten usein kunkin kuvan rungon arviointijärjestykset vastaavat todellisia ihmisten arviointijärjestyksiä COCO-tietokannassa.

Voittoprosentit, jotka osoittavat, miten usein kunkin kuvan rungon arviointijärjestykset vastaavat todellisia ihmisten arviointijärjestyksiä COCO-tietokannassa.

Johtopäätös

On selvää, että vaikka ihmisten osallistuminen kehitykseen on ihanteellinen lähestymistapa mittarien ja häviöfunktioiden kehittämiseen, tällaisia järjestelmien päivittämisen mittakaava ja tarvittava tiheys tekevät niistä vielä epäkäytännöllisiä – ehkä siihen asti, kunnes laaja yleinen osallistuminen arvioihin yleisesti kannustetaan; tai kun, kuten on tapahtunut CAPTCHA-kuvien kohdalla, se on pakotettu.

Tutkijoiden uuden järjestelmän uskottavuus riippuu edelleen sen yhteydestä ihmisten arviointiin, vaikka yhden asteen kauempana kuin monissa viimeaikaisissa ihmisten osallistumista edellyttävissä lähestymistavoissa; ja cFreD:n legitiimiys riippuu edelleen ihmisten preferenssien tietojen perusteella (ilmeisesti, koska ilman tällaista vertailukohtaa väite, että cFreD heijastaa ihmismäistä arviointia, olisi todistamaton).

Voi väittää, että vakiinnuttamalla nykyiset kriteerimme “realismin” määritelmälle generatiivisissa tuloksissa voisi olla pitkällä tähtäimellä virhe, koska määritelmämme tästä käsitteestä on tällä hetkellä hyökkäysuhrina uusille generatiivisille AI-järjestelmille, ja se on merkittävästi uudelleenmääriteltävä usein.

 

* Tässä vaiheessa minulla olisi normaalisti esitettävä esimerkki kuvaa uudesta akateemisesta julkaisusta; mutta se olisi pahantahtoista – kuka tahansa, joka on viettänyt yli 10-15 minuuttia Arxivin generatiivisen AI:n tuloksia selatessa, on jo nähnyt videon, jonka subjektiivisesti heikko laatu viittaa siihen, että liittyvä julkaisu ei ole merkittävä.

Yhteensä 46 kuvan runkomallia käytettiin kokeissa, eikä kaikkia niistä otettu huomioon graafisissa tuloksissa. Lue tutkimuksen liitteestä täydellinen luettelo; ne, jotka on mainittu taulukoissa ja kuvissa, on lueteltu.

 

Julkaistu ensimmäisen kerran tiistaina 1. huhtikuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai