Andersonin kulma

Käyttäen tekoälyä parantamaan valokuvia ennen kuin ne otetaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

Sen sijaan, että käyttäisit tekoälyä valokuvien korjaamiseen jälkeenpäin kuin ne on otettu, tutkijat ovat kouluttaneet järjestelmän, joka kertoo, miten liikkua, asettaa ja kehystää kuva etukäteen, käyttäen tietoa siitä, mitä tekee valokuvat muistettaviksi.

 

Valokuvien korjaaminen jälkeenpäin on ollut helpompaa jo jonkin aikaa, koska valmistajat ja teknologia-alustat tarjoavat yhä useammin kameran sisäisiä editointiominaisuuksia, jotka sallivat käyttäjien muokata kuvia heti niiden ottamisen jälkeen. Suosittuja järjestelmiä tällaisia ovat Google:n konversaatioeditointi ja Samsungin generatiivinen editointi, muun muassa.

Kuitenkin uusi suuntaus, joka suosii “aidoitta” tuloksia tekoälyparannuksien sijaan, voi tarkoittaa, että monet kuluttajat, joita nämä järjestelmät on tarkoitettu, alkavat pitää “muokattuja” valokuvia “tekoälyroskana”.

Tähän saattaa viitata se, että Google on luonut tekoälykoulutetun “kameravalmentajan”, joka perustuu Geminiin, ja joka pystyy antamaan suoria ohjeita valokuvan parantamiseksi valokuvan ottamisen aikana:

Google:n Kameravalmentaja kertoo käyttäjälle, miten uudelleenkehystää valokuva, muun muassa. Lähde: https://store.google.com/intl/fi/ideas/articles/camera-coach/

Google:n Kameravalmentaja kertoo käyttäjälle, miten uudelleenkehystää valokuva, muun muassa. Lähde

Koska se on suljettu järjestelmä, ja koska siitä on käytettävissä lähes täysin tietoa verkossa, Kameravalmentaja näyttää hyödyntävän Geminiä auttaakseen käyttäjiä parantamaan kehystystä (ks. kuva yllä) tai tekemään pieniä muutoksia asennossa (kuten liikkumalla lähemmäs toisiaan tai katsomalla suoraan kameraan).

Niin kauan kuin kukaan voi sanoa, tuote pyrkii siirtämään kohtauksen kohti mediaania, luultavasti perustuen miljoonien ladattujen sisältöjen data-pisteisiin, jotka ovat todennäköisesti vaikuttaneet Geminiin koulutukseen. Tässä mielessä lataavat käyttäjät ovat luoneet tekoälyn kalibroinnin hylkäämällä tyytymättömiä otoksia ja lataamalla ne, joita he pitävät hyvinä – tehokas (ja ilmainen) muoto datasetin kuratointia!

Sitten on sanottava, että valokuvat, jotka ovat keskitetyt kohtauksen suhteen, eivät välttämättä omista samoja esteettisiä arvoja tai katsojan vaikutusta kuin valokuvat, jotka ovat muistettavissa.

Ylittämällä ‘Cheese!’ ja kolmannen säännön

Tähän tarkoitukseen, ja kohti järjestelmää, joka on helpommin saatavilla eri alustoilla, uusi tutkimus Italiasta tarjoaa Coach-tyyppisen järjestelmän, joka perustuu aikaisempiin tietoihin siitä, mitä tekee valokuvat muistettaviksi:

Laajat esimerkit neuvoista uudesta järjestelmästä. Lähde - https://arxiv.org/pdf/2602.21877

Laajat esimerkit neuvoista uudesta järjestelmästä. Lähde

Yllä olevissa esimerkeissä näemme neuvoja, jotka uusi järjestelmä antaa – jota kutsutaan MemCoachiksi – ja jota on vaikea kuvitella, että komposiittorientoitunut tekoäly kuten Kameravalmentaja voisi antaa. Ensimmäisessä (vasemmassa) tapauksessa neuvo poistaa päähine on erittäin epäilyttävä; toisessa kuvassa on vaikea kuvitella, mitä konventionaalista kontekstia komposiittorientoitunut tekoäly voisi piirtää yleisestä tilanteesta (ts. “taiteellisesta” kuvasta nuoresta naisesta, joka makaa lattialla silmät suljettuina).

Ydinymmärrys valokuvien muistettavuudesta, jota käytetään MemCoachin kehittämiseen, perustuu useisiin aikaisempiin tutkimuksiin, mukaan lukien vuoden 2015 julkaisu Mikä tekee objektin muistettavaksi? ja vuoden 2013 artikkeli Mikä tekee valokuvan muistettavaksi?.

Vuoden 2013 artikkelista Mikä tekee valokuvan muistettavaksi?, edustavat esimerkit hyvistä, keskivertaisista ja huonoista valokuvista muistettavuuden suhteen. Lähde - https://people.csail.mit.edu/torralba/publications/Isola_memorabilityPhotos_PAMI2014.pdf

Vuoden 2013 artikkelista Mikä tekee valokuvan muistettavaksi?, edustavat esimerkit hyvistä, keskivertaisista ja huonoista valokuvista muistettavuuden suhteen. Lähde

Kuka tahansa, kuten minä, jolla on negatiivinen Unix-syntymäaika, tunnistaa todennäköisesti mallin “vähiten muistettavista kuvista” (yläkulmassa yllä), äärettömistä diakuvista, jotka olivat nuoruutemme kirouksia. Kuten kirjoittajat toteavat*:

‘Nämä tutkimukset tunnistivat avain sisäiset tekijät, kuten ihmisten läsnäolo, sisätilat tai emotionaaliset ilmeet, eivätkä esineet ja panoraamiset näkymät, sekä ulkoiset tekijät, kuten konteksti ja havainnoitsija. ‘

Hankkeen keskiössä on ‘muistettavuuspalautteen’ (MemFeed), jota ilmenee MemCoach-ohjaussovelluksessa, ja vertailukohta (joka on nimeltään MemBench) perustuu PPR10K-datasettiin.

Paperista PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, moninaiset esimerkit datasetistä. Ylärivi näyttää alkuperäiset kuvat, alarivi näyttää asiantuntijoiden retusoidut versiot ja vastaavat ihmisen alueen maskit. Alkuperäiset kuvat vaihtelevat laajasti näkökulmasta, taustasta, valaistuksesta ja kameran asetuksista, kun taas retusoidut tulokset näyttävät parantuneen visuaalista laatua ja vahvempaa johdonmukaisuutta kussakin ryhmässä. Lähde - https://arxiv.org/pdf/2105.09180

Paperista PPR10K: A Large-Scale Portrait Photo Retouching Dataset with Human-Region Mask and Group-Level Consistency, moninaiset esimerkit datasetistä. Ylärivi näyttää alkuperäiset kuvat, alarivi näyttää asiantuntijoiden retusoidut versiot ja vastaavat ihmisen alueen maskit. Alkuperäiset kuvat vaihtelevat laajasti näkökulmasta, taustasta, valaistuksesta ja kameran asetuksista, kun taas retusoidut tulokset näyttävät parantuneen visuaalista laatua ja vahvempaa johdonmukaisuutta kussakin ryhmässä. Lähde

Tutkimus toteaa, että muistettavuus on määrätty valokuvissa, eikä se ole subjektiivisen arvion rekisteri, ja kirjoittajat toteavat myös, että ominaisuus on tunnistettu sekä valokuvissa (erilaisissa tutkimuksissa) että videoissa (erilaisissa tutkimuksissa).

Uusi artikkeli on nimeltään Miten ottaa muistettava kuva? Käyttäjien valmentaminen toimivalla palautteella, ja se on neljän tutkijan yhteistyötä Trenton yliopistosta, Pisan yliopistosta ja Fondazione Bruno Kessleristä. Hankkeen verkkosivu viittaa siihen, että GitHub-koodi ja Hugging Face -isännöity data tulevat saataville ensi kuussa (maaliskuussa 2026).

Menetelmä

Jotta voidaan kuratoida MemBench-datasetti PPR10K-portraitsdatasetistä, tutkijat ryhmittivät valokuvat samasta kohtauksesta ja arvioivat jokaisen kuvan muistettavuuden koulutetun ennustajan avulla, joka perustui CLIP ominaisuuksiin. He sitten järjestivät kuvat jokaisessa kohtauksessa vähemmän muistettavista enemmän muistettaviin ja parittivat ne vastaavasti:

MemBenchin rakentamisen ja arvioinnin yleiskatsaus. Ylärivi esittää data-pipelinea, josta ryhmitellään kuvat kohtauksittain ja ennustetaan muistettavuutta, sitten kuvat järjestetään ja luodaan muistettavuusorientoitu toimintapalaute. Alarivi havainnollistaa arviointia, jossa mitataan palautteen laatua editoinnin perusteella saavutettujen muistettavuusvoittojen ja hämmästyksen arviointia varten.

MemBenchin rakentamisen ja arvioinnin yleiskatsaus. Ylärivi esittää data-pipelinea, josta ryhmitellään kuvat kohtauksittain ja ennustetaan muistettavuutta, sitten kuvat järjestetään ja luodaan muistettavuusorientoitu toimintapalaute. Alarivi havainnollistaa arviointia, jossa mitataan palautteen laatua editoinnin perusteella saavutettujen muistettavuusvoittojen ja hämmästyksen arviointia varten.

Kunkin parin kohdalla luotiin luonnollisen kielen kuvauksia InternVL3.5-mallilla selittämään näkyvien erojen välillä vähemmän muistettavassa ja enemmän muistettavassa versiossa; ja nämä kuvaukset muodostaisivat koulutussignaalin muistettavuuspalautejärjestelmälle.

Toisin kuin logiikka, joka perustaa Google:n Kameravalmentajan, tutkijat etsivät hienostuneempaa tulkintaa:

‘Toisin kuin laskennalliset valokuvauskorjaukset, jotka keskittyvät jälkikäteen tehtäviin korjauksiin (esim. “tee kuva kirkkaammaksi”), keskitymme semanttisiin toimiin, joita käyttäjä voi tehdä lennossa paremman otoksen saamiseksi, esim. “Kääntykää toisiinne päin”.’

Lopullinen MemBench-kokoelma koostuu noin 10 000:sta kuvasta, jotka on ryhmitelty 1 570 kohtaukseen, ja keskimäärin 6,5 kuvaa kussakin kohtauksessa. Sanapilvi, jonka kirjoittajat loivat (ks. kuva alla), viittaa laajaan joukkoon semanttisia kategorioita datasetissä:

Sanapilvi datasetin useimmin esiintyvistä termeistä.

Sanapilvi datasetin useimmin esiintyvistä termeistä.

Lähdekuvat saivat keskimäärin 0,63 muistettavuuspisteen, kun taas eniten muistettavat kuvat samasta kohtauksesta vaihtelivat 0,51:stä 1,0:aan, ja havaittiin merkittävää päivittäin molempien ryhmien välillä:

Muistettavuuspistemäärien jakauma, jossa verrataan vähiten ja eniten muistettavia kuvia kussakin kohtauksessa.

Muistettavuuspistemäärien jakauma, jossa verrataan vähiten ja eniten muistettavia kuvia kussakin kohtauksessa.

Palaute vaihteli lyhyistä 7 sanan pituisista merkinnöistä huomattavasti pidempiin ohjeisiin (vasemmalla alla olevassa kuvassa). Jokainen neuvo jaettiin pieniin toimintatyyppeihin GPT-5 Mini:n avulla (oikealla alla olevassa kuvassa):

Palautepituuden jakauma mitattuna sisällön sanojen määrällä, ja atomisten alitoimien luokittelu, jossa käytetään sointuvälejä osoittamaan yhteisesiintymisen tiheyttä kategorioiden välillä.

Palautepituuden jakauma mitattuna sisällön sanojen määrällä, ja atomisten alitoimien luokittelu, jossa käytetään sointuvälejä osoittamaan yhteisesiintymisen tiheyttä kategorioiden välillä.


Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai