Andersonin kulma
Ihmiskuvien palauttaminen ja muokkaaminen tekoälyllä

Uusi yhteistyö Kalifornian yliopiston Mercedin ja Adoben välillä tarjoaa edistysaskeleen ihmiskuvien täydentämisessä – tutkitussa tehtävässä, jossa pyritään “peittämään” tai “piilottamaan” osia kuvista, tarkoituksena esimerkiksi virtuaalinen try-on, animaatio ja valokuvien muokkaus.

Ihmiskuvien täydentämisen järjestelmät, kuten CompleteMe, voivat asettaa uudet vaatteet olemassa oleviin kuviin (viitatun kuva esimerkiksi keskisarake) ja muuttaa niitä käyttäjän toiveiden mukaan. Nämä esimerkit ovat uuden tutkimuksen laajasta liitteestä. Source: https://liagm.github.io/CompleteMe/pdf/supp.pdf
Uusi lähestymistapa, joka on nimeltään CompleteMe: Viitepohjainen ihmiskuvien täydentäminen, käyttää apuna viitekuvia, joiden avulla järjestelmä “ehdottaa”, mitä sisältöä piilotettu tai puuttuva osa kuvasta tulisi olla.

CompleteMe-järjestelmä voi sovittaa viiteaineistoa peitettävään tai piilotettavaan osaan ihmiskuvasta.
Uusi järjestelmä käyttää kaksinkertaista U-Net-arkkitehtuuria ja Aluekohtaisen huomion (RFA) lohkoa, joka kokoaa resursseja asianmukaiseen alueeseen kuvan palauttamisprosessissa.
Tutkijat esittävät myös uuden haastavan vertailujärjestelmän, jolla arvioidaan viitepohjaisia täydentämistehtäviä (koska CompleteMe on osa tietokonegrafiikan tutkimussuuntaa, jolla ei ole ollut vertailujärjestelmää tähän asti).
Kokeissa ja laajassa käyttäjätutkimuksessa uusi menetelmä osoittautui parhaaksi useimmissa mittareissa ja yleisesti ottaen.

Vanhan AnyDoor-menetelmän esimerkki, jossa on vaikeuksia tulkita viitekuva.
Tutkimusraportissa todetaan:
‘Laajojen kokeiden avulla osoitamme, että CompleteMe ylittää aiemmat viitepohjaiset ja viiteettömät menetelmät sekä määrällisissä mittareissa, laadullisissa tuloksissa että käyttäjätutkimuksissa.
‘Erityisesti haastavissa tilanteissa, joissa on monimutkaiset asennot, yksityiskohtaiset vaatekuvioinnit ja ominaiset lisävarusteet, mallimme saavuttaa johdonmukaisesti paremman visuaalisen uskottavuuden ja semanttisen yhdenmukaisuuden.’
Valitettavasti projektin GitHub-sivu ei sisällä koodia eikä luvaa sitä, ja aloite, jolla on myös vaatimaton projektisivu, näyttää olevan omistettu arkkitehtuuri.
Menetelmä
CompleteMe-kehyksessä on kaksi U-Net-arkkitehtuuria ja yhteinen U-Net, joka mahdollistaa laajemman prosessien valikoiman lopputuloksen saavuttamiseksi, kuten alla olevassa konseptikartassa näkyy:

CompleteMe-konseptikartta. Lähde: https://arxiv.org/pdf/2504.20042
Järjestelmä koodaa ensin maskitun syötekuvan latentti-esitykseksi. Samalla Viite-U-Net prosessoi useita viitekuvia, joista jokainen esittää eri kehon osia, ja poimii yksityiskohtaisia avaruullisia piirteitä.
Nämä piirteet kulkevat Aluekohtaisen huomion lohkon läpi, joka on upotettu “täydelliseen” U-Netiin, missä ne maskataan valikoivasti vastaavien alueiden maskeja käyttäen, varmistamalla, että malli kiinnittää huomion vain viitekuvien relevantteihin alueisiin.
Maskatut piirteet yhdistetään sitten globaaleihin, CLIP:istä johdetuista semanttisiin piirteisiin, joita käytetään irtautuneen ristihuomion kautta, mikä mahdollistaa mallin jälleenrakentaa puuttuvaa sisältöä sekä hienojen yksityiskohtien että semanttisen yhdenmukaisuuden kanssa.
Järjestelmä parantaa realismin ja luotettavuuden lisäämällä satunnaisen ruutuun perustuvan peittämisen ja kehon muotoon perustuvan maskin, joista kumpaakin sovelletaan samalla todennäköisyydellä, mikä lisää puuttuvien alueiden monimutkaisuutta, joita mallin on täydennettävä.
Vain viiteeksi
Aiemmat viitepohjaiset kuvien täydentämismenetelmät perustuivat yleensä semanttiselle tasolle. Tällaisia projekteja ovat CLIP itse ja DINOv2, jotka poimivat globaaleja piirteitä viitekuvista, mutta usein menettävät hienot avaruulliset yksityiskohdat, joita tarvitaan identiteetin säilyttämiseksi.

Vanhan DINOv2-lähestymistavan esimerkki, joka on mukana vertailukokeissa uudessa tutkimuksessa. Värikoodatut yläpinot osoittavat, miten DINOv2 ryhmittelee samankaltaisia objektiosia eri kuvissa. Lähde: https://arxiv.org/pdf/2304.07193
CompleteMe ratkaisee tämän ongelman erityisellä Viite-U-Netillä, joka on aloitettu Stable Diffusion 1.5:sta, mutta toimii ilman diffuusiomelun askelta*.
Jokainen viitekuva, joka esittää eri kehon osia, koodataan yksityiskohtaisiin latentteihin tällä U-Netillä. Globaalit semanttiset piirteet poimitaan erikseen CLIP:in avulla, ja molemmat piirteet tallennetaan välimuistiin tehokkaan käytön vuoksi. Näin järjestelmä voi käsitellä useita viitekuvia joustavasti säilyttäen samalla hienojen yksityiskohtien näköinen informaation.
Orkestraatio
Yhteinen U-Net hallinnoi lopullisia täydentämisen vaiheita. Se on sovellettu Stable Diffusion 1.5:n täydentämismallista ja ottaa syötteenä maskitun lähdekuvan latenttimuodossa sekä yksityiskohtaiset avaruulliset piirteet, jotka on poimittu viitekuvista, ja globaalit semanttiset piirteet, jotka on poimittu CLIP-koodarin avulla.
Nämä eri syötteet yhdistetään Aluekohtaisen huomion lohkon kautta, joka on ratkaiseva osa mallin huomion ohjaamisessa viiteaineiston relevantteihin alueisiin.
Ennen huomion mekanismin käynnistämistä viitepiirteet maskataan nimenomaisesti poistamaan epäolennaiset alueet ja yhdistetään lähdekuvan latentti-esitykseen, varmistamalla, että huomio kohdistetaan mahdollisimman tarkasti.
Tätä yhdistämistä varten CompleteMe sisältää irtautuneen ristihuomion, joka on sovellettu IP-Adapter-kehyksestä:

IP-Adapter, josta osa on otettu CompleteMeen, on yksi menestyneimmistä ja useimmin hyödynnetyistä projekteista viimeisten kolmen vuoden aikana latentti-diffuusiomallien kehityksessä. Lähde: https://ip-adapter.github.io/












