Andersonin kulma

Ihmiskuvien palauttaminen ja muokkaaminen tekoälyllä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

Uusi yhteistyö Kalifornian yliopiston Mercedin ja Adoben välillä tarjoaa edistysaskeleen ihmiskuvien täydentämisessä – tutkitussa tehtävässä, jossa pyritään “peittämään” tai “piilottamaan” osia kuvista, tarkoituksena esimerkiksi virtuaalinen try-on, animaatio ja valokuvien muokkaus.

Ihmiskuvien täydentämisen järjestelmät, kuten CompleteMe, voivat asettaa uudet vaatteet olemassa oleviin kuviin (viitatun kuva esimerkiksi keskisarake) ja muuttaa niitä käyttäjän toiveiden mukaan. Nämä esimerkit ovat uuden tutkimuksen laajasta liitteestä.

Ihmiskuvien täydentämisen järjestelmät, kuten CompleteMe, voivat asettaa uudet vaatteet olemassa oleviin kuviin (viitatun kuva esimerkiksi keskisarake) ja muuttaa niitä käyttäjän toiveiden mukaan. Nämä esimerkit ovat uuden tutkimuksen laajasta liitteestä. Source: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Uusi lähestymistapa, joka on nimeltään CompleteMe: Viitepohjainen ihmiskuvien täydentäminen, käyttää apuna viitekuvia, joiden avulla järjestelmä “ehdottaa”, mitä sisältöä piilotettu tai puuttuva osa kuvasta tulisi olla.

CompleteMe-järjestelmä voi sovittaa viiteaineistoa peitettävään tai piilotettavaan osaan ihmiskuvasta.

CompleteMe-järjestelmä voi sovittaa viiteaineistoa peitettävään tai piilotettavaan osaan ihmiskuvasta.

Uusi järjestelmä käyttää kaksinkertaista U-Net-arkkitehtuuria ja Aluekohtaisen huomion (RFA) lohkoa, joka kokoaa resursseja asianmukaiseen alueeseen kuvan palauttamisprosessissa.

Tutkijat esittävät myös uuden haastavan vertailujärjestelmän, jolla arvioidaan viitepohjaisia täydentämistehtäviä (koska CompleteMe on osa tietokonegrafiikan tutkimussuuntaa, jolla ei ole ollut vertailujärjestelmää tähän asti).

Kokeissa ja laajassa käyttäjätutkimuksessa uusi menetelmä osoittautui parhaaksi useimmissa mittareissa ja yleisesti ottaen.

Vanhan AnyDoor-menetelmän esimerkki, jossa on vaikeuksia tulkita viitekuva.

Vanhan AnyDoor-menetelmän esimerkki, jossa on vaikeuksia tulkita viitekuva.

Tutkimusraportissa todetaan:

‘Laajojen kokeiden avulla osoitamme, että CompleteMe ylittää aiemmat viitepohjaiset ja viiteettömät menetelmät sekä määrällisissä mittareissa, laadullisissa tuloksissa että käyttäjätutkimuksissa.

‘Erityisesti haastavissa tilanteissa, joissa on monimutkaiset asennot, yksityiskohtaiset vaatekuvioinnit ja ominaiset lisävarusteet, mallimme saavuttaa johdonmukaisesti paremman visuaalisen uskottavuuden ja semanttisen yhdenmukaisuuden.’

Valitettavasti projektin GitHub-sivu ei sisällä koodia eikä luvaa sitä, ja aloite, jolla on myös vaatimaton projektisivu, näyttää olevan omistettu arkkitehtuuri.

Menetelmä

CompleteMe-kehyksessä on kaksi U-Net-arkkitehtuuria ja yhteinen U-Net, joka mahdollistaa laajemman prosessien valikoiman lopputuloksen saavuttamiseksi, kuten alla olevassa konseptikartassa näkyy:

CompleteMe-konseptikartta. Lähde: https://arxiv.org/pdf/2504.20042

CompleteMe-konseptikartta. Lähde: https://arxiv.org/pdf/2504.20042

Järjestelmä koodaa ensin maskitun syötekuvan latentti-esitykseksi. Samalla Viite-U-Net prosessoi useita viitekuvia, joista jokainen esittää eri kehon osia, ja poimii yksityiskohtaisia avaruullisia piirteitä.

Nämä piirteet kulkevat Aluekohtaisen huomion lohkon läpi, joka on upotettu “täydelliseen” U-Netiin, missä ne maskataan valikoivasti vastaavien alueiden maskeja käyttäen, varmistamalla, että malli kiinnittää huomion vain viitekuvien relevantteihin alueisiin.

Maskatut piirteet yhdistetään sitten globaaleihin, CLIP:istä johdetuista semanttisiin piirteisiin, joita käytetään irtautuneen ristihuomion kautta, mikä mahdollistaa mallin jälleenrakentaa puuttuvaa sisältöä sekä hienojen yksityiskohtien että semanttisen yhdenmukaisuuden kanssa.

Järjestelmä parantaa realismin ja luotettavuuden lisäämällä satunnaisen ruutuun perustuvan peittämisen ja kehon muotoon perustuvan maskin, joista kumpaakin sovelletaan samalla todennäköisyydellä, mikä lisää puuttuvien alueiden monimutkaisuutta, joita mallin on täydennettävä.

Vain viiteeksi

Aiemmat viitepohjaiset kuvien täydentämismenetelmät perustuivat yleensä semanttiselle tasolle. Tällaisia projekteja ovat CLIP itse ja DINOv2, jotka poimivat globaaleja piirteitä viitekuvista, mutta usein menettävät hienot avaruulliset yksityiskohdat, joita tarvitaan identiteetin säilyttämiseksi.

Vanhan DINOv2-lähestymistavan esimerkki, joka on mukana vertailukokeissa uudessa tutkimuksessa. Värikoodatut yläpinot osoittavat, miten DINOv2 ryhmittelee samankaltaisia objektiosia eri kuvissa. Lähde: https://arxiv.org/pdf/2304.07193

Vanhan DINOv2-lähestymistavan esimerkki, joka on mukana vertailukokeissa uudessa tutkimuksessa. Värikoodatut yläpinot osoittavat, miten DINOv2 ryhmittelee samankaltaisia objektiosia eri kuvissa. Lähde: https://arxiv.org/pdf/2304.07193

CompleteMe ratkaisee tämän ongelman erityisellä Viite-U-Netillä, joka on aloitettu Stable Diffusion 1.5:sta, mutta toimii ilman diffuusiomelun askelta*.

Jokainen viitekuva, joka esittää eri kehon osia, koodataan yksityiskohtaisiin latentteihin tällä U-Netillä. Globaalit semanttiset piirteet poimitaan erikseen CLIP:in avulla, ja molemmat piirteet tallennetaan välimuistiin tehokkaan käytön vuoksi. Näin järjestelmä voi käsitellä useita viitekuvia joustavasti säilyttäen samalla hienojen yksityiskohtien näköinen informaation.

Orkestraatio

Yhteinen U-Net hallinnoi lopullisia täydentämisen vaiheita. Se on sovellettu Stable Diffusion 1.5:n täydentämismallista ja ottaa syötteenä maskitun lähdekuvan latenttimuodossa sekä yksityiskohtaiset avaruulliset piirteet, jotka on poimittu viitekuvista, ja globaalit semanttiset piirteet, jotka on poimittu CLIP-koodarin avulla.

Nämä eri syötteet yhdistetään Aluekohtaisen huomion lohkon kautta, joka on ratkaiseva osa mallin huomion ohjaamisessa viiteaineiston relevantteihin alueisiin.

Ennen huomion mekanismin käynnistämistä viitepiirteet maskataan nimenomaisesti poistamaan epäolennaiset alueet ja yhdistetään lähdekuvan latentti-esitykseen, varmistamalla, että huomio kohdistetaan mahdollisimman tarkasti.

Tätä yhdistämistä varten CompleteMe sisältää irtautuneen ristihuomion, joka on sovellettu IP-Adapter-kehyksestä:

IP-Adapter, josta osa on otettu CompleteMeen, on yksi menestyneimmistä ja useimmin hyödynnetyistä projekteista viimeisten kolmen vuoden aikana latentti-diffuusiomallien kehityksessä. Lähde: https://ip-adapter.github.io/

IP-Adapter, josta osa on otettu CompleteMeen, on yksi menestyneimmistä ja useimmin hyödynnetyistä projekteista viimeisten kolmen vuoden aikana latentti-diffuusiomallien kehityksessä. Lähde: https://ip-adapter.github.io/


Kirjailija tekoälystä, alan erikoismies ihmisen kuvien synteesistä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: [email protected]