Andersons vinkel

Nvidias eDiffi-diffusionsmodell tillåter “målning med ord” och mer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Försöken att skapa exakta kompositioner med latent diffusionsgenereringsmodeller för bilder, såsom Stable Diffusion, kan vara som att försöka styra katter; den kreativa och tolkande kraft som möjliggör systemet att skapa extraordinära detaljer och frammana extraordinära bilder från relativt enkla textprompt är också svår att stänga av när man letar efter Photoshoplevel-kontroll över en bildgenerering.

Nu har NVIDIA -forskning presenterat en ny metod, kallad ensemble-diffusion för bilder (eDiffi), som använder en kombination av flera inbäddnings- och tolkningsmetoder (i stället för samma metod hela vägen genom pipelinen) för att tillåta en mycket högre grad av kontroll över den genererade innehållet. I exemplet nedan ser vi en användare som målar element där varje färg representerar ett ord från en textprompt:

'Målning med ord' är en av de två nya förmågorna i Nvidias eDiffi-diffusionsmodell. Varje penseldrag av färg representerar ett ord från prompten (se dem dyka upp på vänster sida under generationen), och den färg som appliceras på området kommer endast att bestå av det elementet. Se slutet av artikeln för den inbäddade officiella videon, med fler exempel och bättre upplösning. Källa: https://www.youtube.com/watch?v=k6cOx9YjHJc

‘Målning med ord’ är en av de två nya förmågorna i Nvidias eDiffi-diffusionsmodell. Varje penseldrag av färg representerar ett ord från prompten (se dem dyka upp på vänster sida under generationen), och den färg som appliceras på området kommer endast att bestå av det elementet. Se källa (officiell) video för fler exempel och bättre upplösning på https://www.youtube.com/watch?v=k6cOx9YjHJc

I princip är detta “målning med masker”, och vänder på npainting-paradigmet i Stable Diffusion, som bygger på att fixa trasiga eller otillfredsställande bilder, eller utöka bilder som kunde ha varit av önskad storlek från början.

Här, istället, representerar marginalerna på den målade penseldraget de tillåtna ungefärliga gränserna för endast ett unikt element från ett enda koncept, vilket tillåter användaren att ange den slutliga canvasstorleken från början och sedan diskret lägga till element.

Exempel från den nya artikeln. Källa: https://arxiv.org/pdf/2211.01324.pdf

Exempel från den nya artikeln. Källa: https://arxiv.org/pdf/2211.01324.pdf

De varierade metoder som används i eDiffi innebär också att systemet gör ett mycket bättre jobb med att inkludera varje element i långa och detaljerade prompt, medan Stable Diffusion och OpenAI:s DALL-E 2 tenderar att prioritera vissa delar av prompten, beroende på hur tidigt målorden dyker upp i prompten, eller på andra faktorer, såsom den potentiella svårigheten att skilja på de olika elementen som krävs för en komplett men samtidigt omfattande (i förhållande till textprompten) komposition:

Från artikeln: eDiffi kan iterera mer noggrant genom prompten tills det maximala möjliga antalet element har renderats. Även om de förbättrade resultaten för eDiffi (högersta kolumnen) är utvalda, är också de jämförbara bilderna från Stable Diffusion och DALL-E 2 utvalda.

Från artikeln: eDiffi kan iterera mer noggrant genom prompten tills det maximala möjliga antalet element har renderats. Även om de förbättrade resultaten för eDiffi (högersta kolumnen) är utvalda, är också de jämförbara bilderna från Stable Diffusion och DALL-E 2 utvalda.

Dessutom innebär användningen av en dedikerad T5-text-till-text-encoder att eDiffi kan rendera förståelig engelsk text, antingen abstrakt begärd från en prompt (dvs. “bilden innehåller någon text av [x]”) eller explicit begärd (dvs. “t-shirten säger ‘Nvidia Rocks'”):

Dedikerad text-till-text-bearbetning i eDiffi innebär att text kan renderas ordagrant i bilder, i stället för att bara köras genom en text-till-bild-tolkande lager som förstör utdata.

Dedikerad text-till-text-bearbetning i eDiffi innebär att text kan renderas ordagrant i bilder, i stället för att bara köras genom en text-till-bild-tolkande lager som förstör utdata.

En ytterligare fördel med det nya ramverket är att det också är möjligt att tillhandahålla en enda bild som en stilprompt, i stället för att behöva träna en DreamBooth-modell eller en textuell inbäddning på flera exempel på en genre eller stil.

Stilöverföring kan appliceras från en referensbild till en text-till-bild-prompt, eller till och med en bild-till-bild-prompt.

Stilöverföring kan appliceras från en referensbild till en text-till-bild-prompt, eller till och med en bild-till-bild-prompt.

Den nya artikeln heter eDiffi: Text-till-bild-diffusionsmodeller med en ensemble av expertdenoisers, och

T5-textkodaren

Användningen av Googles Text-till-text Transfer Transformer (T5) är den avgörande faktorn i de förbättrade resultaten som demonstreras i eDiffi. Den genomsnittliga latent diffusionspipeline centrerar på associationen mellan tränade bilder och de rubriker som åtföljde dem när de samlades in från internet (eller annars justerades manuellt senare, även om detta är en dyr och därför sällsynt intervention).

Från juli 2020-papperet för T5 – textbaserade transformationer, som kan hjälpa den generativa bildarbetsflödet i eDiffi (och, potentiellt, andra latent diffusionsmodeller). Källa: https://arxiv.org/pdf/1910.10683.pdf

Från juli 2020-papperet för T5 – textbaserade transformationer, som kan hjälpa den generativa bildarbetsflödet i eDiffi (och, potentiellt, andra latent diffusionsmodeller). Källa: https://arxiv.org/pdf/1910.10683.pdf

Genom att omformulera källtexten och köra T5-modulen kan mer exakta associationer och representationer erhållas än vad som tränades in i modellen ursprungligen, nästan likt post facto manuell märkning, med större specifikhet och tillämplighet för kraven i den begärda textprompten.

Författarna förklarar:

‘I de flesta befintliga arbeten om diffusionsmodeller delas denoisningsmodellen över alla brusnivåer, och den temporala dynamiken representeras med en enkel tidsinbäddning som matas till denoisningsmodellen via ett MLP-nätverk. Vi hävdar att den komplexa temporala dynamiken i denoisningsdiffusionen kanske inte kan läras effektivt från data med hjälp av en delad modell med begränsad kapacitet.

‘I stället föreslår vi att öka denoisningsmodellens kapacitet genom att införa en ensemble av expertdenoisers; varje expertdenoiser är en denoisningsmodell specialiserad för en viss brusnivå. På detta sätt kan vi öka modellens kapacitet utan att sakta ner samplingen, eftersom den beräkningsmässiga komplexiteten för att utvärdera [den bearbetade enheten] på varje brusnivå förblir densamma.’

Konceptuell arkitektur för eDiffi.

Konceptuell arkitektur för eDiffi.

Den befintliga CLIP-kodningsmodulen som ingår i DALL-E 2 och Stable Diffusion är också kapabel att hitta alternativa bildtolkningar för text relaterad till användarindata. Men de är tränade på liknande information som den ursprungliga modellen och används inte som en separat tolkningslager på samma sätt som T5 i eDiffi.

Författarna påstår att eDiffi är den första gången som både en T5- och en CLIP-kodare har införlivats i en enda pipeline:

’Eftersom dessa två kodare tränas med olika mål, föredrar deras inbäddningar bildformationer med samma indata, men med olika bilder. Medan CLIP-textinbäddningar hjälper till att bestämma den globala utseendet på de genererade bilderna, tenderar utdata att sakna de fina detaljerna i texten.

‘I kontrast genererar bilder med T5-textinbäddningar ensamma bättre de enskilda objekten som beskrivs i texten, men deras globala utseende är mindre exakt. Att använda dem tillsammans producerar de bästa bildgenereringsresultaten i vår modell.’

Avbrytande och förstärkning av diffusionsprocessen

Artikeln noterar att en typisk latent diffusionsmodell börjar resan från rent brus till en bild genom att förlita sig enbart på text i de tidiga stadierna av generationen.

När bruset löser sig till någon form av grov layout som representerar beskrivningen i textprompten, släpper den textstyrda aspekten av processen i princip, och resten av processen skiftar mot att förstärka de visuella funktionerna.

Detta innebär att alla element som inte löstes under den tidiga fasen av textstyrda brusinterpretation är svåra att injicera i bilden senare, eftersom de två processerna (text-till-layout och layout-till-bild) har relativt liten överlappning, och den grundläggande layouten är ganska sammanflätad när den anländer till bildförstärkningsprocessen.

Från artikeln: uppmärksamhetskartor för olika delar av pipelinen när brus-till-bild-processen mognar. Vi kan se den skarpa avkortningen av CLIP-influens på bilden i den nedre raden, medan T5 fortsätter att påverka bilden mycket längre in i renderingsprocessen.

Från artikeln: uppmärksamhetskartor för olika delar av pipelinen när brus-till-bild-processen mognar. Vi kan se den skarpa avkortningen av CLIP-influens på bilden i den nedre raden, medan T5 fortsätter att påverka bilden mycket längre in i renderingsprocessen.

Professionell potential

Exemplen på projektets sida och YouTube-video fokuserar på PR-vänliga generationer av meme-tastiska söta bilder. Som vanligt spelar NVIDIA-forskning ned potentialen för sin senaste innovation för att förbättra fotorealistiska eller VFX-arbetsflöden, liksom dess potential för förbättring av deepfake-bilder och video.

I exemplen ritar en novis eller amatöranvändare grova konturer för specifika element, medan i ett mer systematiskt VFX-arbetsflöde kunde det vara möjligt att använda eDiffi för att tolka flera ramar av en videoenhet med hjälp av text-till-bild, där konturerna är mycket exakta och baseras på, till exempel, figurer där bakgrunden har tagits bort via grön skärm eller algoritmiska metoder.

Runway ML tillhandahåller redan AI-baserad rotoscoping. I detta exempel representerar den 'gröna skärmen' runt subjektet alfa-lagret, medan extraheringen har utförts via maskinlärande snarare än algoritmisk borttagning av en verklig grön skärm-bakgrund. Källa: https://twitter.com/runwayml/status/1330978385028374529

Runway ML tillhandahåller redan AI-baserad rotoscoping. I detta exempel representerar den ‘gröna skärmen’ runt subjektet alfa-lagret, medan extraheringen har utförts via maskinlärande snarare än algoritmisk borttagning av en verklig grön skärm-bakgrund. Källa: https://twitter.com/runwayml/status/1330978385028374529

Användning av en tränad DreamBooth-karaktär och en bild-till-bild-pipeline med eDiffi kan det potentiellt vara möjligt att börja lösa en av de svåraste problemen med varje latent diffusionsmodell: temporal stabilitet. I ett sådant fall skulle både marginalerna på den påtvingade bilden och innehållet i bilden “flyta” mot användarens canvas, med temporal kontinuitet i det renderade innehållet (t.ex. att förvandla en verklig Tai Chi-utövare till en robot) som tillhandahålls av användning av en låst DreamBooth-modell som har “minns” sin träningsdata – dåligt för tolkbarhet, men bra för reproducerbarhet, trohet och kontinuitet.

Metod, data och tester

Artikeln anger att eDiffi-modellen tränades på “en samling offentliga och proprietära datamängder”, kraftigt filtrerade av en förtränad CLIP-modell, för att ta bort bilder som sannolikt skulle sänka den allmänna estetiska poängen för utdata. Den slutliga filtrerade bildmängden består av “cirka en miljard” text-bild-par. Storleken på de tränade bilderna beskrivs som med “den kortaste sidan större än 64 pixlar”.

Flera modeller tränades för processen, med både bas- och superupplösningsmodellerna tränade på AdamW-optimisator med en inlärningshastighet på 0,0001, med en viktförfall på 0,01, och med en imponerande batchstorlek på 2048.

Basmodellen tränades på 256 NVIDIA A100 GPU:er, och de två superupplösningsmodellerna på 128 NVIDIA A100 GPU:er för varje modell.

Systemet baserades på Nvidias egen Imaginaire PyTorch-bibliotek. COCO- och Visual Genome-datasets användes för utvärdering, men inte inkluderade i de slutliga modellerna, med MS-COCO den specifika varianten som användes för testning. Rivaliserande system som testades var GLIDE, Make-A-Scene, DALL-E 2, Stable Diffusion, och Googles två bildsyntes-system, Imagen och Parti.

I enlighet med liknande tidigare arbete användes zero-shot FID-30K som en utvärderingsmetrik. Under FID-30K extraherades 30 000 rubriker slumpmässigt från COCO-valideringsuppsättningen (dvs. inte de bilder eller text som användes i träningsprocessen), som sedan användes som textprompt för att syntetisera bilder.

Frechet Inception Distance (FID) mellan de genererade och grundtruth-bilderna beräknades, tillsammans med att registrera CLIP-poängen för de genererade bilderna.

Resultat från zero-shot FID-testerna mot aktuella state-of-the-art-approcher på COCO 2014-valideringsdatasetet, med lägre resultat bättre.

Resultat från zero-shot FID-testerna mot aktuella state-of-the-art-approcher på COCO 2014-valideringsdatasetet, med lägre resultat bättre.

I resultaten kunde eDiffi uppnå den lägsta (bästa) poängen på zero-shot FID, till och med mot system med ett mycket högre antal parametrar, såsom de 20 miljarder parametrarna i Parti, jämfört med de 9,1 miljarder parametrarna i den högst specade eDiffi-modellen som tränades för testerna.

Slutsats

Nvidias eDiffi representerar ett välkommet alternativ till att bara lägga till mer och mer data och komplexitet till befintliga system, utan använder i stället en mer intelligent och skiktad approach till några av de törnigaste hindren relaterade till sammanflätning och icke-redigerbarhet i latent diffusionsgenererande bildsystem.

Det finns redan diskussioner på Stable Diffusion-subreddits och Discords om antingen direkt inkorporering av eventuell kod som kan göras tillgänglig för eDiffi, eller om att omställa principerna bakom det i en separat implementering. Den nya pipelinen är dock så radikalt annorlunda att den skulle utgöra en hel versionsnummerförändring för SD, och skulle därmed kasta bort viss bakåtkompatibilitet, men samtidigt erbjuda möjligheten till kraftigt förbättrad kontroll över de slutliga syntetiserade bilderna, utan att offra den fascinerande kreativa kraften i latent diffusion.

 

Publicerad första gången den 3 november 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai