AI-modeller och plattformar
Zero123++: En enda bild till konsekvent multi-vy diffusion basmodell

De senaste åren har sett en snabb utveckling av prestanda, effektivitet och generativa förmågor hos nya AI-genereringsmodeller som utnyttjar omfattande datamängder och 2D-diffusionsgenereringstekniker. Idag är generativa AI-modeller extremt kapabla att generera olika former av 2D- och till viss del 3D-medieinnehåll, inklusive text, bilder, videor, GIF:er och mer.
I den här artikeln kommer vi att prata om Zero123++-ramverket, en bildbetingad diffusionsgenereringsmodell med målet att generera 3D-konsekventa multi-vy-bilder med en enda vy-inmatning. För att maximera fördelen med tidigare förtränade genereringsmodeller implementerar Zero123++-ramverket flera tränings- och betingsmekanismer för att minimera den ansträngning som krävs för att finjustera från färdiga diffusionsbildmodeller. Vi kommer att dyka djupare i arkitekturen, funktionen och resultaten från Zero123++-ramverket och analysera dess förmåga att generera konsekventa multi-vy-bilder av hög kvalitet från en enda bild. Så låt oss komma igång.
Zero123 och Zero123++: En introduktion
Zero123++-ramverket är en bildbetingad diffusionsgenereringsmodell som syftar till att generera 3D-konsekventa multi-vy-bilder med en enda vy-inmatning. Zero123++-ramverket är en fortsättning på Zero123- eller Zero-1-till-3-ramverket som utnyttjar zero-shot-ny vy-bildsynthesteknik för att bana väg för öppen källkodsomvandling från en bild till 3D. Även om Zero123++-ramverket presterar lovande, har de bilder som genereras av ramverket synliga geometriska inkonsekvenser, och det är den främsta anledningen till att gapet mellan 3D-scener och multi-vy-bilder fortfarande existerar.
Zero-1-till-3-ramverket fungerar som grunden för flera andra ramverk, inklusive SyncDreamer, One-2-3-45, Consistent123 och fler, som lägger till extra lager till Zero123-ramverket för att få mer konsekventa resultat när det gäller att generera 3D-bilder. Andra ramverk som ProlificDreamer, DreamFusion, DreamGaussian och fler följer en optimeringsbaserad approach för att erhålla 3D-bilder genom att destillera en 3D-bild från olika inkonsekventa modeller. Även om dessa tekniker är effektiva och genererar tillfredsställande 3D-bilder, kan resultaten förbättras med implementeringen av en basdiffusionsmodell som kan generera multi-vy-bilder konsekvent. I enlighet med detta tar Zero123++-ramverket Zero-1-till-3 och finjusterar en ny multi-vy-basdiffusionsmodell från Stable Diffusion.
I Zero-1-till-3-ramverket genereras varje ny vy oberoende, och denna approach leder till inkonsekvenser mellan vyerna som genereras eftersom diffusionsmodeller har en sampelkaraktär. För att tackla detta problem antar Zero123++-ramverket en tiling-layout-approach, där objektet omges av sex vyer i en enda bild, och säkerställer korrekt modellering för den gemensamma fördelningen av ett objekts multi-vy-bilder.
En annan stor utmaning som utvecklare som arbetar med Zero-1-till-3-ramverket står inför är att det underutnyttjar de förmågor som erbjuds av Stable Diffusion som slutligen leder till ineffektivitet och ökade kostnader. Det finns två stora skäl till varför Zero-1-till-3-ramverket inte kan maximera de förmågor som erbjuds av Stable Diffusion
- När man tränar med bildbetingningar, inkorporerar Zero-1-till-3-ramverket inte lokal eller global betingsmekanism som erbjuds av Stable Diffusion effektivt.
- Under träningsprocessen använder Zero-1-till-3-ramverket reducerad upplösning, en approach där utmatningsupplösningen reduceras under träningsupplösningen, vilket kan reducera kvaliteten på bildgenerering för Stable Diffusion-modeller.
För att tackla dessa problem implementerar Zero123++-ramverket en mängd betingsmekanismer som maximiserar utnyttjandet av resurser som erbjuds av Stable Diffusion och upprätthåller kvaliteten på bildgenerering för Stable Diffusion-modeller.
Förbättring av beting och konsekvens
I ett försök att förbättra bildbeting och multi-vy-bild-konsekvens, har Zero123++-ramverket implementerat olika tekniker med det primära målet att återanvända tidigare tekniker från den förtränade Stable Diffusion-modellen.
Multi-vy-generering
Den oumbärliga kvaliteten på att generera konsekventa multi-vy-bilder ligger i att modellera den gemensamma fördelningen av flera bilder korrekt. I Zero-1-till-3-ramverket ignoreras korrelationen mellan multi-vy-bilder eftersom ramverket modellerar den villkorsmässiga marginalfördelningen oberoende och separat för varje bild. Men i Zero123++-ramverket har utvecklarna valt en tiling-layout-approach som lägger sex bilder i en enda bild för konsekvent multi-vy-generering, och processen demonstreras i följande bild.

Dessutom har det noterats att objektriktningar tenderar att bli tvetydiga när man tränar modellen på kamerapositioner, och för att förhindra denna tvetydighet, tränar Zero-1-till-3-ramverket på kamerapositioner med höjdvinklar och relativ azimut till inmatningen. För att implementera denna approach är det nödvändigt att känna till höjdvinkeln för vy-inmatningen, som sedan används för att bestämma den relativa posen mellan nya vy-inmatningar. I ett försök att känna till denna höjdvinkel, lägger ramverken ofta till en höjdskattningmodul, och denna approach kan ofta leda till ytterligare fel i pipelinen.
Buller-schema
Det skalförändrade linjära schemat, det ursprungliga buller-schemat för Stable Diffusion, fokuserar främst på lokala detaljer, men som det kan ses i följande bild, har det mycket få steg med lägre SNR eller signal-till-brus-förhållande.

Dessa steg med lågt signal-till-brus-förhållande inträffar tidigt under avbrusningsstadiet, ett stadium som är avgörande för att bestämma den globala lågfrekvensstrukturen. Att reducera antalet steg under avbrusningsstadiet, antingen under interferens eller träningsprocessen, kan leda till en större strukturförändring. Även om denna konfiguration är idealisk för single-image-generering, begränsar den ramverkets förmåga att säkerställa global konsekvens mellan olika vyer. För att övervinna detta hinder, finjusterar Zero123++-ramverket en LoRA-modell på Stable Diffusion 2-v-prediktion-ramverket för att utföra en leksaksuppgift, och resultaten demonstreras nedan.

Med det skalförändrade linjära buller-schemat, överanpassar LoRA-modellen inte, men bleker bara bilden något. Omvänt, när man arbetar med det linjära buller-schemat, genererar LoRA-ramverket en tom bild framgångsrikt oavsett inmatningsprompten, vilket visar buller-schemats påverkan på ramverkets förmåga att anpassa sig till nya krav globalt.
Skalad referensuppmärksamhet för lokala beting
Den enda vy-inmatningen eller betingsbilderna i Zero-1-till-3-ramverket är sammanfogade med de bullriga inmatningarna i funktionen för att bulla för bildbeting.
Denna sammanfogning leder till en felaktig pixelvis spatial korrespondens mellan målbilden och inmatningen. För att tillhandahålla korrekt lokal betingsinmatning, använder Zero123++-ramverket en skalad referensuppmärksamhetsapproach, där en avbrusnings-UNet-modell körs på en extra referensbild, följt av appendningen av värde-matriser och självuppmärksamhetsnyckel från referensbilden till respektive uppmärksamhetslager när modellinmatningen avbrusas, och det demonstreras i följande figur.

Referensuppmärksamhetsapproachen kan guida diffusionsmodellen att generera bilder som delar liknande textur med referensbilden och semantiskt innehåll utan någon finjustering. Med finjustering ger referensuppmärksamhetsapproachen överlägsna resultat med det latenta skalat.

Global beting: FlexDiffuse
I den ursprungliga Stable Diffusion-approachen är textinbäddningarna den enda källan till globala inbäddningar, och approachen använder CLIP-ramverket som en textkodare för att utföra korsundersökningar mellan textinbäddningarna och modellens latenta. Resultatmässigt kan utvecklare använda justeringen mellan textutrymmena och de resulterande CLIP-bilderna för att använda dem för global bildbeting.
Zero123++-ramverket föreslår att man ska använda en tränbar variant av den linjära guidningsmekanismen för att inkorporera den globala bildbetingen i ramverket med minimal finjustering behövs, och resultaten demonstreras i följande bild. Som det kan ses, utan närvaron av en global bildbeting, är kvaliteten på innehållet som genereras av ramverket tillfredsställande för synliga områden som motsvarar inmatningsbilden. Men kvaliteten på bilden som genereras av ramverket för osynliga områden lider av en betydande försämring, vilket främst beror på modellens oförmåga att härleda objektets globala semantik.

Modellarkitektur
Zero123++-ramverket är tränat med Stable Diffusion 2v-modellen som grund med de olika approacherna och teknikerna som nämns i artikeln. Zero123++-ramverket är förtränat på Objaverse-datasetet som är renderat med slumpmässig HDRI-belysning. Ramverket antar också den fasade träningsplanen som används i Stable Diffusion Image Variations-ramverket i ett försök att ytterligare minimera den mängd finjustering som krävs och bevara så mycket som möjligt av den tidigare Stable Diffusion.
Funktionen eller arkitekturen för Zero123++-ramverket kan delas in i sekventiella steg eller faser. Den första fasen ser ramverket finjustera KV-matriserna för cross-attention-lager och self-attention-lagren i Stable Diffusion med AdamW som optimerare, 1000 varm-uppsteg och den cosinusformiga lärningshastigheten som maximerar vid 7×10-5. I den andra fasen använder ramverket en högst konservativ konstant lärningshastighet med 2000 varm-uppsättningar och använder Min-SNR-approachen för att maximera effektiviteten under träningsprocessen.
Zero123++: Resultat och prestandajämförelse
Kvalitativ prestanda
För att bedöma prestandan hos Zero123++-ramverket baserat på dess genererade kvalitet, jämförs det mot SyncDreamer och Zero-1-till-3-XL, två av de bästa ramverken för innehållsgenerering. Ramverken jämförs mot fyra inmatningsbilder med olika omfattning. Den första bilden är en elektrisk leksaks-katt, tagen direkt från Objaverse-datasetet, och den har en stor osäkerhet på baksidan av objektet. Den andra bilden är en brand-släckare, och den tredje bilden är en hund som sitter på en raket, genererad av SDXL-modellen. Den sista bilden är en anime-illustration. De erforderliga höjdstegen för ramverken uppnås genom att använda One-2-3-4-5-ramverkets höjdskattning-metod, och bakgrundsavlägsnande uppnås genom att använda SAM-ramverket. Som det kan ses, genererar Zero123++-ramverket högkvalitativa multi-vy-bilder konsekvent och kan generalisera till utom-domän-2D-illustrationer och AI-genererade bilder lika bra.


Kvantitativ analys
För att kvantitativt jämföra Zero123++-ramverket mot state-of-the-art Zero-1-till-3 och Zero-1-till-3-XL-ramverken, utvärderar utvecklare den Lärda Perceptuella Bild-Patch-Likhet (LPIPS)-poängen för dessa modeller på valideringsdelningsdata, en undermängd av Objaverse-datasetet. För att utvärdera modellens prestanda på multi-vy-bild-generering, lägger utvecklarna samman grund-sanning-bilder och 6 genererade bilder, och beräknar sedan LPIPS-poängen. Resultaten demonstreras nedan och som det kan ses, uppnår Zero123++-ramverket den bästa prestandan på valideringsdelningsuppsättningen.

Text-till-multi-vy-utvärdering
För att utvärdera Zero123++-ramverkets förmåga att generera text-till-multi-vy-innehåll, använder utvecklare först SDXL-ramverket med textprompt för att generera en bild, och sedan använder de Zero123++-ramverket till den genererade bilden. Resultaten demonstreras i följande bild, och som det kan ses, när man jämför med Zero-1-till-3-ramverket som inte kan garantera konsekvent multi-vy-generering, returnerar Zero123++-ramverket konsekventa, realistiska och högdetaljerade multi-vy-bilder genom att implementera text-till-bild-till-multi-vy-approachen eller pipeline.

Zero123++-djupkontrollnät
Utöver det grundläggande Zero123++-ramverket, har utvecklare också släppt Djupkontrollnät Zero123++, en djupkontrollerad version av det ursprungliga ramverket byggt med ControlNet-arkitekturen. De normaliserade linjära bilderna renderas i respekt med de efterföljande RGB-bilderna, och ett ControlNet-ramverk tränas för att kontrollera geometrin hos Zero123++-ramverket med djupperception.

Slutsats
I den här artikeln har vi talat om Zero123++, en bildbetingad diffusionsgenereringsmodell med målet att generera 3D-konsekventa multi-vy-bilder med en enda vy-inmatning. För att maximera fördelen med tidigare förtränade genereringsmodeller, implementerar Zero123++-ramverket flera tränings- och betingsmekanismer för att minimera den ansträngning som krävs för att finjustera från färdiga diffusionsbildmodeller. Vi har också diskuterat de olika approacherna och förbättringarna som implementerats av Zero123++-ramverket för att uppnå resultat som är jämförbara med, och till och med överträffar, de som uppnås av nuvarande state-of-the-art-ramverk.
Men trots dess effektivitet och förmåga att generera högkvalitativa multi-vy-bilder konsekvent, har Zero123++-ramverket fortfarande något utrymme för förbättring, med potentiella områden för forskning som en
- två-stegs-förfiningsmodell som kan lösa Zero123++-ramverkets oförmåga att uppfylla globala krav på konsekvens.
- ytterligare skalförstoringar för att ytterligare förbättra Zero123++-ramverkets förmåga att generera bilder av ännu högre kvalitet.












