AI-modeller och plattformar
Splatter Image: Ultra-snabb Envy 3D-rekonstruktion
Envy 3D-objektrekonstruktion med konvolutionsnätverk har visat anmärkningsvärda förmågor. Envy 3D-rekonstruktionsmodeller genererar 3D-modellen av vilket objekt som helst med hjälp av en enda bild som referens, vilket gör det till ett av de hetaste forskningsområdena inom datorseende.

Till exempel, låt oss överväga motorcykeln i bilden ovan. Att generera dess 3D-struktur kräver en komplex pipeline som först kombinerar ledtrådar från lågnivåbilder med högnivåsemantisk information och kunskap om den strukturella anordningen av delar.
På grund av den komplexa processen har Envy 3D-rekonstruktion varit en stor utmaning inom datorseende. I ett försök att förbättra effektiviteten i Envy 3D-rekonstruktion har utvecklare arbetat med Splatter Image, en metod som syftar till att uppnå ultra-snabb envy 3D-form och 3D-utseende konstruktion av objekt. I dess kärna använder Splatter Image-ramverket Gaussisk splattningsmetoden för att analysera 3D-representationer, med fördel av den hastighet och kvalitet den erbjuder.
Nyligen har Gaussisk splattningsmetod implementerats av många multi-view rekonstruktionsmodeller för realtidsrendering, förbättrad skalning och snabb utbildning. Med det sagt är Splatter Image det första ramverket som implementerar Gaussisk splattningsmetod för single-view rekonstruktionsuppgifter.
I den här artikeln kommer vi att undersöka hur Splatter Image-ramverket använder Gaussisk splattningsmetod för att uppnå ultra-snabb envy 3D-rekonstruktion. Så låt oss komma igång.
Splatter Image : Ett försök till ultra-snabb Envy 3D-rekonstruktion
Som nämnts tidigare är Splatter Image en ultra-snabb metod för Envy 3D-objektrekonstruktion baserad på Gaussisk splattningsmetod. Splatter Image är det första datorseende-ramverket som implementerar Gaussisk splattningsmetod för monokulär 3D-objektgenerering, eftersom Gaussisk splattningsmetod traditionellt har använts för att driva multi-view 3D-objektrekonstruktionsramverk. Men vad skiljer Splatter Image-ramverket från tidigare metoder är att det är en lärande-baserad metod, och rekonstruktion under testning kräver endast feed-forward utvärdering av neuronnätverket.
Splatter Image-ramverket bygger i grunden på Gaussisk splattnings renderingskvaliteter och hög processhastighet för att generera 3D-rekonstruktioner. Splatter Image-ramverket har en enkel design: ramverket använder ett 2D-bild-till-bild neuronnätverk för att förutsäga ett 3D-Gaussiskt värde per ingångsbildspixel och kartar ingångsbilden till ett 3D-Gaussiskt värde per pixel. De resulterande 3D-Gaussiska värdena har formen av en bild, känd som Splatter Image, och de Gaussiska värdena ger också en 360-graders representation av bilden. Processen visas i följande bild.

Även om processen är enkel och rak, finns det några nyckelutmaningar som Splatter Image-ramverket står inför när det använder Gaussisk splattningsmetod för att generera 3D-Gaussiska värden för Envy 3D-representationer. Den första stora utmaningen är att utforma ett neuronnätverk som accepterar bilden av ett objekt som ingång och genererar en motsvarande Gaussisk blandning som representerar alla sidor av bilden som utgång. För att tackla detta utnyttjar Splatter Image-ramverket det faktum att även om den genererade Gaussiska blandningen är en samling eller en oordnad samling av artiklar, kan den fortfarande lagras i en ordnad datastruktur. Enligt detta använder ramverket en 2D-bild som en behållare för 3D-Gaussiska värden, vilket resulterar i att varje pixel i behållaren innehåller parametrarna för en Gaussisk, inklusive dess egenskaper som form, opacitet och färg.
Genom att lagra 3D-Gaussiska värden i en bild kan Splatter Image-ramverket minska rekonstruktionshinder som uppstår när man lär sig en bild-till-bild neuronnätverk. Genom att använda denna metod kan rekonstruktionsprocessen implementeras endast genom att använda effektiva 2D-operatörer istället för att förlita sig på 3D-operatörer. Dessutom, i Splatter Image-ramverket, är 3D-representationen en blandning av 3D-Gaussiska värden, vilket gör att det kan utnyttja renderingshastigheten och minneseffektiviteten som erbjuds av Gaussisk splattningsmetod, vilket förbättrar effektiviteten i både utbildning och inferens. Fortsättning, Splatter Image-ramverket genererar inte bara Envy 3D-representationer, utan det visar också anmärkningsvärd effektivitet eftersom det kan tränas även på en enda GPU på standard 3D-objektrekonstruktionsbenchmark. Dessutom kan Splatter Image-ramverket utökas för att ta flera bilder som ingång. Det kan uppnås genom att registrera de enskilda Gaussiska blandningarna till en gemensam referens och sedan genom att kombinera de Gaussiska blandningar som förutsagts från enskilda vyer. Ramverket injicerar också lätta cross-attention-lager i sin arkitektur, vilket tillåter olika vyer att kommunicera med varandra under förutsägelse.
Från ett empiriskt perspektiv är det värt att notera att Splatter Image-ramverket kan producera 360-graders rekonstruktion av objektet, även om det bara ser en sida av objektet. Ramverket tilldelar då olika Gaussiska värden i en 2D-grannskap till olika delar av 3D-objektet för att koda den genererade 360-graders informationen i 2D-bilden. Dessutom ställer ramverket in opaciteten för flera Gaussiska värden till noll, vilket inaktiverar dem, och tillåter dem att stängas av under efterbearbetning.
För att sammanfatta är Splatter Image-ramverket
- En ny metod för att generera Envy 3D-objektrekonstruktioner genom att porta Gaussisk splattningsmetod.
- Utökar metoden för multi-view 3D-objektrekonstruktion.
- Uppnår toppmodell 3D-objektrekonstruktionsprestanda på standardbenchmark med anmärkningsvärd hastighet och kvalitet.
Splatter Image : Metodik och Arkitektur
Gaussisk Splattningsmetod
Som nämnts tidigare är Gaussisk splattningsmetod den primära metoden som implementeras av Splatter Image-ramverket för att generera Envy 3D-objektrekonstruktioner. I enkla termer är Gaussisk splattningsmetod en rasteriseringsmetod för att rekonstruera 3D-bilder och realtidsrendering av bilder med flera vyer. 3D-utrymmet i bilden kallas Gaussiska värden, och maskinlärningsmetoder implementeras för att lära sig parametrarna för varje Gaussiskt värde. Gaussisk splattningsmetod kräver inte utbildning under rendering, vilket möjliggör snabbare renderingshastigheter. Följande bild sammanfattar arkitekturen för 3D-Gaussisk splattningsmetod.

3D-Gaussisk splattningsmetod använder först uppsättningen av ingångsbilder för att generera en punktmoln. Gaussisk splattningsmetod använder sedan ingångsbilderna för att uppskatta de externa parametrarna för kameran, som vinkel och position, genom att matcha pixlarna mellan bilderna, och dessa parametrar används sedan för att beräkna punktmolnet. Med hjälp av olika maskinlärningsmetoder optimerar Gaussisk splattningsmetod sedan fyra parametrar för varje Gaussiskt värde, nämligen: Position (var är den belägen), Kovarians (utsträckning av dess sträckning eller skalning i 3×3-matris), Färg (vilken är RGB-färgschemat) och Alfa (mätning av transparensen). Optimeringsprocessen renderar bilden för varje kameraposition och använder den för att bestämma parametrarna närmare den ursprungliga bilden. Som ett resultat är den resulterande 3D-Gaussiska splattningsutgången en bild, känd som Splatter Image, som liknar den ursprungliga bilden mest vid kamerapositionen från vilken den togs.

Dessutom ger opacitetsfunktionen och färgfunktionen i Gaussisk splattningsmetod en strålningsfält med vyriktningen för 3D-punkten. Ramverket renderar sedan strålningsfältet på en bild genom att integrera färgerna som observeras längs strålen som passerar genom pixeln. Gaussisk splattningsmetod representerar dessa funktioner som en kombination av färgade Gaussiska värden, där Gaussiska medelvärdet eller centrum, tillsammans med Gaussiska kovariansen, hjälper till att bestämma dess form och storlek. Varje Gaussiskt värde har också en opacitetsegenskap och en vy-beroende färgsegenskap som tillsammans definierar strålningsfältet.
Splatter Image
Renderingskomponenten kartar uppsättningen av 3D-Gaussiska värden till en bild. För att utföra Envy 3D-rekonstruktion söker ramverket efter en invers funktion för 3D-Gaussiska värden som rekonstruerar blandningen av 3D-Gaussiska värden från en bild. Den viktiga inklusionen här är att föreslå en effektiv men enkel design för den inversa funktionen. Specifikt, för en ingångsbild, förutsäger nätverket ett Gaussiskt värde för varje enskild pixel med hjälp av en bild-till-bild neuronnätverksarkitektur för att producera en utgångskanal-tensor som utgång, och för varje pixelkanal kodar parametrarna som sedan omvandlas till offset, opacitet, rotation, djup och färg. Ramverket använder sedan icke-linjära funktioner för att aktivera parametrarna och erhålla Gaussiska parametrarna.
Nu kan det spekuleras om hur Splatter Image-ramverket kan rekonstruera 3D-representationen av ett objekt, även om det bara har tillgång till en av dess vyer? I realtid lär sig Splatter Image-ramverket att använda några av de tillgängliga Gaussiska värdena för att rekonstruera vyn och använder de återstående Gaussiska värdena för att automatiskt rekonstruera osynliga delar av bilden. För att maximera sin effektivitet kan ramverket automatiskt stänga av några Gaussiska värden genom att förutsäga om opaciteten är noll. Om opaciteten är noll, stängs Gaussiska värdena av och ramverket renderar inte dessa punkter, och de stängs av i efterbearbetning.
Bildnivåförlust
En stor fördel med att utnyttja hastigheten och effektiviteten som erbjuds av Gaussisk splattningsmetod är att det möjliggör för ramverket att rendera alla bilder vid varje iteration, även för batchar med relativt stora batchstorlekar. Dessutom innebär det att ramverket inte bara kan använda dekomponerbara förluster, utan också bildnivåförluster som inte dekomponerar sig i förluster per pixel.
Skalnormalisering
Det är svårt att uppskatta storleken på ett objekt genom att titta på en enda vy, och det är en svår uppgift att lösa denna tvetydighet när det tränas med en förlust. Samma problem observeras inte i syntetiska datamängder, eftersom alla objekt renderas med identiska kameraintrik och objekten är på ett fast avstånd från kameran, vilket slutligen hjälper till att lösa tvetydigheten. Men i datamängder med riktiga bilder är tvetydigheten ganska tydlig, och Splatter Image-ramverket använder flera förbehandlingsmetoder för att approximativt fixa storleken på alla objekt.
Vy-beroende färg
För att representera vy-beroende färger använder Splatter Image-ramverket sfäriska harmoniker för att generalisera färgerna bortom Lambertiska färgmodellen. För varje specifikt Gaussiskt värde definierar modellen koefficienter som förutsägs av nätverket och sfäriska harmonikerna. Vyförändringen transformerar en vyriktning i källkameran till dess motsvarande vyriktning i referensramen. Modellen hittar sedan de motsvarande koefficienterna för att hitta den transformerade färgfunktionen. Modellen kan göra detta eftersom sfäriska harmoniker är slutna under rotation, tillsammans med varje annan ordning.
Neuronnätverksarkitektur
En majoritet av arkitekturen för prediktor som kartar ingångsbilden till Gaussiska blandningen är identisk med processen som används i SongUNet-ramverket. Den sista lagern i arkitekturen ersätts av ett 1×1 konvolutionslager med färgmodellen som bestämmer utgångskanalernas bredd. Givet ingångsbilden producerar nätverket en utgångskanal-tensor som utgång, och för varje pixelkanal kodar parametrarna som sedan omvandlas till offset, opacitet, rotation, djup och färg. Ramverket använder sedan icke-linjära funktioner för att aktivera parametrarna och erhålla Gaussiska parametrarna.
För att rekonstruera 3D-representationer med multi-view, använder Splatter Image-ramverket samma nätverk till varje ingångsvy och kombinerar sedan de enskilda rekonstruktionerna med vy-approachen. Dessutom, för att möjliggöra effektiv samordning och utbyte av information mellan vyerna i nätverket, gör Splatter Image-ramverket två modifieringar i nätverket. Först, villkorar ramverket modellen med dess respektive kameraposition och skickar vektorer genom att koda varje post med en sinusoid positionsembeddning, vilket resulterar i flera dimensioner. För det andra, lägger Splatter Image-ramverket till cross-attention-lager för att möjliggöra kommunikation mellan funktionerna för olika vyer.
Splatter Image : Experiment och Resultat
Splatter Image-ramverket mäter kvaliteten på sina rekonstruktioner genom att utvärdera Novel View Synthesis-kvaliteten, eftersom ramverket använder källvyn och renderar 3D-formen till målvyer för att utföra rekonstruktioner. Ramverket utvärderar sin prestanda genom att mäta SSIM eller Structural Similarity, Peak Signal to Noise Ratio eller PSNR och Perceptual Quality eller LPIPS-poäng.
Envy 3D-rekonstruktionsprestanda
Följande tabell visar prestandan för Splatter Image-modellen i Envy 3D-rekonstruktionsuppgiften på ShapeNet-benchmark.

Som det kan observeras, överträffar Splatter Image-ramverket alla deterministiska rekonstruktionsmetoder över LPIPS- och SSIM-poäng. Poängen indikerar att Splatter Image-modellen genererar bilder med skarpare rekonstruktioner. Dessutom överträffar Splatter Image-modellen alla deterministiska baslinjer i termer av PSNR-poäng, vilket indikerar att de genererade rekonstruktionerna också är mer exakta. Dessutom, utöver att överträffa alla deterministiska metoder, kräver Splatter Image-ramverket endast relativ kameraposition för att förbättra sin effektivitet i både utbildnings- och testfasen.
Följande bild visar den kvalitativa dugligheten hos Splatter Image-ramverket, och som det kan ses, genererar modellen rekonstruktioner med tunna och intressanta geometrier och fångar detaljerna i villkorsvyn.

Följande bild visar att rekonstruktionerna som genereras av Splatter Image-ramverket inte bara är skarpare utan också har bättre noggrannhet än tidigare modeller, särskilt i ovanliga förhållanden med tunna strukturer och begränsad synlighet.

Multi-view 3D-rekonstruktion
För att utvärdera sin multi-view 3D-rekonstruktionsförmåga tränas Splatter Image-ramverket på SpaneNet-SRN Cars-dataset för tvåvyförutsägelse. Existerande metoder använder absolut kamerapositionsvillkor för multi-view 3D-rekonstruktionsuppgifter, vilket innebär att modellen lär sig att förlita sig främst på objektets kanoniska orientering i objektet. Även om det fungerar, begränsar det tillämpbarheten av modellerna, eftersom den absoluta kamerapositionen ofta är okänd för en ny bild av ett objekt.

Slutliga tankar
I den här artikeln har vi talat om Splatter Image, en metod som syftar till att uppnå ultra-snabb Envy 3D-form och 3D-utseende konstruktion av objekt. I dess kärna använder Splatter Image-ramverket Gaussisk splattningsmetod för att analysera 3D-representationer, med fördel av den hastighet och kvalitet den erbjuder. Splatter Image-ramverket bearbetar bilder med hjälp av en färdig 2D-CNN-arkitektur för att förutsäga en pseudo-bild som innehåller ett färgat Gaussiskt värde per pixel. Genom att använda Gaussisk splattningsmetod kan Splatter Image-ramverket kombinera snabb rendering med snabb inferens, vilket resulterar i snabb utbildning och snabbare utvärdering på riktiga och syntetiska benchmark.












