AI-modeller och plattformar
Osprey: Pixelnivåförståelse med visuell instruktionsjustering
Med den senaste förbättringen av visuell instruktionsjusteringsmetoder har multimodala stora språkmodeller (MLLMs) visat imponerande allmänna vision-språkliga förmågor. Dessa förmågor gör dem till nyckelbyggstenar för moderna allmänna visuella assistenter. Nya modeller, inklusive MiniGPT-4, LLaVA, InstructBLIP och andra, visar imponerande visuell resonemang och instruktionsföljande förmågor. Även om de flesta av dem förlitar sig på bild-textpar för bildnivås vision-språklig justering, fungerar de bra i detta område. Men deras beroende av boxnivå och bildnivåförståelse är den primära anledningen till att MLLMs inte kan återge sin prestation på fina vision-språkliga justeringsuppgifter på pixelnivå. Dessutom utgör den begränsade tillgängligheten av maskbaserad instruktionsdata för utbildning utmaningar för att ytterligare förbättra MLLMs.
Osprey är en mask-text instruktionsutbildningsmetod med det primära målet att utöka MLLMs. Den införlivar fina maskerade områden i språkinstruktioner för att uppnå pixelnivås visuell-språklig förståelse. För att uppnå detta kuraterar Osprey-ramverket en maskbaserad region-textdataset med över 700 000 prover. Den injicerar pixelnivårepresentation i stora språkmodeller (LLMs) för att utforma en vision-språklig modell. Noterbart är att Osprey-ramverket antar en convolutional CLIP-modell som sin visionencoder och integrerar en maskmedveten visuell extraherare i sin arkitektur. Detta möjliggör exakt extrahering av visuella maskfunktioner från högupplösta indata.
I den här artikeln kommer vi att diskutera Osprey-ramverket och gå djupare in i dess arkitektur. Vi kommer också att undersöka den kuraterade region-textdataseten med över 700 000 prover och jämföra dess prestanda i olika regionförståelseuppgifter. Så, låt oss komma igång.
Osprey: Pixelförståelse med visuell instruktionsjustering
Multimodala stora språkmodeller som MiniGPT-4, Otter, Qwen-LV, InstructBLIP och andra är föregångarna för att utveckla allmänna visuella assistenter, och de är kända för sina exceptionella multimodala och visiongenererande förmågor. Men multimodala stora språkmodeller lider av en stor utmaning eftersom de ger otillfredsställande resultat på fina bildförståelseuppgifter som kapitel, regionklassificering och resonemang. En stor anledning till den undermåliga prestandan på fina bildförståelseuppgifter är bristen på justering på regionnivå. Nya MLLMs som GPT4RoI, Shikra och andra syftar till att möjliggöra regionnivåförståelse i vision-språkliga modeller genom att bearbeta begränsningsboxspecifika regioner och utnyttja visuell instruktionsjustering med spatiala funktioner på objektnivå.
Även om tillvägagångssättet för att möjliggöra regionnivåförståelse kan förbättra prestandan, kan användningen av glesa begränsningsboxar som direkt hänvisande indataregion introducera irrelevanta bakgrundsfuncioner, vilket leder till inkorrekt region-textparjustering för visuell instruktionsjustering på stora språkmodeller. Under inferensprocessen kan den boxnivåhänvisande ingången inte upptäcka och representera objektnivån exakt, vilket kan resultera i semantisk avvikelse, som visas i följande bild.

I jämförelse kan användningen av fina masker istället för grova begränsningsboxar som hänvisande indata representera objekten med större precision. Nyligen utvecklade SAM eller Segment Anything Model tränas på miljarder högkvalitativa masker, visar imponerande segmenteringskvalitet på nollskottobjekt och stöder användningen av punkter eller enkla begränsningsboxar som promptrar. Men SAM-ramverket kan inte generera primära semantiska etiketter, och kan inte heller tillhandahålla detaljerade semantiska beskrivningar och attribut. Som ett resultat saknar befintliga modeller inneboende multimodala fina funktioner, och har en begränsad förståelse av scener i den verkliga världen.
För att tackla utmaningarna som befintliga MLLMs står inför, syftar Osprey, en ny mask-text instruktionsutbildningsmetod, till att utöka multimodala stora språkmodellers förmågor för fina förståelse på pixelnivå. Osprey-ramverket introducerar en maskmedveten visuell extraherare som fångar visuella maskfunktioner med varierande granularitet exakt. Ramverket väver sedan samman de visuella funktionerna med språkinstruktioner för att generera inmatningssekvensen för den stora språkmodellen, och utnyttjar en convolutional CLIP-arkitektur för att underlätta användningen av högupplösta indata. Tack vare sin design och arkitektur kan Osprey-ramverket uppnå fina semantiska förståelse för objektnivå- och delnivåregioner, och tillhandahåller detaljerade objektfunktioner tillsammans med primära objektkategorier och förbättrade beskrivningar av komplexa scener.
Genom att utnyttja förmågorna hos visuell instruktionsjustering möjliggör Osprey-ramverket nya förmågor utöver bildnivå- och boxnivåförståelse av scener, eftersom Osprey-ramverket kan generera fina semantiska funktioner med hjälp av klassagnostiska masker från SAM. Dessutom visar Osprey imponerande förmågor över hela refererande objektklassificering, öppenvokabulär erkännande, regional nivåbeskrivning och detaljerad regionsbeskrivning.
Osprey: Metodik och arkitektur
Följande figur visar en översikt över Osprey-ramverkets arkitektur, som består av en stor språkmodell, pixelnivåmaskmedveten visuell extraherare och en bildnivåvisionencoder.

För en given bild, ingångsspråk och hänvisande maskregioner, utför ramverket omvandling och tokenisering för att generera inbäddningar innan de skickar språkinbäddningssekvenser och vävda samman maskfunktioner till den stora språkmodellen för att få fina semantiska förståelser.
Convolutional CLIP Vision Encoder
Visionencodern som används i de flesta multimodala stora språkmodeller är ett exempel på en ViT-baserad CLIP-modell. Som ett resultat antar ramverket en bildupplösning på antingen 224×224 pixlar eller 336 x 336 pixlar. Men användningen av ViT-baserad CLIP-modell gör det svårt för modellen att uppnå fina bildförståelser på pixelnivå, ett problem som förstärks ytterligare i små regioner. Dessutom hindrar den beräkningsmässiga överbelastningen som är förknippad med ViT-arkitekturen möjligheten att öka bildupplösningen.
För att tackla utmaningen implementerar Osprey-ramverket en convolutional CLIP-modell som visionencodern i sin arkitektur. Traditionellt har convolutionella neurala nätverksbaserade CLIP-modeller visat imponerande generaliseringsförmågor över olika ingångsupplösningar jämfört med visionstransformatorbaserade CLIP-modeller. Implementeringen av en CNN-baserad CLIP-modell skapar utrymme för snabb inferens och effektiv utbildning utan att kompromissa med modellens prestanda. Dessutom kan en CNN-baserad CLIP-modell generera flerskalefunktioner som ramverket sedan direkt använder för funktionsextrahering i varje efterföljande objektsregion.
Maskmedveten visuell extraherare
I motsats till befintliga regionbaserade modeller som använder glesa begränsningsboxar som hänvisande indata, använder Osprey-ramverket detaljerade maskregioner för att implementera objektbaserade representationer. Osprey-modellen använder en maskmedveten visuell extraherarkomponent för att fånga pixelnivåfunktioner inom varje objektsregion.
För att implementera detta använder Osprey först de multilevelbildfunktioner som genereras av visionencodern för att anta maskpoolningsoperationen, och för varje enskild nivåfunktion, poolar ramverket alla funktioner som ligger inom maskregionen. Modellen kodar sedan funktionerna över olika lager genom att skicka varje funktion genom en linjär projiceringsskikt som genererar regionspecifika inbäddningar, och sammanfogar multilevelfunktioner genom att utföra summering. Modellen använder sedan en MLP-lager för att producera den visuella masktoken. Dessutom bevarar Osprey den rumsliga geometrin hos objektsregionen genom att koda den pixelnivåpositionella relationen genom att implementera en binär mask för varje objektsregion. Till sist inkluderar Osprey den visuella masktoken och dess respektive rumsliga token för varje maskregionsinbäddning.
LLM-tokenisering
Som nämnts tidigare extraherar modellen bildnivåinbäddningar av en bild genom att mata in den i en förtränad CNN-baserad visuell encoder. För textinformation, tokeniserar modellen först textsekvenser med hjälp av förtränade LLM-tokenisatorer, och projicerar sedan dessa tokeniserade textsekvenser till textinbäddningar.
Osprey: Tre-stegs utbildningsprocess
Osprey-ramverket använder en tre-stegs utbildningsprocess, där varje utbildningsfas övervakas av en next-token prediktionsförlust.
Steg 1: Bild-text justeringsutbildning
I den första fasen, använder Osprey-ramverket CNN-baserad CLIP-visionencoder för att träna bildnivåfunktioner och språkanslutning för att träna modellen för bild-textfunktionjustering.
Steg 2: Mask-text justeringsförutbildning
I den andra fasen, laddar Osprey viktorna som tränades i den första fasen, och använder sin maskmedvetna visuella extraherarkomponent för att fånga pixelnivåregionsfunktioner.
Steg 3: Slutgiltig finjustering
I den tredje och sista fasen, fixar modellen viktorna för visionencodern och finjusterar den stora språkmodellen, maskbaserade regionsfunktionsextraherarkomponenten och bildnivåprojektorerna i sin arkitektur.
Efter att ha implementerat de tre utbildningsstegen kan Osprey-ramverket förstå komplexa scenarier som definieras av användarinstruktioner och baseras på pixelnivåmaskregioner.
Osprey: Experimentella resultat
För att utvärdera sin prestanda, genomför Osprey-utvecklare en mängd olika experiment för att demonstrera modellens förmågor i klassificering, pixelnivåregionsbaserad erkännande och komplexa beskrivningar.

Öppenvokabulär segmentering
Det primära målet med öppenvokabulär segmentering är att generera maskbaserad regionsigenkänning och dess respektive kategori explicit. För att uppnå öppenvokabulär segmentering, använder Osprey först en inmatningstextprompt, följt av att modellen antar grundtruthmaskregioner för modellinterferens för att utvärdera modellens prestanda i öppenvokabulär erkänningsuppgifter.

Som det kan observeras, överträffar Osprey-ramverket befintliga metoder med en betydande marginal på både Cityscapes och ADE20K-150-dataseten. Resultaten indikerar Ospreys förmåga att överträffa befintliga tillvägagångssätt och uppnå robust förståelse och erkännande på fina objektnivåregioner.
Refererande objektklassificering
I refererande objektklassificeringsuppgiften, krävs att modellen klassificerar objekten inom en specifik region av en bild. För att utvärdera sin klassificeringsförmåga, använder Osprey-ramverket två semantiska relevansmått, inklusive semantisk IoU och semantisk likhet.

Detaljerad regionsbeskrivning
I detaljerad regionsbeskrivningsuppgiften, utvärderar modellen sin prestanda på instruktionsföljande detaljerade beskrivningsförmåga tillsammans med andra regionsbaserade tillvägagångssätt.

Regionsnivåbeskrivning
Osprey-ramverket överträffar också befintliga tillvägagångssätt på regionsnivåbeskrivningsuppgifter, med resultaten som visas i följande bild.

Slutliga tankar
I den här artikeln har vi talat om Osprey, en mask-text instruktionsutbildningsmetod med det primära målet att utöka MLLMs genom att införliva fina maskerade områden i språkinstruktioner för att uppnå pixelnivås visuell-språklig förståelse. För att uppnå sitt mål, kuraterar Osprey-ramverket en maskbaserad region-textdataset med över 700 000 prover, och injicerar pixelnivårepresentation i LLM för att utforma en vision-språklig modell. Osprey-ramverket syftar till att förbättra MLLMs för fina visuella förståelser avsevärt, och genom att implementera en CNN-baserad CLIP-modell och en maskmedveten visuell extraherare, uppnår Osprey förmågan att förstå bilder på både delnivå och objektnivåregioner.












