AI-modeller og platforme
Osprey: Pixel-Niveau Forståelse med Visuel Instruktionsafstemning
Med den seneste forbedring af visuel instruktionsafstemningsmetoder har Multimodale Store Sprogmodeller (MLLMs) demonstreret bemærkelsesværdige generelle formålsvision-sprog-evner. Disse evner gør dem til nøglebyggesten for moderne generelle formålsvision-assistenter. Seneste modeller, herunder MiniGPT-4, LLaVA, InstructBLIP og andre, viser imponerende visuel resonans og instruktionsfølgeevner. Selvom de fleste af dem afhænger af billed-tekst-par til billedniveau-vision-sprog-afstemning, fungerer de godt i dette domæne. however, deres afhængighed af box-niveau og billedniveau-forståelse er den primære årsag til, at MLLMs ikke kan gentage deres præstation på fine-grained vision-sprog-afstemningsopgaver på pixelniveau. Derudover udgør den begrænsede tilgængelighed af masken-baseret instruktionsdata til træning en udfordring i yderligere forbedring af MLLMs.
Osprey er en masken-tekst instruktions-træningsmetode med det primære formål at udvide MLLMs. Den inkorporerer fine-grained maskerede regioner i sprog-instruktioner for at opnå pixel-niveau visuel-sprog-forståelse. For at opnå dette curaterer Osprey-rammen en masken-baseret region-tekstdatabase med over 700.000 eksempler. Den injicerer pixel-niveau-repræsentation i Store Sprogmodeller (LLMs) for at designe en vision-sprog-model. Bemærkelsesværdigt er, at Osprey-rammen antager en convolutional CLIP-model som sin vision-encoder og integrerer en masken-bevidst visuel extractor i sin arkitektur. Dette giver mulighed for præcis ekstraktion af visuelle masken-funktioner fra højopløsningsinput.
I denne artikel vil vi diskutere Osprey-rammen og dykke dybere ind i dens arkitektur. Vi vil også udforske den curaterede region-tekstdatabase med over 700.000 eksempler og sammenligne dens præstation i forskellige region-forståelsesopgaver. Så lad os komme i gang.
Osprey: Pixel-Niveau Forståelse med Visuel Instruktionsafstemning
Multimodale Store Sprogmodeller som MiniGPT-4, Otter, Qwen-LV, InstructBLIP og andre er frontløberne for udvikling af generelle formålsvision-assistenter, og de er kendt for deres exceptionelle multimodale og vision-generative evner. however, Multimodale Store Sprogmodeller lider under en stor udfordring, da de leverer utilfredsstillende resultater på fine-grained billedforståelsesopgaver som kapitel, region-klassificering og resonans. En stor årsag til den underlige præstation på fine-grained billedforståelsesopgaver er manglen på afstemning på region-niveau. Seneste MLLMs som GPT4RoI, Shikra og andre sigter mod at aktivere region-niveau-forståelse i vision-sprog-modeller ved at behandle bounding-box-specifikke regioner og udnytte visuel instruktionsafstemning med rumlige funktioner på objekt-niveau.
Selvom tilgangen til at aktivere region-niveau-forståelse kan forbedre præstationen, kan anvendelsen af sparse bounding-boxer som henvisningsinputregion direkte introducere irrelevante baggrundsfunktioner, der fører til ukorrekt region-tekst-par-afstemning for visuel instruktionsafstemning på store sprogmodeller. Under inferensprocessen kan box-niveau-henvisningsinput ikke være i stand til at detektere og repræsentere objektet præcist, hvilket kan resultere i semantisk afvigelse, som demonstreres i følgende billed.

I modsætning hertil kan anvendelsen af fine-grained masker i stedet for grove bounding-boxer som henvisningsinput muligvis repræsentere objekter med større præcision. Nyligt udviklet SAM eller Segment Anything Model trænes på milliarder af højkvalitetsmasker, viser bemærkelsesværdig segmenteringskvalitet på zero-shot-objekter og understøtter brugen af punkter eller simple bounding-boxer som prompts. however, SAM-rammen kan ikke generere primære semantiske mærker, og kan heller ikke give detaljerede semantiske beskrivelser og attributter. Som følge heraf mangler eksisterende modeller indre multimodale fine-grained information og har en begrænsede forståelse af scener i den virkelige verden.
For at tackle udfordringerne, som eksisterende MLLMs står over for, sigter Osprey, en ny masken-tekst instruktions-træningsmetode, mod at udvide evnerne af multimodale store sprogmodeller for fine-grained forståelse på pixel-niveau. Osprey-rammen introducerer en masken-bevidst visuel extractor, der fanger visuelle masken-funktioner med varierende granularitet præcist. Rammen interpolerer derefter de visuelle funktioner med sprog-instruktioner for at generere input-sekvensen for den store sprogmodel, og udnytter convolutional CLIP-arkitektur for at facilitere brugen af højopløsningsinput. Takket være sin design og arkitektur er Osprey-rammen i stand til at opnå fine-grained semantisk forståelse for objekt-niveau og del-niveau-regioner og giver detaljerede objekt-attributter sammen med primær objekt-kategori og forbedrede beskrivelser af komplekse scener.
Ved at udnytte evnerne af visuel instruktionsafstemning giver Osprey-rammen mulighed for nye evner ud over billedniveau og box-niveau-forståelse af scener, da Osprey-rammen kan generere fine-grained semantik ved hjælp af klasse-agnostiske masker fra off-the-shelf SAMs. Derudover viser Osprey bemærkelsesværdige evner på henvisningsobjekt-klassificering, åben-vokabular-genkendelse, regional-niveau-kapitel og detaljeret region-beskrivelsesopgaver.
Osprey: Metodologi og Arkitektur
Følgende figur viser en oversigt over Osprey-rammens arkitektur, bestående af en stor sprogmodel, pixel-niveau-masken-bevidst visuel extractor og en billedniveau-vision-encoder.

For et givent billede, udfører rammen konvertering og tokenisering for at generere indlejninger, før sprog-embeddings-sekvenser og interpolerede masken-funktioner sendes til den store sprogmodel for at opnå fine-grained semantisk forståelse.
Convolutional CLIP Vision Encoder
Vision-encoderen, der er anvendt i de fleste multimodale store sprogmodeller, er eksemplificeret ved hjælp af en ViT-baseret CLIP-model. Som følge heraf antager rammen en billedopløsning på enten 224×224 pixels eller 336 x 336 pixels. however, brugen af ViT-baseret CLIP-model gør det vanskeligt for modellen at opnå fine-grained billedforståelse af pixel-niveau-repræsentationer, et problem, der forstærkes yderligere i små regioner. Derudover hindrer den computermæssige overbelastning, der er forbundet med ViT-arkitekturen, muligheden for at øge input-billedopløsningen.
For at tackle udfordringen implementerer Osprey-rammen en convolutional CLIP-model som vision-encoderen i sin arkitektur. Traditionelt har convolutional neural network-baserede CLIP-modeller demonstreret bemærkelsesværdige generaliserings-evner på tværs af forskellige input-opløsninger i forhold til vision transformer-baserede CLIP-modeller. Implementeringen af en CNN-baseret CLIP-model giver plads til hurtig inferens og effektiv træning uden at gå på kompromis med modellens præstation. Derudover er en CNN-baseret CLIP-model i stand til at generere multi-skala-funktioner, som rammen derefter direkte anvender til funktionsekstraktion i hver efterfølgende objektregion.
Masken-Bevidst Visuel Extractor
I modsætning til eksisterende region-baserede modeller, der anvender sparse bounding-boxer som henvisningsinput, anvender Osprey-rammen detaljerede masken-regioner til at implementere objekt-baserede repræsentationer. Osprey-modellen anvender en masken-bevidst visuel extractor-komponent for at fange pixel-niveau-funktioner inden for hver objektregion.
For at implementere dette anvender Osprey først de multi-niveau-billedfunktioner, der er genereret af vision-encoderen, for at antage masken-poolings-operationen, og for hvert enkelt niveau-funktion, pooler rammen alle funktioner, der ligger inden for masken-regionen. Modellen encoderer derefter funktionerne på tværs af forskellige lag ved at sende hver funktion gennem en lineær projekteringslag, der genererer region-niveau-indlejninger, og fusionerer multi-niveau-funktioner ved at udføre summering. Modellen anvender derefter en MLP-lag for at producere det visuelle masken-token. Derudover bevarer Osprey den rumlige geometri af objektregionen ved at encoderer pixel-niveau-position-relationen ved at implementere en binær masken for hver objektregion. Til sidst inkluderer Osprey det visuelle masken-token og dens respektive rumlige tokens for hver masken-region-indlejning.
LLM Tokenisering
Som nævnt tidligere extractorer modellen billedniveau-embeddings af et billede ved at sende det ind i en pre-trænet CNN-baseret visuel encoder. For tekst-information anvender modellen først pre-trænede LLM-tokenisatorer for at tokenisere tekst-sekvenser og projekterer derefter disse tokeniserede tekst-sekvenser ind i tekst-embeddings. For masken-baserede regioner definerer modellen en special-token som en placeholder og erstatter derefter denne med en rumlig token sammen med en masken-token. Når modellen henviser til en objektregion i tekst-input, tilføjer den placeholderen efter region-navnet, hvilket giver mulighed for, at masken-regioner kan blande sig med tekst uden tokenisering-afstand. Derudover inkluderer modellen, ud over bruger-instruktioner, også en præfiks-prompt, en special-token, der fungerer som en placeholder, der derefter erstattes af vision-encoderens billedniveau-embeddings. Til sidst interpolerer rammen region-niveau- og billedniveau-visuelle tokens sammen med tekst-tokens og sender dem ind i den store sprogmodel for at forstå bruger-instruktioner og billedet med forskellige regioner i objektet.
Osprey: Tre-Trins Træningsproces
Osprey-rammen anvender en tre-trins træningsproces, hvor hver af træningsfaserne overvåges ved at minimere en next-token-prædiktionsfejl.
Trin 1: Billede-Tekst Afstemnings-Træning
I den første fase anvender Osprey-rammen den CNN-baserede CLIP-vision-encoder for at træne billedniveau-funktioner og en billedniveau-projektor for at træne modellen for billed-tekst-funktion-afstemning. I den første fase anvender rammen tre komponenter: en pre-trænet stor sprogmodel, en pre-trænet vision-encoder og en billedniveau-projektor. Rammen anvender også en MLP-lag for at fungere som vision-sprog-connector, der hjælper med at forbedre Ospreys multimodale generative evner.
Trin 2: Masken-Tekst Afstemnings-For-Træning
I den anden fase loader Osprey vægten, der er trænet i den første fase, og anvender sin masken-bevidst visuel extractor-komponent for at fange pixel-niveau-region-funktioner. I den anden fase træner rammen kun masken-bevidst visuel extractor for at afstemme sprog-embeddings med masken-baserede region-funktioner. Derudover samler modellen pixel-niveau-masken-par og korte tekster fra del-niveau og offentligt tilgængelige objekt-niveau-datasets og konverterer dem til instruktions-følge-data for at yderligere træne modellen.
Trin 3: End-To-End Fine-Træning
I den tredje og sidste fase fikserer modellen vægten af vision-encoderen og finjusterer den store sprogmodel, masken-baserede region-funktion-extractor og billedniveau-projektor-komponenter i sin arkitektur. Det primære formål med træningen i den tredje fase er at udvide modellens evne til at følge bruger-instruktioner præcist og effektivt udføre pixel-niveau-region-forståelsesopgaver.
Efter implementeringen af de tre træningsfaser er Osprey-rammen i stand til at forstå komplekse scener defineret af bruger-instruktioner og baseret på pixel-niveau-masken-regioner.
Osprey: Eksperimentelle Resultater
For at evaluere sin præstation udfører Osprey-udviklerne en bred vifte af eksperimenter for at demonstrere modellens evner i klassificering, pixel-niveau-region-baseret genkendelse og komplekse beskrivelser.

Åben-Vokabular-Segmentering
Det primære formål med åben-vokabular-segmentering er at generere masken-baserede region-genkendelse og dens respektive kategori eksplicit. For at opnå åben-vokabular-segmentering anvender Osprey først en input-tekst-prompt, hvorefter modellen antager ground-truth-masken-regioner for model-inferens for at evaluere modellens præstation i åben-vokabular-genkendelsesopgaver. På basis af den sætning-svar, der er genereret af den multimodale store sprogmodel, beregner Osprey den semantiske lignende mellem vokabular-listen og output af hver dataset. Følgende figur sammenligner Osprey med state-of-the-art multimodale store sprogmodeller.

Som det kan observeres, overgår Osprey-rammen eksisterende metoder med en betydelig margin på både Cityscapes- og ADE20K-150-datasets. Resultaterne indikerer Ospreys evne til at overgå eksisterende tilgange og opnå robust forståelse og genkendelse på fine-grained objekt-regioner.
Henvisnings-Objekt-Klassificering
I henvisnings-objekt-klassificeringsopgaven skal modellen klassificere objektet inden for en specifik region af et billede. For at evaluere sin klassificerings-evne anvender Osprey-rammen to semantiske relevans-metrrikker, herunder Semantisk IoU eller S-IoU og Semantisk Lignende eller SS. Semantisk IoU repræsenterer overlap af ord mellem ground-truth- og prædiktion-mærker, mens Semantisk Lignende måler lignende prædiktioner og/eller ground-truth-mærker i en semantisk rum.

Detaljeret-Region-Beskrivelse
I detaljeret-region-beskrivelsesopgaven evaluerer modellen sin præstation på instruktions-følge-detaljerings-evner sammen med andre region-baserede tilgange. Modellen vælger tilfældigt en input-inferens-prompt fra en liste af foruddefinerede prompts og anvender GPT-4 LLM-rammen for at måle kvaliteten af svaret, der er genereret af modellen, i forhold til input-henvisnings-regioner komprehensivt. Ved hjælp af instruktions-genererings-pipeline genererer modellen spørgsmål og søger GPT-4s svar, hvorefter LLM vurderer korrektheden af semantik og præcision af henvisnings-forståelse.

Region-Niveau-Kapitel
Osprey-rammen overgår også nuværende tilgange på region-niveau-kapitel-opgaver, med resultaterne indeholdt i følgende figur.

Endelige Tanker
I denne artikel har vi talt om Osprey, en masken-tekst instruktions-træningsmetode med det primære formål at udvide MLLMs ved at inkorporere fine-grained maskerede regioner i sprog-instruktioner for at opnå pixel-niveau visuel-sprog-forståelse. For at opnå dette formål curaterer Osprey-rammen en masken-baseret region-tekstdatabase med over 700.000 eksempler og injicerer pixel-niveau-repræsentation i LLM for at designe en vision-sprog-model. Osprey-rammen sigter mod at forbedre MLLMs for fine-grained visuel forståelse betydeligt, og ved at implementere en CNN-baseret CLIP-model og en masken-bevidst visuel extractor, opnår Osprey evnen til at forstå billeder på både del-niveau og objekt-niveau-regioner.












