AI-modeller og platforme

Osprey: Pixel-Niveau Forståelse med Visuel Instruktionsafstemning

mm
Føj Unite.AI til dine foretrukne kilder på Google

Med den seneste forbedring af visuel instruktionsafstemningsmetoder har Multimodale Store Sprogmodeller (MLLMs) demonstreret bemærkelsesværdige generelle formålsvision-sprog-evner. Disse evner gør dem til nøglebyggesten for moderne generelle formålsvision-assistenter. Seneste modeller, herunder MiniGPT-4, LLaVA, InstructBLIP og andre, viser imponerende visuel resonans og instruktionsfølgeevner. Selvom de fleste af dem afhænger af billed-tekst-par til billedniveau-vision-sprog-afstemning, fungerer de godt i dette domæne. however, deres afhængighed af box-niveau og billedniveau-forståelse er den primære årsag til, at MLLMs ikke kan gentage deres præstation på fine-grained vision-sprog-afstemningsopgaver på pixelniveau. Derudover udgør den begrænsede tilgængelighed af masken-baseret instruktionsdata til træning en udfordring i yderligere forbedring af MLLMs.

Osprey er en masken-tekst instruktions-træningsmetode med det primære formål at udvide MLLMs. Den inkorporerer fine-grained maskerede regioner i sprog-instruktioner for at opnå pixel-niveau visuel-sprog-forståelse. For at opnå dette curaterer Osprey-rammen en masken-baseret region-tekstdatabase med over 700.000 eksempler. Den injicerer pixel-niveau-repræsentation i Store Sprogmodeller (LLMs) for at designe en vision-sprog-model. Bemærkelsesværdigt er, at Osprey-rammen antager en convolutional CLIP-model som sin vision-encoder og integrerer en masken-bevidst visuel extractor i sin arkitektur. Dette giver mulighed for præcis ekstraktion af visuelle masken-funktioner fra højopløsningsinput.

I denne artikel vil vi diskutere Osprey-rammen og dykke dybere ind i dens arkitektur. Vi vil også udforske den curaterede region-tekstdatabase med over 700.000 eksempler og sammenligne dens præstation i forskellige region-forståelsesopgaver. Så lad os komme i gang.

Osprey: Pixel-Niveau Forståelse med Visuel Instruktionsafstemning

Multimodale Store Sprogmodeller som MiniGPT-4, Otter, Qwen-LV, InstructBLIP og andre er frontløberne for udvikling af generelle formålsvision-assistenter, og de er kendt for deres exceptionelle multimodale og vision-generative evner. however, Multimodale Store Sprogmodeller lider under en stor udfordring, da de leverer utilfredsstillende resultater på fine-grained billedforståelsesopgaver som kapitel, region-klassificering og resonans. En stor årsag til den underlige præstation på fine-grained billedforståelsesopgaver er manglen på afstemning på region-niveau. Seneste MLLMs som GPT4RoI, Shikra og andre sigter mod at aktivere region-niveau-forståelse i vision-sprog-modeller ved at behandle bounding-box-specifikke regioner og udnytte visuel instruktionsafstemning med rumlige funktioner på objekt-niveau.

Selvom tilgangen til at aktivere region-niveau-forståelse kan forbedre præstationen, kan anvendelsen af sparse bounding-boxer som henvisningsinputregion direkte introducere irrelevante baggrundsfunktioner, der fører til ukorrekt region-tekst-par-afstemning for visuel instruktionsafstemning på store sprogmodeller. Under inferensprocessen kan box-niveau-henvisningsinput ikke være i stand til at detektere og repræsentere objektet præcist, hvilket kan resultere i semantisk afvigelse, som demonstreres i følgende billed.

I modsætning hertil kan anvendelsen af fine-grained masker i stedet for grove bounding-boxer som henvisningsinput muligvis repræsentere objekter med større præcision. Nyligt udviklet SAM eller Segment Anything Model trænes på milliarder af højkvalitetsmasker, viser bemærkelsesværdig segmenteringskvalitet på zero-shot-objekter og understøtter brugen af punkter eller simple bounding-boxer som prompts. however, SAM-rammen kan ikke generere primære semantiske mærker, og kan heller ikke give detaljerede semantiske beskrivelser og attributter. Som følge heraf mangler eksisterende modeller indre multimodale fine-grained information og har en begrænsede forståelse af scener i den virkelige verden.

For at tackle udfordringerne, som eksisterende MLLMs står over for, sigter Osprey, en ny masken-tekst instruktions-træningsmetode, mod at udvide evnerne af multimodale store sprogmodeller for fine-grained forståelse på pixel-niveau. Osprey-rammen introducerer en masken-bevidst visuel extractor, der fanger visuelle masken-funktioner med varierende granularitet præcist. Rammen interpolerer derefter de visuelle funktioner med sprog-instruktioner for at generere input-sekvensen for den store sprogmodel, og udnytter convolutional CLIP-arkitektur for at facilitere brugen af højopløsningsinput. Takket være sin design og arkitektur er Osprey-rammen i stand til at opnå fine-grained semantisk forståelse for objekt-niveau og del-niveau-regioner og giver detaljerede objekt-attributter sammen med primær objekt-kategori og forbedrede beskrivelser af komplekse scener.

Ved at udnytte evnerne af visuel instruktionsafstemning giver Osprey-rammen mulighed for nye evner ud over billedniveau og box-niveau-forståelse af scener, da Osprey-rammen kan generere fine-grained semantik ved hjælp af klasse-agnostiske masker fra off-the-shelf SAMs. Derudover viser Osprey bemærkelsesværdige evner på henvisningsobjekt-klassificering, åben-vokabular-genkendelse, regional-niveau-kapitel og detaljeret region-beskrivelsesopgaver.

Osprey: Metodologi og Arkitektur

Følgende figur viser en oversigt over Osprey-rammens arkitektur, bestående af en stor sprogmodel, pixel-niveau-masken-bevidst visuel extractor og en billedniveau-vision-encoder.

For et givent billede, udfører rammen konvertering og tokenisering for at generere indlejninger, før sprog-embeddings-sekvenser og interpolerede masken-funktioner sendes til den store sprogmodel for at opnå fine-grained semantisk forståelse.

Convolutional CLIP Vision Encoder

Vision-encoderen, der er anvendt i de fleste multimodale store sprogmodeller, er eksemplificeret ved hjælp af en ViT-baseret CLIP-model. Som følge heraf antager rammen en billedopløsning på enten 224×224 pixels eller 336 x 336 pixels. however, brugen af ViT-baseret CLIP-model gør det vanskeligt for modellen at opnå fine-grained billedforståelse af pixel-niveau-repræsentationer, et problem, der forstærkes yderligere i små regioner. Derudover hindrer den computermæssige overbelastning, der er forbundet med ViT-arkitekturen, muligheden for at øge input-billedopløsningen.

For at tackle udfordringen implementerer Osprey-rammen en convolutional CLIP-model som vision-encoderen i sin arkitektur. Traditionelt har convolutional neural network-baserede CLIP-modeller demonstreret bemærkelsesværdige generaliserings-evner på tværs af forskellige input-opløsninger i forhold til vision transformer-baserede CLIP-modeller. Implementeringen af en CNN-baseret CLIP-model giver plads til hurtig inferens og effektiv træning uden at gå på kompromis med modellens præstation. Derudover er en CNN-baseret CLIP-model i stand til at generere multi-skala-funktioner, som rammen derefter direkte anvender til funktionsekstraktion i hver efterfølgende objektregion.

Masken-Bevidst Visuel Extractor

I modsætning til eksisterende region-baserede modeller, der anvender sparse bounding-boxer som henvisningsinput, anvender Osprey-rammen detaljerede masken-regioner til at implementere objekt-baserede repræsentationer. Osprey-modellen anvender en masken-bevidst visuel extractor-komponent for at fange pixel-niveau-funktioner inden for hver objektregion.

For at implementere dette anvender Osprey først de multi-niveau-billedfunktioner, der er genereret af vision-encoderen, for at antage masken-poolings-operationen, og for hvert enkelt niveau-funktion, pooler rammen alle funktioner, der ligger inden for masken-regionen. Modellen encoderer derefter funktionerne på tværs af forskellige lag ved at sende hver funktion gennem en lineær projekteringslag, der genererer region-niveau-indlejninger, og fusionerer multi-niveau-funktioner ved at udføre summering. Modellen anvender derefter en MLP-lag for at producere det visuelle masken-token. Derudover bevarer Osprey den rumlige geometri af objektregionen ved at encoderer pixel-niveau-position-relationen ved at implementere en binær masken for hver objektregion. Til sidst inkluderer Osprey det visuelle masken-token og dens respektive rumlige tokens for hver masken-region-indlejning.

LLM Tokenisering

Som nævnt tidligere extractorer modellen billedniveau-embeddings af et billede ved at sende det ind i en pre-trænet CNN-baseret visuel encoder. For tekst-information anvender modellen først pre-trænede LLM-tokenisatorer for at tokenisere tekst-sekvenser og projekterer derefter disse tokeniserede tekst-sekvenser ind i tekst-embeddings. For masken-baserede regioner definerer modellen en special-token som en placeholder og erstatter derefter denne med en rumlig token sammen med en masken-token. Når modellen henviser til en objektregion i tekst-input, tilføjer den placeholderen efter region-navnet, hvilket giver mulighed for, at masken-regioner kan blande sig med tekst uden tokenisering-afstand. Derudover inkluderer modellen, ud over bruger-instruktioner, også en præfiks-prompt, en special-token, der fungerer som en placeholder, der derefter erstattes af vision-encoderens billedniveau-embeddings. Til sidst interpolerer rammen region-niveau- og billedniveau-visuelle tokens sammen med tekst-tokens og sender dem ind i den store sprogmodel for at forstå bruger-instruktioner og billedet med forskellige regioner i objektet.

Osprey: Tre-Trins Træningsproces

Osprey-rammen anvender en tre-trins træningsproces, hvor hver af træningsfaserne overvåges ved at minimere en next-token-prædiktionsfejl.

Trin 1: Billede-Tekst Afstemnings-Træning

I den første fase anvender Osprey-rammen den CNN-baserede CLIP-vision-encoder for at træne billedniveau-funktioner og en billedniveau-projektor for at træne modellen for billed-tekst-funktion-afstemning. I den første fase anvender rammen tre komponenter: en pre-trænet stor sprogmodel, en pre-trænet vision-encoder og en billedniveau-projektor. Rammen anvender også en MLP-lag for at fungere som vision-sprog-connector, der hjælper med at forbedre Ospreys multimodale generative evner.

Trin 2: Masken-Tekst Afstemnings-For-Træning

I den anden fase loader Osprey vægten, der er trænet i den første fase, og anvender sin masken-bevidst visuel extractor-komponent for at fange pixel-niveau-region-funktioner. I den anden fase træner rammen kun masken-bevidst visuel extractor for at afstemme sprog-embeddings med masken-baserede region-funktioner. Derudover samler modellen pixel-niveau-masken-par og korte tekster fra del-niveau og offentligt tilgængelige objekt-niveau-datasets og konverterer dem til instruktions-følge-data for at yderligere træne modellen.

Trin 3: End-To-End Fine-Træning

I den tredje og sidste fase fikserer modellen vægten af vision-encoderen og finjusterer den store sprogmodel, masken-baserede region-funktion-extractor og billedniveau-projektor-komponenter i sin arkitektur. Det primære formål med træningen i den tredje fase er at udvide modellens evne til at følge bruger-instruktioner præcist og effektivt udføre pixel-niveau-region-forståelsesopgaver.

Efter implementeringen af de tre træningsfaser er Osprey-rammen i stand til at forstå komplekse scener defineret af bruger-instruktioner og baseret på pixel-niveau-masken-regioner.

Osprey: Eksperimentelle Resultater

For at evaluere sin præstation udfører Osprey-udviklerne en bred vifte af eksperimenter for at demonstrere modellens evner i klassificering, pixel-niveau-region-baseret genkendelse og komplekse beskrivelser.

Åben-Vokabular-Segmentering

Det primære formål med åben-vokabular-segmentering er at generere masken-baserede region-genkendelse og dens respektive kategori eksplicit. For at opnå åben-vokabular-segmentering anvender Osprey først en input-tekst-prompt, hvorefter modellen antager ground-truth-masken-regioner for model-inferens for at evaluere modellens præstation i åben-vokabular-genkendelsesopgaver. På basis af den sætning-svar, der er genereret af den multimodale store sprogmodel, beregner Osprey den semantiske lignende mellem vokabular-listen og output af hver dataset. Følgende figur sammenligner Osprey med state-of-the-art multimodale store sprogmodeller.

Som det kan observeres, overgår Osprey-rammen eksisterende metoder med en betydelig margin på både Cityscapes- og ADE20K-150-datasets. Resultaterne indikerer Ospreys evne til at overgå eksisterende tilgange og opnå robust forståelse og genkendelse på fine-grained objekt-regioner.

Henvisnings-Objekt-Klassificering

I henvisnings-objekt-klassificeringsopgaven skal modellen klassificere objektet inden for en specifik region af et billede. For at evaluere sin klassificerings-evne anvender Osprey-rammen to semantiske relevans-metrrikker, herunder Semantisk IoU eller S-IoU og Semantisk Lignende eller SS. Semantisk IoU repræsenterer overlap af ord mellem ground-truth- og prædiktion-mærker, mens Semantisk Lignende måler lignende prædiktioner og/eller ground-truth-mærker i en semantisk rum.

Detaljeret-Region-Beskrivelse

I detaljeret-region-beskrivelsesopgaven evaluerer modellen sin præstation på instruktions-følge-detaljerings-evner sammen med andre region-baserede tilgange. Modellen vælger tilfældigt en input-inferens-prompt fra en liste af foruddefinerede prompts og anvender GPT-4 LLM-rammen for at måle kvaliteten af svaret, der er genereret af modellen, i forhold til input-henvisnings-regioner komprehensivt. Ved hjælp af instruktions-genererings-pipeline genererer modellen spørgsmål og søger GPT-4s svar, hvorefter LLM vurderer korrektheden af semantik og præcision af henvisnings-forståelse.

Region-Niveau-Kapitel

Osprey-rammen overgår også nuværende tilgange på region-niveau-kapitel-opgaver, med resultaterne indeholdt i følgende figur.

Endelige Tanker

I denne artikel har vi talt om Osprey, en masken-tekst instruktions-træningsmetode med det primære formål at udvide MLLMs ved at inkorporere fine-grained maskerede regioner i sprog-instruktioner for at opnå pixel-niveau visuel-sprog-forståelse. For at opnå dette formål curaterer Osprey-rammen en masken-baseret region-tekstdatabase med over 700.000 eksempler og injicerer pixel-niveau-repræsentation i LLM for at designe en vision-sprog-model. Osprey-rammen sigter mod at forbedre MLLMs for fine-grained visuel forståelse betydeligt, og ved at implementere en CNN-baseret CLIP-model og en masken-bevidst visuel extractor, opnår Osprey evnen til at forstå billeder på både del-niveau og objekt-niveau-regioner.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.