AI-modeller og plattformer

Visuell instruksjonstuning for pikselnivå-forståelse med Osprey

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Med den nylige forbedringen av visuell instruksjonstuning-metoder, har multimodale store språkmodeller (MLLMs) vist bemerkelsesverdige generelle visuell-språklige evner. Disse evnene gjør dem til nøkkelbyggestener for moderne generelle visuelle assistenter. Nylige modeller, inkludert MiniGPT-4, LLaVA, InstructBLIP og andre, viser imponerende visuell resonnering og instruksjonsfølgingsevner. Selv om de fleste av dem avhenger av bilde-tekst-par for bilde-nivå visuell-språklige justering, fungerer de godt i dette domenet. Men deres avhengighet av boks-nivå og bilde-nivå forståelse er den primære årsaken til at MLLMs ikke kan gjenta deres ytelse på fine-grenede visuell-språklige justeringsoppgaver på pikselnivå. I tillegg er den begrensede tilgjengeligheten av mask-basert instruksjonsdata for trening en utfordring i å videre forbedre MLLMs.

Osprey er en mask-tekst instruksjonsmetode med det primære målet å utvide MLLMs. Den inkorporerer fine-grenede maskerte regioner i språkinstruksjoner for å oppnå pikselnivå visuell-språklige forståelse. For å oppnå dette, kuraterer Osprey-rammen en mask-basert region-tekstdatasett med over 700 000 eksempler. Den injiserer pikselnivå-representasjon i store språkmodeller (LLMs) for å designe en visuell-språklig modell. Merket er at Osprey-rammen adopterer en konvolusjonell CLIP-modell som sin visjon-encoder og integrerer en mask-avhengig visuell extractor i sin arkitektur. Dette gjør det mulig for Osprey å forstå bilder på både del-nivå og objekt-nivå regioner.

I denne artikkelen skal vi diskutere Osprey-rammen og dykke dyptere inn i dens arkitektur. Vi skal også utforske den kuraterte region-tekstdatasetten med over 700 000 eksempler og sammenligne dens ytelse i ulike region-forståelsesoppgaver. Så, la oss begynne.

Osprey: Pikselnivå-forståelse med visuell instruksjonstuning

Multimodale store språkmodeller som MiniGPT-4, Otter, Qwen-LV, InstructBLIP og andre er frontløperne for å utvikle generelle visuelle assistenter, og de er kjent for sine bemerkelsesverdige multimodale og visuelle genererings-evner. Men multimodale store språkmodeller lider under en stor utfordring, da de leverer utilfredsstillende resultater på fine-grenede bilde-forståelsesoppgaver som kapittel, region-klassifisering og resonnering. En stor årsak til den under-par ytelsen på fine-grenede bilde-forståelsesoppgaver er mangelen på justering på region-nivå. Nylige MLLMs som GPT4RoI, Shikra og andre har som mål å aktivere region-nivå forståelse i visuell-språklige modeller ved å prosessere boks-nivå angitte regioner, og utnytte visuell instruksjonstuning med romlige egenskaper på objekt-nivå.

Selv om tilnærmingen til å aktivere region-nivå forståelse kan forbedre ytelsen, kan bruk av sparse boks-nivå som refererende inndata-region direkte introdusere irrelevante bakgrunns-egenskaper som kan føre til uakkurat region-tekst-par-justering for visuell instruksjonstuning på store språkmodeller. Under inferens-prosessen kan boks-nivå refererende inndata ikke være i stand til å detektere og representere objektet nøyaktig; dette kan resultere i semantisk avvik som vist i følgende bilde.

I sammenligning kan bruk av fine-grenede masker i stedet for grove boks-nivå som refererende inndata muligens representere objekter med mer nøyaktighet. Nylig utviklet SAM eller Segment Anything Model trenes på milliarder av høykvalitetsmasker, viser bemerkelsesverdige segmenteringskvaliteter på null-skotsobjekter og støtter bruk av punkter eller enkle boks-nivå som prompts. Men SAM-rammen kan ikke generere primære semantiske etiketter, og kan heller ikke gi detaljerte semantiske beskrivelser og attributter. Som resultat mangler eksisterende modeller innebygd multimodal fine-grenede informasjon, og har en begrenset forståelse av scener i den virkelige verden.

For å møte utfordringene som eksisterende MLLMs står overfor, er Osprey, en ny mask-tekst instruksjonsmetode, utformet for å utvide multimodale store språkmodellers evner for fine-grenede forståelse på pikselnivå. Osprey-rammen introduserer en mask-avhengig visuell extractor som fanger visuelle mask-egenskaper med varierende granularitet nøyaktig. Rammen interleaver deretter visuelle egenskaper med språkinstruksjoner for å generere inndata-sekvensen for store språkmodellen, og utnytter konvolusjonell CLIP-arkitektur for å muliggjøre bruk av høyoppløselig inndata. Takket være sin design og arkitektur, er Osprey-rammen i stand til å oppnå fine-grenede semantiske forståelse for objekt-nivå og del-nivå regioner, og gir detaljerte objekt-attributter sammen med primær objekt-kategori og forbedrede beskrivelser av komplekse scener.

Ved å utnytte evnene til visuell instruksjonstuning, muliggjør Osprey-rammen nye evner utover bilde-nivå og boks-nivå forståelse av scener, da Osprey-rammen kan generere fine-grenede semantiske beskrivelser ved hjelp av klasse-agnostiske masker fra SAM. I tillegg viser Osprey bemerkelsesverdige evner på refererende objekt-klassifisering, åpen-vokabular-gjenkjenning, region-nivå-beskrivelse og detaljert region-beskrivelse-oppgaver.

Osprey: Metodologi og arkitektur

Følgende figur viser en oversikt over Osprey-rammens arkitektur, bestående av en stor språkmodell, piksel-nivå mask-avhengig visuell extractor og en bilde-nivå visjon-encoder.

For et gitt bilde, utfører rammen konvertering og tokenisering for å generere innbedninger før den sender språk-innbedningssekvensene og interleavede mask-egenskaper til store språkmodellen for å oppnå fine-grenede semantiske forståelser.

Konvolusjonell CLIP-visjon-encoder

Visjon-encoderen som er utformet i de fleste multimodale store språkmodeller er et eksempel på en ViT-basert CLIP-modell. Som resultat, adopterer rammen en bilde-oppløsning på enten 224×224 piksler eller 336 x 336 piksler. Men bruk av ViT-basert CLIP-modell gjør det vanskelig for modellen å oppnå fine-grenede bilde-forståelse av piksel-nivå-representasjoner, et problem som forverres ytterligere i små regioner. I tillegg hindrer den komputasjonelle overbelastningen assosiert med ViT-arkitekturen muligheten for å øke inndata-bilde-oppløsningen.

For å møte utfordringen, implementerer Osprey-rammen en konvolusjonell CLIP-modell som visjon-encoderen i sin arkitektur. Tradisjonelt har konvolusjonelle neurale nettverk-baserte CLIP-modeller vist bemerkelsesverdige generaliserings-evner over ulike inndata-oppløsninger når de sammenlignes med visjon-transformator-baserte CLIP-modeller. Implementering av en CNN-basert CLIP-modell åpner for rask inferens og effektiv trening uten å kompromittere modellens ytelse. I tillegg er en CNN-basert CLIP-modell i stand til å generere multi-skala-egenskapskarter som rammen deretter direkte kan bruke til egenskaps-ekstraksjon i hver påfølgende objekt-region.

Mask-avhengig visuell extractor

I motsetning til eksisterende region-baserte modeller som bruker sparse boks-nivå som refererende inndata, bruker Osprey-rammen detaljerte mask-regioner for å implementere objekt-baserte representasjoner. Osprey-modellen anvender en mask-avhengig visuell extractor-komponent for å fange piksel-nivå-egenskaper innen hver objekt-region.

For å implementere dette, bruker Osprey først de multi-nivå-bilde-egenskapene generert av visjon-encoderen for å adoptere mask-pool-operasjonen, og for hver enkelt-nivå-egenskap, samler rammen alle egenskapene som ligger innen mask-regionen. Modellen koder deretter egenskapene over ulike lag ved å sende hver egenskap gjennom en lineær projeksjonslag som genererer region-nivå-innbedninger, og fusjonerer multi-nivå-egenskaper ved å utføre summering. Modellen bruker deretter en MLP-lag for å produsere visuell mask-token. I tillegg bevarer Osprey den romlige geometrien til objekt-regionen ved å kode piksel-nivå-posisjonsforholdet ved å implementere en binær mask for hver objekt-region. Til slutt inkluderer Osprey visuell mask-token og dens respektive romlige token for hver mask-region-innbedning.

LLM-tokenisering

Som nevnt tidligere, trekker modellen ut bilde-nivå-innbedningene av et bilde ved å mate det inn i en forhånds-trent CNN-basert visuell encoder. For tekst-informasjon, bruker modellen først forhånds-trente LLM-tokenisatorer for å tokenisere tekst-sekvenser, og projiserer deretter disse tokeniserte tekst-sekvensene inn i tekst-innbedninger.

Osprey: Tre-trinns treningprosess

Osprey-rammen deployer en tre-trinns treningprosess hvor hver av trening-fasene er overvåket av å minimere en neste-token-prediksjons-tap.

Trinn 1: Bilde-tekst-justerings-trening

I den første fasen, deployer Osprey-rammen en CNN-basert CLIP-visjon-encoder for å trene bilde-nivå-egenskaper og en språk-connector for å trene modellen for bilde-tekst-egenskaps-justering. I den første fasen, anvender rammen tre komponenter: en forhånds-trent stor språkmodell, en forhånds-trent visjon-encoder og en bilde-nivå-projektor. Rammen adopterer også en MLP-lag for å fungere som visjon-språk-connector som hjelper til å forbedre Ospreys multimodale genererings-evner.

Trinn 2: Mask-tekst-justerings-for-trening

I den andre fasen, laster Osprey vekten som er trent i den første fasen, og anvender sin mask-avhengige visuelle extractor-komponent for å fange piksel-nivå-region-egenskaper. I den andre fasen, trener rammen kun mask-avhengig visuell extractor for å justere språk-innbedninger med mask-baserte region-egenskaper.

Trinn 3: End-to-end fin-justering

I den tredje og siste fasen, fikserer modellen vekten til visjon-encoderen, og fin-justerer store språkmodellen, mask-basert region-egenskaps-ekstraktor og bilde-nivå-projektor-komponentene i sin arkitektur. Det primære målet med trening i den tredje fasen er å utvide modellens evne til å følge bruker-instruksjoner nøyaktig, og effektivt utføre piksel-nivå-region-forståelsesoppgaver.

Etter å ha implementert de tre trening-fasene, er Osprey-rammen i stand til å forstå komplekse scener definert av bruker-instruksjoner og basert på piksel-nivå-mask-regioner.

Osprey: Eksperimentelle resultater

For å evaluere sin ytelse, gjennomfører Osprey-utviklerne en rekke eksperimenter for å demonstrere modellens evner i klassifisering, piksel-nivå-region-basert gjenkjenning og komplekse beskrivelser.

Åpen-vokabular-segmentering

Det primære målet med åpen-vokabular-segmentering er å generere mask-basert region-gjenkjenning og dens respektive kategori eksplisitt. For å oppnå åpen-vokabular-segmentering, bruker Osprey først en inndata-tekst-prompt, og deretter adopterer modellen grunn-sannhets-mask-regioner for modell-inferens for å vurdere modellens ytelse i åpen-vokabular-gjenkjenning-oppgaver.

Som det kan observeres, overgår Osprey-rammen eksisterende metoder med en betydelig margin på både Cityscapes- og ADE20K-150-datasettene. Resultatene indikerer Ospreys evne til å overgå eksisterende tilnærminger og oppnå robust forståelse og gjenkjenning på fine-grenede objekt-regioner.

Refererende objekt-klassifisering

I refererende objekt-klassifisering-oppgaven, må modellen klassifisere objektet innen en spesifikk region av et bilde. For å evaluere sin klassifiserings-evne, bruker Osprey-rammen to semantiske relevans-metrikker, inkludert Semantisk IoU eller S-IoU og Semantisk Likhet eller SS.

Detaljert-region-beskrivelse

I detaljert-region-beskrivelse-oppgaven, evaluerer modellen sin ytelse på instruksjons-følging detaljert beskrivelses-evner sammen med andre region-nivå-tilnærminger.

Region-nivå-kapittel

Osprey-rammen overgår også nåværende tilnærminger på region-nivå-kapittel-oppgaver med resultater som er inkludert i følgende bilde.

Slutt-tanker

I denne artikkelen har vi diskutert Osprey, en mask-tekst instruksjonsmetode med det primære målet å utvide MLLMs ved å inkorporere fine-grenede maskerte regioner i språkinstruksjoner for å oppnå piksel-nivå visuell-språklige forståelse. For å oppnå sitt mål, kuraterer Osprey-rammen en mask-basert region-tekstdatasett med over 700 000 eksempler, og injiserer piksel-nivå-representasjon i store språkmodeller for å designe en visuell-språklig modell. Osprey-rammen har som mål å forbedre MLLMs for fine-grenede visuell forståelse betydelig, og ved å implementere en CNN-basert CLIP-modell og en mask-avhengig visuell extractor, oppnår Osprey evnen til å forstå bilder på både del-nivå og objekt-nivå regioner.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.