AI-modeller og platforme
Ferret: Overlegen Præstation i Henvisning og Grundlæggelse af Opgaver
At aktivere rumlig forståelse i vision-sprog-modeller er stadig en central udfordring i forskningen. Denne forståelse danner grundlag for to afgørende evner: grundlæggelse og henvisning. Henvisning giver mulighed for, at modellen kan fortolke semantikken af bestemte regioner nøjagtigt, mens grundlæggelse indebærer brug af semantiske beskrivelser til at lokaliserer disse regioner.
Udviklerne har introduceret Ferret, en Multimodal Stor Sprogmodel (MLLM), der kan forstå rumlig henvisning på tværs af enhver granularitet eller form i et billede og nøjagtigt grundlægge åbne-vokabularbeskrivelser. Ferret bruger en ny hybridrepræsentation, der kombinerer kontinuerte funktioner og diskrete koordinater til at repræsentere billedregioner. Dens rum-bevidst visuel sampler kan håndtere varierende sparsomhed i former, hvilket giver mulighed for at behandle forskellige regionindgange som f.eks. fri-formsformer, begrænsningsbokse og punkter.
Ferrets tilgang giver mulighed for, at den kan udføre klassisk grundlæggelse og henvisning opgaver og overgå andre MLLM’er i lokaliseringskrævende og regionsbaseret multimodal kommunikation. Denne artikel dykker ned i Ferrets arkitektur og metode, og fremhæver dens imponerende præstation i forskellige multimodale sprogopgaver. Lad os udforske dette nærmere.
Ferret : Overlegen Præstation i Henvisning og Grundlæggelse af Opgaver
Henvisning i en model er en evne, der giver mulighed for, at modellen kan forstå semantikken af bestemte regioner nøjagtigt, mens grundlæggelse gør det muligt for modellen at bruge de givne semantiske beskrivelser til at lokaliserer regionerne. Selvom de kan være forskellige i deres respektive opgaver, har både henvisning og grundlæggelse den samme grundlæggende koncept: alignment af rumlig semantik og information. Men på trods af, at de deler det samme koncept, lærer eksisterende modeller grundlæggelse og henvisning individuelt. Selvom metoden fungerer, stiller det en hindring for at opnå menneske-lignende evner, da mennesker kan lære fra en opgave og anvende læringen til andre opgaver uden besvær og kan integrere grundlæggelse/henvisningsevner med begrundelse og daglig dialog. Ferret-rammeværket tager inspiration fra denne nævnte lukning i eksisterende MLLM-rammeværk og studerer tre hovedspørgsmål:
- Hvordan kan man samle grundlæggelse og henvisningsevner i rammeværket, og hvordan kan deres samling gavne hinanden?
- Mennesker bruger forskellige typer regioner som f.eks. boks, punkt, skitse, fri-formsformer til henvisning? Hvordan kan man repræsentere disse forskellige regioner?
- Hvordan kan man gøre grundlæggelse og henvisning instruktionsfølsom, robust og åben-vokabular, hvilket er kritisk for deres praktiske og reelle anvendelser?
Ferret-rammeværket er en ny henvis og grundlæg Multimodal Stor Sprogmodel, der forsøger at imødekomme disse spørgsmål. Ferret-rammeværket vælger en Multimodal Stor Sprogmodel som grundlag på grund af deres bemærkelsesværdige globale vision og sprogforståelse. Desuden til at samle grundlæggelse og henvisningsevner, repræsenterer Ferret-rammeværket koordinaterne for regioner i naturlig sprog numerisk form. Men i praksis er det ineffektivt at bruge boks-koordinater eller blot enkelt punkt til at repræsentere forskellige regionsformer som f.eks. skitser, streger eller komplekse polygoner, da disse former er kritiske for forbedret præcision og mere universel menneske-model-interaktion. For at tackle dette problem, bruger Ferret-rammeværket en rum-bevidst visuel sampler, der erhverver visuelle regioner for regioner uanset form, og forhandler dermed med varierende sparsomhed i disse former. Rammeværket kombinerer herefter de kontinuerte visuelle funktioner med diskrete koordinater til at repræsentere visuelle regioner i input, hvilket resulterer i oprettelsen af en hybrid regionsrepræsentation i Ferret.
Ferret-rammeværket anvender ovennævnte metoder til at løse input, der kombinerer fri-form tekst med henvisningsregioner, og kan herefter generere koordinater for hver grundbar objekt med genereret tekst til at grundlægge de nævnte objekter i output. Ved at gøre dette, er Ferret det første rammeværk, der kan behandle fri-formsregionsinput i Multimodal Stor Sprogmodeller. Desuden absorberer Ferret-rammeværket bemærkelsesværdige åben-vokabular-evner af rumlig lokaliserings- og forståelsesevner, hvilket giver rammeværket mulighed for at opnå overlegen præstation, når det vurderes på konventionelle grundlæggelse og henvisningsopgaver.
Herefter søger Ferret-rammeværket inspiration fra tre eksisterende AI-rammeværk, herunder Multimodal Stor Sprogmodeller, MLLM’er til Henvisning og Grundlæggelse, og Samling af Grundlæggelse og Visuel Forståelse.
Introduktionen af Store Sprogmodeller, herunder GPT, DALL-E, PaLM, LLaMA og BLOOM, har ændret landskabet i NLP-forskning, hvilket har resulteret i betydelige fremskridt i multimodale sprogmodeller. De tidligere multimodale sprogmodeller fokuserede primært på stor skala billed-tekst-generering med nogle bemærkelsesværdige eksempler som PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 og PaLI-X. Men siden Flamingo-rammeværket opnåede effektiv integration af LLM’er med en pre-trænet CLIP-billed-encoder gennem cross-gated attention-blokke, hvilket resulterede i bemærkelsesværdige multimodale few-shot-lærings-evner. Den nuværende forskning søger efter måder at anvende pre-trænede store sprogmodeller til visuel instruktions-justering med nogle bemærkelsesværdige eksempler som MiniGPT-4, Otter, InstructBLIP og mere. Desuden har nylige modeller som Emu og GILL vist bemærkelsesværdig succes i at anvende MLLM’er til billed-generering og billed-søgning. Ferret-rammeværket henviser også til tidligere forskning, der fokuserer på at samle tekst og begrænsningsboks-output for Vision Language-modeller.
Ferret : Metode og Arkitektur
Hybrid-Regions-Repræsentationer
Punkt, boks og fri-formsformer er de tre dominerende formater, som en sprogmodel anvender, når den henviser til bestemte regioner. På den ene side kan punkt- og boks-formatet nøjagtigt repræsenteres ved koordinater, men at kortlægge fri-formsformer er lidt mere komplekst, da fri-formsformer kan omfatte en bred vifte af regioner, herunder masker, polygoner og skitser. At bruge koordinater til at beskrive fri-formsformer er en kompleks opgave, der hindrer modellens evne til at lære at etablere en korrelation mellem regionerne og de tilsvarende koordinater. Desuden er brugen af koordinater til fri-formsformer komputationelt dyrt og uklart.
For at tackle dette problem og generalisere over alle tre formater, foreslår Ferret-rammeværket en hybrid-regions-repræsentation, der kombinerer kontinuerte visuelle funktioner med diskrete koordinater til at henvisning til en bestemt region.

For kontinuerte visuelle funktioner konstruerer Ferret-rammeværket først en 2D binær maske af samme størrelse som billedet og markerer en værdi 1 inden for den målte region, mens den tildeler en værdi 0 uden for regionen. Modellen udtrækker herefter den binære maske sammen med den udtrukne billed-funktion-kort og sender det til den rum-bevidste visuelle sampler.
Arkitektur
Ferret-modellens arkitektur består af tre hovedkomponenter
- En billed-encoder til at udtrække billed-embeddings.
- En rum-bevidst visuel sampler til at udtrække regional kontinuert funktion.
- En Stor Sprogmodel til at modelere tekst, billed- og regionsfunktioner sammen.

Billedet indføres først i den pre-trænede visuelle encoder til at udtrække billed-embeddings. For tekst-input bruger rammeværket først en pre-trænet LLM-tokenizer til at tokenisere tekst-sekvensen og projekterer herefter disse tokens ind i tekst-embeddings. For henvisningsregioner tilføjer Ferret en special-token og koordinater som en placeholder for kontinuerte funktioner efter regionsnavnet. Hvis regionsnavnet er ukendt eller komplekst at beskrive som følge af inklusion af flere objekter, bruger rammeværket blot området eller regionsnavnet.
En af de største udfordringer ved henvisningsregioner er, at deres form kan være ret varierende, hvilket betyder, at de kan have forskellige former, og er ikke blot begrænset til rektangulære bokse eller punkter. Henvisningsregioner med uregelmæssige former kan ikke behandles med traditionelle metoder som f.eks. grid-baseret behandling, herunder patch-attention eller convolutionsteknikker. For at tackle dette problem foreslår Ferret-rammeværket en rum-bevidst visuel sampler. For en given udtrukket funktion-kort med en binær regionsmaske, udtrækker Ferret-modellen først tilfældigt N antal punkter inden for den binære regionsmaske.
For hvert enkelt punkt udtrækker modellen dens funktion ved at udføre bilinear interpolation. De N punkter indføres herefter i en kaskade af blokke, hvor hver af dem passerer gennem tre forskellige faser: sampling, gathering og pooling. I sampling-fasen samples en fast antal punkter fra N antal punkter, der er tilgængelige, ved hjælp af FPS eller Farthest Point Sampling-algoritmen, der garanterer tilstrækkelig dækning. I den anden fase søger rammeværket for hvert sample-punkt efter dets k nærmeste naboer fra puljen af tilgængelige N punkter. For hver gruppe fusionerer modellen herefter funktionerne af et sample-punkt med dets nabo-punkter. I den endelige fase udfører Ferret-rammeværket en max-pooling til at fusionere k nabo-funktioner ind i en funktion, der kan fungere som repræsentation for det sampede punkt. Ved at udføre disse tre faser er Ferret-rammeværket tilbage med færre punkter, men funktioner-rummet med højere tæthed, da det ikke blot inkorporerer funktionerne af lokale naboer, men også deres relative positioner.
GPT-Assisteret Visuel Data-Generering
Dialogue Instruction Tuning Data er af kritisk betydning for Multimodal Store Sprogmodeller, da de ikke blot hjælper med at konvertere eksisterende dataset ved hjælp af skabeloner, men også hjælper modellen med at forstå menneskelig intention og generere en passende respons. De fleste MLLM’er bruger en few-shot prompting-metode til at erhverve visuel instruktions-justeringsdata, hvor modellen giver tekst-beskrivelser af scener i billedet sammen med menneske-annoterede dialoger som few-shot-demonstrationer. Men eksisterende instruktions-justeringsmetoder fokuserer primært på at beskrive hele billedet uden at specificere spatial-relateret information eksplicit. Ferret-rammeværket lægger vægt på regionsbaseret viden til at samle henvis og grundlæg instruktions-justeringsdata i tre trin.
- Foruden at bruge globale beskrivelser og objekter, giver rammeværket en symbolsk scene-beskrivelse, der beskriver den fysiske relation mellem regions-beskrivelser og objekter, samt deres koordinater.
- For menneske-annoterede dialoger tilføjer rammeværket koordinater efter grundbare objekter eller regioner enten i input eller output eller begge, med dialogerne, der fokuserer primært på bestemte regioner, hvilket hjælper med at fremme sprogmodellen implicit til at følge lignende mønstre for ny dialog-generering.
- Det kan være muligt, at dialogen, der er genereret af rammeværket, ikke følger reglerne og mønstrene, som er instrueret af few-shot-eksempler og system-prompts. For at tackle dette problem bruger rammeværket igen en sprogmodel til at raffinere dialogerne, der er genereret af modellen initialt.
Rumlig Negativ Mining
Tidligere forskning har demonstreret, at multimodale store sprogmodeller har en høj sandsynlighed for at hallucinere, når de besvarer ja eller nej-spørgsmål. For at sikre, at Ferret-modellen ikke hallucinerer under lignende betingelser, bruger rammeværket en rumlig negativ mining-tilgang med Image-Conditioned Category Localization og Semantics-conditioned Category Localization. Begge disse metoder beder modellen om at lokaliserer bestemte objekt-kategorier, hvilket giver modellen mulighed for at genkende fraværet af bestemte objekter i billedet.
Ferret : Resultater og Eksperimenter
For at analysere dens præstation evalueres Ferret-rammeværket på konventionelle grundlæggelse og henvisnings-benchmark efterfulgt af en mere kompleks multimodal chat-opgave og testning af dens henvis og grundlæg-evner.

Modellens evne til at forstå henvisning evalueres ved, hvor nøjagtigt en model kan forstå semantikken af den henvisnings-region, der er givet en henvisnings-region i billedet eller spørgsmålet. For at måle modellens nøjagtighed overvejes objekter, der er de mest grundlæggende semantik, først, da det ikke blot er grundlæggende, men også let at definere. For at efterligne menneske-lignende fleksibilitet erstatter rammeværket objektets placering i billedet med en fri-formsform, en boks og et punkt. For en fri-formsform genererer modellen tilfældigt streger inden for det grundlæggende objekt til simulation. For en boks bruger Ferret-rammeværket det grundlæggende begrænsningsboks, der er leveret af LVIS-komponenten. Til sidst for et punkt sampler modellen tilfældigt et punkt inden for det grundlæggende objekt, der også er nær grænsen af det grundlæggende objekt. Resultaterne på de tre typer henvisning demonstreres i følgende billed.

Ferret-rammeværket demonstrerer bemærkelsesværdig præstation i henvisningsdialog-opgaver, hvilket giver mulighed for integration med forskellige visuelle læringsopgaver, især de, der har grundlæggelse-outputs. For at evaluere dens grundlæggelse-evne underkaster Ferret-rammeværket sig først benchmark-visuelle grundlæggelse-opgaver med en generativ paradigme. Rammeværket evaluerer herefter dens evne på grundlæggende beskrivelsesopgaver til at måle alignmentet mellem regionerne og ordene.
I visuelle grundlæggelse-opgaver sigter rammeværket mod at grundlægge sprog-forespørgsler i alignede regioner af billedet, og som det kan ses i følgende billed, demonstrerer Ferret-rammeværket bemærkelsesværdig præstation på tværs af alle benchmark, og præstationen er sammenlignelig med den, der er opnået af specialiserede fin-justeringsmetoder.

For grundlæggende beskrivelsesopgaver skal modellen generere en beskrivelse og herefter grundlægge de genererede substantiver til billed-regioner. Den endelige forudsigelse, der er lavet af modellen, består af tre komponenter: visuelle regioner som bokse, tekst-beskrivelser og grundlæggelse-alignment mellem bokse og ord. Resultaterne demonstreres i følgende billed, og som det kan ses, leverer rammeværket en præstation, der er sammenlignelig med state-of-the-art-metoder.

Til sidst er multimodal chatting en af de mest ønskede evner inden for en MLLM, og eksisterende MLLM’er evaluerer primært detaljerede beskrivelser, samtale og kompleks begrundelse med sprogmodellen som dommer. Men da der ikke findes nogen dataset, der evaluerer multimodal chatting med obligatorisk henvisning eller grundlæggelse, efterlader det en lukning. For at brokke denne lukning dækker Ferret-rammeværket tre regionsbaserede spørgsmål til at evaluere dens henvis og grundlæg-evner i multimodal chat-opgaver.

Til sidst sammenlignes Ferret-rammeværket direkte med state-of-the-art GPT-rammeværket, og resultaterne demonstreres nedenfor.

Endelige Tanker
I denne artikel har vi talt om Ferret, en multimodal stor sprogmodel, der demonstrerer bemærkelsesværdig grundlæggelse og henvisningsevner. Ferret-rammeværket kan henvisnings-regioner uanset form og kan grundlægge tekst, der er forudsiget af modellen automatisk. Ferret bruger en rum-bevidst visuel sampler, der kan håndtere varierende sparsomhed, der vises af forskellige former, til at udtrække de kontinuerte funktioner af fleksible regioner. Som følge heraf kan Ferret-rammeværket indtaste forskellige regions-input, herunder fri-formsformer, begrænsningsbokse og punkter.












