Modele și platforme AI
Ferret: Performanță Superioară în Task-uri de Referință și Încărcare
Dezvoltarea înțelegerii spațiale în modelele de învățare a limbajului și a viziunii rămâne o provocare de cercetare de bază. Această înțelegere stă la baza a două capacități cruciale: referință și încărcare. Referința permite modelului să interpreteze cu acuratețe semantica unor regiuni specifice, în timp ce încărcarea implică utilizarea descrierilor semantice pentru localizarea acestor regiuni.
Dezvoltatorii au introdus Ferret, un model de limbaj mare multimodal (MLLM), capabil să înțeleagă referința spațială la orice granulație sau formă într-o imagine și să localizeze cu acuratețe descrieri de vocabular deschis. Ferret utilizează o reprezentare hibridă nouă, care combină caracteristici vizuale continue și coordonate discrete pentru a reprezenta regiunile imaginilor. Samplerul său vizual conștient de spațiu poate gestiona variații de raritate în forme, permițându-i să proceseze intrări de regiuni diverse, cum ar fi forme libere, cutii de delimitare și puncte.
Abordarea Ferret îi permite să excelleze în task-uri clasice de încărcare și referință și să depășească alte MLLM-uri în comunicarea multimodală care solicită localizare și regiuni. Acest articol explorează arhitectura și metodologia Ferret, subliniind performanța sa remarcabilă în diverse task-uri de limbaj multimodal. Să explorăm mai departe.
Ferret: Performanță Superioară în Task-uri de Referință și Încărcare
Referința într-un model este o capacitate care permite modelului să înțeleagă semantica unor regiuni specifice cu acuratețe, în timp ce încărcarea face ca modelul să utilizeze descrierile semantice pentru a localiza regiunile. Deși pot diferi în task-urile lor respective, atât referința, cât și încărcarea au același concept fundamental: alinierea semanticii spațiale și a informației. Cu toate acestea, în ciuda faptului că împărtășesc același concept, modelele existente învață încărcarea și referința individual. Deși metoda funcționează, aceasta prezintă o barieră în atingerea capacităților umane, deoarece oamenii pot învăța dintr-un task și aplica cunoștințele la alte task-uri fără efort, integrând cu ușurință capacitățile de încărcare/referință cu raționamentul și dialogul zilnic. Framework-ul Ferret se inspiră din această lacună din cadrul existent al modelelor MLLM și studiază trei întrebări principale:
- Cum se pot uni capacitățile de încărcare și referință în cadrul, și cum se vor beneficia una de cealaltă?
- Oamenii folosesc diverse tipuri de regiuni, cum ar fi cutii, puncte, scribbles, forme libere, pentru referință? Cum se pot reprezenta aceste regiuni versatile?
- Cum se pot face încărcarea și referința instructive, robuste și cu vocabular deschis, aspecte critice pentru aplicațiile practice și în timp real?
Framework-ul Ferret este un model de limbaj mare multimodal nou care încearcă să abordeze aceste întrebări. Ferret alege un model de limbaj mare multimodal ca fundament, datorită capacităților sale remarcabile de înțelegere a viziunii și limbajului la nivel global. Mai mult, pentru a uni capacitățile de încărcare și referință, framework-ul Ferret reprezintă coordonatele regiunilor în formă numerică de limbaj natural. Cu toate acestea, în practică, este ineficient să se utilizeze coordonate pentru a reprezenta forme libere, deoarece aceste forme sunt versatile și pot include o varietate de regiuni, cum ar fi măști, poligoane și scribbles.
Pentru a aborda această problemă și a generaliza toate cele trei formate, framework-ul Ferret propune o reprezentare hibridă a regiunilor, care combină caracteristici vizuale continue cu coordonate discrete pentru a reprezenta o regiune specifică.

Pentru caracteristici vizuale continue, pentru o regiune dată, framework-ul Ferret construiește mai întâi o mască binară 2D de aceeași dimensiune cu imaginea și marchează o valoare 1 în regiunea țintă, asignând o valoare 0 în afara regiunii. Modelul extrage apoi masca binară împreună cu harta de caracteristici a imaginii extrase și o trimite la samplerul vizual conștient de spațiu.
Arhitectură
Arhitectura modelului Ferret cuprinde trei componente principale
- Un encoder de imagine pentru a extrage încorporări de imagine.
- Un sampler vizual conștient de spațiu pentru a extrage caracteristici continue regionale.
- Un model de limbaj mare pentru a modela text, imagine și caracteristici de regiune în mod comun.

Imaginea este mai întâi introdusă în encoderul vizual preantrenat pentru a extrage încorporările de imagine. Pentru intrări de text, framework-ul folosește mai întâi un tokenizer de limbaj mare preantrenat pentru a tokeniza secvența de text și apoi proiectează aceste tokenuri în încorporări de text. Pentru regiuni referite, Ferret anexează un token special și coordonatele ca un placeholder pentru caracteristici continue după numele regiunii.
Una dintre principalele provocări în legătură cu regiunile referite este că forma lor poate fi foarte variată, ceea ce înseamnă că pot avea forme diferite și nu sunt limitate la cutii rectangulare sau puncte. Regiunile referite cu forme neregulate nu pot fi procesate cu metode tradiționale, cum ar fi procesarea bazată pe grilă, incluzând atenția patch-ului sau tehnici de convoluție. Pentru a aborda această problemă, framework-ul Ferret propune un sampler vizual conștient de spațiu.
Pentru o hartă de caracteristici extrase dată cu o mască binară de regiune, modelul Ferret extrage mai întâi un număr N de puncte în interiorul măștii binare a regiunii. Pentru fiecare punct individual, modelul obține caracteristica sa prin interpolare biliniară. Punctele N sunt apoi introduse într-o cascadă de blocuri, fiecare trecând prin trei etape diferite: eșantionare, colectare și poolare. În faza de eșantionare, un număr fix de puncte sunt eșantionate din N puncte disponibile, utilizând algoritmul de eșantionare a punctului cel mai îndepărtat (FPS) care garantează o acoperire adecvată.
Generarea Datelor Vizuale Asistată de GPT
Datele de instruire pentru dialog sunt de o importanță critică pentru modelele de limbaj mare multimodale, deoarece nu numai că ajută la convertirea seturilor de date existente prin șabloane, dar ajută și modelul să înțeleagă intenția umană și să genereze răspunsuri adecvate. Majoritatea modelelor MLLM utilizează o metodă de promptare cu câteva exemple pentru a obține date de instruire vizuală, unde modelul oferă descrieri textuale ale scenelor din imagine, împreună cu dialoguri annotate de către oameni, ca exemple de promptare cu câteva exemple.
- În plus față de utilizarea descrierilor globale și a obiectelor, framework-ul oferă o descriere simbolică a scenei care descrie relația fizică dintre caption-urile de regiune și obiecte, precum și coordonatele lor.
- Pentru dialogurile annotate de către oameni, framework-ul adaugă coordonate după obiecte sau regiuni care pot fi groundate, fie în intrare, fie în ieșire, sau în ambele, cu dialogurile care se concentrează în principal pe regiuni specifice, ceea ce ajută la promptarea modelului de limbaj să urmeze aceleași tipare pentru generarea de noi dialoguri.
- Este posibil ca dialogul generat de framework să nu urmeze regulile și tiparele instruite de exemplele de promptare cu câteva exemple și de sistem. Pentru a aborda această problemă, framework-ul utilizează din nou un model de limbaj pentru a rafina dialogurile generate inițial de model.
Minarea Negativă Spațială
Cercetările anterioare au demonstrat că modelele de limbaj mare multimodale au o probabilitate ridicată de a halucina atunci când răspund la întrebări de tip da sau nu. Pentru a preveni ca modelul Ferret să nu halucineze în astfel de condiții, framework-ul utilizează abordarea de minare negativă spațială, cu localizarea categoriilor condiționate de imagine și localizarea categoriilor condiționate de semantică.
Ferret: Rezultate și Experimentări
Pentru a analiza performanța sa, framework-ul Ferret este evaluat pe benchmark-uri convenționale de încărcare și referință, după care este evaluat într-o sarcină de chat multimodală mai complexă și testat pentru capacitățile sale de referință și încărcare.

Capacitatea modelului de a înțelege referința este evaluată prin acuratețea cu care modelul poate înțelege semantica regiunii referite, dată o regiune referită în imagine sau o întrebare. Pentru a măsura acuratețea modelului, se consideră mai întâi obiectele, care sunt cele mai fundamentale semantice, deoarece nu numai că sunt fundamentale, dar și ușor de definit.

Framework-ul Ferret demonstrează o performanță remarcabilă în task-uri de dialog referențial, făcând loc pentru integrarea cu diverse task-uri de învățare vizuală, în special cele cu ieșiri de încărcare.

Pentru task-urile de încărcare vizuală, framework-ul își propune să localizeze întrebări de limbaj în regiuni aliniate ale imaginii, și, așa cum se poate vedea în imaginea de mai jos, framework-ul Ferret demonstrează o performanță remarcabilă pe toate benchmark-urile, iar performanța este comparabilă cu cea realizată de metodele de fine-tuning specializate.

În cele din urmă, chat-ul multimodal este una dintre cele mai dorite capacități într-un model MLLM, iar modelele MLLM existente evaluează în principal descrieri detaliate, conversații și raționamente complexe, cu modelul de limbaj ca judecător. Cu toate acestea, deoarece nu există niciun set de date care să evalueze chat-ul multimodal cu acțiuni de referință și încărcare obligatorii, rămâne o lacună.

În cele din urmă, framework-ul Ferret este comparat direct cu framework-ul GPT de ultimă generație, iar rezultatele sunt prezentate mai jos.

Gânduri Finale
În acest articol, am discutat despre Ferret, un model de limbaj mare multimodal care demonstrează capacități remarcabile de încărcare și referință. Framework-ul Ferret poate referi regiuni de imagini indiferent de forma lor și poate stabili încărcarea pentru textul prezis de model în mod automat. Ferret utilizează un sampler vizual conștient de spațiu capabil să gestioneze variații de raritate afișate de diferite forme pentru a extrage caracteristici continue de regiuni versatile.












