AI-modeller och plattformar

ÖRN: Utforska designutrymmet för multimodala stora språkmodeller med en blandning av encodare

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Förmågan att tolka komplex visuell information på ett korrekt sätt är en viktig fokus för multimodala stora språkmodeller (MLLM). Nyliga studier visar att förbättrad visuell perception signifikant minskar hallucinationer och förbättrar prestanda på upplösningskänsliga uppgifter, såsom optisk teckenigenkänning och dokumentanalys. Flera nyliga MLLM uppnår detta genom att använda en blandning av visionencodare. Trots deras framgång finns det en brist på systematiska jämförelser och detaljerade ablationsstudier som behandlar kritiska aspekter, såsom experturval och integration av flera visionsexperter. Den här artikeln tillhandahåller en omfattande utforskning av designutrymmet för MLLM med en blandning av visionencodare och upplösningar, Eagle-ramverket som försöker utforska designutrymmet för multimodala stora språkmodeller med en blandning av encodare. Resultaten visar flera underliggande principer som är gemensamma för olika existerande strategier, vilket leder till en strömlinjeformad men effektiv designansats. Eagle upptäcker att det enkelt att konkatenera visuella token från en uppsättning kompletterande visionencodare är lika effektivt som mer komplexa blandningsarkitekturer eller strategier. Dessutom introducerar Eagle Pre-Alignment för att överbrygga gapet mellan visionssfokuserade encodare och språktoken, vilket förbättrar modellens sammanhang. Den resulterande familjen av MLLM, Eagle, överträffar andra ledande öppen källkodsmodeller på stora MLLM-benchmark.

… (rest of the content)

Örn: Experiment och resultat

Efter att ha utvecklat sina strategier har Örn etablerat följande principer för modellen: (1) integrera fler visionsexperter med en optimerad träningsrecept; (2) kombinera flera visionsexperter genom direkt kanal-konkatenation; (3) förträna visionsexperterna separat via pre-alignment. I det här avsnittet för att ytterligare demonstrera Örn-modellernas fördelar, inkorporeras ytterligare träningsdata och Örn jämförs med nuvarande state-of-the-art MLLM över olika uppgifter. Örn använder Vicuna-v1.5-7B, Llama3-8B och Vicuna-v1.5-13B som språkmodeller. För visionencodarna används Örn-modellerna, som betecknas som Örn-X4, som innehåller fyra visionencodare: CLIP, ConvNeXt, Pix2Struct och EVA-02, och Örn-X5, som innehåller en ytterligare SAM-visionencodare.

Visuell frågebesvarande uppgifter

Örn jämför modellserien över tre visuella frågebesvarande benchmark, inklusive GQA, VQAv2 och VizWiz. Som visas i följande tabell uppnår Örn-X5 state-of-the-art-prestanda på GQA och VQAv2, vilket lyfter fram fördelarna med att inkorporera ytterligare visionsexperter.

… (rest of the content)

Slutliga tankar

I den här artikeln har vi talat om Örn, en djupgående analys av designutrymmet för att integrera visionencodare i multimodala stora språkmodeller. Till skillnad från tidigare arbeten som fokuserar på att designa nya fusionparadigm, upptäcker Örn att systematiska designval är viktiga och upptäcker en serie användbara tekniker. Steg för steg optimerar Örn träningsreceptet för enskilda visionencodare, identifierar en utbyggnadsbar och effektiv fusionmetod och kombineras gradvis visionencodare med olika domänkunskap. Resultaten lyfter fram den kritiska betydelsen av grundläggande designutrymmesöverväganden.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.