AI-mallit ja alustat

EAGLE: Tutkimalla suunnittelutilaa monimodaalisille suurille kielimalleille yhdistelemällä koodareita

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Monimodaalisten suurten kielimallien (MLLM) kyky tulkita oikein monimutkaisia visuaalisia tietoja on tärkeä keskittyminen. Viimeaikaiset tutkimukset osoittavat, että parannettu visuaalinen havainnointi vähentää hallusinaatioita ja parantaa suorituskykyä resoluutioherkkissä tehtävissä, kuten optisessa tekstintunnistuksessa ja asiakirjan analyysissä. Useat viimeaikaiset MLLM:t saavuttavat tämän käyttämällä visuaalisten koodareiden yhdistelmää. Vaikka heillä on menestystä, niiden visuaalisten koodareiden yhdistämiseen liittyvien kriittisten asioiden, kuten asiantuntijoiden valinnan ja useiden visuaalisten asiantuntijoiden integroinnin, systemaattisten vertailujen ja yksityiskohtaisten ablaatiotutkimusten puute on edelleen olemassa. Tässä artikkelissa esitetään laaja tutkimus monimodaalisten suurten kielimallien suunnittelutilasta visuaalisten koodareiden ja resoluutioiden yhdistelmänä, Eagle-kehys, joka pyrkii tutkimaan suunnittelutilaa monimodaalisille suurille kielimalleille koodareiden yhdistelmänä. Tulokset paljastavat useita yleisiä periaatteita, jotka ovat yhteisiä eri strategioille, joista seuraa suoraviivainen mutta tehokas suunnittelulähestymistapa. Eagle osoittaa, että visuaalisten tokenien yksinkertainen yhdistäminen useista visuaalisista koodareista on yhtä tehokasta kuin monimutkaisemmat yhdistämisarkkitehtuuri tai -strategiat. Lisäksi Eagle esittelee Pre-Alignmentin, joka siltaa visuaalisten koodareiden ja kielen tokenien välinen aukon ja parantaa mallin yhdenmukaisuutta. Saadut MLLM-malliperhe, Eagle, ylittää muut johtavat avoimet mallit suurten MLLM-benchmarkien osalla.

… (kaikki lähde sisältö on käännetty tähän asti)

Eagle: Kokeet ja Tulokset

Eagle on kehittänyt tarkoin strategiansa ja on vakiinnuttanut seuraavat periaatteet mallilleen: (1) useiden visuaalisten asiantuntijoiden integrointi optimoidulla koulutusreseptillä; (2) useiden visuaalisten asiantuntijoiden yhdistäminen suoran kanavayhdistämisen kautta; (3) visuaalisten asiantuntijoiden esikoulutus erikseen Pre-Alignmentin kautta. Tässä osiossa Eagle vertaa malliaan nykyisiin MLLM-malleihin eri tehtävissä ja osoittaa etuja. Eagle käyttää Vicuna-v1.5-7B, Llama3-8B ja Vicuna-v1.5-13B kielen malleina. Visuaalisten koodareiden osalta Eagle-mallit on merkitty Eagle-X4:ksi, joka sisältää neljä visuaalista koodaria: CLIP, ConvNeXt, Pix2Struct ja EVA-02, ja Eagle-X5:ksi, joka sisältää lisäksi SAM-visuaalisen koodarin.

Visuaalisten Kysymysten Vastaus

Eagle vertaa mallisarjaa kolmessa visuaalisen kysymyksen vastaus -benchmarkissa, mukaan lukien GQA, VQAv2 ja VizWiz. Kuten seuraavassa taulukossa näkyy, Eagle-X5 saavuttaa huipputuloksen GQA- ja VQAv2-benchmarkissa, korostaen lisävisuaalisten asiantuntijoiden hyödyt.

… (kaikki lähde sisältö on käännetty tähän asti)

Lopputajat

Tässä artikkelissa olemme käyneet läpi Eagle-mallia, joka on syvä analyysi visuaalisten koodareiden integroimisesta monimodaalisille suurille kielimalleille. Toisin kuin aiemmat työt, jotka keskittyvät uusien yhdistämismallien suunnitteluun, Eagle osoittaa, että systemaattiset suunnitteluvaihtoehdot ovat tärkeitä ja löytää sarjan hyödyllisiä tekniikoita. Askel askeleelta Eagle optimoi yksittäisten visuaalisten koodareiden koulutusreseptiä, tunnistaa laajennettavan ja tehokkaan yhdistämismenetelmän ja yhdistää vähitellen visuaalisten koodareita eri aihealueiden tietämyksellä. Tulokset korostavat perussuunnittelutilan tärkeyttä.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.