AI-modellen en platforms
Mini-Gemini: Versnelling van Multi-Modale VLM’s
De vooruitgang in grote taalmodellen heeft de ontwikkeling van natuurlijke taalverwerking aanzienlijk versneld, of NLP. De introductie van het transformer-kader bleek een mijlpaal te zijn, waardoor de ontwikkeling van een nieuwe golf van taalmodellen mogelijk werd, waaronder OPT en BERT, die een diep linguïstisch begrip vertonen. Bovendien heeft de invoering van GPT, of Generative Pre-trained Transformer-modellen, een nieuwe paradigma geïntroduceerd met autoregressieve modellering en heeft een robuuste methode voor taalvoorspelling en -generatie vastgesteld. De komst van taalmodellen zoals GPT-4, ChatGPT, Mixtral, LLaMA en anderen heeft de snelle evolutie verder aangewakkerd, waarbij elk model een verbeterde prestatie in taken met complexe taalverwerking vertoont. Onder de bestaande methoden is instructietuning opgekomen als een sleuteltechniek voor het verfijnen van de output van grote voorgetrainde taalmodellen, en de integratie van deze modellen met specifieke tools voor visuele taken heeft hun aanpasbaarheid benadrukt en deuren geopend voor toekomstige toepassingen. Deze reiken verder dan de traditionele tekstgebaseerde verwerking van LLM’s en omvatten multimodale interacties.
Verder heeft de convergentie van natuurlijke taalverwerking en computermodellen tot VLM’s, of Visuele Taalmodellen, geleid, die linguïstische en visuele modellen combineren om cross-modale begrip en redeneercapaciteiten te bereiken. De integratie en introductie van visuele en linguïstische modellen hebben een cruciale rol gespeeld bij het vooruitgang boeken van taken die zowel taalverwerking als visueel begrip vereisen. De opkomst van revolutionaire modellen zoals CLIP heeft de kloof tussen visuele taken en taalmodellen verder verkleind, en heeft de haalbaarheid en praktische toepasbaarheid van cross-modale toepassingen aangetoond. Meer recente kaders zoals LLaMA en BLIP maken gebruik van aangepaste instructiegegevens om efficiënte strategieën te ontwikkelen die de krachtige capaciteiten van het model demonstreren. Bovendien ligt de focus van recent onderzoek naar multimodale modellen op het combineren van grote taalmodellen met beelduitvoer, waarbij recente methoden in staat zijn om directe generatie te omzeilen door gebruik te maken van de beeldopnamebenadering om beelduitvoer en tussenliggende teksten te produceren.

Met dat gezegd, en ondanks de snelle vooruitgang in visuele taalmodellen die basisredenering en visueel dialoog mogelijk maken, bestaat er nog steeds een aanzienlijke prestatiekloof tussen geavanceerde modellen zoals GPT-4 en visuele taalmodellen. Mini-Gemini is een poging om de kloof tussen visuele taalmodellen en geavanceerdere modellen te verkleinen door het potentieel van VLM’s te onderzoeken voor betere prestaties vanuit drie aspecten: VLM-geleide generatie, hoge kwaliteit gegevens en hoge resolutie visuele tokens. Om visuele tokens te verbeteren, stelt het Mini-Gemini-kader voor om een extra visuele encoder te gebruiken voor hoge resolutie-raffinage zonder de telling van visuele tokens te verhogen. Het Mini-Gemini-kader bouwt verder een hoge kwaliteit dataset om precies begrip van beelden en redenering-gebaseerde generatie te bevorderen. Algemeen genomen probeert het Mini-Gemini-kader het potentieel van visuele taalmodellen te onderzoeken en bestaande kaders te versterken met beeldredenering, -begrip en -generatiecapaciteiten tegelijkertijd. Dit artikel heeft als doel het Mini-Gemini-kader diepgaand te behandelen, en we onderzoeken de mechanismen, de methodologie, de architectuur van het kader en de vergelijking met state-of-the-art-kaders. Laten we beginnen.
Mini-Gemini: Versnelling van Multi-Modale VLM’s
In de loop der jaren zijn grote taalmodellen geëvolueerd en beschikken ze nu over opmerkelijke multi-modale capaciteiten, en zijn ze een essentieel onderdeel van huidige visuele taalmodellen. Er bestaat echter een kloof tussen de multi-modale prestaties van grote taalmodellen en visuele taalmodellen, waar recent onderzoek naar zoekt om visie te combineren met grote taalmodellen met behulp van beelden en video’s. Voor visuele taken op zich is beeldresolutie een cruciaal element om expliciet te zijn ondanks de omgevingsomstandigheden met minimale visuele hallucinaties. Om de kloof te overbruggen, ontwikkelen onderzoekers modellen om de visuele begrip in huidige visuele taalmodellen te verbeteren, en twee van de meest voorkomende benaderingen zijn: het verhogen van de resolutie en het verhogen van het aantal visuele tokens. Hoewel het verhogen van het aantal visuele tokens met hogere resolutiebeelden de visuele begrip verbetert, wordt de verbetering vaak vergezeld van verhoogde computationele vereisten en daarmee samenhangende kosten, vooral bij het verwerken van meerdere beelden. Bovendien blijven de capaciteiten van bestaande modellen, de kwaliteit van bestaande gegevens en de toepasbaarheid onvoldoende voor een versnelde ontwikkelingsprocedure, waardoor onderzoekers met de vraag blijven zitten: “hoe kan de ontwikkeling van visuele taalmodellen met aanvaardbare kosten worden versneld”?
Het Mini-Gemini-kader is een poging om deze vraag te beantwoorden, omdat het probeert het potentieel van visuele taalmodellen vanuit drie aspecten te onderzoeken: VLM-geleide generatie of uitgebreide toepassingen, hoge kwaliteit gegevens en hoge resolutie visuele tokens. Ten eerste implementeert het Mini-Gemini-kader een ConvNet-architectuur om hogere resolutie-kandidaten efficiënt te genereren, waardoor visuele details worden verbeterd terwijl de visuele token telling voor het grote taalmodel wordt behouden. Het Mini-Gemini-kader combineert openbaar beschikbare hoge kwaliteit datasets in een poging om de kwaliteit van de gegevens te verbeteren en integreert deze verbeteringen met state-of-the-art generatieve en grote taalmodellen in een poging om de prestaties van de VLM’s te verbeteren en de gebruikerservaring te verbeteren. De multifacette strategie die door het Mini-Gemini-kader wordt geïmplementeerd, stelt het in staat om de verborgen capaciteiten van visuele taalmodellen te onderzoeken en bereikt aanzienlijke vooruitgang met bewezen resourcebeperkingen.

In het algemeen gebruikt het Mini-Gemini-kader een elk-naar-elk-paradigma, omdat het zowel tekst als beelden als invoer en uitvoer kan verwerken. In het bijzonder introduceert het Mini-Gemini-kader een efficiënte pipeline voor het verbeteren van visuele tokens voor invoerbeelden en beschikt over een dubbele encoder-systeem dat bestaat uit twee encoders: de eerste encoder is voor hoge resolutiebeelden, terwijl de tweede encoder is voor lage kwaliteit visuele embedding. Tijdens de inferentie werken de encoders in een aandachtmechanisme, waarbij de lage resolutie-encoder visuele queries genereert, terwijl de hoge resolutie-encoder sleutel en waarden voor referentie biedt. Om de gegevenskwaliteit te verbeteren, verzamelt en produceert het Mini-Gemini-kader meer gegevens op basis van openbare bronnen, waaronder taakgerichte instructies, generatie-gerelateerde gegevens en hoge resolutie-antwoorden, waardoor de verhoogde hoeveelheid en verbeterde kwaliteit de algehele prestaties en capaciteiten van het model verbeteren. Bovendien ondersteunt het Mini-Gemini-kader gelijktijdige tekst- en beeldgeneratie als gevolg van de integratie van het visuele taalmodel met geavanceerde generatieve modellen.
Mini-Gemini: Methodologie en Architectuur
In zijn kern is het Mini-Gemini-kader conceptueel eenvoudig en bestaat het uit drie componenten.
- Het kader gebruikt dubbele visuele encoders om lage resolutie visuele embedding en hoge resolutie-kandidaten te bieden.
- Het kader stelt voor om patch-informatie-ontginning te implementeren om ontginning uit te voeren op patchniveau tussen lage resolutie visuele queries en hoge resolutie-regio’s.
- Het Mini-Gemini-kader gebruikt een groot taalmodel om tekst met beelden te combineren voor zowel generatie als begrip tegelijkertijd.
Dubbele Visuele Encoders
Het Mini-Gemini-kader kan zowel tekst als beeldinvoer verwerken, met de optie om ze afzonderlijk of in combinatie te behandelen. Zoals wordt aangetoond in de volgende afbeelding, start het Mini-Gemini-kader het proces door bilineaire interpolatie te gebruiken om een lage resolutiebeeld te genereren van het corresponderende hoge resolutiebeeld.

Het kader verwerkt vervolgens deze beelden en codeert ze in een multi-grid visuele embedding in twee parallelle beeldstromen. Meer specifiek behoudt het Mini-Gemini-kader de traditionele pipeline voor lage resolutie-stromen en gebruikt een CLIP-voorgeleerd Visueel Transformer om de visuele embedding te coderen, waardoor het model in staat is om de lange-afstandsrelatie tussen visuele patches te behouden voor latere interacties in grote taalmodellen. Voor de hoge resolutie-stromen gebruikt het Mini-Gemini-kader een CNN- of Convolutioneel Neuraal Netwerk-gebaseerde encoder voor adaptieve en efficiënte hoge resolutiebeeldverwerking.
Patch Informatie-ontginning
Met de dubbele visuele encoders die lage resolutie-embedding en hoge resolutie-kenmerken genereren, stelt het Mini-Gemini-kader voor om patch-informatie-ontginning te implementeren met als doel het potentieel van visuele taalmodellen uit te breiden met verbeterde visuele tokens. Om het aantal visuele tokens voor efficiëntie in grote taalmodellen te behouden, neemt het Mini-Gemini-kader de lage resolutie visuele embedding als de query en probeert het om relevante visuele hints op te halen uit de hoge resolutie-kenmerk-kandidaten, waarbij het kader de hoge resolutie-kenmerk-kaart als sleutel en waarde gebruikt.

Zoals wordt aangetoond in de bovenstaande afbeelding, omvat de formule het proces van verfijnen en synthetiseren van visuele hints, wat leidt tot de generatie van geavanceerde visuele tokens voor de latere grote taalmodelverwerking. Het proces zorgt ervoor dat het kader in staat is om de ontginning voor elke query te beperken tot de corresponderende subregio in de hoge resolutie-kenmerk-kaart met de pixel-wijze functietelling, waardoor een verbeterde efficiëntie ontstaat. Als gevolg van deze ontwerpkeuze is het Mini-Gemini-kader in staat om de hoge resolutie-kenmerkdetails op te halen zonder het aantal visuele tokens te verhogen en behoudt het een balans tussen computationele haalbaarheid en rijkdom aan details.
Tekst en Beeldgeneratie
Het Mini-Gemini-kader concateneert de visuele tokens en invoerteksttokens als invoer voor de grote taalmodellen voor autoregressieve generatie. In tegenstelling tot traditionele visuele taalmodellen, ondersteunt het Mini-Gemini-kader zowel tekst-only als tekst-beeldgeneratie als invoer en uitvoer, d.w.z. elk-naar-elk-inferentie, en het is het resultaat van deze uitstekende beeld-tekstbegrip en redeneercapaciteiten dat het Mini-Gemini-kader in staat is om hoge kwaliteit beelden te genereren. In tegenstelling tot recente werken die zich richten op de domeinkloof tussen tekstembedding van generatiemodellen en grote taalmodellen, probeert het Mini-Gemini-kader de kloof in het domein van taalprompts te optimaliseren door gebruikersinstructies te vertalen in hoge kwaliteit prompts die contextuele beelden in latente diffusiemodellen produceren. Bovendien verzamelt het Mini-Gemini-kader voor een beter begrip van instructie-fijnafstemming en cross-modale uitlijning monsters uit openbaar beschikbare hoge kwaliteit datasets en gebruikt het het GPT-4-turbo-kader om verder een 13K-instructie-volgend dataset te construeren om beeldgeneratie te ondersteunen.

Mini-Gemini: Experimenten en Resultaten
Om de prestaties te evalueren, wordt het Mini-Gemini-kader geïnstantieerd met het voorgetrainde ConvNext-L-kader voor de hoge resolutie visuele encoder en met een CLIP-voorgeleerd Visueel Transformer voor de lage resolutie visuele encoder. Om de trainings-efficiëntie te waarborgen, houdt het Mini-Gemini-kader de twee visuele encoders vast en optimaliseert het de projectoren van patch-informatie-ontginning in alle stadia en optimaliseert het het grote taalmodel tijdens de instructie-fijnafstemmingsfase.

De volgende tabel vergelijkt de prestaties van het Mini-Gemini-kader met state-of-the-art-modellen in verschillende instellingen en houdt ook privé-modellen in overweging. Zoals te zien is, overtreft het Mini-Gemini-kader bestaande kaders consistent op normale resolutie en toont het een superieure prestatie wanneer het is geconfigureerd met de Gemma-2B in de categorie van efficiënte modellen. Bovendien toont het Mini-Gemini-kader een bewezen schaalbaarheid wanneer grotere grote taalmodellen worden gebruikt.

Om de prestaties op hoge resolutie en uitgebreide visuele tokens te evalueren, worden de experimenten uitgevoerd met een invoergrootte van 672 voor de lage resolutie visuele encoder en 1536 voor de visuele encoder. Zoals eerder vermeld, is het hoofddoel van de hoge resolutie visuele encoder om hoge resolutie-kandidaat-informatie te bieden. Zoals te zien is, levert het Mini-Gemini-kader een superieure prestatie wanneer het wordt vergeleken met state-of-the-art-kaders.

Bovendien wordt het Mini-Gemini-kader toegepast op een reeks van redeneer- en begrijptaken in echte wereldinstellingen, zoals wordt aangetoond in de volgende afbeelding. Zoals te zien is, is het Mini-Gemini-kader in staat om een breed scala aan complexe taken op te lossen dankzij de implementatie van patch-informatie-ontginning en hoge kwaliteit gegevens. Maar wat nog indrukwekkender is, is het feit dat het Mini-Gemini-kader een scherpe toevoeging aan details toont die verder gaat dan louter herkenning, en beschrijft ingewikkelde elementen op een gedetailleerde manier.


De volgende figuur biedt een uitgebreide evaluatie van de generatieve capaciteiten van het Mini-Gemini-kader.

Wanneer het wordt vergeleken met recente modellen zoals ChatIllusion en AnyGPT, toont het Mini-Gemini-kader een sterkere multi-modale begripscapaciteit, waardoor het in staat is om tekst-naar-beeld-beschrijvingen te genereren die beter overeenkomen met de invoerinstructies en resulteert in beeld-naar-tekst-antwoorden met een sterkere conceptuele overeenkomst. Wat nog indrukwekkender is, is het feit dat het Mini-Gemini-kader een opmerkelijke vaardigheid toont in het genereren van hoge kwaliteit inhoud met behulp van multi-model menselijke instructies, alleen met teksttrainingsgegevens, een capaciteit die de robuuste semantische interpretatie en beeld-tekstuitlijning van Mini-Gemini illustreert.

Slotbeschouwing
In dit artikel hebben we het over Mini-Gemini gehad, een krachtig en gestroomlijnd kader voor multi-modale visuele taalmodellen. Het primaire doel van het Mini-Gemini-kader is om de latentie capaciteiten van visuele taalmodellen te benutten met behulp van hoge kwaliteit gegevens, strategische ontwerp van het kader en een uitgebreide functionele reikwijdte. Mini-Gemini is een poging om de kloof tussen visuele taalmodellen en geavanceerdere modellen te verkleinen door het potentieel van VLM’s te onderzoeken voor betere prestaties vanuit drie aspecten: VLM-geleide generatie, hoge kwaliteit gegevens en hoge resolutie visuele tokens. Om visuele tokens te verbeteren, stelt het Mini-Gemini-kader voor om een extra visuele encoder te gebruiken voor hoge resolutie-raffinage zonder het aantal visuele tokens te verhogen. Het Mini-Gemini-kader bouwt verder een hoge kwaliteit dataset om precies begrip van beelden en redenering-gebaseerde generatie te bevorderen. Algemeen genomen probeert het Mini-Gemini-kader het potentieel van visuele taalmodellen te onderzoeken en bestaande kaders te versterken met beeldredenering, -begrip en -generatiecapaciteiten tegelijkertijd.












