AI-modellen en platforms
LLaVA-UHD: efficiënt beeldherkenning in elke aspectverhouding en hoge resolutie
De recente vooruitgang en ontwikkeling van Large Language Models heeft een significante toename van visuele-taalredenering, -begrip en -interactie mogelijkheden ervaren. Moderne kaders bereiken dit door visuele signalen in LLM’s (Large Language Models) te projecteren om hun vermogen om de wereld visueel te interpreteren te ermöglichen, een reeks scenario’s waarin visuele coderingsstrategieën een cruciale rol spelen. Echter, beelden uit de echte wereld bevatten niet alleen een breed scala aan scenario’s, maar verschillen ook aanzienlijk in termen van resoluties en aspectverhoudingen, waardoor significante uitdagingen voor LLM’s in verschillende domeinen en taken ontstaan. Om de significante variatie die door beelden uit de echte wereld wordt veroorzaakt aan te pakken, percipiëren moderne grote taalmodellen beelden in een lage resolutie, bijv. 224×224, en een vaste aspectverhouding, bijv. 1:1. Hoewel het compromis om bij lage resolutie en vaste aspectverhouding te blijven de generaliseerbaarheid van de LLM in toepassingen uit de echte wereld verhoogt, leidt dit vaak tot zeer vage beelden en ernstige vormvervorming. Dit compromis heeft een significante impact op de mogelijkheden van grote multimodale modellen of LMM’s, met name die welke zijn geoptimaliseerd voor fijne taken, zoals optische tekenherkenning en het begrijpen van kleine objecten. Aangezien de resolutie en de aspectverhouding zijn vooraf gedefinieerd, kunnen de modellen alleen maar naar de vage beelden raden, waardoor modelhallucinaties ontstaan, een situatie waarin het model tekstuele antwoorden genereert die niet feitelijk in de beelden zijn geworteld.
In dit artikel zullen we het hebben over LLaVA-UHD, een novate benadering die eerst de LLaVA-1.5 en de GPT-4V-kaders als representatieve voorbeelden neemt en probeert de systematische fouten die in hun visuele coderingsstrategie zijn geworteld te blootleggen. Het LLaVA-UHD-kader, een multimodale modus, is een poging om deze uitdagingen aan te pakken. Het LLaVA-UHD-kader kan beelden in hoge resolutie en elke aspectverhouding percipiëren. Het LLaVA-UHD-kader is gebouwd rond drie sleutelcomponenten. Ten eerste, een beeldmodularisatiestrategie die native-resolutiebeelden in kleinere variabele-grootte-slices deelt in een poging om efficiëntie en codering uit te breiden. Ten tweede, een compressiemodule die beeldtokens die door visuele encoders zijn gegenereerd verder condenseert. Ten slotte, een ruimtelijk schema dat slicetokens voor grote taalmodellen organiseert. Uitgebreide experimenten geven aan dat het LLaVA-UHD-kader in staat is om state-of-the-art-grote taalmodellen op 9 benchmarks te overtreffen. Bovendien kan het LLaVA-UHD-kader, door slechts 94% van de inferentieberekening te gebruiken, beelden met 6 keer grotere resolutie ondersteunen, bijv. 672×1088.
LLaVA-UHD: efficiënt beeldherkenning in elke aspectverhouding en hoge resolutie
Visuele-taalredenering, -begrip en -interactie hebben onlangs significante vooruitgang geboekt, voornamelijk door de recente push voor Large Language Models. In moderne kaders wordt dit bereikt door visuele signalen in LLM’s (Large Language Models) te voeden om hun vermogen om de wereld visueel te interpreteren te ermöglichen, een reeks scenario’s die afhankelijk zijn van visuele coderingsstrategieën. Het verschil in scenario’s weerspiegelt een beperkte dekking van LLM’s in verschillende domeinen en taken, terwijl het verschil in resoluties en aspectverhoudingen de grote intraklassenvariaties in beelden uit de echte wereld onthult, die moeilijk te hanteren zijn. In tegenstelling tot de kleine schaal die de variatie verlaagt, hanteren modellen na BERT de significantie vanuit de lage resolutie (bijv. voor het LLaVA-UHD is het 224×224) van beelden met een vaste aspectverhouding, 1:1, om beelden uit de echte wereld te geven. Hoewel dit compromis nuttig is voor het waarborgen van de generaliseerbaarheid van de LLM in toepassingen uit de echte wereld, leidt het vaak tot zeer vage beelden en ernstige vormvervorming. Dit compromis heeft een significante impact op de mogelijkheden van grote multimodale modellen of LMM’s, met name die welke zijn geoptimaliseerd voor fijne taken, zoals optische tekenherkenning en het begrijpen van kleine objecten. Aangezien de resolutie en de aspectverhouding zijn vooraf gedefinieerd, kunnen de modellen alleen maar naar de vage beelden raden, waardoor modelhallucinaties ontstaan, waardoor de gegenereerde tekstuele antwoorden niet feitelijk in de beelden zijn geworteld.
Er zijn twee belangrijke redenen waarom benchmark-LMM’s niet in staat zijn om beelden met hoge resolutie en variabele aspectverhouding te percipiëren. Ten eerste, aangezien visuele encoders zijn getraind in vaste resoluties, maakt dit het moeilijk voor het model en de encoder om met beelden met variabele aspectverhoudingen en resoluties om te gaan, waardoor de adaptiviteit van het model aanzienlijk wordt beïnvloed. Ten tweede, het direct coderen van hoge-resolutiebeelden met behulp van visietransformatoren is geassocieerd met significante berekeningskosten in verhouding tot de grootte van de beelden. Bovendien kunnen de berekeningskosten aanzienlijk hoger zijn voor het grote taalmodel om een groot aantal visuele tokens voor hoge-resolutiebeelden te verwerken, waardoor de algehele efficiëntie van het model aanzienlijk wordt beïnvloed. Om deze uitdagingen te overwinnen, neemt het LLaVA-UHD, een groot multimodaal model dat hoge-resolutiebeelden en elke aspectverhouding kan percipiëren, de LLaVA-1.5 en de GPT-4V-kaders als representatieve voorbeelden en probeert de systematische fouten die in hun visuele coderingsstrategie zijn geworteld te blootleggen.

Het bovenstaande beeld reflecteert de experimentele resultaten van de GPT-4V bij het identificeren van het aantal objecten in een beeld. Het LLaVA-UHD-kader heeft drie componenten. Ten eerste, een beeldmodularisatiestrategie die native-resolutiebeelden in kleinere variabele-grootte-slices deelt voor uitbreidbare en efficiënte codering. In tegenstelling tot de recente LLM’s die beelden in enkele vaste resoluties en aspectverhoudingen passen, maken de variabele-grootte-slices die door het LLaVA-UHD-kader worden gegenereerd een volledige adaptiviteit aan native-resolutiebeelden mogelijk zonder vormvervorming, herschaling of opvulling. Ten tweede, condenseert het model de visuele tokens door een compressielaag tot een bescheiden lengte, waardoor de berekening voor LLM’s aanzienlijk wordt verlaagd. Ten slotte, organiseert het model de gecomprimeerde slicetokens in een ruimtelijk schema om de sliceposities in de beelden aan het grote taalmodel te informeren.
LLaVA-UHD: methodologie en architectuur
Op basis van de inzichten uit enkele proefexperimenten om bestaande kaders, waaronder GPT-4V en LLaVA-1.5, te bestuderen, implementeert het LLaVA-UHD-kader een driedelige architectuur, zoals weergegeven in het volgende beeld.

Ten eerste, een beeldmodularisatiestrategie die native-resolutiebeelden in kleinere variabele-grootte-slices deelt in een poging om efficiëntie en codering uit te breiden. Ten tweede, een compressiemodule die beeldtokens die door visuele encoders zijn gegenereerd verder condenseert. Ten slotte, een ruimtelijk schema dat slicetokens voor grote taalmodellen organiseert. Laten we een gedetailleerde blik werpen op deze componenten.
Modulair visueel coderen
Een veel voorkomende aanpak om om te gaan met hoge-resolutiebeelden met verschillende aspectverhoudingen is om de positie-embeddings van de Vision Transformer of ViT te interpoleren naar de doelvorm voor directe codering als geheel. Echter, de implementatie van deze aanpak gaat vaak gepaard met hoge berekeningskosten, en uit-distributieproblemen leiden tot verdere prestatieverslechtering. Om deze uitdaging aan te pakken, presenteert het LLaVA-UHD-kader een modulair visueel coderingsstrategie die native-resolutiebeelden in kleinere variabele-grootte-slices deelt, waarvan de vorm van elke slice dicht bij de standaardvoorinstellingen van de visietransformator ligt. Door het gebruik van variabele-grootte-slices kan het LLaVA-UHD-kader een volledige adaptiviteit aan native-resolutiebeelden bereiken zonder enige vormvervormende herschaling of opvulling. Bovendien is het primaire doel van de beeldsnijsstrategie om een splitsing van hoge-resolutiebeelden met minimale veranderingen in de resolutie van elke slice te bepalen. Voor een beeld met een bepaalde resolutie (w, h) en een visietransformator die in een andere resolutie is getraind, bepaalt het LLaVA-UHD-kader eerst het ideale aantal slices dat nodig is om het beeld te verwerken. Het kader deelt vervolgens het aantal slices in m kolommen en n rijen. Het kader definieert vervolgens een score-functie om de afwijking van de standaardvoorinstellingen van de visietransformator te meten. Theoretisch kan het LLaVA-UHD-kader aantonen dat de partitie-strategie die in zijn architectuur is geïmplementeerd, een kleine verwachte verandering en een matige slechtste-verandering garandeert met betrekking tot de standaardvoorinstellingen van de resolutie voor elke slice.
Bovendien implementeren de meeste bestaande LLM’s een statische resolutie voor beeldsnijs-codering, een aanpak die de volledige adaptiviteit van het model aan native-resoluties verhindert, aangezien ze alleen toegang hebben tot enkele vooraf gedefinieerde vaste vorm-slices. Bovendien schaadt statische sliceresolutie de prestaties, efficiëntie en correctheid van het model, aangezien het onvermijdelijk vormvervormende herschaling of opvulling veroorzaakt. Om dit probleem aan te pakken, stelt het LLaVA-UHD-kader voor om beeldslices in de aspectverhouding te coderen zoals gedefinieerd door de partitie-strategie. Om specifiek te zijn, past het LLaVA-UHD-kader eerst het oorspronkelijke beeld evenredig aan in overeenstemming met de aspectverhouding, zodat het aantal patches past binnen het voorinstellingsbudget, d.w.z. het aantal positie-embeddings in de visietransformator, maximaal. Het LLaVA-UHD-model vormt vervolgens de vooraf getrainde 1D-positie-embeddings van de visietransformator om in een 2D-formaat in overeenstemming met zijn voorinstellingen.
Compressielaag
Een veel voorkomend probleem dat LLM’s ondervinden bij het verwerken van hoge-resolutiebeelden is dat de hoeveelheid visuele tokens die ze moeten verwerken aanzienlijk hoger is (bijv. produceert het LLaVA-1.5-kader ongeveer 3500 visuele tokens bij het verwerken van een enkel beeld met resolutie 672×1008), wat een groot deel van de berekeningsbronnen en -kosten vertegenwoordigt. Om deze uitdaging aan te pakken, implementeert het LLaVA-UHD-model een gedeelde perceiver-resampler-laag om de visuele tokens van elke beeldslice te comprimeren. Het model implementeert vervolgens een reeks query-vektoren via cross-attention om de uitvoer van beeldtokens door visuele encoders te resampleren naar een lager aantal. In vergelijking met veel voorkomende multilayer-perceptron-gebaseerde visuele projectie-strategieën, is de perceiver-sample-aanpak die door LLaVA-UHD wordt geïmplementeerd in staat om een betaalbare maar vaste hoeveelheid visuele tokens ongeacht de beeldresolutie te behouden, waardoor het LLaVA-UHD-kader meer compatibel is met hoge-resolutiebeeldverwerking en -begrijpingstaken. Om dit te verduidelijken, genereert het LLaVA-UDH-kader hetzelfde aantal tokens bij het coderen van een beeld met resolutie 672×1008 als het LLaVA-1.5-kader genereert bij het coderen van een beeld met resolutie 336×336, bijna 6 keer effectiever dan zijn concurrent.
Ruimtelijk schema voor beeldslices
Het is noodzakelijk om het grote taalmodel te informeren over de ruimtelijke organisatie van beeldslices, aangezien de partitie van beelden dynamisch is over verschillende beelden. Het LLaVA-UHD-kader ontwerpt en implementeert een ruimtelijk schema dat twee speciale tokens gebruikt om het LLM te informeren over de relatieve positie van de beeldslices. Onder dit ruimtelijk schema gebruikt het LLaVA-UHD-kader “,” om de slicerepresentaties in een rij te scheiden, en worden de verschillende rijen gescheiden met een “n”.
LLaVA-UDH: experimenten en resultaten
Het LLaVA-UHD-kader wordt geëvalueerd tegen 9 populaire benchmarks, waaronder algemene visuele vraagbeantwoording-benchmarks, optische teken-gebaseerde visuele vraagbeantwoording-benchmarks, hallucinatie-benchmark en uitgebreide benchmarks. Bovendien wordt het LLaVA-UHD-kader vergeleken met sterke basismodellen, waaronder LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2 en meer.
De prestaties van het LLaVA-UHD-kader op 9 populaire benchmarks worden samengevat en vergeleken met populaire benchmarks in de onderstaande tabel.

Op basis van de bovenstaande prestaties kan worden geconcludeerd dat het LLaVA-UHD-kader in staat is om sterke basismodellen te overtreffen op populaire benchmarks, waaronder sterke algemene basismodellen die zijn getraind op een aanzienlijk grotere hoeveelheid gegevens, evenals het overtreffen van LLM’s die aanzienlijk meer berekening nodig hebben, zoals Fuyu-8B, Monkey en meer. Ten tweede geven de resultaten ook aan dat het LLaVA-UHD-kader aanzienlijk betere resultaten behaalt dan de LLaVA-1.5-architectuur, en terwijl de LLaVA-1.5 een vaste resolutie van 336×336 ondersteunt, ondersteunt het LLaVA-UHD-kader beelden met resolutie 672×1088 en elke aspectverhouding, en hetzelfde aantal visuele tokens.


Slotgedachten
In dit artikel hebben we het gehad over LLaVA-UHD, een novate benadering die eerst de LLaVA-1.5 en de GPT-4V-kaders als representatieve voorbeelden neemt en probeert de systematische fouten die in hun visuele coderingsstrategie zijn geworteld te blootleggen. Het LLaVA-UHD-kader, een multimodale modus, is een poging om deze uitdagingen aan te pakken. Het LLaVA-UHD-kader kan beelden in hoge resolutie en elke aspectverhouding percipiëren. Het LLaVA-UHD-kader is gebouwd rond drie sleutelcomponenten. Ten eerste, een beeldmodularisatiestrategie die native-resolutiebeelden in kleinere variabele-grootte-slices deelt in een poging om efficiëntie en codering uit te breiden. Ten tweede, een compressiemodule die beeldtokens die door visuele encoders zijn gegenereerd verder condenseert. Ten slotte, een ruimtelijk schema dat slicetokens voor grote taalmodellen organiseert. Uitgebreide experimenten geven aan dat het LLaVA-UHD-kader in staat is om state-of-the-art-grote taalmodellen op 9 benchmarks te overtreffen. Bovendien kan het LLaVA-UHD-kader, door slechts 94% van de inferentieberekening te gebruiken, beelden met 6 keer grotere resolutie ondersteunen, bijv. 672×1088.












