AI-modellen en platforms

MiniGPT-5: Interleaved Visie- en Taalgeneratie via Generatieve Vokens

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

De afgelopen jaren hebben Large Language Models (LLM’s) de aandacht getrokken van AI-ontwikkelaars over de hele wereld vanwege doorbraken in Natural Language Processing (NLP). Deze modellen hebben nieuwe benchmarks gezet in tekstgeneratie en -begrip. Echter, ondanks de vooruitgang in tekstgeneratie, is het produceren van afbeeldingen die coherent zijn met tekstuele verhalen nog steeds een uitdaging. Om dit aan te pakken, hebben ontwikkelaars een innovatieve visie- en taalgeneratieaanpak gebaseerd op “generatieve vokens” geïntroduceerd, waarmee de kloof tussen tekst- en afbeeldingsuitvoer wordt overbrugd.

De basis van MiniGPT-5 is een tweefasen_trainingsstrategie die zich sterk richt op beschrijvingsvrije multimodale datageneratie, waarbij de trainingsdata geen uitgebreide afbeeldingsbeschrijvingen vereist. Bovendien omvat het model een classificator-vrije guidancesysteem dat de effectiviteit van een voken voor afbeeldingsgeneratie verhoogt. In de initiële fase heeft het MiniGPT-5-kader krachtige prestaties getoond en een aanzienlijke verbetering ten opzichte van het basismodel Divter, dat getraind is op de MMDialog-dataset, en heeft consequent aangetoond dat het multimodale uitvoer kan leveren die vergelijkbaar is met en zelfs superieur is aan de huidige basismodellen en state-of-the-art-modellen.

MiniGPT5: Een Inleiding

Met de recente ontwikkelingen van de LLM-kaders en toepassingen op basis van deze LLM-kaders, is multimediakenmerkintegratie een gebied dat een toename in populariteit heeft gezien, omdat het ook een vitale vooruitgang is die een breed scala aan toepassingen van state-of-the-art content creatie tools tot cutting-edge multimodale dialoogagenten aandrijft. Met voortdurende onderzoek en ontwikkeling zijn taal- en visiemodellen op het punt gekomen waarop werk wordt gedaan om hen in staat te stellen om zowel tekst als visuele gegevens naadloos te genereren. De mogelijkheid van LLM’s om multimodale gegevens naadloos te genereren zal helpen om interacties over verschillende domeinen, waaronder e-commerce, media en virtuele realiteit, te verbeteren.

Uiteindelijk is het doel om modellen in staat te stellen om te synthetiseren, te herkennen en te reageren op een consistente en logische manier met behulp van zowel tekstuele als visuele modaliteiten, waarmee een cruciale rol wordt gespeeld bij het harmoniseren van de stroom van informatie en het creëren van logische en consistente verhalen. De behoefte om een combinatie van tekstuele en visuele modaliteiten te bereiken, wordt voornamelijk aangedreven door de behoefte aan meer vloeibare, geïntegreerde en interactieve multimodale interacties in LLM’s en uiteindelijk het bereiken van de afwisselende taal- en visiegeneratie. Echter, het bereiken van geïntegreerde en interactieve multimodale interacties in LLM’s is een complexe taak met talrijke uitdagingen, waaronder

  1. Hoewel de huidige LLM’s extreem efficiënt en capabel zijn bij tekstgeneratie en tekst-afbeeldingsparen, leveren ze geen bevredigende prestaties bij het genereren van afbeeldingen.
  2. De ontwikkeling van deze visie- en taalmodellen is sterk afhankelijk van onderwerpspecifieke gegevens, waardoor het moeilijk is voor modellen om de gegenereerde tekst te laten aansluiten bij de corresponderende afbeeldingen.
  3. Ten slotte is er een behoefte aan meer effectieve strategieën, aangezien de geheugeneisen van LLM’s toenemen met hun capaciteiten, vooral bij het uitvoeren van downstream-taken.

Het MiniGPT-5-kader, een techniek voor taal- en visiegeneratie, introduceert het concept van “generatieve vokens” in een poging om de bovengenoemde uitdagingen aan te pakken. Het MiniGPT-5-kader stelt een nieuwe aanpak voor voor multimodale datageneratie door Large Language Models te combineren met Stable Diffusion-technieken met behulp van speciale visuele tokens. Het voorgestelde tweefasen-trainingsmethode van het MiniGPT-5-kader benadrukt het belang van een fundamentele fase zonder beschrijvingen en bereidt het model voor om efficiënte prestaties te leveren, zelfs in scenario’s met beperkte gegevens.

Maar wat het MiniGPT-5-model onderscheidt van de huidige bestaande kaders, is dat de generieke fasen van het MiniGPT-5-kader geen domeinspecifieke annotaties bevatten. Bovendien om te garanderen dat de gegenereerde tekst en de corresponderende afbeeldingen in harmonie met elkaar zijn, gebruikt het MiniGPT-5-kader een dual-loss-strategie die de aanpak van het MiniGPT-5-kader voor het gebruik van classificator-vrije guidances en generatieve vokens verder verhoogt. Het MiniGPT-5-kader optimaliseert de trainings-efficiëntie en adresseert de geheugeneisen dankzij hun parameter-efficiënte strategie voor het fijn afstemmen van het model.

Om u een snel overzicht te geven, stelt het MiniGPT-5-kader

  1. Een methode voor die multimodale encoders gebruikt die een novum en een generieke methode vormen die historisch gezien effectiever zijn gebleken dan traditionele LLM’s, en die generatieve tokens combineert met Stable Diffusion-technieken om afwisselende taal- en visuele uitvoer te genereren.
  2. Een tweefasen-trainingsstrategie voor de generatie van beschrijvingsvrije multimodale uitvoer, en de incorporatie van classificator-vrije guidances tijdens de training om de kwaliteit van de gegenereerde gegevens verder te verfijnen.

Het MiniGPT-5-model is sterk geïnspireerd op het voorgaande onderzoek en de werkzaamheden in de gebieden van

  • Tekst-naar-afbeelding-generatie: Om de transformatie van tekstuele beschrijvingen naar hun respectieve visuele voorstellingen te faciliteren, en tekst-naar-afbeeldingsmodellen.
  • MLLM’s of Multimodale Large Language Models: Het gebruik van vooraf getrainde LLM-modellen om hun toepassingen en effectiviteit bij het genereren van multimodale gegevens te onderzoeken.
  • Multimodale generatie met Large Language Models: Om de capaciteiten van een LLM te vergroten om taal- en visuele gegevens naadloos te integreren.

MiniGPT-5: Methode, Architectuur en Kader

Om Large Language Models met multimodale datageneratiecapaciteiten te faciliteren, introduceert het MiniGPT-5-model een kader dat erop gericht is om tekst-naar-afbeeldingsgeneratie-modellen en vooraf getrainde multimodale Large Language Models te integreren. Het MiniGPT-5-kader introduceert verder de “generatieve vokens”, speciale visuele tokens die ontwikkelaars in staat stellen om de discrepanties die optreden in verschillende domeinen aan te pakken door rechtstreeks te trainen op ruwe afbeeldingen. Om de kwaliteit van de multimodale gegevens die door de LLM’s worden gegenereerd verder te verhogen, introduceert het MiniGPT-5-kader een classificator-vrije strategie in combinatie met een geavanceerde tweefasen-trainingsmethode. Laten we een gedetailleerd overzicht nemen van het MiniGPT-5-kader.

Multimodale Invoerfase

De ontwikkelingen van LLM’s in de recente verleden hebben de multimodale begripscapaciteiten van LLM’s aan het licht gebracht, waardoor het verwerken van afbeeldingen als sequentiële invoer mogelijk is. Het MiniGPT-5-kader maakt gebruik van speciaal ontworpen generatieve vokens voor het uitvoeren van visuele kenmerken in een poging om de multimodale begripscapaciteiten van LLM’s uit te breiden tot multimodale datageneratie. Bovendien maakt het MiniGPT-5-kader gebruik van parameter-efficiënte en cutting-edge fijnafstemmingsmethoden voor multimodale uitvoerleren met het LLM-kader.

Multimodale Encodering

De vooraf getrainde visuele encoder in het MiniGPT-5-kader transformeert elke invoer-afbeelding in een kenmerk, en elk teksttoken wordt ingebed als een vector, en de invoer-prompt-kenmerken worden gegenereerd wanneer deze insluitingen met elkaar worden verbonden.

Toevoegen van Vokens in Large Language Models

Traditioneel bestaat de vocabulaire van een Large Language Model alleen uit tekstuele tokens, waardoor de ontwikkelaars die werkten aan het MiniGPT-5-kader de kloof tussen de generatieve en de traditionele LLM’s moesten overbruggen. Het MiniGPT-5-kader introduceert een set speciale tokens als generatieve tokens in de vocabulaire van de LLM. Het kader maakt vervolgens gebruik van de verborgen uitvoertoestand van de LLM voor deze speciale vokens voor latere afbeeldingsgeneratie, en de invoeging van afwisselende afbeeldingen wordt weergegeven door de positie van de vokens.

PEFT of Parameter-Efficiënte Fijnafstemming

PEFT of Parameter-Efficiënte Fijnafstemming is een cruciaal concept dat wordt gebruikt om LLM’s te trainen, en nog steeds is de toepassing van PEFT in multimodale instellingen grotendeels onverkend. Het MiniGPT-5-kader gebruikt de Parameter-Efficiënte Fijnafstemming over de encoder van het MiniGPT-4-kader om het model te trainen om prompts of instructies beter te begrijpen en om de algehele prestaties van het model in een zero-shot- of nieuwe omgeving te verbeteren.

Multimodale Uitvoergeneratie

Om het generatieve model met de generatieve tokens nauwkeurig uit te lijnen, formuleert het MiniGPT-5-kader een compacte mapping-module voor het uitlijnen van de dimensies en het incorporeren van supervisory-verlies, waaronder latent diffusie-verlies en tekst-ruimte-verlies. Het latent diffusie-supervisory-verlies lijnt de visuele kenmerken rechtstreeks uit met de tokens, terwijl het tekst-ruimte-verlies het model helpt om de correcte posities van de tokens te leren. Omdat de generatieve vokens in het MiniGPT-5-kader rechtstreeks worden geleid door de afbeeldingen, heeft het MiniGPT-5-kader geen uitgebreide beschrijvingen van afbeeldingen nodig, waardoor een beschrijvingsvrije leeromgeving ontstaat.

Tekst-ruimtegeneratie

Het MiniGPT-5-kader volgt de causale taalmodelleringmethode om zowel vokens als teksten in de tekst-ruimte gezamenlijk te genereren, en tijdens de trainingsfase voegen de ontwikkelaars de vokens toe aan de positie van de grondwaarheidsafbeeldingen en trainen ze het model om vokens te voorspellen bij tekstgeneratie.

Mapping van Voken-kenmerken voor Afbeeldingsgeneratie

Nadat de tekst-ruimte is gegenereerd, lijnt het kader de verborgen uitvoertoestand uit met de tekst-conditionele kenmerkruimte van het tekst-naar-afbeeldingsgeneratiemodel. Het kader ondersteunt ook een feature-mapper-module die een dual-laags MLP-model, een leerbaar decoder-kenmerkensequentie en een vierlaags encoder-decoder-transformermodel bevat.

Afbeeldingsgeneratie met LDM of Latent Diffusie Model

Om de benodigde afbeeldingen in het denoiseringsproces te genereren, gebruikt het kader de mapping-kenmerken als conditionele invoer. Het kader maakt ook gebruik van een LDM of Latent Diffusie Model voor guidances, aangezien het grondwaarheidsbeeld tijdens de trainingsfase eerst wordt omgezet in een latent kenmerk met behulp van een vooraf getrainde VAE, waarna de ontwikkelaars het latent ruiskenmerk verkrijgen door enige ruis toe te voegen.

De uitgebreide aanpak die door het MiniGPT-5-kader wordt gebruikt, stelt ontwikkelaars in staat om een coherent begrip en generatie van zowel visuele als tekstuele elementen te hebben, met behulp van gespecialiseerde tokens, het benutten van de capaciteiten van vooraf getrainde modellen en het gebruik van innovatieve trainingsmethoden.

MiniGPT-5: Training en Resultaten

Toen de ontwikkelaars aan het MiniGPT-5-kader werkten, zagen ze dat het trainen op een beperkte afwisselende tekst- en afbeeldingsdataset rechtstreeks kan resulteren in afbeeldingen van verminderde kwaliteit en misalignement, gezien de significante domeinverschuiving tussen de afbeeldings- en tekstdomeinen. Om dit probleem te mitigeren, hebben de ontwikkelaars twee afzonderlijke trainingsstrategieën geadopteerd,

  1. Het incorporeren van classificator-vrije guidancetechnieken die de effectiviteit van generatieve tokens tijdens het diffusieproces verhogen.
  2. De tweede strategie is verder onderverdeeld in twee fasen
    1. Een initiële voortrainingsfase die zich richt op het uitlijnen van grove kenmerken.
    2. Een fijnafstemmingsfase die kenmerkleren faciliteert.

CFG of Classificator-Vrije Guidances

Het idee om eerst CFG te gebruiken voor multimodale generatie kwam voort uit een poging om de consistentie en logica tussen de gegenereerde afbeeldingen en teksten te verhogen, en de CFG wordt geïntroduceerd tijdens het tekst-naar-afbeeldingsdiffusieproces. Deze methode observeert dat door te trainen op zowel onvoorwaardelijke als voorwaardelijke generatie met conditionele dropout, het generatieve model verbeterde voorwaardelijke resultaten kan bereiken.

Tweefasen-Trainingsstrategie

Gezien de significante domeinverschuiving tussen tekst-afbeeldingsgeneratie en pure tekstgeneratie, gebruikt het MiniGPT-5-kader een tweefasenstrategie voor training

  1. Unimodale Uitlijningsfase of UAS,
  2. Multimodale Leerfase of MLS.

Aanvankelijk lijnt het kader de afbeeldingsgeneratiekenmerken uit met de vokenkenmerken in enkelvoudige tekst-afbeeldingsdatasets, waarbij elke gegevenssample slechts één tekst en één afbeelding bevat, en de tekst meestal de afbeeldingsbijschrift is. In deze fase stelt het kader de LLM in staat om vokens te genereren door bijschriften als LLM-invoer te gebruiken.

Zodra de UAS met succes is uitgevoerd, kan het model afbeeldingen genereren voor enkelvoudige tekstbeschrijvingen, maar heeft moeite met afwisselende taal- en visiegeneratie, waaronder tekst-afbeeldingsparen, en complicatievere redenering is vereist voor afbeeldings- en tekstgeneratie. Om deze hindernis te overwinnen, hebben de ontwikkelaars het MiniGPT-5-kader verder fijn afgestemd met behulp van PEFT-parameters door afwisselende visie- en taaldatasets zoals VIST. Tijdens deze fase construeert het kader drie verschillende taken van de dataset

  1. Tekst-Alleen-Generatie: Genereert de gerelateerde tekst gegeven de volgende afbeelding.
  2. Afbeelding-Alleen-Generatie: Genereert de gerelateerde afbeelding gegeven de volgende tekst.
  3. Multimodale Generatie: Genereert tekst-afbeeldingsparen met behulp van de gegeven context.

MiniGPT-5: Benchmarks en Resultaten

Om de prestaties in multimodale generatie grondig te evalueren, vergelijkt het MiniGPT-5-ontwikkelteam de prestaties met andere prominente basismodellen, waaronder Divter, GILL en het fijn afgestemde Unimodale Generatiemodel, en de vergelijking wordt getoond in de onderstaande tabel.

Het MiniGPT-5-kader begrijpt dat de multimodale uitvoer zinvol kan zijn in de context, maar kan afwijken van de grondwaarheid, wat de primaire reden is waarom het MiniGPT-5-kader ook menselijke invoer incorporeert om de prestaties van het model te evalueren en te beoordelen. Algemeen wordt de effectiviteit van het MiniGPT-5-kader voor multimodale taken gemeten vanuit drie perspectieven.

  1. Taalcontinuïteit: het beoordelen of de gegenereerde inhoud naadloos aansluit bij de gegeven context.
  2. Afbeeldingskwaliteit: het beoordelen of evalueren van de relevantie en duidelijkheid van de gegenereerde afbeelding.
  3. Multimodale Coherentie: om te bepalen of de gecombineerde tekst-afbeeldingsuitvoer in overeenstemming is met de initiële context.

VIST Eindstap-Evaluatie

In de eerste fase van de experimenten, stelt het MiniGPT-5-kader zich ten doel om de corresponderende afbeeldingen te genereren, en de onderstaande tabel vat de resultaten samen die zijn verkregen uit deze instelling.

Zoals te zien is, kan het MiniGPT-5-kader in alle drie de instellingen de fijn afgestemde SD2 uitvoeren, waarmee de effectiviteit van de MiniGPT-5-pijplijn wordt aangetoond.

De bovenstaande figuur vergelijkt de prestaties van het MiniGPT-5-kader met het fijn afgestemde MiniGPT-4-kader op de S-BERT, Rouge-L en Meteor-prestatiekenmerken. De resultaten geven aan dat het gebruik van generatieve vokens de prestaties van het kader niet negatief beïnvloedt bij het uitvoeren van multimodale begripsTaken. De resultaten tonen ook aan dat het MiniGPT-5-kader in staat is om lange horizontale multimodale invoer-prompts over een breed scala aan gegevens te gebruiken om hoge-kwaliteit- en coherente afbeeldingen te genereren zonder de capaciteiten van het oorspronkelijke model voor multimodale begrip te compromitteren.

De bovenstaande tabel vergelijkt de prestaties van drie kaders op 5.000 samples voor multimodale generatie vanuit de aspecten van Multimodale Coherentie, Afbeeldingskwaliteit en Taalcontinuïteit. Zoals te zien is, overtreft het MiniGPT-5-kader de andere twee basismodellen in meer dan 70% van de gevallen. Aan de andere kant toont de onderstaande tabel de prestaties van het MiniGPT-5-kader op de CC3M-validatiedataset voor de generatie van enkelvoudige afbeeldingen. Vanwege gegevensbeperkingen vonden de ontwikkelaars een kloof voor voken-uitlijning bij het gebruik van Stable Diffusie. Ondanks deze beperking overtreft het MiniGPT-5-kader het huidige state-of-the-art-basismodel GILL over alle kenmerken.

Conclusie

In dit artikel hebben we het over MiniGPT-5, een techniek voor taal- en visiegeneratie die het concept van “generatieve vokens” introduceert in een poging om de capaciteiten van LLM’s te benutten om multimodale gegevens te genereren door het grote taalmodel uit te lijnen met een tekst-naar-afbeeldingsgeneratiemodel dat vooraf is getraind. We hebben het over de essentiële componenten en de algehele architectuur van het MiniGPT-5-kader gesproken, evenals de resultaten die aanzienlijke verbeteringen in prestaties en efficiëntie aantonen in vergelijking met de huidige basismodellen en state-of-the-art-modellen. MiniGPT-5 streeft ernaar om een nieuwe benchmark te zetten in het multimodale inhouds- en gegevensgeneratiedomein en om de uitdagingen aan te pakken die door eerdere modellen worden geconfronteerd bij het proberen om hetzelfde probleem op te lossen.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.