AI-modeller og platforme

MiniGPT-5: Interleaveret Vision-And-Language Generation via Generative Vokens

mm
Føj Unite.AI til dine foretrukne kilder på Google

Over de sidste få år har Large Language Models (LLM’er) fået opmærksomhed fra AI-udviklere verden over på grund af gennembrud i Natural Language Processing (NLP). Disse modeller har sat nye standarder for tekstgenerering og forståelse. Men selvom der er sket fremskridt i tekstgenerering, er det stadig en udfordring at producere billeder, der sammenhænger med tekstuelle fortællinger. For at løse dette problem har udviklere introduceret en innovativ vision og sproggenereringsmetode baseret på “generative vokens”, der brobygger gapet for harmoniserede tekst-billede-outputs.

Baggrunden for MiniGPT-5 er en to-trinsstrategi, der fokuserer på beskrivelsesfri multimodal datagenerering, hvor træningsdata ikke kræver nogen omfattende billedbeskrivelser. Desuden inkorporerer modellen en klassificator-fri vejledningssystem, der forbedrer effektiviteten af en voken til billedgenerering. I den første fase har MiniGPT-5-rammen demonstreret kraftfuld præstation og en betydelig forbedring over baseline- Divter-modellen, der er trænet på MMDialog-datasættet, og har konsekvent demonstreret sin evne til at levere sammenlignelige og endda overlegne multimodale outputs i menneskelige evalueringer udført på VIST-datasættet, hvilket yderligere fremhæver dens præstation og effektivitet på tværs af forskellige benchmarks.

MiniGPT5: En Introduktion

Med de seneste udviklinger af LLM-rammer og applikationer baseret på disse LLM-rammer, er multimediaindtægtsintegration et felt, der har oplevet en stigning i popularitet, da det også viser sig at være en vital fremgang, der driver en bred vifte af applikationer fra state-of-the-art-indholdsskabende værktøjer til avancerede multimodale dialogagenter. Med kontinuerlig forskning og udvikling er sprog- og visionsmodeller nået til et punkt, hvor arbejdet går på at facilitere dem til at generere både tekst og visuel data sammenhængende. Evnen til LLM til at generere multimodal data sammenhængende vil hjælpe med at forbedre interaktioner på tværs af forskellige domæner, herunder e-handel, medier og virtuel virkelighed.

Ultimo, er målet at tillade modellerne at syntetisere, genkende og reagere på en sammenhængende og logisk måde ved hjælp af både tekstuelle og visuelle modaliteter, og spiller dermed en afgørende rolle i at harmonisere informationsflowet og skabe logiske og sammenhængende fortællinger. Behovet for at opnå en blanding af tekstuelle og visuelle modaliteter er primært drevet af behovet for mere flydende, integrerede og interaktive multimodale interaktioner i LLM’er, og ultimativt opnående den alternende sprog- og visionsgenerering. Men at opnå integrerede og interaktive multimodale interaktioner i LLM’er er en kompliceret opgave, der er omgivet af talrige udfordringer, herunder

  1. Selvom nuværende LLM’er er ekstremt effektive og kapable, når det kommer til tekstgenerering og tekst-billede-par, leverer de ikke tilfredsstillende præstation, når det kommer til billedgenerering.
  2. Udviklingen af disse visions- og sprogmodeller afhænger tungt af emnefokuseret data, hvilket gør det vanskeligt for modellerne at alignere den genererede tekst med dens respektive billeder.
  3. Endelig er der behov for at komme med mere effektive strategier, da deres krav til hukommelse øges, især når de udfører downstream-opgaver.

MiniGPT-5-rammen, en interleaveret sprog- og visionsgenereringsalgoritmeteknik, introducerer begrebet “generative vokens” i et forsøg på at løse de nævnte udfordringer. MiniGPT-5-rammen foreslår en ny tilgang til multimodal datagenerering ved at kombinere Large Language Models med Stable Diffusion-teknikker ved hjælp af speciale visuelle tokens. Den foreslåede to-trinsstrategi, der anvendes af MiniGPT-5-rammen, fremhæver betydningen af en grundlæggende fase, der er fri for beskrivelser, og forbereder modellen til at levere effektiv præstation, selv i scenarier med begrænsede data.

Men hvad adskiller MiniGPT-5-modellen fra nuværende eksisterende rammer er, at de generiske faser af MiniGPT-5-rammen ikke består af domænespecifikke annoteringer. Desuden, for at sikre, at den genererede tekst og dens respektive billeder er i harmoni med hinanden, anvender MiniGPT-5-rammen en dual-loss-strategi, der yderligere forbedrer MiniGPT-5’s tilgang til at anvende klassificator-fri vejledning og generative vokens. MiniGPT-5-rammen optimerer trænings-effektiviteten og løser hukommelsesbegrænsningerne takket være deres parameter-effektive strategi for finjustering af modellen.

For at give dig en hurtig oversigt, foreslår MiniGPT-5-rammen

  1. En metode, der anvender multimodale encodere, der repræsenterer en ny og generisk metode, der historisk har vist sig at være mere effektiv end traditionelle LLM’er, og anvender generative tokens kombineret med Stable Diffusion-teknikker til at generere interleaverede sprog- og visuelle outputs.
  2. En to-trinsstrategi for generering af beskrivelsesfri multimodal output, og inklusion af klassificator-fri vejledning under træning for yderligere at forbedre kvaliteten af den genererede data.

MiniGPT-5-modellen er inspireret af tidligere forskning og arbejde i felterne

  • Text til Billede-Generering: For at faciliterer transformationen af tekstuelle beskrivelser til deres respektive visuelle repræsentationer, og tekst til billed-modeller.
  • MLLM’er eller Multimodale Large Language Models: Anvendelse af forudtrænede LLM-modeller til at udforske deres anvendelser og effektivitet i generering af multimodal data.
  • Multimodal Generering med Large Language Models: For at udvide kapaciteten af en LLM til at integrere sprog- og visuel datagenerering sammenhængende.

MiniGPT-5: Metode, Arkitektur og Ramme

For at facilitere Large Language Models med multimodal datagenereringskapaciteter, introducerer MiniGPT-5-rammen en ramme, der sigter på at integrere tekst til billed-genereringsmodeller og forudtrænede multimodale Large Language Models. MiniGPT-5-rammen introducerer desuden “generative vokens”, speciale visuelle tokens, der tillader udviklere at løse diskrepanser, der opstår på tværs af forskellige domæner, ved at kunne træne direkte på rå billeder. For yderligere at forbedre kvaliteten af den multimodale data, der genereres af LLM’er, introducerer MiniGPT-5-rammen en klassificator-fri strategi kombineret med en avanceret to-trinsstrategi.

Multimodal Indput-Stage

Udviklingen af LLM’er i den seneste tid har bragt LLM’ers multimodale forståelsesevner til lyset, og muliggjort behandling af billeder som sekventielle input. MiniGPT-5-rammen anvender speciale designede generative vokens til at outputte visuelle funktioner i et forsøg på at udvide LLM’ers multimodale forståelsesevner til multimodal datagenerering. Desuden anvender MiniGPT-5-rammen parameter-effektive og avancerede finjusteringsteknikker til multimodal output-læring med LLM-rammen.

Multimodal Encoding

Den forudtrænede visuelle encoder i MiniGPT-5-rammen transformerer hver input-billede til en funktion, og hver tekst-token er indlejret som en vektor, og input-prompt-funktionerne genereres, når disse indlejring er kombineret med hinanden.

Tilføjelse af Vokens i Large Language Models

Traditionelt består Large Language Model-vokabularet kun af tekstuelle tokens, og udviklerne af MiniGPT-5-rammen har derfor måttet brobygge gapet mellem den generative og den traditionelle LLM. MiniGPT-5-rammen introducerer en sæt af speciale tokens som generative tokens i LLM’ens vokabular. Rammen anvender herefter den skjulte output-tilstand af LLM’en for disse speciale vokens til efterfølgende billedgenerering, og indsættelsen af interleaverede billeder repræsenteres af positionen af vokens.

PEFT eller Parameter-Effektiv Finjustering

PEFT eller Parameter-Effektiv Finjustering er et afgørende begreb, der anvendes til at træne LLM’er, og dog er anvendelsen af PEFT i multimodale sammenhænge stadig uudforsket i en ret stor udstrækning. MiniGPT-5-rammen anvender Parameter-Effektiv Finjustering over encoderen i MiniGPT-4-rammen for at træne modellen til at forstå instruktioner bedre og forbedre modellens præstation i en zero-shot eller ny omgang.

Multimodal Output-Generering

For at aligne genereringsmodellen med generative tokens nøjagtigt, formulerer MiniGPT-5-rammen en kompakt mappingsmodul til at matche dimensionerne og inkorporere supervisory-loss, herunder latent diffusion model-loss og tekst-rum-loss. Den latente diffusion-supervisory-loss aligner de passende visuelle funktioner med tokens direkte, mens tekst-rum-loss hjælper modellen med at lære den korrekte position af tokens. Da generative vokens i MiniGPT-5-rammen er guidet direkte af billederne, har MiniGPT-5-rammen ikke brug for billeder at have en omfattende beskrivelse, hvilket resulterer i en beskrivelsesfri læring.

Tekst-Rum-Generering

MiniGPT-5-rammen følger den kausale sprog-modelering til at generere både vokens og tekst i tekst-rummet sammen, og under træningsfasen appendes vokens til positionen af ground truth-billederne, og trænes modellen til at forudsige vokens under tekstgenerering.

Mapping Voken-Funktioner til Billede-Generering

Efter generering af tekst-rummet, aligner rammen den skjulte output-tilstand med tekst-til-billede-genereringsmodellens tekst-betinget funktion-rum. Rammen understøtter desuden en feature-mapper-modul, der inkluderer en dual-layer MLP-model, en lærbart decoder-funktion-sekvens og en fire-lag encoder-decoder-transformer-model.

Billede-Generering med LDM eller Latent Diffusion Model

For at generere de nødvendige billeder i den afrensning, anvender rammen mappings-funktionerne som en betinget input. Rammen anvender desuden en LDM eller Latent Diffusion Model til vejledning, da under træningsfasen konverteres ground truth-billedet først til en latent funktion ved hjælp af en forudtrænet VAE, hvorefter udviklerne får den latente støj-funktion ved at tilføje noget støj.

Den omfattende tilgang, der er anvendt i MiniGPT-5-rammen, giver udviklerne mulighed for at have en sammenhængende forståelse og generering af både visuelle og tekstuelle elementer, ved hjælp af specialdesignede tokens, udnyttelse af forudtrænede modellers kapaciteter og anvendelse af innovative trænings-teknikker.

MiniGPT-5: Træning og Resultater

Da udviklerne arbejdede på MiniGPT-5-rammen, observerede de, at træning på et begrænset interleaveret tekst- og billed-datasæt direkte kan resultere i billeder med reduceret kvalitet og misaligneret, på grund af den betydelige domæne-skift mellem billed- og tekst-domæner. For at afhjælpe dette problem, anvendte udviklerne to distinkte træningsstrategier,

  1. Inklusion af klassificator-fri vejledningsteknikker, der forbedrer effektiviteten af generative tokens under diffusionen.
  2. Den anden strategi er yderligere opdelt i to faser
    1. En initial for-træningsfase, der fokuserer primært på at alignere grove funktioner.
    2. En finjusteringsfase, der faciliterer funktion-læring.

CFG eller Klassificator-Fri Vejledning

Ideën om at anvende CFG til multimodal generering kom som en følge af et forsøg på at forbedre konsistens og logik mellem de genererede billeder og tekst, og CFG introduceres under tekst-til-billede-diffusionen. Denne metode observerer, at ved at træne på både ubetinget og betinget generering med betinget dropout, kan genereringsmodellen opnå forbedrede betingede resultater.

To-Trins-Træningsstrategi

På grund af den betydelige domæne-skift mellem tekst-billede-generering og ren tekstgenerering, anvender MiniGPT-5-rammen en to-trins-strategi til træning

  1. Unimodal Alignment Stage eller UAS,
  2. Multimodal Læring Stage eller MLS.

Initialt aligner rammen billed-genereringsfunktionerne med voken-funktionen i enkelt tekst-billede-par-datasæt, hvor hver datasæt kun indeholder en tekst og et billede, og teksten normalt er billedets beskrivelse. I denne fase tillader rammen LLM’en at generere vokens ved at anvende beskrivelser som LLM-input.

Når UAS er udført succesfuldt, kan modellen generere billeder for enkelt tekstbeskrivelser, men har svært ved at generere interleaveret sprog- og visionsgenerering, herunder tekst-billede-par og kompliceret resonnering. For at tackle denne udfordring har udviklerne yderligere finjusteret MiniGPT-5-rammen ved hjælp af PEFT-parametre ved hjælp af interleaveret vision- og sprog-datasæt som VIST. Under denne fase konstruerer rammen tre forskellige opgaver fra datasættet

  1. Tekst Kun-Generering: Genererer den relaterede tekst, givet det næste billede.
  2. Billede Kun-Generering: Genererer det relaterede billede, givet den næste tekst.
  3. Multimodal Generering: Genererer tekst-billede-par ved hjælp af den givne kontekst.

MiniGPT-5: Benchmarks og Resultater

For at evaluere dens præstation i multimodal generering omfattende, sammenligner MiniGPT-5-udviklingsholdet dens præstation med andre prominente baseline-modeller, herunder Divter, GILL og den finjusterede Unimodale Genereringsmodel, og sammenligningen vises i tabellen nedenfor.

MiniGPT-5-rammen forstår, at den multimodale output kan være meningsfuld i konteksten, men kan afvige fra den virkelige verden, hvilket er den primære grund til, at MiniGPT-5-rammen også inkorporerer menneskelige input til at evaluere og vurderer modellens præstation. Samlet set vurderes effektiviteten af MiniGPT-5-rammen til multimodale opgaver ud fra tre perspektiver.

  1. Sprog-Kontinuitet: Vurderer, om den genererede indhold aligner med den givne kontekst sammenhængende.
  2. Billede-Kvalitet: Vurderer eller evaluerer relevansen og klaren af det genererede billede.
  3. Multimodal Kohærens: Bestemmer, om den kombinerede tekst-billede-output er i harmoni med den initiale kontekst.

VIST Finalet-Trin-Evaluering

I den første fase af eksperimenterne, sigter MiniGPT-5-rammen på at generere de respektive billeder, og tabellen nedenfor summerer resultaterne fra denne indstilling.

Som det kan ses, kan MiniGPT-5-rammen i alle tre indstillinger overgå den finjusterede SD2-ramme, hvilket fremhæver effektiviteten af MiniGPT-5-pipeline.

Figuren ovenfor sammenligner præstationen af MiniGPT-5-rammen med den finjusterede MiniGPT-4-ramme på S-BERT, Rouge-L og Meteor-præstationsmetrikker. Resultaterne indikerer, at anvendelsen af generative vokens ikke påvirker rammen negativt, når det kommer til at udføre multimodale forståelsesopgaver. Resultaterne viser desuden, at MiniGPT-5-rammen kan anvende lange-horisontale multimodale input-prompter på tværs af et bredt datasæt til at generere højkvalitets- og sammenhængende billeder uden at kompromittere den oprindelige modells evne til multimodal forståelse.

Tabellen ovenfor sammenligner præstationen af tre rammer på 5.000 eksempler til multimodal generering fra aspekterne Multimodal Kohærens, Billede-Kvalitet og Sprog-Kontinuitet. Som det kan ses, overgår MiniGPT-5-rammen de to andre baseline-modeller i mere end 70% af tilfældene. På den anden side viser tabellen nedenfor præstationen af MiniGPT-5-rammen på CC3M-valideringsdatasættet til generering af enkelt billeder. Takket være data-begrænsninger fandt udviklerne en gap for voken-alignment, når de anvendtes med Stable Diffusion. Trods denne begrænsning overgår MiniGPT-5-rammen den nuværende tilstand af kunst baseline GILL-ramme på alle metrikker.

Konklusion

I denne artikel har vi talt om MiniGPT-5, en interleaveret sprog- og visionsgenereringsalgoritmeteknik, der introducerer begrebet “generative vokens” i et forsøg på at udnytte kapaciteten af LLM’er til at generere multimodal data ved at alignere den store sprogmodel med en tekst-til-billede-genereringsmodel, der er forudtrænet. Vi har talt om de essentielle komponenter og den overordnede arkitektur af MiniGPT-5-rammen samt resultaterne, der indikerer betydelige forbedringer i præstation og effektivitet i forhold til nuværende baseline- og tilstandsmodeller. MiniGPT-5 sigter på at sætte en ny standard i multimodal indhold- og datagenereringsdomænet og har til formål at løse udfordringerne, som tidligere modeller har mødt, når de forsøger at løse det samme problem.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.