AI-modeller og plattformer

Visuell Autoregressiv Modellering: Skalerbar Bildegenerering via Next-Scale Prediksjon

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Introduksjonen av GPT-modeller, sammen med andre autoregressive eller store sprÃĨkmodeller, har ÃĨpnet en ny ÃĶra i maskinlÃĶring og kunstig intelligens. GPT og autoregressive modeller viser ofte generell intelligens og fleksibilitet som regnes som et viktig skritt mot generell kunstig intelligens eller AGI, selv om de har noen problemer som hallucinasjoner. Det mystiske problemet med disse store modellene er en selvovervÃĨkende lÃĶringstrategi som tillater modellen ÃĨ forutsi neste token i en sekvens, en enkel men effektiv strategi. Nyere arbeider har vist suksessen til disse store autoregressive modellene, og hÃļylysning deres generaliserbarhet og skalerbarhet. Skalerbarhet er et typisk eksempel pÃĨ eksisterende skaleringslover som tillater forskerne ÃĨ forutsi ytelsen til den store modellen fra ytelsen til mindre modeller, noe som resulterer i bedre ressursallokering. PÃĨ den andre siden er generaliserbarhet ofte bevist ved lÃĶringstrategier som nullskudd, enkelt-skudd og fÃĨ-skudd lÃĶring, og hÃļylysning evnen til ubetretningslÃĶrte modeller til ÃĨ tilpasse seg ulike og uante oppgaver. Sammen avslÃļrer generaliserbarhet og skalerbarhet potensialet til autoregressive modeller til ÃĨ lÃĶre fra en stor mengde ulabelt data.

Bygging pÃĨ dette, i denne artikkelen vil vi snakke om Visuell Autoregressiv eller VAR-rammeverket, et nytt generasjonsmÃļnster som omdefinerer autoregressiv lÃĶring pÃĨ bilder som grov-til-fine “neste-resolusjons prediksjon” eller “neste-skala prediksjon”. Selv om det er enkelt, er tilnÃĶrmingen effektiv og tillater autoregressive transformatorer ÃĨ lÃĶre visuelle distribusjoner bedre, og forbedret generaliserbarhet. Videre tillater Visuell Autoregressiv-modellene GPT-liknende autoregressive modeller ÃĨ overgÃĨ diffusjonsmodeller i bildegenerering for fÃļrste gang. Eksperimenter indikerer ogsÃĨ at VAR-rammeverket forbedrer autoregressive baseline betydelig, og overgÃĨr Diffusjonstransformator eller DiT-rammeverket i flere dimensjoner, inkludert dataeffektivitet, bildekvalitet, skalerbarhet og inferenshastighet. Videre viser skaleringsopphÃļyning av Visuell Autoregressiv-modellene kraftlov-skaleringslover som ligner pÃĨ de som er observert med store sprÃĨkmodeller, og viser ogsÃĨ nullskudd generaliserbarhetsevne i nedstrÃļmsoppgaver, inkludert redigering, innmalings- og utmalingsoppgaver.

Denne artikkelen har til hensikt ÃĨ dekke Visuell Autoregressiv-rammeverket i dybden, og vi utforsker mekanismen, metodologien, arkitekturen til rammeverket sammen med dens sammenligning med state-of-the-art-rammeverk. Vi vil ogsÃĨ snakke om hvordan Visuell Autoregressiv-rammeverket demonstrerer to viktige egenskaper til LLM-er: Skaleringslover og nullskudd generaliserbarhet. SÃĨ la oss begynne.

Visuell Autoregressiv Modellering: Skalerbar Bildegenerering

En vanlig mÃļnster blant nyere store sprÃĨkmodeller er implementeringen av en selvovervÃĨkende lÃĶringstrategi, en enkel men effektiv tilnÃĶrming som forutsier neste token i sekvensen. Takk til tilnÃĶrmingen har autoregressive og store sprÃĨkmodeller i dag demonstrert bemerkelsesverdig skalerbarhet og generaliserbarhet, egenskaper som avslÃļrer potensialet til autoregressive modeller til ÃĨ lÃĶre fra en stor mengde ulabelt data, og sammenfatter essensen av Generell Kunstig Intelligens. Videre har forskere i datavisjonsfeltet arbeidet parallelt for ÃĨ utvikle store autoregressive eller verdensmodeller med mÃĨlet ÃĨ matche eller overgÃĨ deres imponerende skalerbarhet og generaliserbarhet, med modeller som DALL-E og VQGAN som allerede har demonstrert potensialet til autoregressive modeller i bildegenerering. Disse modellene implementerer ofte en visuell tokenisator som representerer eller approksimerer kontinuerlige bilder i en grid av 2D-tokens, som deretter flates ut i en 1D-sekvens for autoregressiv lÃĶring, og speiler dermed den sekvensielle sprÃĨkmodellprosessen.

Imidlertid har forskerne ennÃĨ ikke utforsket skaleringslovene til disse modellene, og hva som er mer frustrerende er det faktum at ytelsen til disse modellene ofte ligger bak diffusjonsmodeller med en betydelig margin, som demonstrert i fÃļlgende bilde. Gapet i ytelse indikerer at nÃĨr sammenlignet med store sprÃĨkmodeller, er evnene til autoregressive modeller i datavisjon underutforsket.

PÃĨ den ene siden krever tradisjonelle autoregressive modeller en definert rekkefÃļlge av data, mens pÃĨ den andre siden omdefinerer Visuell Autoregressiv eller VAR-modellen hvordan man bestiller en bilde, og dette er hva som skille VAR fra eksisterende AR-metoder. Vanligvis skaper eller oppfatter mennesker et bilde pÃĨ en hierarkisk mÃĨte, ved ÃĨ fange den globale strukturen fulgt av lokale detaljer, en multi-skala, grov-til-fine tilnÃĶrming som foreslÃĨr en rekkefÃļlge for bildet naturlig. Videre, ved ÃĨ dra inspirasjon fra multi-skala design, definerer VAR-rammeverket autoregressiv lÃĶring for bilder som neste-skala prediksjon i motsetning til konvensjonelle tilnÃĶrminger som definerer lÃĶringen som neste-token prediksjon. TilnÃĶrmingen implementert av VAR-rammeverket starter med ÃĨ kode et bilde inn i multi-skala token-kart. Rammeverket starter deretter den autoregressive prosessen fra 1×1 token-kartet og utvider i opplÃļsning progressivt. PÃĨ hver trinn, forutsier transformatoreren neste hÃļyere opplÃļsning token-kart betinget pÃĨ alle tidligere, en metode som VAR-rammeverket refererer til som VAR-modellering.

VAR-rammeverket forsÃļker ÃĨ utnytte transformatorarkitekturen til GPT-2 for visuell autoregressiv lÃĶring, og resultater er synlige pÃĨ ImageNet-benchmarket hvor VAR-modellen forbedrer sin AR-baseline betydelig, og oppnÃĨr en FID pÃĨ 1,80, og en oppfinnelsesscore pÃĨ 356, sammen med en 20x forbedring i inferenshastighet. Hva som er enda mer interessant er at VAR-rammeverket klarer ÃĨ overgÃĨ ytelsen til DiT eller Diffusjonstransformator-rammeverket i termer av FID- og IS-poeng, skalerbarhet, inferenshastighet og dataeffektivitet. Videre viser Visuell Autoregressiv-modellen sterke skaleringslover som ligner pÃĨ de som er observert i store sprÃĨkmodeller.

For ÃĨ sammenfatte, forsÃļker VAR-rammeverket ÃĨ bidra med fÃļlgende.

  1. Det foreslÃĨr et nytt visuelt generativt rammeverk som bruker en multi-skala autoregressiv tilnÃĶrming med neste-skala prediksjon, i motsetning til den tradisjonelle neste-token prediksjon, noe som resulterer i ÃĨ designe den autoregressive algoritmen for datavisjonsoppgaver.
  2. Det forsÃļker ÃĨ validere skaleringslover for autoregressive modeller sammen med nullskudd generaliserbarhetspotensiale som emulerer de tiltalende egenskapene til LLM-er.
  3. Det tilbyr et gjennombrudd i ytelsen til visuelle autoregressive modeller, og muliggjÃļr GPT-liknende autoregressive rammeverk til ÃĨ overgÃĨ eksisterende diffusjonsmodeller i bildegenerering for fÃļrste gang.

Videre er det ogsÃĨ viktig ÃĨ diskutere de eksisterende kraftlov-skaleringslovene som matematisk beskriver forholdet mellom datasettstÃļrrelser, modellparametere, ytelsesforbedringer og beregningsressurser til maskinlÃĶringsmodeller. FÃļrst tillater disse kraftlov-skaleringslovene ÃĨ bruke en stÃļrre modells ytelse ved ÃĨ skale opp modellstÃļrrelsen, beregningskostnaden og datamengden, og sparer unÃļdvendige kostnader og allokerer treningbudsjettet ved ÃĨ gi prinsipper. Andre, har skaleringslovene demonstrert en konsistent og ikke-mettende Ãļkning i ytelse. Ved ÃĨ gÃĨ videre med prinsippene til skaleringslovene i neurale sprÃĨkmodeller, har flere LLM-er inkorporert prinsippet om at ÃĨ Ãļke modellskalaen tenderer ÃĨ resultere i forbedrede ytelsesresultater. Nullskudd generaliserbarhet pÃĨ den andre siden refererer til evnen til en modell, spesielt en LLM, til ÃĨ utfÃļre oppgaver den ikke er trent pÃĨ eksplisitt. Innenfor datavisjonsdomenet er interessen for ÃĨ bygge inn nullskudd og kontekstlÃĶringsevner til grunnmodeller.

SprÃĨkmodeller avhenger av WordPiece-algoritmer eller Byte Pair Encoding-tilnÃĶrming for teksttokenisering. Visuelle genereringsmodeller basert pÃĨ sprÃĨkmodeller avhenger ogsÃĨ tungt av ÃĨ kode 2D-bilder inn i 1D-token sekvenser. Tidlige arbeider som VQVAE demonstrerte evnen til ÃĨ representere bilder som diskrete tokens med moderat rekonstruksjonskvalitet. Arvtakeren til VQVAE, VQGAN-rammeverket, inkorporerte perseptuelle og adversarielle tap for ÃĨ forbedre bildefideliteten, og brukte ogsÃĨ en decoder-bare transformator til ÃĨ generere bilde-tokens i standard raster-scan autoregressiv mÃĨte. Diffusjonsmodeller pÃĨ den andre siden har lenge vÃĶrt regnet som frontlÃļpere for visuelle synteseoppgaver, takket vÃĶre deres diversitet og overlegne genereringskvalitet. Fremgangen i diffusjonsmodeller har vÃĶrt sentrert rundt ÃĨ forbedre samplingsteknikker, arkitektoniske forbedringer og raskere sampling. Latente diffusjonsmodeller anvender diffusjon i latente rommet, og forbedrer treningseffektiviteten og inferensen. Diffusjonstransformator-modeller erstatter den tradisjonelle U-Net-arkitekturen med en transformator-basert arkitektur, og har vÃĶrt deployert i nyere bilde- eller videosyntese-modeller som SORA og Stable Diffusion.

Visuell Autoregressiv: Metodologi og Arkitektur

I kjernen har VAR-rammeverket to separate treningstadier. I det fÃļrste stadiet, en multi-skala kvantisert autoencoder eller VQVAE, koder et bilde inn i token-kart, og en sammensatt rekonstruksjonsfeil implementeres for trening. I figuren ovenfor, er innlejring et ord som definerer konvertering av diskrete tokens til kontinuerlige innlejningsvektorer. I det andre stadiet, er transformatoreren i VAR-modellen trent ved ÃĨ minimere kryssentropitapsen eller maksimere sannsynligheten ved ÃĨ bruke neste-skala prediksjonstilnÃĶrmingen. Den trente VQVAE produserer deretter token-kart-grundigheten for VAR-rammeverket.

Autoregressiv Modellering via Neste-Token Prediksjon

For en gitt sekvens av diskrete tokens, hvor hver token er et heltall fra et vokabular pÃĨ stÃļrrelse V, foreslÃĨr neste-token autoregressiv modell at sannsynligheten for ÃĨ observere den nÃĨvÃĶrende token avhenger bare av dens prefiks. Antagelse av unidireksjonal token-avhengighet tillater VAR-rammeverket ÃĨ dekomponere sannsynligheten til sekvensen i produktet av betingede sannsynligheter. Trening av en autoregressiv modell innebÃĶrer ÃĨ optimere modellen over en datasett, og denne optimeringsprosessen er kjent som neste-token prediksjon, og tillater den trente modellen ÃĨ generere nye sekvenser. Videre er bilder 2D kontinuerlige signaler av natur, og ÃĨ anvende den autoregressive modelltilnÃĶrmingen til bilder via neste-token prediksjonsprosessen har noen forutsetninger. FÃļrst mÃĨ bildet tokeniseres inn i flere diskrete tokens. Vanligvis implementeres en kvantisert autoencoder for ÃĨ konvertere bildefunksjonskartet til diskrete tokens.

Bilde-tokenene i diskrete tokens er arrangert i en 2D-grid, og i motsetning til naturlige sprÃĨksetninger som har en innebygd venstre-til-hÃļyre rekkefÃļlge, mÃĨ rekkefÃļlgen av bilde-tokens defineres eksplisitt for unidireksjonal autoregressiv lÃĶring. Tidligere autoregressive tilnÃĶrminger flattet den 2D-gridden av diskrete tokens ut i en 1D-sekvens ved ÃĨ bruke metoder som rad-hoved raster-scan, z-kurve eller spiral-rekkefÃļlge. NÃĨr de diskrete tokenene var flattet, utvant AR-modellene en mengde sekvenser fra datasettet, og deretter trent en autoregressiv modell til ÃĨ maksimere sannsynligheten i produktet av T betingede sannsynligheter ved ÃĨ bruke neste-token prediksjon.

Visuell-Autoregressiv Modellering via Neste-Skala Prediksjon

VAR-rammeverket omdefinerer den autoregressive modelltilnÃĶrmingen pÃĨ bilder ved ÃĨ skifte fra neste-token prediksjon til neste-skala prediksjonstilnÃĶrming, en prosess under hvilken i stedet for ÃĨ vÃĶre en enkelt token, er den autoregressive enheten en hel token-kart. Modellen kvantiserer fÃļrst funksjonskartet inn i multi-skala token-kart, hver med en hÃļyere opplÃļsning enn den forrige, og kulminerer med ÃĨ matche opplÃļsningen til det originale funksjonskartet. Videre utvikler VAR-rammeverket en ny multi-skala kvantisering-encoder for ÃĨ kode et bilde inn i multi-skala diskrete token-kart, nÃļdvendig for VAR-lÃĶringen. VAR-rammeverket anvender samme arkitektur som VQGAN, men med en modifisert multi-skala kvantiseringlag, med algoritmene demonstrert i fÃļlgende bilde.

Visuell Autoregressiv: Resultater og Eksperimenter

VAR-rammeverket anvender den vanlige VQVAE-arkitekturen med en multi-skala kvantiseringsskjema med K ekstra konvolusjon, og anvender en delt kodebok for alle skalaer og en latent dimensjon pÃĨ 32. Hovedfokuset ligger pÃĨ VAR-algoritmen, og derfor er modellarkitekturdesignet holdt enkelt men effektivt. Rammeverket anvender arkitekturen til en standard decoder-bare transformator lik den implementert pÃĨ GPT-2-modeller, med den eneste modifikasjonen vÃĶre erstattning av tradisjonell lag-normalisering for adaptiv normalisering eller AdaLN. For klassisk betinget syntese implementerer VAR-rammeverket klasse-embeddings som start-token, og ogsÃĨ betingelsen for den adaptive normaliseringslaget.

State of the Art Bildegenereringsresultater

NÃĨr sammenlignet med eksisterende generative rammeverk, inkludert GAN-er eller Generative Adversarial Networks, BERT-liknende maskerte prediksjonsmodeller, diffusjonsmodeller og GPT-liknende autoregressive modeller, viser Visuell Autoregressiv-rammeverket lovende resultater sammenfattet i fÃļlgende tabell.

Som det kan observeres, er Visuell Autoregressiv-rammeverket ikke bare i stand til ÃĨ overgÃĨ FID- og IS-poeng, men det viser ogsÃĨ bemerkelsesverdig bildegenereringshastighet, sammenlignbar med state-of-the-art-modeller. Videre viser VAR-rammeverket ogsÃĨ tilfredsstillende presisjon og gjennkallingspoeng, som bekrefter dens semantiske konsistens. Men den virkelige overraskelsen er den bemerkelsesverdige ytelsen levert av VAR-rammeverket pÃĨ tradisjonelle AR-egenskaper, og gjÃļr det til den fÃļrste autoregressive modellen som overgÃĨr en Diffusjonstransformator-modell, som demonstrert i fÃļlgende tabell.

Nullskudd Oppgavegeneraliseringsresultat

For inn- og utmalingsoppgaver, tvinger VAR-rammeverket grunnigheten utenfor masken, og lar modellen generere bare tokenene innenfor masken, uten noen klasse-etikettinformasjon injiseres i modellen. Resultatene er demonstrert i fÃļlgende bilde, og som det kan sees, oppnÃĨr VAR-modellen akseptable resultater pÃĨ nedstrÃļmsoppgaver uten ÃĨ justere parametre eller modifisere nettverksarkitekturen, og demonstrerer dermed generaliserbarheten til VAR-rammeverket.

SluttTanker

I denne artikkelen har vi snakket om et nytt visuelt generativt rammeverk kalt Visuell Autoregressiv modellering (VAR) som 1) teoretisk adresserer noen problemer innebygget i standard bildeautoregressive (AR) modeller, og 2) gjÃļr sprÃĨkmodell-basert AR-modeller til ÃĨ overgÃĨ sterke diffusjonsmodeller i termer av bildekvalitet, diversitet, dataeffektivitet og inferenshastighet. PÃĨ den ene siden krever tradisjonelle autoregressive modeller en definert rekkefÃļlge av data, mens pÃĨ den andre siden omdefinerer Visuell Autoregressiv eller VAR-modellen hvordan man bestiller en bilde, og dette er hva som skille VAR fra eksisterende AR-metoder. Ved ÃĨ skale opp VAR til 2 milliarder parametere, observerte utviklerne av VAR-rammeverket en klar kraftlov-forhold mellom testytelse og modellparametere eller trening beregning, med Pearsons koeffisienter nÃĶrmer seg −0,998, og indikerer et robust rammeverk for ytelsesprediksjon. Disse skaleringslovene og muligheten for nullskudd oppgavegeneralisering, som kjennetegn til LLM-er, er nÃĨ initialt verifisert i vÃĨre VAR-transformator-modeller.

En ingeniÃļr av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjÃĶrlighet og forstÃĨelse av AI og ML, dedikert til ÃĨ forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.