AI-modeller og plattformer

Visuell Autoregressiv Modellering: Skalerbar Bildegenerering via Next-Scale Prediksjon

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Introduksjonen av GPT-modeller, sammen med andre autoregressive eller store språkmodeller, har åpnet en ny æra i maskinlæring og kunstig intelligens. GPT og autoregressive modeller viser ofte generell intelligens og fleksibilitet som regnes som et viktig skritt mot generell kunstig intelligens eller AGI, selv om de har noen problemer som hallucinasjoner. Det mystiske problemet med disse store modellene er en selvovervåkende læringstrategi som tillater modellen å forutsi neste token i en sekvens, en enkel men effektiv strategi. Nyere arbeider har vist suksessen til disse store autoregressive modellene, og høylysning deres generaliserbarhet og skalerbarhet. Skalerbarhet er et typisk eksempel på eksisterende skaleringslover som tillater forskerne å forutsi ytelsen til den store modellen fra ytelsen til mindre modeller, noe som resulterer i bedre ressursallokering. På den andre siden er generaliserbarhet ofte bevist ved læringstrategier som nullskudd, enkelt-skudd og få-skudd læring, og høylysning evnen til ubetretningslærte modeller til å tilpasse seg ulike og uante oppgaver. Sammen avslører generaliserbarhet og skalerbarhet potensialet til autoregressive modeller til å lære fra en stor mengde ulabelt data.

Bygging på dette, i denne artikkelen vil vi snakke om Visuell Autoregressiv eller VAR-rammeverket, et nytt generasjonsmønster som omdefinerer autoregressiv læring på bilder som grov-til-fine “neste-resolusjons prediksjon” eller “neste-skala prediksjon”. Selv om det er enkelt, er tilnærmingen effektiv og tillater autoregressive transformatorer å lære visuelle distribusjoner bedre, og forbedret generaliserbarhet. Videre tillater Visuell Autoregressiv-modellene GPT-liknende autoregressive modeller å overgå diffusjonsmodeller i bildegenerering for første gang. Eksperimenter indikerer også at VAR-rammeverket forbedrer autoregressive baseline betydelig, og overgår Diffusjonstransformator eller DiT-rammeverket i flere dimensjoner, inkludert dataeffektivitet, bildekvalitet, skalerbarhet og inferenshastighet. Videre viser skaleringsopphøyning av Visuell Autoregressiv-modellene kraftlov-skaleringslover som ligner på de som er observert med store språkmodeller, og viser også nullskudd generaliserbarhetsevne i nedstrømsoppgaver, inkludert redigering, innmalings- og utmalingsoppgaver.

Denne artikkelen har til hensikt å dekke Visuell Autoregressiv-rammeverket i dybden, og vi utforsker mekanismen, metodologien, arkitekturen til rammeverket sammen med dens sammenligning med state-of-the-art-rammeverk. Vi vil også snakke om hvordan Visuell Autoregressiv-rammeverket demonstrerer to viktige egenskaper til LLM-er: Skaleringslover og nullskudd generaliserbarhet. Så la oss begynne.

Visuell Autoregressiv Modellering: Skalerbar Bildegenerering

En vanlig mønster blant nyere store språkmodeller er implementeringen av en selvovervåkende læringstrategi, en enkel men effektiv tilnærming som forutsier neste token i sekvensen. Takk til tilnærmingen har autoregressive og store språkmodeller i dag demonstrert bemerkelsesverdig skalerbarhet og generaliserbarhet, egenskaper som avslører potensialet til autoregressive modeller til å lære fra en stor mengde ulabelt data, og sammenfatter essensen av Generell Kunstig Intelligens. Videre har forskere i datavisjonsfeltet arbeidet parallelt for å utvikle store autoregressive eller verdensmodeller med målet å matche eller overgå deres imponerende skalerbarhet og generaliserbarhet, med modeller som DALL-E og VQGAN som allerede har demonstrert potensialet til autoregressive modeller i bildegenerering. Disse modellene implementerer ofte en visuell tokenisator som representerer eller approksimerer kontinuerlige bilder i en grid av 2D-tokens, som deretter flates ut i en 1D-sekvens for autoregressiv læring, og speiler dermed den sekvensielle språkmodellprosessen.

Imidlertid har forskerne ennå ikke utforsket skaleringslovene til disse modellene, og hva som er mer frustrerende er det faktum at ytelsen til disse modellene ofte ligger bak diffusjonsmodeller med en betydelig margin, som demonstrert i følgende bilde. Gapet i ytelse indikerer at når sammenlignet med store språkmodeller, er evnene til autoregressive modeller i datavisjon underutforsket.

På den ene siden krever tradisjonelle autoregressive modeller en definert rekkefølge av data, mens på den andre siden omdefinerer Visuell Autoregressiv eller VAR-modellen hvordan man bestiller en bilde, og dette er hva som skille VAR fra eksisterende AR-metoder. Vanligvis skaper eller oppfatter mennesker et bilde på en hierarkisk måte, ved å fange den globale strukturen fulgt av lokale detaljer, en multi-skala, grov-til-fine tilnærming som foreslår en rekkefølge for bildet naturlig. Videre, ved å dra inspirasjon fra multi-skala design, definerer VAR-rammeverket autoregressiv læring for bilder som neste-skala prediksjon i motsetning til konvensjonelle tilnærminger som definerer læringen som neste-token prediksjon. Tilnærmingen implementert av VAR-rammeverket starter med å kode et bilde inn i multi-skala token-kart. Rammeverket starter deretter den autoregressive prosessen fra 1×1 token-kartet og utvider i oppløsning progressivt. På hver trinn, forutsier transformatoreren neste høyere oppløsning token-kart betinget på alle tidligere, en metode som VAR-rammeverket refererer til som VAR-modellering.

VAR-rammeverket forsøker å utnytte transformatorarkitekturen til GPT-2 for visuell autoregressiv læring, og resultater er synlige på ImageNet-benchmarket hvor VAR-modellen forbedrer sin AR-baseline betydelig, og oppnår en FID på 1,80, og en oppfinnelsesscore på 356, sammen med en 20x forbedring i inferenshastighet. Hva som er enda mer interessant er at VAR-rammeverket klarer å overgå ytelsen til DiT eller Diffusjonstransformator-rammeverket i termer av FID- og IS-poeng, skalerbarhet, inferenshastighet og dataeffektivitet. Videre viser Visuell Autoregressiv-modellen sterke skaleringslover som ligner på de som er observert i store språkmodeller.

For å sammenfatte, forsøker VAR-rammeverket å bidra med følgende.

  1. Det foreslår et nytt visuelt generativt rammeverk som bruker en multi-skala autoregressiv tilnærming med neste-skala prediksjon, i motsetning til den tradisjonelle neste-token prediksjon, noe som resulterer i å designe den autoregressive algoritmen for datavisjonsoppgaver.
  2. Det forsøker å validere skaleringslover for autoregressive modeller sammen med nullskudd generaliserbarhetspotensiale som emulerer de tiltalende egenskapene til LLM-er.
  3. Det tilbyr et gjennombrudd i ytelsen til visuelle autoregressive modeller, og muliggjør GPT-liknende autoregressive rammeverk til å overgå eksisterende diffusjonsmodeller i bildegenerering for første gang.

Videre er det også viktig å diskutere de eksisterende kraftlov-skaleringslovene som matematisk beskriver forholdet mellom datasettstørrelser, modellparametere, ytelsesforbedringer og beregningsressurser til maskinlæringsmodeller. Først tillater disse kraftlov-skaleringslovene å bruke en større modells ytelse ved å skale opp modellstørrelsen, beregningskostnaden og datamengden, og sparer unødvendige kostnader og allokerer treningbudsjettet ved å gi prinsipper. Andre, har skaleringslovene demonstrert en konsistent og ikke-mettende økning i ytelse. Ved å gå videre med prinsippene til skaleringslovene i neurale språkmodeller, har flere LLM-er inkorporert prinsippet om at å øke modellskalaen tenderer å resultere i forbedrede ytelsesresultater. Nullskudd generaliserbarhet på den andre siden refererer til evnen til en modell, spesielt en LLM, til å utføre oppgaver den ikke er trent på eksplisitt. Innenfor datavisjonsdomenet er interessen for å bygge inn nullskudd og kontekstlæringsevner til grunnmodeller.

Språkmodeller avhenger av WordPiece-algoritmer eller Byte Pair Encoding-tilnærming for teksttokenisering. Visuelle genereringsmodeller basert på språkmodeller avhenger også tungt av å kode 2D-bilder inn i 1D-token sekvenser. Tidlige arbeider som VQVAE demonstrerte evnen til å representere bilder som diskrete tokens med moderat rekonstruksjonskvalitet. Arvtakeren til VQVAE, VQGAN-rammeverket, inkorporerte perseptuelle og adversarielle tap for å forbedre bildefideliteten, og brukte også en decoder-bare transformator til å generere bilde-tokens i standard raster-scan autoregressiv måte. Diffusjonsmodeller på den andre siden har lenge vært regnet som frontløpere for visuelle synteseoppgaver, takket være deres diversitet og overlegne genereringskvalitet. Fremgangen i diffusjonsmodeller har vært sentrert rundt å forbedre samplingsteknikker, arkitektoniske forbedringer og raskere sampling. Latente diffusjonsmodeller anvender diffusjon i latente rommet, og forbedrer treningseffektiviteten og inferensen. Diffusjonstransformator-modeller erstatter den tradisjonelle U-Net-arkitekturen med en transformator-basert arkitektur, og har vært deployert i nyere bilde- eller videosyntese-modeller som SORA og Stable Diffusion.

Visuell Autoregressiv: Metodologi og Arkitektur

I kjernen har VAR-rammeverket to separate treningstadier. I det første stadiet, en multi-skala kvantisert autoencoder eller VQVAE, koder et bilde inn i token-kart, og en sammensatt rekonstruksjonsfeil implementeres for trening. I figuren ovenfor, er innlejring et ord som definerer konvertering av diskrete tokens til kontinuerlige innlejningsvektorer. I det andre stadiet, er transformatoreren i VAR-modellen trent ved å minimere kryssentropitapsen eller maksimere sannsynligheten ved å bruke neste-skala prediksjonstilnærmingen. Den trente VQVAE produserer deretter token-kart-grundigheten for VAR-rammeverket.

Autoregressiv Modellering via Neste-Token Prediksjon

For en gitt sekvens av diskrete tokens, hvor hver token er et heltall fra et vokabular på størrelse V, foreslår neste-token autoregressiv modell at sannsynligheten for å observere den nåværende token avhenger bare av dens prefiks. Antagelse av unidireksjonal token-avhengighet tillater VAR-rammeverket å dekomponere sannsynligheten til sekvensen i produktet av betingede sannsynligheter. Trening av en autoregressiv modell innebærer å optimere modellen over en datasett, og denne optimeringsprosessen er kjent som neste-token prediksjon, og tillater den trente modellen å generere nye sekvenser. Videre er bilder 2D kontinuerlige signaler av natur, og å anvende den autoregressive modelltilnærmingen til bilder via neste-token prediksjonsprosessen har noen forutsetninger. Først må bildet tokeniseres inn i flere diskrete tokens. Vanligvis implementeres en kvantisert autoencoder for å konvertere bildefunksjonskartet til diskrete tokens.

Bilde-tokenene i diskrete tokens er arrangert i en 2D-grid, og i motsetning til naturlige språksetninger som har en innebygd venstre-til-høyre rekkefølge, må rekkefølgen av bilde-tokens defineres eksplisitt for unidireksjonal autoregressiv læring. Tidligere autoregressive tilnærminger flattet den 2D-gridden av diskrete tokens ut i en 1D-sekvens ved å bruke metoder som rad-hoved raster-scan, z-kurve eller spiral-rekkefølge. Når de diskrete tokenene var flattet, utvant AR-modellene en mengde sekvenser fra datasettet, og deretter trent en autoregressiv modell til å maksimere sannsynligheten i produktet av T betingede sannsynligheter ved å bruke neste-token prediksjon.

Visuell-Autoregressiv Modellering via Neste-Skala Prediksjon

VAR-rammeverket omdefinerer den autoregressive modelltilnærmingen på bilder ved å skifte fra neste-token prediksjon til neste-skala prediksjonstilnærming, en prosess under hvilken i stedet for å være en enkelt token, er den autoregressive enheten en hel token-kart. Modellen kvantiserer først funksjonskartet inn i multi-skala token-kart, hver med en høyere oppløsning enn den forrige, og kulminerer med å matche oppløsningen til det originale funksjonskartet. Videre utvikler VAR-rammeverket en ny multi-skala kvantisering-encoder for å kode et bilde inn i multi-skala diskrete token-kart, nødvendig for VAR-læringen. VAR-rammeverket anvender samme arkitektur som VQGAN, men med en modifisert multi-skala kvantiseringlag, med algoritmene demonstrert i følgende bilde.

Visuell Autoregressiv: Resultater og Eksperimenter

VAR-rammeverket anvender den vanlige VQVAE-arkitekturen med en multi-skala kvantiseringsskjema med K ekstra konvolusjon, og anvender en delt kodebok for alle skalaer og en latent dimensjon på 32. Hovedfokuset ligger på VAR-algoritmen, og derfor er modellarkitekturdesignet holdt enkelt men effektivt. Rammeverket anvender arkitekturen til en standard decoder-bare transformator lik den implementert på GPT-2-modeller, med den eneste modifikasjonen være erstattning av tradisjonell lag-normalisering for adaptiv normalisering eller AdaLN. For klassisk betinget syntese implementerer VAR-rammeverket klasse-embeddings som start-token, og også betingelsen for den adaptive normaliseringslaget.

State of the Art Bildegenereringsresultater

Når sammenlignet med eksisterende generative rammeverk, inkludert GAN-er eller Generative Adversarial Networks, BERT-liknende maskerte prediksjonsmodeller, diffusjonsmodeller og GPT-liknende autoregressive modeller, viser Visuell Autoregressiv-rammeverket lovende resultater sammenfattet i følgende tabell.

Som det kan observeres, er Visuell Autoregressiv-rammeverket ikke bare i stand til å overgå FID- og IS-poeng, men det viser også bemerkelsesverdig bildegenereringshastighet, sammenlignbar med state-of-the-art-modeller. Videre viser VAR-rammeverket også tilfredsstillende presisjon og gjennkallingspoeng, som bekrefter dens semantiske konsistens. Men den virkelige overraskelsen er den bemerkelsesverdige ytelsen levert av VAR-rammeverket på tradisjonelle AR-egenskaper, og gjør det til den første autoregressive modellen som overgår en Diffusjonstransformator-modell, som demonstrert i følgende tabell.

Nullskudd Oppgavegeneraliseringsresultat

For inn- og utmalingsoppgaver, tvinger VAR-rammeverket grunnigheten utenfor masken, og lar modellen generere bare tokenene innenfor masken, uten noen klasse-etikettinformasjon injiseres i modellen. Resultatene er demonstrert i følgende bilde, og som det kan sees, oppnår VAR-modellen akseptable resultater på nedstrømsoppgaver uten å justere parametre eller modifisere nettverksarkitekturen, og demonstrerer dermed generaliserbarheten til VAR-rammeverket.

SluttTanker

I denne artikkelen har vi snakket om et nytt visuelt generativt rammeverk kalt Visuell Autoregressiv modellering (VAR) som 1) teoretisk adresserer noen problemer innebygget i standard bildeautoregressive (AR) modeller, og 2) gjør språkmodell-basert AR-modeller til å overgå sterke diffusjonsmodeller i termer av bildekvalitet, diversitet, dataeffektivitet og inferenshastighet. På den ene siden krever tradisjonelle autoregressive modeller en definert rekkefølge av data, mens på den andre siden omdefinerer Visuell Autoregressiv eller VAR-modellen hvordan man bestiller en bilde, og dette er hva som skille VAR fra eksisterende AR-metoder. Ved å skale opp VAR til 2 milliarder parametere, observerte utviklerne av VAR-rammeverket en klar kraftlov-forhold mellom testytelse og modellparametere eller trening beregning, med Pearsons koeffisienter nærmer seg −0,998, og indikerer et robust rammeverk for ytelsesprediksjon. Disse skaleringslovene og muligheten for nullskudd oppgavegeneralisering, som kjennetegn til LLM-er, er nå initialt verifisert i våre VAR-transformator-modeller.

Kunal Kejriwal er en backend‑ingeniør som spesialiserer seg på Python, PostgreSQL, Redis og skyinfrastruktur på GCP og AWS. Med tre års erfaring med å bygge og skalere produksjonssystemer skriver han om AI‑infrastruktur, distribuerte systemer og arkitekturen bak utrulling av maskinlæringsarbeidsbelastninger.