AI-modeller og platforme
Visuelt Autoregressivt Modeling: Skalerbar Billedegenerering via Næste-Skala-Prediktion
Introduktionen af GPT-modeller samt andre autoregressive eller store sprogmodeller har åbnet en ny æra inden for maskinlæring og kunstig intelligens. GPT- og autoregressive modeller viser ofte generel intelligens og fleksibilitet, der anses for at være et betydeligt skridt mod generel kunstig intelligens eller AGI, selvom de har nogle problemer som hallucinationer. Det forvirrende problem med disse store modeller er en selv-tilrettelæggende lærestrategi, der giver mulighed for, at modellen kan forudsige den næste token i en sekvens, en simpel men effektiv strategi. Nylige arbejder har demonstreret succesen med disse store autoregressive modeller, der fremhæver deres generaliserbarhed og skalerbarhed. Skalerbarhed er et typisk eksempel på de eksisterende skaleringslove, der giver forskerne mulighed for at forudsige modellens præstation ud fra præstationen af mindre modeller, hvilket resulterer i en bedre ressourceallokering. På den anden side er generaliserbarhed ofte dokumenteret gennem læringsstrategier som zero-shot, one-shot og few-shot læring, der fremhæver evnen af ubetjente, men trænede modeller til at tilpasse sig forskellige og usete opgaver. Sammen afslører generaliserbarhed og skalerbarhed potentialet for autoregressive modeller til at lære fra en stor mængde ulabellede data.
Bygget på dette, vil vi i denne artikel tale om Visuelt Autoregressivt eller VAR-rammeværket, en ny generationsmønster, der omdefinerer autoregressivt læring på billeder som grov-til-fine “næste-resolution forudsigelse” eller “næste-skala forudsigelse”. Selvom det er enkelt, er tilgangen effektiv og giver autoregressive transformatorer mulighed for at lære visuelle distributioner bedre, og forbedret generaliserbarhed. Desuden giver Visuelt Autoregressivt modeller GPT-stil autoregressive modeller mulighed for at overgå diffusionstransformer i billedegenerering for første gang. Eksperimenter viser også, at VAR-rammeværket forbedrer autoregressive baseline væsentligt og overgår Diffusion Transformer eller DiT-rammeværket på flere områder, herunder dataeffektivitet, billedekvalitet, skalerbarhed og inferenshastighed. Yderligere viser opskalering af Visuelt Autoregressivt modeller kraft-love skaleringslove, der ligner dem, der er observeret med store sprogmodeller, og viser også zero-shot generaliserbarhed i downstream-opgaver, herunder redigering, in-painting og out-painting.
Denne artikel har til formål at dække Visuelt Autoregressivt rammeværk i dybden og udforske mekanismen, metoden, arkitekturen og sammenligningen med state-of-the-art rammeværker. Vi vil også tale om, hvordan Visuelt Autoregressivt rammeværk demonstrerer to vigtige egenskaber af LLM’er: Skaleringslove og zero-shot generaliserbarhed. Så lad os komme i gang.
Visuelt Autoregressivt Modeling: Skalerbar Billedegenerering
Et almindeligt mønster blandt nyere store sprogmodeller er implementeringen af en selv-tilrettelæggende lærestrategi, en simpel men effektiv tilgang, der forudsiger den næste token i sekvensen. Takket være denne tilgang har autoregressive og store sprogmodeller i dag demonstreret bemærkelsesværdig skalerbarhed samt generaliserbarhed, egenskaber, der afslører potentialet for autoregressive modeller til at lære fra en stor mængde ulabellede data, og dermed summerer essensen af Generel Kunstig Intelligens. Desuden har forskere inden for computer vision feltet arbejdet parallelt med at udvikle store autoregressive eller verden modeller med det formål at matche eller overgå deres imponerende skalerbarhed og generaliserbarhed, med modeller som DALL-E og VQGAN, der allerede har demonstreret potentialet for autoregressive modeller inden for billedegenerering. Disse modeller implementerer ofte en visuel tokenizer, der repræsenterer eller approksimerer kontinuerte billeder i en grid af 2D tokens, der derefter flades ud i en 1D sekvens til autoregressivt læring, og dermed spejler den sekventielle sprogmodel proces.

Forskere er dog endnu ikke kommet i gang med at udforske skaleringslovene for disse modeller, og hvad der er endnu mere frustrerende er, at præstationen af disse modeller ofte ligger bag diffusion modellerne med en betydelig margin, som demonstreret i følgende billede. Gapet i præstation indikerer, at når sammenlignet med store sprogmodeller, er evnerne af autoregressive modeller inden for computer vision underudforsket.

På den ene side kræver traditionelle autoregressive modeller en defineret rækkefølge af data, mens på den anden side genovervejer Visuelt Autoregressivt eller VAR-modellen, hvordan man kan ordne et billede, og dette er, hvad der adskiller VAR fra eksisterende AR-metoder. Typisk skaber mennesker eller opfatter et billede på en hierarkisk måde, der indfanger den globale struktur efterfulgt af lokale detaljer, en multi-skala, grov-til-fine tilgang, der foreslår en rækkefølge for billedet naturligt. Desuden tager VAR-rammeværket inspiration fra multi-skala design og definerer autoregressivt læring for billeder som næste-skala forudsigelse i modsætning til konventionelle tilgange, der definerer læringen som næste-token forudsigelse. Tilgangen implementeret af VAR-rammeværket starter med at kodificere et billede i multi-skala token-kort. Rammeværket starter derefter den autoregressive proces fra 1×1 token-kortet og udvider i opløsning progressivt. På hvert trin forudsiger transformator den næste højere opløsning token-kort betinget af alle tidligere, en metode, som VAR-rammeværket henviser til som VAR-modellering.
VAR-rammeværket forsøger at udnytte transformator-arkitekturen af GPT-2 til visuelt autoregressivt læring, og resultaterne er tydelige på ImageNet-benchmarket, hvor VAR-modellen forbedrer sin AR-baseline væsentligt, opnår en FID på 1,80 og en inception-score på 356 samt en 20-gange forbedring af inferenshastigheden. Hvad der er endnu mere interessant er, at VAR-rammeværket formår at overgå præstationen af DiT eller Diffusion Transformer-rammeværket i forhold til FID- og IS-scores, skalerbarhed, inferenshastighed og dataeffektivitet. Desuden viser Visuelt Autoregressivt modellen stærke skaleringslove, der ligner dem, der er observeret i store sprogmodeller.
For at samme det op, forsøger VAR-rammeværket at bidrage med følgende.
- Det foreslår en ny visuel generativ ramme, der anvender en multi-skala autoregressiv tilgang med næste-skala forudsigelse, i modsætning til den traditionelle næste-token forudsigelse, hvilket resulterer i design af den autoregressive algoritme til computer vision-opgaver.
- Det forsøger at validere skaleringslove for autoregressive modeller samt zero-shot generaliserbarheds potentiale, der efterligner de tiltalende egenskaber af LLM’er.
- Det tilbyder en gennembrud i præstationen af visuelt autoregressivt modeller, der giver GPT-stil autoregressivt rammeværk mulighed for at overgå eksisterende diffusion modeller i billede-syntese opgaver for første gang nogensinde.
Desuden er det også vigtigt at diskutere de eksisterende kraft-love skaleringslove, der matematisk beskriver forholdet mellem datasætstørrelser, modellparametre, præstationsforbedringer og beregningsressourcer af maskinlæringsmodeller. Først giver disse kraft-love skaleringslove mulighed for at anvende en større modells præstation ved at skale op modellens størrelse, beregningsomkostninger og datasætstørrelse, hvilket resulterer i en bedre ressourceallokering og giver principper for tildeling af træningsbudgettet. Anden, har skaleringslove demonstreret en konstant og ikke-mættende stigning i præstation. Fremad med principperne for skaleringslove i neurale sprogmodeller, indeholder flere LLM’er principper, der går ud på, at øgning af modellens størrelse tenderer til at give forbedrede præstationsresultater. Zero-shot generaliserbarhed på den anden side henviser til evnen af en model, især en LLM, til at udføre opgaver, den ikke er blevet trænet på eksplitt.
Sprogmodeller afhænger af WordPiece-algoritmer eller Byte Pair Encoding-tilgang til teksttokenisering. Visuelle genereringsmodeller baseret på sprogmodeller afhænger også stærkt af kodificering af 2D-billeder i 1D-token sekvenser. Tidlige arbejder som VQVAE demonstrerede evnen til at repræsentere billeder som diskrete tokens med moderat rekonstruktionskvalitet. Efterfølgeren til VQVAE, VQGAN-rammeværket, inkorporerede perceptuelle og adversarielle tab samt anvendte en decoder-kun transformator til at generere billedtokens i standard raster-scan autoregressiv måde. Diffusion modeller på den anden side er længe blevet anset for at være frontløberne for visuelle synteseopgaver på grund af deres diversitet og overlegne genereringskvalitet. Fremgangen af diffusion modeller er blevet centreret omkring forbedring af samplingsteknikker, arkitektoniske forbedringer og hurtigere sampling. Latente diffusion modeller anvender diffusion i latente rum, hvilket forbedrer trænings-effektiviteten og inferens. Diffusion Transformer-modeller erstatter den traditionelle U-Net-arkitektur med en transformator-baseret arkitektur og er blevet anvendt i nyere billed- eller video-syntese modeller som SORA og Stable Diffusion.
Visuelt Autoregressivt: Metode og Arkitektur

I sin kerne har VAR-rammeværket to separate træningsfaser. I den første fase kodificerer en multi-skala kvantificeret autoencoder eller VQVAE et billede i token-kort, og en sammensat rekonstruktions-tab bliver implementeret til træningsformål. I ovenstående figur er embedding et ord, der bruges til at konvertere diskrete tokens til kontinuerte embedding-vektorer. I den anden fase bliver transformator i VAR-modellen trænet ved enten at minimere cross-entropy-taben eller at maksimere sandsynligheden ved at anvende næste-skala forudsigelse tilgangen. Den trænede VQVAE producerer derefter token-kort sandheden for VAR-rammeværket.
Autoregressivt Modeling via Næste-Token Forudsigelse
For en given sekvens af diskrete tokens, hvor hvert token er et integer fra et vokabularium af størrelse V, antager den næste-token autoregressive model, at sandsynligheden for at observere det nuværende token afhænger kun af dets præfiks. Antagelse af unidirektionel token-afhængighed giver VAR-rammeværket mulighed for at dekomponere sandsynligheden af sekvensen i produktet af betingede sandsynligheder. Træning af en autoregressiv model indebærer optimering af modellen på tværs af et datasæt, og denne optimeringsproces kaldes næste-token forudsigelse, og giver den trænede model mulighed for at generere nye sekvenser. Desuden er billeder 2D kontinuerte signaler af natur, og for at anvende den autoregressive model tilgang til billeder via næste-token forudsigelse optimeringsprocessen har nogle forudsætninger. Først skal billedet tokeniseres i flere diskrete tokens. Som regel implementeres en kvantificeret autoencoder til at konvertere billedets funktionelle kort til diskrete tokens.
Billed-token i diskrete tokens er arrangeret i en 2D grid, og til forskel fra naturlige sprog-sætninger, der har en indbygget venstre-til-højre rækkefølge, skal token-rækkefølgen for billeder defineres eksplitt for unidirektionel autoregressivt læring. Tidligere autoregressive tilgange fladede den 2D grid af diskrete tokens ud i en 1D sekvens ved hjælp af metoder som row-major raster-scan, z-curve eller spiral-rækkefølge. Når de diskrete tokens var fladet ud, trak AR-modellerne en samling af sekvenser fra datasættet og trænede derefter en autoregressiv model til at maksimere sandsynligheden i produktet af T betingede sandsynligheder ved at anvende næste-token forudsigelse.
Visuelt-Autoregressivt Modeling via Næste-Skala Forudsigelse
VAR-rammeværket omdefinerer den autoregressive model tilgang på billeder ved at skifte fra næste-token forudsigelse til næste-skala forudsigelse tilgang, en proces, hvor i stedet for at være et enkelt token, er den autoregressive enhed en hel token-kort. Modellen kvantificerer først funktionelle kortet i multi-skala token-kort, hver med en højere opløsning end den foregående, og kulminerer med at matche opløsningen af de originale funktionelle kort. Desuden udvikler VAR-rammeværket en ny multi-skala kvantificerings-encoder til at kodificere et billede i multi-skala diskrete token-kort, nødvendigt for VAR-læring. VAR-rammeværket anvender samme arkitektur som VQGAN, men med en modificeret multi-skala kvantificerings-lag, med algoritmerne demonstreret i følgende billede.

Visuelt Autoregressivt: Resultater og Eksperimenter
VAR-rammeværket anvender den vanille VQVAE-arkitektur med en multi-skala kvantificerings-skema med K ekstra convolution og anvender en delt kodebog for alle skalaer og en latent dim på 32. Den primære fokus ligger på VAR-algoritmen, og derfor er modellens arkitektur designet simpel, men effektiv. Rammeværket anvender arkitekturen af en standard decoder-kun transformator, lignende dem, der er implementeret på GPT-2 modeller, med den eneste modification, der er erstattelse af traditionel lag-normalisering for adaptiv normalisering eller AdaLN. Til klassisk betinget syntese implementerer VAR-rammeværket klasse-embedding som start-token og også betingelsen for den adaptive normaliserings-lag.
State of the Art Billedegenereringsresultater
Når sammenlignet med eksisterende generative rammeværker, herunder GAN’er eller Generative Adversarial Networks, BERT-stil masked prediction-modeller, diffusion modeller og GPT-stil autoregressive modeller, viser Visuelt Autoregressivt rammeværk lovende resultater, som sammenfattes i følgende tabel.

Som det kan observeres, er Visuelt Autoregressivt rammeværk ikke kun i stand til at overgå FID- og IS-scores, men det viser også bemærkelsesværdig billedegenereringshastighed, der er sammenlignelig med state-of-the-art modeller. Desuden viser VAR-rammeværket også tilfredsstillende præcision og genkaldelses-scores, hvilket bekræfter dets semantiske konsistens. Men den virkelige overraskelse er den bemærkelsesværdige præstation, der leveres af VAR-rammeværket på traditionelle AR-kapacitetsopgaver, hvilket gør det til den første autoregressive model, der overgår en Diffusion Transformer-model, som demonstreret i følgende tabel.

Zero-Shot Opgave Generaliseringsresultat
Til in- og out-painting opgaver tvinger VAR-rammeværket ground truth tokens uden for masken og lader modellen generere kun tokens inden for masken, uden at indsætte nogen klasse-etiket information i modellen. Resultaterne vises i følgende billede, og som det kan ses, opnår VAR-modellen acceptable resultater på downstream-opgaver uden at justere parametre eller ændre netværksarkitekturen, hvilket demonstrerer generaliserbarheden af VAR-rammeværket.

Afsluttende Tanker
I denne artikel har vi talt om en ny visuel generativ ramme, der kaldes Visuelt Autoregressivt modeling (VAR), der 1) teoretisk adresserer nogle problemer, der er indbygget i standard billed-autoregressive (AR) modeller, og 2) gør sprogmodel-baserede AR-modeller i stand til at overgå stærke diffusion modeller i forhold til billedekvalitet, diversitet, dataeffektivitet og inferenshastighed. På den ene side kræver traditionelle autoregressive modeller en defineret rækkefølge af data, mens på den anden side genovervejer Visuelt Autoregressivt eller VAR-modellen, hvordan man kan ordne et billede, og dette er, hvad der adskiller VAR fra eksisterende AR-metoder. Ved at skale VAR op til 2 milliarder parametre observerede udviklerne af VAR-rammeværket en tydelig kraft-lov relation mellem testpræstation og modellparametre eller træningsberegningsressourcer, med Pearson-koefficienter nær −0,998, hvilket indikerer en robust ramme for præstationsforudsigelse. Disse skaleringslove og muligheden for zero-shot opgave generaliserbarhed, som kendetegn af LLM’er, er nu blevet initialt verificeret i vores VAR-transformator-modeller.












