AI-modeller och plattformar
Visuell AutoRegressiv Modellering: Skalbar Bildgenerering via Next-Scale-Prediktion
Genombrottet av GPT-modeller, tillsammans med andra autoregressiva eller stora sprÃĨkmodeller, har inletts en ny era inom maskinlÃĪrning och artificiell intelligens. GPT och autoregressiva modeller visar ofta allmÃĪn intelligens och anpassningsfÃķrmÃĨga som anses vara ett betydande steg mot allmÃĪn artificiell intelligens eller AGI, trots att de har vissa problem som hallucinationer. Men det fÃķrbryllande problemet med dessa stora modeller ÃĪr en sjÃĪlvstÃĪndig inlÃĪrningsstrategi som tillÃĨter modellen att fÃķrutsÃĪga nÃĪsta token i en sekvens, en enkel men effektiv strategi. Nya arbeten har visat framgÃĨngen fÃķr dessa stora autoregressiva modeller, som betonar deras generaliserbarhet och skalbarhet. Skalbarhet ÃĪr ett typiskt exempel pÃĨ befintliga skalningslagar som tillÃĨter forskare att fÃķrutsÃĪga prestationen hos den stora modellen frÃĨn prestationen hos mindre modeller, vilket resulterar i en bÃĪttre resursfÃķrdelning. Ã andra sidan ÃĪr generaliserbarhet ofta belagd med inlÃĪrningsstrategier som zero-shot, one-shot och few-shot-inlÃĪrning, som betonar fÃķrmÃĨgan hos oÃķvervakade men trÃĪnade modeller att anpassa sig till olika och outforskade uppgifter. Tillsammans avslÃķjar generaliserbarhet och skalbarhet potentialen hos autoregressiva modeller att lÃĪra sig frÃĨn en stor mÃĪngd oetiketterad data.
Byggande pÃĨ samma, i den hÃĪr artikeln kommer vi att prata om Visuell AutoRegressiv eller VAR-ramverket, ett nytt generationsmÃķnster som omdefinierar autoregressivt lÃĪrande pÃĨ bilder som grov-till-fine ânÃĪsta-upplÃķsning-prediktionâ eller ânÃĪsta-skala-prediktionâ. Trots att det ÃĪr enkelt ÃĪr tillvÃĪgagÃĨngssÃĪttet effektivt och tillÃĨter autoregressiva transformer att lÃĪra sig visuella distributioner bÃĪttre, och fÃķrbÃĪttrad generaliserbarhet. Dessutom mÃķjliggÃķr Visuell AutoRegressiva modeller GPT-liknande autoregressiva modeller att fÃķr fÃķrsta gÃĨngen ÃķvertrÃĪffa diffusionsÃķverfÃķringar i bildgenerering. Experiment visar ocksÃĨ att VAR-ramverket fÃķrbÃĪttrar autoregressiva baslinjer avsevÃĪrt och ÃķvertrÃĪffar Diffusion Transformer eller DiT-ramverket i flera dimensioner, inklusive dataeffektivitet, bildkvalitet, skalbarhet och inferenshastighet. Dessutom visar skalning av Visuell AutoRegressiva modeller kraftlagsskalningslagar liknande de som observerats med stora sprÃĨkmodeller, och visar ocksÃĨ nollskottsgeneraliseringsfÃķrmÃĨga i nedstrÃķmsuppgifter, inklusive redigering, in-painting och ut-painting.
Denna artikel syftar till att tÃĪcka Visuell AutoRegressiv ramverk i djupet, och vi utforskar mekanismen, metodiken, arkitekturen i ramverket samt dess jÃĪmfÃķrelse med state-of-the-art-ramverk. Vi kommer ocksÃĨ att prata om hur Visuell AutoRegressiv ramverk demonstrerar tvÃĨ viktiga egenskaper hos LLM: Skalningslagar och nollskottsgeneralisering. SÃĨ lÃĨt oss komma igÃĨng.
Visuell AutoRegressiv Modellering: Skalbar Bildgenerering
Ett vanligt mÃķnster bland senaste stora sprÃĨkmodeller ÃĪr implementeringen av en sjÃĪlvstÃĪndig inlÃĪrningsstrategi, en enkel men effektiv tillvÃĪgagÃĨngssÃĪtt som fÃķrutsÃĪger nÃĪsta token i sekvensen. Tack vare tillvÃĪgagÃĨngssÃĪttet har autoregressiva och stora sprÃĨkmodeller idag visat remarkabel skalbarhet och generaliserbarhet, egenskaper som avslÃķjar potentialen hos autoregressiva modeller att lÃĪra sig frÃĨn en stor mÃĪngd oetiketterad data, och sammanfattar dÃĪrmed essensen av allmÃĪn artificiell intelligens. Dessutom har forskare inom datavisualiseringsomrÃĨdet arbetat parallellt fÃķr att utveckla stora autoregressiva eller vÃĪrldsmodeller med mÃĨlet att matcha eller ÃķvertrÃĪffa deras imponerande skalbarhet och generaliserbarhet, med modeller som DALL-E och VQGAN som redan visat potentialen hos autoregressiva modeller inom bildgenerering. Dessa modeller implementerar ofta en visuell tokenisator som representerar eller approximerar kontinuerliga bilder i en 2D-token grid, som sedan plattas till en 1D-sekvens fÃķr autoregressivt lÃĪrande, och speglar dÃĪrmed den sekventiella sprÃĨkmodelleringen.

Men forskare har ÃĪnnu inte utforskat skalningslagarna fÃķr dessa modeller, och vad som ÃĪr ÃĪnnu mer frustrerande ÃĪr det faktum att prestationen hos dessa modeller ofta ligger efter diffusionsmodeller med en betydande marginal, som visas i fÃķljande bild. Gapet i prestanda indikerar att nÃĪr jÃĪmfÃķrt med stora sprÃĨkmodeller, ÃĪr fÃķrmÃĨgan hos autoregressiva modeller inom datavisualisering underutforskad.

à ena sidan krÃĪver traditionella autoregressiva modeller en definierad ordning av data, medan ÃĨ andra sidan Visuell AutoRegressiv eller VAR-modellen omprÃķvar hur man bestÃĪller en bild, och detta ÃĪr vad som skiljer VAR frÃĨn befintliga AR-metoder. Vanligtvis skapar eller uppfattar mÃĪnniskor en bild pÃĨ ett hierarkiskt sÃĪtt, som fÃĨngar den globala strukturen fÃķljt av lokala detaljer, en multi-skala, grov-till-fine-approach som fÃķreslÃĨr en ordning fÃķr bilden naturligt. Dessutom, med inspiration frÃĨn multi-skala-design, definierar VAR-ramverket autoregressivt lÃĪrande fÃķr bilder som nÃĪsta-skala-prediktion, till skillnad frÃĨn konventionella tillvÃĪgagÃĨngssÃĪtt som definierar lÃĪrandet som nÃĪsta-token-prediktion. TillvÃĪgagÃĨngssÃĪttet som implementeras av VAR-ramverket bÃķrjar med att koda en bild i multi-skala-token-kartor. Ramverket startar sedan den autoregressiva processen frÃĨn 1Ã1-token-kartan och expanderar i upplÃķsning progressivt. Vid varje steg fÃķrutsÃĪger transformatorn nÃĪsta hÃķgre upplÃķsning token-karta villkorad av alla tidigare, en metodik som VAR-ramverket hÃĪnvisar till som VAR-modellering.
VAR-ramverket fÃķrsÃķker utnyttja transformatorarkitekturen i GPT-2 fÃķr visuellt autoregressivt lÃĪrande, och resultaten ÃĪr uppenbara pÃĨ ImageNet-benchmarken dÃĪr VAR-modellen fÃķrbÃĪttrar sin AR-baslinje avsevÃĪrt, och uppnÃĨr en FID pÃĨ 1,80, och en inceptions-poÃĪng pÃĨ 356, tillsammans med en 20-gÃĨnger fÃķrbÃĪttring av inferenshastigheten. Vad som ÃĪr ÃĪnnu mer intressant ÃĪr att VAR-ramverket lyckas ÃķvertrÃĪffa prestationen hos DiT eller Diffusion Transformer-ramverket i termer av FID- och IS-poÃĪng, skalbarhet, inferenshastighet och dataeffektivitet. Dessutom visar Visuell AutoRegressiv modell starka skalningslagar liknande de som observerats i stora sprÃĨkmodeller.
FÃķr att sammanfatta fÃķrsÃķker VAR-ramverket att bidra med fÃķljande.
- Det fÃķreslÃĨr ett nytt visuellt generativt ramverk som anvÃĪnder en multi-skala autoregressiv approach med nÃĪsta-skala-prediktion, till skillnad frÃĨn den traditionella nÃĪsta-token-prediktionen, vilket resulterar i att utforma den autoregressiva algoritmen fÃķr datavisualiseringsuppgifter.
- Det fÃķrsÃķker validera skalningslagar fÃķr autoregressiva modeller, tillsammans med nollskottsgeneraliseringspotential som emulerar de tilltalande egenskaperna hos LLM.
- Det erbjuder ett genombrott i prestationen hos visuella autoregressiva modeller, vilket mÃķjliggÃķr GPT-liknande autoregressiva ramverk att fÃķr fÃķrsta gÃĨngen ÃķvertrÃĪffa befintliga diffusionsmodeller i bildsyntesuppgifter.
Dessutom ÃĪr det ocksÃĨ viktigt att diskutera befintliga kraftlagsskalningslagar som matematiskt beskriver relationen mellan datamÃĪngder, modellparametrar, prestandafÃķrbÃĪttringar och berÃĪkningsresurser fÃķr maskinlÃĪrningsmodeller. FÃķrst underlÃĪttar dessa kraftlagsskalningslagar tillÃĪmpningen av en stÃķrre modells prestanda genom att skala upp modellstorleken, berÃĪkningskostnaden och datamÃĪngden, vilket sparar onÃķdiga kostnader och tilldelar utbildningsbudgeten genom att tillhandahÃĨlla principer. FÃķr det andra har skalningslagar visat en konsekvent och icke-mÃĪttnad prestandafÃķrbÃĪttring. FortsÃĪttning med principerna fÃķr skalningslagar i neurala sprÃĨkmodeller, innehÃĨller flera LLM de principen att Ãķka modellens skala tenderar att ge fÃķrbÃĪttrade prestandaresultat. Nollskottsgeneralisering ÃĨ andra sidan refererar till fÃķrmÃĨgan hos en modell, sÃĪrskilt en LLM, att utfÃķra uppgifter den inte har trÃĪnats pÃĨ explicit. Inom datavisualiseringsdomÃĪnen ÃĪr intresset fÃķr att bygga in nollskott och i-sammanhang-lÃĪrande fÃķrmÃĨgor hos grundmodeller.
SprÃĨkmodeller fÃķrlitar sig pÃĨ WordPiece-algoritmer eller Byte Pair Encoding-approach fÃķr texttokenisering. Visuella genereringsmodeller baserade pÃĨ sprÃĨkmodeller fÃķrlitar sig ocksÃĨ tungt pÃĨ att koda 2D-bilder i 1D-token-sekvenser. Tidiga arbeten som VQVAE visade fÃķrmÃĨgan att representera bilder som diskreta token med mÃĨttlig rekonstruktionskvalitet. EfterfÃķljaren till VQVAE, VQGAN-ramverket, inkorporerade perceptuella och adversariala fÃķrluster fÃķr att fÃķrbÃĪttra bildtrohet, och anvÃĪnde ocksÃĨ en decoder-only-transformator fÃķr att generera bildtoken i standard raster-scan autoregressivt sÃĪtt. Diffusionsmodeller ÃĨ andra sidan har lÃĪnge ansetts vara frontfÃķrarna fÃķr visuella syntesuppgifter, tack vare deras mÃĨngfald och ÃķverlÃĪgsna genereringskvalitet. Utvecklingen av diffusionsmodeller har centrerats kring att fÃķrbÃĪttra samplingstekniker, arkitektoniska fÃķrbÃĪttringar och snabbare sampling. Latent diffusionsmodeller tillÃĪmpar diffusionsmodeller i latenta utrymmet, vilket fÃķrbÃĪttrar utbildningseffektiviteten och inferensen. Diffusion Transformer-modeller ersÃĪtter den traditionella U-Net-arkitekturen med en transformer-baserad arkitektur, och har anvÃĪnts i nyliga bild- eller videosyntesmodeller som SORA och Stable Diffusion.
Visuell AutoRegressiv : Metodik och Arkitektur

I sin kÃĪrna har VAR-ramverket tvÃĨ diskreta utbildningsstadier. I det fÃķrsta stadiet kodar en multi-skala kvantiserad autoencoder eller VQVAE en bild i token-kartor, och en sammansatt rekonstruktionsfÃķrlust implementeras fÃķr utbildningsÃĪndamÃĨl. I ovanstÃĨende figur ÃĪr inbÃĪddning ett ord som anvÃĪnds fÃķr att definiera omvandling av diskreta token till kontinuerliga inbÃĪddningsvektorer. I det andra stadiet trÃĪnas transformatorn i VAR-modellen genom att antingen minimera korsentropifÃķrlusten eller maximera sannolikheten med hjÃĪlp av nÃĪsta-skala-prediktionen. Den trÃĪnade VQVAE producerar sedan token-karta grundvÃĪrdet fÃķr VAR-ramverket.
Autoregressiv Modellering via NÃĪsta-Token-Prediktion
FÃķr en given sekvens av diskreta token, dÃĪr varje token ÃĪr ett heltal frÃĨn ett ordfÃķrrÃĨd av storlek V, fÃķreslÃĨr den autoregressiva modellen att sannolikheten fÃķr att observera det aktuella tokenet beror endast pÃĨ dess prefix. Antagandet om unidirektionell tokenberoende tillÃĨter VAR-ramverket att bryta ned sannolikheten fÃķr sekvensen i produkten av villkorliga sannolikheter. Utbildning av en autoregressiv modell innebÃĪr att optimera modellen Ãķver en datamÃĪngd, och denna optimeringsprocess kallas nÃĪsta-token-prediktion, och tillÃĨter den trÃĪnade modellen att generera nya sekvenser. Dessutom ÃĪr bilder 2D-kontinuerliga signaler av arv, och fÃķr att tillÃĪmpa den autoregressiva modelleringen pÃĨ bilder via nÃĪsta-token-prediktionsoptimeringsprocessen har nÃĨgra fÃķrutsÃĪttningar. FÃķrst mÃĨste bilden tokeniseras i flera diskreta token. Vanligtvis implementeras en kvantiserad autoencoder fÃķr att omvandla bildfunktionen till diskreta token.
Bildtoken i diskreta token ÃĪr arrangerade i en 2D-token-grid, och till skillnad frÃĨn naturliga sprÃĨkmeningar som har en inbyggd vÃĪnster-till-hÃķger-ordning, mÃĨste token-ordningen definieras explicit fÃķr unidirektionellt autoregressivt lÃĪrande. Tidigare autoregressiva tillvÃĪgagÃĨngssÃĪtt plattade den 2D-token-gridden till en 1D-sekvens med hjÃĪlp av metoder som rad-huvudsaklig raster-scan, z-kurva eller spiral-ordning. NÃĪr de diskreta tokenen var plattade, extraherade AR-modellerna en uppsÃĪttning sekvenser frÃĨn datamÃĪngden, och trÃĪnade sedan en autoregressiv modell fÃķr att maximera sannolikheten i produkten av T villkorliga sannolikheter med hjÃĪlp av nÃĪsta-token-prediktion.
Visuell-AutoRegressiv Modellering via NÃĪsta-Skala-Prediktion
VAR-ramverket omkonceptualiserar den autoregressiva modelleringen pÃĨ bilder genom att skifta frÃĨn nÃĪsta-token-prediktion till nÃĪsta-skala-prediktion, en process under vilken den autoregressiva enheten inte ÃĪr en enskild token, utan en hel token-karta. Modellen kvantiserar fÃķrst funktionen i multi-skala-token-kartor, var och en med en hÃķgre upplÃķsning ÃĪn den fÃķregÃĨende, och kulminerar genom att matcha upplÃķsningen pÃĨ de ursprungliga funktionerna. Dessutom utvecklar VAR-ramverket en ny multi-skala-kvantiseringskodare fÃķr att koda en bild till multi-skala-diskreta-token-kartor, nÃķdvÃĪndiga fÃķr VAR-lÃĪrande. VAR-ramverket anvÃĪnder samma arkitektur som VQGAN, men med en modifierad multi-skala-kvantiseringslager, med algoritmerna som visas i fÃķljande bild.

Visuell AutoRegressiv : Resultat och Experiment
VAR-ramverket anvÃĪnder den vanliga VQVAE-arkitekturen med en multi-skala-kvantiseringschema med K extra konvolution, och anvÃĪnder en delad kodbook fÃķr alla skalor och en latent dim pÃĨ 32. Den primÃĪra fokus ligger pÃĨ VAR-algoritmen, vilket gÃķr att modellarkitekturdesignen hÃĨlls enkel men effektiv. Ramverket antar arkitekturen fÃķr en standard decoder-only-transformator, liknande de som implementerats pÃĨ GPT-2-modeller, med den enda modifieringen att traditionell lager-normalisering ersÃĪtts med adaptiv normalisering eller AdaLN. FÃķr klass-villkorsbetingad syntes implementerar VAR-ramverket klass-inbÃĪddningar som start-token, och ÃĪven villkoret fÃķr den adaptiva normaliseringslagret.
State of the Art Bildgenereringsresultat
NÃĪr jÃĪmfÃķrt med befintliga generativa ramverk, inklusive GAN eller Generativa Adversarial Networks, BERT-liknande maskerade fÃķrutsÃĪgelsemodeller, diffusionsmodeller och GPT-liknande autoregressiva modeller, visar Visuell AutoRegressiv ramverk lovande resultat som sammanfattas i fÃķljande tabell.

Som det kan observeras ÃĪr Visuell AutoRegressiv ramverk inte bara i stÃĨnd att ÃķvertrÃĪffa FID och IS-poÃĪng, utan det visar ocksÃĨ remarkabel bildgenereringshastighet, jÃĪmfÃķrbar med state-of-the-art-modeller. Dessutom visar VAR-ramverket ocksÃĨ tillfredsstÃĪllande precision och ÃĨterkallningspoÃĪng, vilket bekrÃĪftar dess semantiska konsekvens. Men den riktiga Ãķverraskningen ÃĪr den remarkabla prestationen som levereras av VAR-ramverket pÃĨ traditionella AR-fÃķrmÃĨgor-uppgifter, vilket gÃķr det till den fÃķrsta autoregressiva modellen som ÃķvertrÃĪffar en Diffusion Transformer-modell, som visas i fÃķljande tabell.

Nollskottsuppgiftsgeneraliseringsresultat
FÃķr in- och ut-painting-uppgifter tvingar VAR-ramverket grundvÃĪrdetoken utanfÃķr masken, och lÃĨter modellen generera endast tokenen inom masken, utan nÃĨgon klass-etikettinformation injiceras i modellen. Resultaten visas i fÃķljande bild, och som det kan ses, uppnÃĨr VAR-modellen acceptabla resultat pÃĨ nedstrÃķmsuppgifter utan att justera parametrar eller modifiera nÃĪtverksarkitekturen, vilket visar generaliserbarheten hos VAR-ramverket.

Slutliga Tankar
I den hÃĪr artikeln har vi talat om ett nytt visuellt generativt ramverk som kallas Visuell AutoRegressiv modellering (VAR) som 1) teoretiskt behandlar vissa problem som ÃĪr inneboende i standardbild-AR-modeller, och 2) gÃķr sprÃĨkmodellbaserade AR-modeller fÃķr fÃķrsta gÃĨngen ÃķvertrÃĪffa starka diffusionsmodeller i termer av bildkvalitet, mÃĨngfald, dataeffektivitet och inferenshastighet. Ã ena sidan krÃĪver traditionella autoregressiva modeller en definierad ordning av data, medan ÃĨ andra sidan Visuell AutoRegressiv eller VAR-modellen omprÃķvar hur man bestÃĪller en bild, och detta ÃĪr vad som skiljer VAR frÃĨn befintliga AR-metoder. NÃĪr VAR skalas upp till 2 miljarder parametrar observerade utvecklarna av VAR-ramverket en tydlig kraftlagssrelation mellan testprestanda och modellparametrar eller utbildningsberÃĪkning, med Pearsons koefficienter som nÃĪrmar sig â0,998, vilket indikerar ett robust ramverk fÃķr prestandaprediktion. Dessa skalningslagar och mÃķjligheten fÃķr nollskottsuppgiftsgeneralisering, som kÃĪnnetecken fÃķr LLM, har nu initialt bekrÃĪftats i vÃĨra VAR-transformator-modeller.












