AI-modeller och plattformar

Generativ AI: Idén bakom CHATGPT, DALL-E, Midjourney och mer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Världen av konst, kommunikation och hur vi uppfattar verkligheten förändras snabbt. Om vi tittar tillbaka på mänsklighetens innovationshistoria kan vi betrakta uppfinningen av hjulet eller upptäckten av elektricitet som monumentala språng. Idag sker en ny revolution – den broar klyftan mellan mänsklig kreativitet och maskinberäkning. Det är Generativ AI.

Generativa modeller har suddat ut gränsen mellan människor och maskiner. Med tillkomsten av modeller som GPT-4, som använder transformermoduler, har vi tagit ett steg närmare naturlig och kontextrik språkgenerering. Dessa framsteg har drivit på tillämpningar inom dokumentskapande, chatsystem och till och med syntetisk musikkomposition.

Nya beslut från stora teknikföretag understryker dess betydelse. Microsoft (MSFT ) avslutar redan sin Cortana-app den här månaden för att prioritera nyare Generativa AI-innovationer, som Bing Chat. Apple (AAPL ) har också tilldelat en betydande del av sin $22,6 miljarder dollar stora FoU-budget till generativ AI, som framgår av vd Tim Cooks uttalanden.

En ny era av modeller: Generativ vs. Diskriminativ

Berättelsen om Generativ AI handlar inte bara om dess tillämpningar, utan grundläggande om dess inre funktionssätt. I det artificiella intelligenssystemet finns två modeller: diskriminativa och generativa.

Diskriminativa modeller är vad de flesta människor stöter på i vardagslivet. Dessa algoritmer tar indata, som text eller en bild, och parar dem med en måloutput, som ett ordöversättning eller en medicinsk diagnos. De handlar om kartläggning och förutsägelse.

Generativa modeller, å andra sidan, är skapare. De genererar inte bara nya, komplexa utdata från vektorer av tal som ofta inte ens är relaterade till verkliga värden.

 

Generativ AI-typ: Text till text, text till bild (GPT, DALL-E, Midjourney)

Tekniken bakom generativa modeller

Generativa modeller skyller sin existens på djupa neurala nätverk, sofistikerade strukturer som är utformade för att härma hjärnans funktion. Genom att fånga och bearbeta multifacetterade variationer i data fungerar dessa nätverk som ryggraden i många generativa modeller.

Hur kommer dessa generativa modeller till liv? Vanligtvis byggs de med djupa neurala nätverk, optimerade för att fånga de multifacetterade variationerna i data. Ett primärexempel är Generative Adversarial Network (GAN), där två neurala nätverk, generatoren och diskriminatoren, tävlar och lär av varandra i en unik lärar-elev-relation. Från målningar till stilöverföring, från musikkomposition till spel, utvecklas och expanderar dessa modeller på sätt som tidigare var otänkbara.

Detta slutar inte med GAN. Variational Autoencoders (VAE), är en annan viktig spelare inom generativa modeller. VAE:er utmärker sig för sin förmåga att skapa fotorealistiska bilder från till synes slumpmässiga tal. Hur? Genom att bearbeta dessa tal via en latent vektor föds konst som speglar komplexiteten i mänsklig estetik.

Generativ AI-typ: Text till text, text till bild

Transformatorer och LLM

Artikeln ” Attention Is All You Need ” av Google (GOOGL ) Brain markerade en vändpunkt i hur vi tänker om textmodellering. Istället för komplexa och sekventiella arkitekturer som Recurrent Neural Networks (RNN) eller Convolutional Neural Networks (CNN), introducerade transformermodellen begreppet uppmärksamhet, som i princip innebar att fokusera på olika delar av indata-texten beroende på sammanhanget. En av de stora fördelarna med detta var enkelheten i parallellisering. Till skillnad från RNN, som bearbetar text sekventiellt och gör dem svåra att skala, kan transformer bearbeta delar av texten samtidigt, vilket gör träning snabbare och mer effektiv på stora datamängder.

Transformer-modell arkitektur

I en lång text har inte varje ord eller mening du läser samma betydelse. Vissa delar kräver mer uppmärksamhet baserat på sammanhanget. Detta är vad uppmärksamhetsmekanismen efterliknar.

För att förstå detta, tänk på en mening: “Unite AI publicerar AI- och robotiknyheter.” Att förutsäga nästa ord kräver en förståelse för vad som är viktigast i det tidigare sammanhanget. Begreppet “Robotik” kan antyda att nästa ord kan vara relaterat till en specifik utveckling eller händelse inom robotikområdet, medan “Publicerar” kan indikera att följande sammanhang kan handla om en nyligen publicerad artikel.

Självuppmärksamhetsmekanism förklaring på en demomening
Självuppmärksamhetsillustration

Uppmärksamhetsmekanismerna i transformer är utformade för att uppnå denna selektiva fokus. De bedömer betydelsen av olika delar av indata-texten och bestämmer var de ska “titta” när de genererar ett svar. Detta är en avvikelse från äldre arkitekturer som RNN, som försökte packa essensen av all indata-text i en enda “tillstånd” eller “minnesenhet”.

Uppmärksamhetsmekanismernas funktion kan liknas vid ett nyckel-värde-återvinningssystem. När du försöker förutsäga nästa ord i en mening erbjuder varje föregående ord en “nyckel” som antyder dess potentiella relevans, och baserat på hur väl dessa nycklar matchar det aktuella sammanhanget (eller frågan) bidrar de med ett “värde” eller vikt till förutsägelsen.

Dessa avancerade AI-djupinlärningsmodeller har integrerats smidigt i olika tillämpningar, från Google’s sökmotorteknik med BERT till GitHub’s Copilot, som utnyttjar Large Language Models (LLM) för att omvandla enkla kodsnuttar till fullständiga källkoder.

Large Language Models (LLM) som GPT-4, Bard och LLaMA är kolossala konstruktioner utformade för att tolka och generera mänskligt språk, kod och mer. Deras enorma storlek, som sträcker sig från miljarder till biljoner parametrar, är en av deras definierande egenskaper. Dessa LLM:er matas med stora mängder textdata, vilket möjliggör för dem att förstå nyanserna i mänskligt språk. En slående egenskap hos dessa modeller är deras förmåga till “fåskottinlärning”. Till skillnad från konventionella modeller som behöver stora mängder specifik träningsdata kan LLM:er generalisera från ett mycket begränsat antal exempel (eller “skott”)

Staten för Large Language Models (LLM) från och med mitten av 2023

Modellnamn Utvecklare Parametrar Tillgänglighet och åtkomst Noterbara funktioner och kommentarer
GPT-4 OpenAI 1,5 biljoner Ej öppen källkod, endast API-åtkomst Impressiv prestanda på en mängd uppgifter, kan bearbeta bilder och text, maximal inmatningslängd 32 768 token
GPT-3 OpenAI 175 miljarder Ej öppen källkod, endast API-åtkomst Visade fåskott- och nollskotinlärningsförmåga. Utför textkomplettering på naturligt språk.
BLOOM BigScience 176 miljarder Nedladdningsbar modell, värd API tillgänglig Flerspråkig LLM utvecklad genom globalt samarbete. Stöder 13 programmeringsspråk.
LaMDA Google 173 miljarder Ej öppen källkod, ingen API- eller nedladdning Tränad på dialog, kan lära sig att prata om i princip allt.
MT-NLG Nvidia /Microsoft 530 miljarder API-åtkomst via ansökan Använder transformerbaserad Megatron-arkitektur för olika NLP-uppgifter.
LLaMA Meta AI 7B till 65B) Nedladdningsbar via ansökan Avsedd att demokratisera AI genom att erbjuda tillgång till forskare, regeringar och akademi.

Hur används LLM?

LLM kan användas på flera sätt, inklusive:

  1. Direkt användning: Användning av en förtränad LLM för textgenerering eller bearbetning. Till exempel användning av GPT-4 för att skriva en bloggpost utan ytterligare finjustering.
  2. Finjustering: Anpassning av en förtränad LLM för en specifik uppgift, en metod som kallas överföringsinlärning. Ett exempel vore att anpassa T5 för att generera sammanfattningar för dokument inom en specifik bransch.
  3. Informationsåtervinning: Användning av LLM, som BERT eller GPT, som en del av större arkitekturer för att utveckla system som kan hämta och kategorisera information.
Generativ AI ChatGPT finjustering
ChatGPT finjusteringsarkitektur

Multi-huvuduppmärksamhet: Varför en när du kan ha många?

Men att förlita sig på en enda uppmärksamhetsmekanism kan vara begränsande. Olika ord eller sekvenser i en text kan ha olika typer av relevans eller associationer. Här kommer multi-huvuduppmärksamhet in. Istället för ett enda uppsättning uppmärksamhetsvikt, använder multi-huvuduppmärksamhet flera uppsättningar, vilket möjliggör för modellen att fånga en rikare variation av relationer i indata-texten. Varje uppmärksamhets-“huvud” kan fokusera på olika delar eller aspekter av indata-texten, och deras kombinerade kunskap används för den slutliga förutsägelsen.

ChatGPT: Den mest populära Generativa AI-verktyget

Från GPT:s tillkomst 2018 byggdes modellen i grunden på 12 lager, 12 uppmärksamhets-huvuden och 120 miljoner parametrar, främst tränad på en datamängd som kallades BookCorpus. Detta var en imponerande start, som gav en glimt av framtiden för språkmodeller.

GPT-2, som lanserades 2019, hade en fyrfaldig ökning av lager och uppmärksamhets-huvuden. Betydande var att dess parameterantal sköt i höjden till 1,5 miljarder. Denna förbättrade version härstammade från WebText, en datamängd som berikats med 40 GB text från olika Reddit-länkar.

GPT-3, som lanserades i maj 2020, hade 96 lager, 96 uppmärksamhets-huvuden och ett massivt parameterantal på 175 miljarder. Vad som särskilde GPT-3 var dess diversifierade träningsdata, som omfattade CommonCrawl, WebText, Engelska Wikipedia, bokkorpus och andra källor, som kombinerades för en total på 570 GB.

Detaljerna kring ChatGPT:s funktionssätt förblir en välbevarad hemlighet. Men en process som kallas “förstärkt inlärning från mänsklig återkoppling” (RLHF) är känd för att vara avgörande. Ursprungligen från ett tidigare ChatGPT-projekt var denna teknik avgörande för att finslipa GPT-3,5-modellen för att göra den mer anpassad till skrivna instruktioner.

ChatGPT:s träning består av en trestegsprocess:

  1. Övervakad finjustering: Inbegriper att skapa mänskligt skriven konversationsinmatning och utmatning för att finslipa den underliggande GPT-3,5-modellen.
  2. Belöningsmodellering: Människor rankar olika modellutmatningar baserat på kvalitet, vilket hjälper till att träna en belöningsmodell som poängsätter varje utmatning med hänsyn till sammanhangets kontext.
  3. Förstärkt inlärning: Sammanhangets kontext utgör bakgrunden där den underliggande modellen föreslår ett svar. Detta svar bedöms av belöningsmodellen, och processen optimeras med hjälp av en algoritm som kallas proximal policyoptimering (PPO).

För de som precis börjar med ChatGPT finns en omfattande startguide som kan hittas här. Om du vill dyka djupare i promptteknik med ChatGPT har vi också en avancerad guide som ger insikt i de senaste och mest avancerade promptteknikerna, tillgänglig på ‘ChatGPT & Avancerad promptteknik: Drivkraften bakom AI-utvecklingen‘.

Diffusion och multimodala modeller

Medan modeller som VAE och GAN genererar sina utmatningar genom en enda passage, och därmed är låsta till vad de producerar, har diffusionsmodeller introducerat konceptet “iterativ förfining”. Genom denna metod återvänder de, rättar till misstag från tidigare steg och producerar gradvis ett mer polerat resultat.

Centrala för diffusionsmodeller är konsten att “fördärva” och “förbättra”. Under sin träningsfas korrumperas en typisk bild progressivt genom att lägga till varierande nivåer av brus. Denna bullriga version matas sedan till modellen, som försöker “avbrusa” eller “avkorrumpera” den. Genom flera omgångar av detta blir modellen skicklig på restaurering, och förstår både subtila och betydande avvikelser.

Generativ AI - Midjourney-prompt
Bild genererad från Midjourney

Processen att generera nya bilder efter träning är intressant. Den börjar med en helt slumpmässig inmatning, som sedan kontinuerligt förfinas med hjälp av modellens förutsägelser. Målet är att uppnå en perfekt bild med minsta antal steg. Kontrollen av korruptionsnivån sker via en “brus-schema”, en mekanism som styr hur mycket brus som appliceras vid olika stadier. En schemaläggare, som ses i bibliotek som “diffusers“, dikterar naturen hos dessa bullriga representationer baserat på etablerade algoritmer.

En essentiell arkitektonisk ryggrad för många diffusionsmodeller är UNet – ett konvolutionsneuralt nätverk specialiserat för uppgifter som kräver utmatningar som speglar inmatningens rumsliga dimension. Det är en blandning av ned- och uppsamplingslager, intrikat kopplade för att behålla högupplöst data, avgörande för bildrelaterade utmatningar.

Att dyka djupare in i generativa modellers värld framträder OpenAI:s DALL-E 2 som ett lysande exempel på fusionen av textuell och visuell AI-kapacitet. Den använder en trestegsstruktur:

DALL-E 2 visar en trestegsarkitektur:

  1. Textencoder: Det omvandlar textprompten till en konceptuell inbäddning i ett latent utrymme. Denna modell börjar inte från scratch. Den bygger på OpenAI:s Contrastive Language-Image Pre-training (CLIP) datamängd som sin grund. CLIP fungerar som en bro mellan visuell och textuell data genom att lära sig visuella koncept med hjälp av naturligt språk. Genom en mekanism som kallas kontrastiv inlärning identifierar och matchar den bilder med deras motsvarande textbeskrivningar.
  2. Prior: Textinbäddningen som härrör från encodern omvandlas sedan till en bildinbäddning. DALL-E 2 testade både autoregressiva och diffusionsmetoder för denna uppgift, med den senare som visade bättre resultat. Autoregressiva modeller, som ses i transformer och PixelCNN, genererar utmatningar i sekvenser. Å andra sidan, diffusionsmodeller, som den som används i DALL-E 2, omvandlar slumpmässigt brus till förutsagda bildinbäddningar med hjälp av textinbäddningar.
  3. Decodern: Kulmen på processen, denna del genererar den slutliga visuella utmatningen baserat på textprompten och bildinbäddningen från den föregående fasen. DALL-E 2:s decoder är skyldig till sin arkitektur från en annan modell, GLIDE, som också kan producera realistiska bilder från textuella signaler.
Arkitektur för DALL-E-modell (diffusionsmulti-modell)
Förenklad arkitektur för DALL-E-modell

Python-användare intresserade av Langchain bör kolla in vår detaljerade tutorial som täcker allt från grunderna till avancerade tekniker.

Generativ AI:s tillämpningar

Textuella domäner

Börjande med text, har Generativ AI förändrats fundamentalt av chattbotar som ChatGPT. Beroende tungt på naturligt språkbehandling (NLP) och stora språkmodeller (LLM), är dessa entiteter kapabla att utföra uppgifter som sträcker sig från kodgenerering och språköversättning till sammanfattning och sentimentanalys. ChatGPT, till exempel, har sett en omfattande adoption och blivit en standard för miljontals. Detta förstärks ytterligare av konversationsplattformar för AI, grundade på LLM som GPT-4, PaLM och BLOOM, som lätt producerar text, assisterar i programmering och till och med erbjuder matematiskt resonemang.

Från ett kommersiellt perspektiv blir dessa modeller ovärderliga. Företag använder dem för en mängd olika operationer, inklusive riskhantering, lageroptimering och prognostisering av efterfrågan. Några noterbara exempel inkluderar Bing AI, Google’s BARD och ChatGPT API.

Konst

Världen av bilder har sett dramatiska förändringar med Generativ AI, särskilt sedan DALL-E 2:s introduktion 2022. Denna teknik, som kan generera bilder från textprompt, har både konstnärliga och professionella implikationer. Till exempel har midjourney utnyttjat denna teknik för att producera imponerande realistiska bilder. Denna senaste post avslöjar midjourney i en detaljerad guide, förklarande både plattformen och dess promptteknikens nyanser. Dessutom använder plattformar som Alpaca AI och Photoroom AI Generativ AI för avancerad bildredigering, som bakgrundsavlägsnande, objektborttagning och till och med ansiktsåterställning.

Video-produktion

Video-produktion, medan den fortfarande är i sin linda inom Generativ AI, visar lovande framsteg. Plattformar som Imagen Video, Meta Make A Video och Runway Gen-2 trycker på gränserna för vad som är möjligt, även om verkligt realistiska utmatningar fortfarande ligger på horisonten. Dessa modeller erbjuder betydande nytta för skapandet av digitala mänskliga videor, med applikationer som Synthesia och SuperCreator i spetsen. Noterbart är att Tavus AI erbjuder en unik säljpunkt genom att personanpassa videor för enskilda tittare, en vinst för företag.

Kodskapande

Kodning, en oumbärlig aspekt av vår digitala värld, har inte förblivit opåverkad av Generativ AI. Även om ChatGPT är ett favoritverktyg, har flera andra AI-applikationer utvecklats för kodningsändamål. Dessa plattformar, som GitHub Copilot, Alphacode och CodeComplete, fungerar som kodassistenter och kan till och med producera kod från textprompt. Vad som är intressant är anpassningsförmågan hos dessa verktyg. Codex, den drivande kraften bakom GitHub Copilot, kan anpassas till en persons kodstil, understrykande den personanpassningspotential som Generativ AI erbjuder.

Slutsats

Genom att kombinera mänsklig kreativitet med maskinberäkning, har Generativ AI utvecklats till ett ovärderligt verktyg, med plattformar som ChatGPT och DALL-E 2 som trycker på gränserna för vad som är möjligt. Från att skapa textinnehåll till att forma visuella mästerverk, deras tillämpningar är omfattande och varierade.

Som med alla teknologier är etiska implikationer av största vikt. Medan Generativ AI lovar obegränsad kreativitet, är det avgörande att använda den på ett ansvarsfullt sätt, medveten om potentiella bias och datamanipulationens kraft.

Med verktyg som ChatGPT blir mer tillgängliga, är det nu den perfekta tiden att testa vattnet och experimentera. Oavsett om du är en konstnär, kodare eller teknikentusiast, är sfären av Generativ AI full av möjligheter som väntar på att utforskas. Revolutionen är inte på horisonten; den är här och nu. Så, dyk in!

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.