AI-modellen en platforms

Generatieve AI: Het Idee Achter CHATGPT, DALL-E, Midjourney en Meer

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

De wereld van kunst, communicatie en hoe we de realiteit waarnemen verandert snel. Als we terugkijken naar de geschiedenis van menselijke innovatie, kunnen we de uitvinding van het wiel of de ontdekking van elektriciteit beschouwen als monumentale sprongen. Vandaag de dag vindt een nieuwe revolutie plaats – het overbruggen van de kloof tussen menselijke creativiteit en machineberekeningen. Dat is Generatieve AI.

Generatieve modellen hebben de grens tussen mensen en machines vervaagd. Met de komst van modellen zoals GPT-4, die transformer-modules gebruiken, zijn we dichter bij natuurlijke en contextrijke taalgeneratie gekomen. Deze vooruitgang heeft toepassingen mogelijk gemaakt in documentcreatie, chatbotdialoogsystemen en zelfs synthetische muzieksamenstelling.

Recente beslissingen van grote technologiebedrijven onderstrepen het belang ervan. Microsoft (MSFT ) stopt deze maand met zijn Cortana-app om nieuwe Generatieve AI-innovaties te prioriteren, zoals Bing Chat. Apple (AAPL ) heeft ook een aanzienlijk deel van zijn $22,6 miljard R&D-begroting toegewezen aan generatieve AI, zoals aangegeven door CEO Tim Cook.

Een Nieuwe Era van Modellen: Generatief vs. Discriminatief

Het verhaal van Generatieve AI gaat niet alleen over de toepassingen, maar fundamenteel over de interne werking. In het ecosysteem van kunstmatige intelligentie bestaan twee modellen: discriminatief en generatief.

Discriminatieve modellen zijn wat de meeste mensen in het dagelijks leven tegenkomen. Deze algoritmes nemen invoerdata, zoals tekst of een afbeelding, en koppelen deze aan een doeluitvoer, zoals een vertaling of een medische diagnose. Ze gaan over kaarten en voorspellingen.

Generatieve modellen zijn daarentegen creators. Ze interpreteren of voorspellen niet alleen, maar genereren nieuwe, complexe uitvoer van vectoren van getallen die vaak niet eens gerelateerd zijn aan werkelijke waarden.

 

Generatieve AI-Types: Tekst naar Tekst, Tekst naar Afbeelding (GPT, DALL-E, Midjourney)

De Technologieën Achter Generatieve Modellen

Generatieve modellen bestaan dankzij diepe neurale netwerken, geavanceerde structuren die zijn ontworpen om de functionaliteit van de menselijke hersenen na te bootsen. Door multifacette variaties in data te detecteren en te verwerken, dienen deze netwerken als de ruggengraat van talloze generatieve modellen.

Hoe komen deze generatieve modellen tot leven? Meestal worden ze gebouwd met diepe neurale netwerken, geoptimaliseerd om de multifacette variaties in data te detecteren. Een voorbeeld is het Generatief Adversariaal Netwerk (GAN), waarin twee neurale netwerken, de generator en de discriminator, concurreren en van elkaar leren in een unieke leraar-leerlingrelatie. Van schilderijen tot stijltransfer, van muzieksamenstelling tot spelletjes, deze modellen evolueren en breiden zich uit op manieren die eerder ondenkbaar waren.

Dit houdt niet op bij GANs. Variational Autoencoders (VAEs) zijn een andere belangrijke speler in het veld van generatieve modellen. VAEs onderscheiden zich door hun vermogen om fotorealistische afbeeldingen te creëren vanuit ogenschijnlijk willekeurige getallen. Hoe? Door deze getallen te verwerken via een latent vector, ontstaat er kunst die de complexiteit van menselijke esthetiek weerspiegelt.

Generatieve AI-Types: Tekst naar Tekst, Tekst naar Afbeelding

Transformers & LLM

Het artikel “Attention Is All You Need” van Google (GOOGL ) Brain markeerde een verschuiving in de manier waarop we denken over taalmodellering. In plaats van complexe en sequentiële architectuur zoals Recurrent Neural Networks (RNNs) of Convolutional Neural Networks (CNNs), introduceerde het Transformer-model het concept van aandacht, wat essentieel betekende dat verschillende delen van de invoerTekst afhankelijk van de context werden gefocust. Een van de belangrijkste voordelen was de eenvoud van parallelisatie. In tegenstelling tot RNNs, die tekst sequentieel verwerken en moeilijker zijn om te schalen, kunnen Transformers delen van de tekst gelijktijdig verwerken, waardoor de training sneller en efficiënter is op grote datasets.

Transformer-model architectuur

In een lange tekst is niet elk woord of zin dat je leest even belangrijk. Sommige delen vereisen meer aandacht op basis van de context. Dit is wat het aandachtsmechanisme nabootst.

Om dit te begrijpen, denk aan een zin: “Unite AI publiceert AI- en robotnieuws.” Nu vereist het voorspellen van het volgende woord een begrip van wat het meest relevant is in de voorgaande context. De term ‘Robotics’ kan suggereren dat het volgende woord gerelateerd kan zijn aan een specifieke vooruitgang of gebeurtenis in het veld van robotica, terwijl ‘Publiceert’ kan aangeven dat de volgende context mogelijk over een recente publicatie of artikel gaat.

Self-Attention Mechanism explanation on a demo sentence
Self-Attention Illustratie

Aandachtsmechanismen in Transformers zijn ontworpen om deze selectieve focus te bereiken. Ze meten de belangrijkheid van verschillende delen van de invoerTekst en beslissen waar ze “naar moeten kijken” bij het genereren van een antwoord. Dit is een afwijking van oudere architectuur zoals RNNs, die probeerden de essentie van alle invoerTekst in één ‘staat’ of ‘geheugen’ te proppen.

Het functioneren van aandacht kan worden vergeleken met een sleutel-waarde-opvragingssysteem. Bij het proberen te voorspellen van het volgende woord in een zin, biedt elk voorgaand woord een ‘sleutel’ die zijn potentiële relevantie suggereert, en op basis van hoe goed deze sleutels overeenkomen met de huidige context (of vraag), dragen ze een ‘waarde’ of gewicht bij aan de voorspelling.

Deze geavanceerde AI-diepe leermodellen zijn naadloos geïntegreerd in diverse toepassingen, van Google’s zoekmachineverbeteringen met BERT tot GitHub’s Copilot, die de mogelijkheden van Large Language Models (LLMs) benut om eenvoudige codefragmenten om te zetten in volledig functionele broncodes.

Large Language Models (LLMs) zoals GPT-4, Bard en LLaMA zijn kolossale constructies ontworpen om menselijke taal, code en meer te ontcijferen en te genereren. Hun immense grootte, variërend van miljarden tot triljoenen parameters, is een van de kenmerkende eigenschappen. Deze LLMs worden gevoed met overvloedige hoeveelheden tekstdata, waardoor ze de nuances van menselijke taal kunnen begrijpen. Een opvallend kenmerk van deze modellen is hun vermogen tot “few-shot” leren. In tegenstelling tot conventionele modellen die een grote hoeveelheid specifieke trainingsdata nodig hebben, kunnen LLMs generaliseren vanuit een zeer beperkt aantal voorbeelden (of “shots”)

State van Large Language Models (LLMs) per medio 2023

Modelnaam Ontwikkelaar Parameters Beschikbaarheid en Toegang Opvallende Kenmerken en Opmerkingen
GPT-4 OpenAI 1,5 Biljoen Niet Open Source, Alleen API-toegang Indrukwekkende prestaties op diverse taken, kan afbeeldingen en tekst verwerken, maximaal 32.768 tokens invoerlengte
GPT-3 OpenAI 175 miljard Niet Open Source, Alleen API-toegang Heeft few-shot en zero-shot learningmogelijkheden gedemonstreerd. Voert tekstvoltooiing in natuurlijke taal uit.
BLOOM BigScience 176 miljard Downloadbaar Model, API-toegang beschikbaar Multitalig LLM ontwikkeld door wereldwijde samenwerking. Ondersteunt 13 programmeertalen.
LaMDA Google 173 miljard Niet Open Source, Geen API of Download Getraind op dialoog, kan leren over vrijwel elk onderwerp.
MT-NLG Nvidia /Microsoft 530 miljard API-toegang op aanvraag Maakt gebruik van transformer-gebaseerde Megatron-architectuur voor diverse NLP-taken.
LLaMA Meta AI 7B tot 65B) Downloadbaar op aanvraag Bedoeld om AI te democratiseren door toegang te bieden aan onderzoekers, overheden en academici.

Hoe Worden LLMs Gebruikt?

LLMs kunnen op diverse manieren worden gebruikt, waaronder:

  1. Directe Toepassing: Het gebruik van een vooraf getrainde LLM voor tekstgeneratie of -verwerking. Bijvoorbeeld het gebruik van GPT-4 om een blogpost te schrijven zonder verdere fine-tuning.
  2. Fine-tuning: Het aanpassen van een vooraf getrainde LLM voor een specifieke taak, een methode bekend als transfer learning. Een voorbeeld zou zijn het aanpassen van T5 om samenvattingen te genereren voor documenten in een specifieke branche.
  3. Informatie-opvraging: Het gebruik van LLMs, zoals BERT of GPT, als onderdeel van grotere architectuur om systemen te ontwikkelen die informatie kunnen opvragen en categoriseren.
Generatieve AI ChatGPT Fine Tuning
ChatGPT Fine Tuning Architectuur

Multi-Head Aandacht: Waarom Één Als Je Er Meer Kan Hebben?

Echter, het vertrouwen op één aandachtsmechanisme kan beperkend zijn. Verschillende woorden of sequenties in een tekst kunnen verschillende soorten relevantie of associaties hebben. Dit is waar multi-head aandacht om de hoek komt. In plaats van één set aandachtsgewichten, gebruikt multi-head aandacht meerdere sets, waardoor het model een rijker scala aan relaties in de invoerTekst kan detecteren. Elke aandachts-“kop” kan zich op verschillende delen of aspecten van de invoerTekst richten, en hun gecombineerde kennis wordt gebruikt voor de finale voorspelling.

ChatGPT: Het Meest Populaire Generatieve AI-Gereedschap

Beginnend met GPT’s introductie in 2018, was het model in wezen gebouwd op een fundament van 12 lagen, 12 aandachtskoppen en 120 miljoen parameters, voornamelijk getraind op een dataset genaamd BookCorpus. Dit was een indrukwekkende start, die een glimp gaf van de toekomst van taalmodellen.

GPT-2, onthuld in 2019, bood een viermaal zo grote toename in lagen en aandachtskoppen. Belangrijk was dat het aantal parameters explosief toenam tot 1,5 miljard. Deze verbeterde versie was afgeleid van WebText, een dataset verrijkt met 40GB aan tekst van diverse Reddit-links.

GPT-3, gelanceerd in mei 2020, had 96 lagen, 96 aandachtskoppen en een enorm aantal parameters van 175 miljard. Wat GPT-3 onderscheidde, was de diverse trainingsdata, waaronder CommonCrawl, WebText, Engelse Wikipedia, boekcorpora en andere bronnen, die in totaal 570 GB opleverden.

De details van ChatGPT’s werking blijven een goed bewaard geheim. Echter, een proces genaamd ‘versterking van het leren vanuit menselijke feedback’ (RLHF) is bekend als cruciaal. Afkomstig van een eerdere ChatGPT-project, was deze techniek instrumenteel bij het afstemmen van het GPT-3.5-model om meer in overeenstemming te zijn met geschreven instructies.

ChatGPT’s training bestaat uit een driedelige aanpak:

  1. Begeleide fine-tuning: Het samenstellen van door mensen geschreven conversational invoer en uitvoer om het onderliggende GPT-3.5-model te verfijnen.
  2. Beloningsmodellering: Mensen beoordelen verschillende modeluitvoer op kwaliteit, waardoor een beloningsmodel wordt getraind dat elke uitvoer scoort met betrekking tot de conversatiecontext.
  3. Versterking van het leren: De conversatiecontext dient als achtergrond waarbij het onderliggende model een reactie voorstelt. Deze reactie wordt beoordeeld door het beloningsmodel, en het proces wordt geoptimaliseerd met behulp van een algoritme genaamd proximale policy-optimalisatie (PPO).

Voor diegenen die voor het eerst met ChatGPT werken, is een uitgebreide startersgids beschikbaar hier. Als je dieper wilt duiken in prompt-engineering met ChatGPT, hebben we ook een geavanceerde gids die de nieuwste en meest geavanceerde prompttechnieken behandelt, beschikbaar op ‘ChatGPT & Geavanceerde Prompt-Engineering: De AI-Evolutie Aandrijven‘.

Diffusie & Multimodale Modellen

Terwijl modellen zoals VAEs en GANs hun uitvoer genereren via één enkele pas, en dus vastzitten in wat ze produceren, hebben diffusiemodellen het concept van ‘iteratieve verfijning‘ geïntroduceerd’. Via deze methode keren ze terug, verfijnen fouten uit eerdere stappen en produceren geleidelijk een meer gepolijst resultaat.

Centraal in diffusiemodellen staat de kunst van “corruptie” en “verfijning”. In hun trainingsfase wordt een typische afbeelding geleidelijk aan corrupt door het toevoegen van variabele niveaus van ruis. Deze ruisige versie wordt vervolgens aan het model gevoerd, dat probeert om deze “te denoiseren” of “te ontdoen van corruptie”. Door meerdere rondes van dit proces wordt het model bedreven in restauratie, en leert het zowel subtiele als significante afwijkingen.

Generatieve AI - Midjourney Prompt
Afbeelding gegenereerd vanuit Midjourney

Het proces van het genereren van nieuwe afbeeldingen na de training is intrigerend. Beginnend met een volledig willekeurige invoer, wordt deze continu verfijnd met behulp van het model’s voorspellingen. Het doel is om een onberispelijke afbeelding te bereiken met het minimum aantal stappen. De controle over het corruptieniveau wordt gedaan via een “ruisplanning”, een mechanisme dat bepaalt hoeveel ruis op verschillende stadia wordt toegepast. Een planner, zoals gezien in bibliotheken als “diffusers“, dicteert de aard van deze ruisige weergaven op basis van gevestigde algoritmen.

Een essentiële architecturale ruggengraat voor veel diffusiemodellen is de UNet—een convolutioneel neuronaal netwerk ontworpen voor taken die outputs vereisen die de ruimtelijke dimensie van de invoer weerspiegelen. Het is een combinatie van downsampling- en upsampling-lagen, die ingewikkeld zijn verbonden om hoge-resolutiegegevens te behouden, wat cruciaal is voor afbeeldingsgerelateerde outputs.

Dieper duiken in het rijk van generatieve modellen, komt OpenAI’s DALL-E 2 naar voren als een schitterend voorbeeld van de fusie van tekstuele en visuele AI-mogelijkheden. Het gebruikt een driedelige structuur:

DALL-E 2 toont een driedubbele architectuur:

  1. Tekstencoder: Het omzetten van de tekstprompt in een conceptueel ingebed in een latent ruimte. Dit model begint niet van scratch. Het leunt op OpenAI’s Contrastive Language–Image Pre-training (CLIP) dataset als zijn fundament. CLIP dient als een brug tussen visuele en tekstuele data door visuele concepten te leren met behulp van natuurlijke taal. Via een mechanisme genaamd contrastief leren, identificeert en matcht het afbeeldingen met hun corresponderende tekstuele beschrijvingen.
  2. De Prior: De tekstembedding afgeleid van de encoder wordt vervolgens omgezet in een afbeeldingembedding. DALL-E 2 heeft zowel autoregressieve als diffusiemethoden getest voor deze taak, waarbij de laatste superieure resultaten liet zien. Autoregressieve modellen, zoals gezien in Transformers en PixelCNN, genereren outputs in sequenties. Aan de andere kant gebruiken diffusiemodellen, zoals die in DALL-E 2, willekeurig ruis om te transformeren in voorspelde afbeeldingembeddings met behulp van tekstembeddings.
  3. De Decoder: Het hoogtepunt van het proces, deze fase genereert de finale visuele output op basis van de tekstprompt en de afbeeldingembedding uit de vorige fase. DALL-E 2’s decoder is gebaseerd op een ander model, GLIDE, dat eveneens realistische afbeeldingen kan produceren vanuit tekstuele hints.
Architectuur van DALL-E model (diffusie multi-model)
Vereenvoudigde Architectuur van DALL-E Model

Python-gebruikers geïnteresseerd in Langchain kunnen onze gedetailleerde tutorial bekijken, die alles behandelt van de basis tot geavanceerde technieken.

Toepassingen van Generatieve AI

Tekstuele Domeinen

Beginnend met tekst, heeft Generatieve AI fundamenteel verandering gebracht door chatbots zoals ChatGPT. Zwaar leunend op Natural Language Processing (NLP) en large language models (LLMs), zijn deze entiteiten in staat om taken uit te voeren die variëren van codegeneratie en taalvertaling tot samenvatting en sentimentanalyse. ChatGPT, bijvoorbeeld, heeft een brede adoptie gezien en is een standaard geworden voor miljoenen. Dit wordt verder versterkt door conversational AI-platforms, gebaseerd op LLMs zoals GPT-4, PaLM, en BLOOM, die moeiteloos tekst produceren, helpen bij programmeren en zelfs wiskundige redenering bieden.

Vanuit een commercieel perspectief worden deze modellen onmisbaar. Bedrijven gebruiken ze voor een veelvoud aan operaties, waaronder risicobeheer, voorraadoptimalisatie en vraagvoorspelling. Enkele opvallende voorbeelden zijn Bing AI, Google’s BARD en ChatGPT API.

Kunst

De wereld van afbeeldingen heeft dramatische transformaties gezien met Generatieve AI, met name sinds de introductie van DALL-E 2 in 2022. Deze technologie, die afbeeldingen kan genereren vanuit tekstuele prompts, heeft zowel artistieke als professionele implicaties. Zo heeft Midjourney deze technologie gebruikt om indrukwekkend realistische afbeeldingen te produceren. Een recente post demystificeert Midjourney in een gedetailleerde gids, die zowel het platform als de nuances van prompt-engineering behandelt. Bovendien gebruiken platforms als Alpaca AI en Photoroom AI Generatieve AI voor geavanceerde beeldbewerkingsfuncties zoals achtergrondverwijdering, objectverwijdering en zelfs gezichtsrestauratie.

Video Productie

Video-productie, hoewel nog in de kinderschoenen in het rijk van Generatieve AI, toont veelbelovende vooruitgang. Platforms als Imagen Video, Meta Make A Video en Runway Gen-2 duwen de grenzen van wat mogelijk is, zelfs als echt realistische outputs nog op de horizon liggen. Deze modellen bieden aanzienlijke utiliteit voor het creëren van digitale menselijke video’s, met toepassingen zoals Synthesia en SuperCreator die de leiding nemen. Opvallend is dat Tavus AI een uniek verkoopargument biedt door video’s te personaliseren voor individuele kijkers, een zegen voor bedrijven.

Code Creatie

Coderen, een onmisbaar aspect van onze digitale wereld, is niet onaangetast gebleven door Generatieve AI. Hoewel ChatGPT een favoriet gereedschap is, zijn verschillende andere AI-toepassingen ontwikkeld voor coderingsdoeleinden. Deze platforms, zoals GitHub Copilot, Alphacode en CodeComplete, dienen als coderingsassistenten en kunnen zelfs code produceren vanuit tekstuele prompts. Wat intrigerend is, is de aanpasbaarheid van deze tools. Codex, de kracht achter GitHub Copilot, kan worden aangepast aan de coderingsstijl van een individu, onderstrepend het personalisatiepotentieel van Generatieve AI.

Conclusie

Het combineren van menselijke creativiteit met machineberekeningen heeft het tot een onmisbaar gereedschap geëvolueerd, met platforms als ChatGPT en DALL-E 2 die de grenzen van wat denkbaar is verleggen. Van het creëren van tekstuele inhoud tot het vormgeven van visuele meesterwerken, hun toepassingen zijn uitgebreid en gevarieerd.

Net als bij elke technologie zijn ethische implicaties van het grootste belang. Terwijl Generatieve AI onbeperkte creativiteit belooft, is het cruciaal om het verantwoordelijk te gebruiken, waarbij men zich bewust is van potentiële vooroordelen en de kracht van dataprocessing.

Met gereedschappen als ChatGPT die toegankelijker worden, is het nu het perfecte moment om de wateren te testen en te experimenteren. Of je nu een kunstenaar, programmeur of technologie-enthousiast bent, het rijk van Generatieve AI is rijk aan mogelijkheden die wachten om te worden verkend. De revolutie is niet aan de horizon; het is hier en nu. Dus, duik erin!

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.