AGI en toekomstige AI

De puzzel ontwarren: OpenAI’s vermeende Q-Star-model ontrafeld

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Er is onlangs veel speculatie geweest binnen de AI-gemeenschap over OpenAI’s vermeende project, Q-star. Ondanks de beperkte informatie over dit mysterieuze initiatief, wordt gezegd dat het een significante stap is naar het bereiken van kunstmatige algemene intelligentie – een niveau van intelligentie dat het menselijke vermogen evenaart of overtreft. Terwijl veel van de discussie zich heeft gericht op de potentiële negatieve gevolgen van deze ontwikkeling voor de mensheid, is er relatief weinig moeite gedaan om de aard van Q-star en de potentiële technologische voordelen die het kan bieden, te onthullen. In dit artikel zal ik een verkenning uitvoeren, waarbij ik zal proberen dit project te ontrafelen, voornamelijk vanuit de naam, die ik geloof voldoende informatie biedt om inzichten over het project te verkrijgen.

Achtergrond van het mysterie

Het begon allemaal toen de raad van bestuur van OpenAI plotseling Sam Altman, de CEO en medeoprichter, verwijderde. Hoewel Altman later werd hersteld, blijven er vragen over de gebeurtenissen. Sommigen zien het als een strijd om de macht, terwijl anderen het toeschrijven aan Altman’s focus op andere ondernemingen zoals Worldcoin. Het verhaal wordt echter nog ingewikkelder als Reuters meldt dat een geheim project genaamd Q-star mogelijk de hoofdreden is voor het drama. Volgens Reuters markeert Q-Star een aanzienlijke stap in de richting van OpenAI’s doel om kunstmatige algemene intelligentie te bereiken, een kwestie die door de werknemers van OpenAI aan de raad van bestuur is meegedeeld. De verschijning van dit nieuws heeft een vloedgolf van speculaties en zorgen veroorzaakt.

Bouwstenen van de puzzel

In dit deel heb ik enkele bouwstenen geïntroduceerd die ons helpen om dit mysterie te ontrafelen.

  • Q-Learning: Versterking van het leren is een type machine learning waarbij computers leren door interactie met hun omgeving, waarbij ze feedback ontvangen in de vorm van beloningen of straffen. Q-Learning is een specifieke methode binnen versterking van het leren die computers helpt bij het nemen van beslissingen door de kwaliteit (Q-waarde) van verschillende acties in verschillende situaties te leren. Het wordt veel gebruikt in scenario’s zoals game-spelen en robotica, waardoor computers kunnen leren om optimale beslissingen te nemen door een proces van trial en error.
  • A-star zoekalgoritme: A-star is een zoekalgoritme dat computers helpt om mogelijkheden te verkennen en de beste oplossing te vinden voor een probleem. Het algoritme is vooral opvallend vanwege zijn efficiëntie in het vinden van de kortste route van een startpunt naar een doel in een grafiek of grid. Zijn belangrijkste kracht ligt in het slim wegen van de kosten van het bereiken van een knooppunt tegen de geschatte kosten van het bereiken van het overall doel. Als gevolg hiervan wordt A-star uitgebreid gebruikt om uitdagingen gerelateerd aan routeplanning en optimalisatie aan te pakken.
  • AlphaZero: AlphaZero, een geavanceerd AI-systeem van DeepMind, combineert Q-learning en zoekfuncties (d.w.z. Monte Carlo Tree Search) voor strategisch plannen in bordspellen zoals schaken en Go. Het leert optimale strategieën door zelfspel, geleid door een neurale netwerk voor zetten en positiebeoordeling. De Monte Carlo Tree Search (MCTS) algoritme balanceert exploratie en exploitatie bij het verkennen van spel mogelijkheden. AlphaZero’s iteratieve zelfspel, leren en zoekproces leidt tot continue verbetering, waardoor het supermenselijke prestaties en overwinningen op menselijke kampioenen mogelijk maakt, en zo zijn effectiviteit in strategisch plannen en probleemoplossing aantoont.
  • Taalmodellen: Grote taalmodellen (LLM’s), zoals GPT-3, zijn een vorm van AI die is ontworpen voor het begrijpen en genereren van mensachtige tekst. Ze ondergaan training op uitgebreide en diverse internetgegevens, die een breed spectrum van onderwerpen en schrijfstijlen dekken. Het opvallende kenmerk van LLM’s is hun vermogen om de volgende woord in een sequentie te voorspellen, bekend als taalmodellering. Het doel is om een begrip te geven van hoe woorden en zinnen met elkaar in verband staan, waardoor het model coherente en contextueel relevante tekst kan produceren. De uitgebreide training maakt LLM’s bedreven in het begrijpen van grammatica, semantiek en zelfs nuances van taalgebruik. Eenmaal getraind, kunnen deze taalmodellen worden aangepast voor specifieke taken of toepassingen, waardoor ze veelzijdige instrumenten zijn voor natuurlijke taalverwerking, chatbots, inhoudsgeneratie en meer.
  • Kunstmatige algemene intelligentie: Kunstmatige algemene intelligentie (AGI) is een type kunstmatige intelligentie met de capaciteit om te begrijpen, te leren en taken uit te voeren die diverse domeinen omvatten op een niveau dat het menselijke cognitieve vermogen evenaart of overtreft. In tegenstelling tot smalle of gespecialiseerde AI, heeft AGI de capaciteit om autonoom aan te passen, te redeneren en te leren zonder beperkt te zijn tot specifieke taken. AGI stelt AI-systemen in staat om onafhankelijke beslissingen te nemen, problemen op te lossen en creatief te denken, waardoor het menselijke intelligentie nabootst. In wezen belichaamt AGI het idee van een machine die elke intellectuele taak kan uitvoeren die door mensen wordt uitgevoerd, waardoor het flexibiliteit en aanpasbaarheid over verschillende domeinen toont.

Sleutelbeperkingen van LLM’s bij het bereiken van AGI

Grote taalmodellen (LLM’s) hebben beperkingen bij het bereiken van kunstmatige algemene intelligentie (AGI). Terwijl ze bedreven zijn in het verwerken en genereren van tekst op basis van geleerde patronen uit uitgebreide gegevens, hebben ze moeite om de echte wereld te begrijpen, waardoor effectief gebruik van kennis wordt gehinderd. AGI vereist alledaagse redenering en planningsvaardigheden voor het omgaan met dagelijkse situaties, die LLM’s moeilijk vinden. Ondanks het produceren van ogenschijnlijk correcte antwoorden, ontbreekt het hen aan de capaciteit om systematisch complexe problemen op te lossen, zoals wiskundige problemen.

Nieuwe studies geven aan dat LLM’s elke berekening kunnen nabootsen als een universele computer, maar worden beperkt door de noodzaak van uitgebreide externe geheugen. Het vergroten van gegevens is cruciaal voor het verbeteren van LLM’s, maar het vereist aanzienlijke berekeningsbronnen en energie, in tegenstelling tot het energie-efficiënte menselijke brein. Dit stelt uitdagingen voor het maken van LLM’s breed beschikbaar en schaalbaar voor AGI. Recent onderzoek suggereert dat het simpelweg toevoegen van meer gegevens de prestaties niet altijd verbetert, waardoor de vraag ontstaat waarop men zich moet concentreren bij de reis naar AGI.

Verbindingen leggen

Veel AI-experts geloven dat de uitdagingen met grote taalmodellen (LLM’s) voortkomen uit hun hoofdfocus op het voorspellen van het volgende woord. Dit beperkt hun begrip van taalnuances, redenering en plannen. Om hiermee om te gaan, suggereren onderzoekers zoals Yann LeCun dat men andere trainingsmethoden moet proberen. Zij stellen voor dat LLM’s actief moeten plannen voor het voorspellen van woorden, in plaats van alleen het volgende token.

Het idee van “Q-star”, vergelijkbaar met AlphaZero’s strategie, kan inhouden dat LLM’s actief plannen voor tokenvoorspelling, in plaats van alleen het volgende woord te voorspellen. Dit brengt gestructureerde redenering en plannen in de taalmodellen, waardoor het gaat beyond de gebruikelijke focus op het voorspellen van het volgende token. Door planningsstrategieën geïnspireerd door AlphaZero te gebruiken, kunnen LLM’s beter taalnuances begrijpen, redenering verbeteren en plannen, waardoor de beperkingen van reguliere LLM-trainingsmethoden worden aangepakt.

Deze integratie zet een flexibel kader op voor het representeren en manipuleren van kennis, waardoor het systeem zich kan aanpassen aan nieuwe informatie en taken. Deze aanpasbaarheid kan cruciaal zijn voor kunstmatige algemene intelligentie (AGI), die in staat moet zijn om diverse taken en domeinen met verschillende vereisten aan te pakken.

AGI heeft alledaagse redenering nodig, en het trainen van LLM’s om te redeneren kan hen uitrusten met een omvattend begrip van de wereld. Bovendien kan het trainen van LLM’s zoals AlphaZero hen helpen om abstracte kennis te leren, waardoor transfer learning en generalisatie over verschillende situaties worden verbeterd, waardoor AGI’s sterke prestaties worden bijgedragen.

Naast de naam van het project, komt steun voor dit idee van een Reuters-rapport, dat de mogelijkheid van Q-star om specifieke wiskundige en redeneringsproblemen succesvol op te lossen, benadrukt.

De bodemlijn

Q-Star, OpenAI’s geheime project, maakt golven in de AI-wereld, met als doel intelligentie die verder gaat dan die van de mens. Tussen alle gesprekken over de potentiële risico’s, graaft dit artikel in de puzzel, waarbij het verbanden legt van Q-learning tot AlphaZero en grote taalmodellen (LLM’s).

We denken dat “Q-star” een slimme fusie van leren en zoeken is, waardoor LLM’s een boost krijgen in plannen en redeneren. Met Reuters die meldt dat het ingewikkelde wiskundige en redeneringsproblemen aankan, suggereert dit een belangrijke vooruitgang. Dit roept op om een nauwere blik te werpen op waar AI-leren in de toekomst naartoe kan gaan.

Dr. Tehseen Zia is een gewaardeerd associate professor aan de COMSATS University Islamabad, met een PhD in AI van de Vienna University of Technology, Oostenrijk. Hij specialiseert zich in Artificial Intelligence, Machine Learning, Data Science en Computer Vision, en heeft significante bijdragen geleverd met publicaties in gerenommeerde wetenschappelijke tijdschriften. Dr. Tehseen heeft ook verschillende industriële projecten geleid als hoofdonderzoeker en heeft gediend als AI-consultant.