AGI och framtidens AI
Är GPT-4 ett stort steg mot att uppnå AGI?
Microsoft (MSFT ) har nyligen släppt en forskningsrapport med titeln: Sparks of Artificial General Intelligence: Early experiments with GPT-4. Som beskrivs av Microsoft:
Denna rapport redovisar vår undersökning av en tidig version av GPT-4, när det fortfarande var under aktiv utveckling av OpenAI. Vi hävdar att (denna tidiga version av) GPT-4 är en del av en ny grupp av LLM:er (tillsammans med ChatGPT och Google’s PaLM till exempel) som visar mer allmän intelligens än tidigare AI-modeller.
I denna rapport finns det övertygande bevis som visar att GPT-4 går långt utöver memorering, och att det har en djup och flexibel förståelse av begrepp, färdigheter och domäner. I själva verket överträffar dess förmåga att generalisera alla levande människor idag.
Medan vi tidigare har diskuterat fördelarna med AGI, bör vi snabbt sammanfatta den allmänna uppfattningen om vad ett AGI-system är. I grund och botten är ett AGI en typ av avancerad AI som kan generalisera över flera domäner och inte är smal i omfattning. Exempel på smal AI inkluderar en autonom fordon, en chattbot, en schackbot eller någon annan AI som är utformad för ett enda syfte.
Ett AGI i jämförelse skulle kunna flexibelt alternera mellan någon av ovanstående eller något annat expertområde. Det är en AI som skulle dra nytta av nascenta algoritmer som överföringsinlärning och evolutionär inlärning, samtidigt som det utnyttjar legacy-algoritmer som djup förstärkningsinlärning.
Ovanstående beskrivning av AGI matchar min personliga erfarenhet av att använda GPT-4, samt bevisen som delas i forskningsrapporten som släpptes av Microsoft.
En av de prompter som beskrivs i rapporten är för GPT-4 att skriva ett bevis för oändligheten av primtal i form av en dikt.

Om vi analyserar kraven för att skapa en sådan dikt förstår vi att det kräver matematiskt resonemang, poetisk uttrycksförmåga och naturligt språkgenerering. Detta är en utmaning som skulle överträffa den genomsnittliga förmågan hos de flesta människor.
Rapporten ville förstå om GPT-4 enbart producerade innehåll baserat på allmän memorering eller om det kunde förstå sammanhang och resonera. När det fick i uppdrag att återskapa en dikt i Shakespeares stil kunde det göra det. Detta kräver en mångfacetterad nivå av förståelse som vida överträffar den allmänna befolkningens förmåga och inkluderar teorin om sinne och matematiskt geni.
Hur beräknar man GPT-4:s intelligens?
Frågan blir då hur kan vi mäta en LLM:s intelligens? Och visar GPT-4 beteenden av verkligt lärande eller enbart memorering?
Det nuvarande sättet att testa ett AI-system är att utvärdera systemet på en uppsättning standardbenchmark-datasets, och att se till att de är oberoende av träningsdata och att de täcker en rad uppgifter och domäner. Detta test är nästan omöjligt på grund av den nästan oändliga mängden data som GPT-4 tränades på.
Rapporten diskuterar generering av nya och svåra uppgifter/frågor som övertygande visar att GPT-4 går långt utöver memorering, och att det har en djup och flexibel förståelse av begrepp, färdigheter och domäner.
När det gäller intelligens kan GPT-4 generera korta berättelser, manus och det kan beräkna de mest komplicerade formlerna.
GPT-4 kan också koda på en mycket hög nivå, både när det gäller att skriva kod från instruktioner och förstå befintlig kod. GPT-4 kan hantera en mängd olika koduppgifter, från kodutmaningar till verkliga tillämpningar, från lågnivåsammansättning till högnivåramverk, från enkla datastrukturer till komplexa program som spel. GPT-4 kan också resonera om körning av kod, simulera effekterna av instruktioner och förklara resultaten i naturligt språk. GPT-4 kan till och med köra pseudokod,
GPT-4 kan ge rationella svar på nästan alla prompter som ges. I själva verket är dess intelligens nästan oövervinnelig i sin komplexitet.
GPT-4:s begränsningar
Rapporten fortsätter sedan att beskriva hur de undersökte GPT-4:s svar och beteenden, för att verifiera dess konsekvens, sammanhang och riktighet, och för att avslöja dess begränsningar och partiskhet.
Den mest uppenbara begränsningen är dess benägenhet att hallucinera. Här är ett exempel på en hallucination som ges i rapporten där GPT-4 var säker på sitt svar som var helt fel.

Det verkar som att även GPT-4 förstår denna nuvarande begränsning med hallucinationer, eftersom det gav följande svar när jag frågade vad en GPT-hallucination är:
En GPT-hallucination refererar till ett fenomen där en Generative Pre-trained Transformer (GPT)-modell, som den du för närvarande interagerar med, producerar ett svar som inte baseras på faktisk information eller är sammanhängande med det tillhandahållna sammanhanget. Dessa hallucinationer uppstår när modellen genererar text som kan verka trovärdig men i själva verket är felaktig, vilseledande eller meningslös.
Med andra ord, när du tränar en LLM-AI på världens data, hur undviker du att systemet lär sig felaktig data? En stor språkmodell som lär sig och återger felaktig information och konspirationsteorier kunde faktiskt vara en av de största fallgroparna och hoten som mänskligheten står inför med stor skala adoption av LLM:er. Detta kunde faktiskt vara ett av de större hoten från AGI, ett som förvånansvärt missas när man diskuterar farorna med AGI.
GPT-4:s bevis för intelligens
Rapporten illustrerar att det inte spelade någon roll vilken typ av komplexa prompter som riktades mot det, GPT-4 skulle överträffa förväntningarna. Som det står i rapporten:
Dess obeskrivliga mästerskap av naturligt språk. Det kan inte bara generera flytande och sammanhängande text, utan också förstå och manipulera den på olika sätt, såsom att sammanfatta, översätta eller svara på en extremt bred uppsättning frågor. Dessutom, med översättning menar vi inte bara mellan olika naturliga språk, utan också översättningar i ton och stil, samt över domäner som medicin, juridik, redovisning, dataprogrammering, musik och mer.
Falska tekniska recensioner gavs till GPT-4, det klarade med lätthet, vilket i detta sammanhang betyder att om detta var en människa på andra sidan, skulle de omedelbart bli anställda som programvaruutvecklare. En liknande preliminär test av GPT-4:s kompetens på Multistate Bar Exam visade en noggrannhet över 70%. Detta betyder att i framtiden kunde vi automatisera många av de uppgifter som för närvarande ges till jurister. I själva verket finns det vissa startups som arbetar med att skapa robotjurister med hjälp av GPT-4.
Att producera ny kunskap
Ett av argumenten i rapporten är att det enda som återstår för GPT-4 för att bevisa verklig förståelse är att producera ny kunskap, såsom att bevisa nya matematiska satser, en prestation som för närvarande ligger utanför räckhåll för LLM:er.
Sedan igen är detta det heliga korset för ett AGI. Medan det finns faror med ett AGI som kontrolleras av fel personer, är fördelarna med ett AGI som kan snabbt analysera all historisk data för att upptäcka nya satser, botemedel och behandlingar nästan oändliga.
Ett AGI kunde vara den saknade länken för att hitta botemedel för sällsynta genetiska sjukdomar som för närvarande saknar privat industrifinansiering, för att bota cancer en gång för alla och för att maximera effektiviteten av förnybar energi för att ta bort vår beroende av ohållbar energi. I själva verket kunde det lösa vilket konsekvent problem som helst som matas in i AGI-systemet. Detta är vad Sam Altman och teamet på OpenAI förstår, ett AGI är verkligen den sista uppfinningen som behövs för att lösa de flesta problem och för att gynna mänskligheten.
Detta löser förstås inte problemet med knappen för kärnvapen, vem som kontrollerar AGI och vad deras avsikter är. Oavsett detta papper gör ett fenomenalt jobb med att hävda att GPT-4 är ett stort steg mot att uppnå drömmen som AI-forskare har haft sedan 1956, när den ursprungliga Dartmouth Summer Research Project on Artificial Intelligence sommarworkshop först lanserades.
Medan det är debatterbart om GPT-4 är ett AGI, kunde det lätt hävdas att för första gången i mänsklighetens historia är det ett AI-system som kan klara Turingtestet.












