Tankeledere
Hvordan godt kan LLM’er egentlig gennemtænke besværlige problemer?
Introduktionen og udviklingen af generativ AI har været så pludselig og intens, at det faktisk er ret svært at fuldt ud værdsætte, hvor meget denne teknologi har ændret vores liv.
Zoom ud til for blot tre år siden. Ja, AI blev mere udbredt, i hvert fald i teorien. Flere mennesker kendte nogle af de ting, det kunne gøre, selv om der også var massive misforståelser om AI’s evner. På en eller anden måde blev teknologien samtidig givet for lidt og for meget credit for, hvad den faktisk kunne opnå. Alligevel kunne den gennemsnitlige person pege på mindst ét eller to områder, hvor AI var i gang, og udførte højt specialiserede opgaver rimelig godt, i højt kontrollerede miljøer. Alt andet var enten stadig i et forskningslaboratorium eller eksisterede simpelthen ikke.
Sammenlign det med i dag. Med ingen færdigheder ud over evnen til at skrive en sætning eller stille et spørgsmål, er verden ved vores fingertippe. Vi kan generere billeder, musik og endda film, der er virkelig unikke og fantastiske, og har mulighed for at afbryde hele brancher. Vi kan overbelaste vores søgemaskineproces, stille et simpelt spørgsmål, der, hvis det er formuleret korrekt, kan generere sider med brugervenlig indhold, der er godt nok til at kunne gå for en universitetsuddannet forsker … eller en gennemsnitlig tredje klasse-elev, hvis vi specificerer synsvinklen. Mens disse muligheder på en eller anden måde er blevet almindelige på blot et eller to år, blev de betragtet som absolut umulige blot få år tidligere. Området for generativ AI eksisterede, men var ikke taget af.
I dag har mange mennesker eksperimenteret med generativ AI, såsom ChatGPT, Midjourney eller andre værktøjer. Andre har allerede inkorporeret dem i deres daglige liv. Hastigheden, hvormed disse har udviklet sig, er så intens, at det er næsten alarmende. Og med tanke på fremgangen i de sidste seks måneder, er vi uden tvivl gået til at blive overvældet, igen og igen, i de kommende få år.
Et bestemt værktøj i spil inden for generativ AI har været præstationen af Retrieval-Augmented Generation (RAG)-systemer og deres evne til at tænke igennem særligt komplekse forespørgsler. Introduktionen af FRAMES-datasettet, som er beskrevet i detaljer i en artikel om, hvordan vurderingsdatasettet fungerer, viser både, hvor kunstens tilstand er lige nu, og hvor den er på vej hen. Selv siden introduktionen af FRAMES i slutningen af 2024 har en række platforme allerede slået nye rekorder, når det kommer til deres evne til at gennemtænke svære og komplekse forespørgsler.
Lad os dykke ned i, hvad FRAMES er meant til at evaluere, og hvor godt forskellige generative AI-modeller performer. Vi kan se, hvordan både decentralisering og åbne platforme ikke kun holder deres grund (især Sentient Chat), men også giver brugerne mulighed for at få et klart glimt af den forbløffende tankegang, som nogle AI-modeller er i stand til at opnå.
FRAMES som et vindue ind i GenAI-hjernen
FRAMES-datasettet og dens vurderingsproces fokuserer på 824 “multi-hop”-spørgsmål, der kræver slutning, logisk sammenhæng, brug af flere forskellige kilder til at hente nøgleinformation, og evnen til logisk at samle alle disse sammen for at besvare spørgsmålet. Spørgsmålene kræver mellem to og 15 dokumenter for at besvare dem korrekt, og indeholder også bevidst begrænsninger, matematiske beregninger og slutninger, samt evnen til at behandle tidsbaseret logik. Med andre ord er disse spørgsmål ekstremt svære og repræsenterer faktisk meget virkelige forskningsopgaver, som et menneske kan påtage sig på internettet. Vi står over for disse udfordringer hele tiden, og må søge efter de spredte nøglestykker af information i en hav af internettet-kilder, samle information sammen baseret på forskellige hjemmesider, oprette ny information ved at beregne og slutte, og forstå, hvordan man kan konsolidere disse fakta til et korrekt svar på spørgsmålet.
Hvad forskerne fandt, da datasettet først blev udgivet og testet, var, at de top GenAI-modeller var i stand til at være nogenlunde nøjagtige (omkring 40%), når de havde brug for at besvare ved hjælp af enkelttrinsmetoder, men kunne opnå en nøjagtighed på 73%, hvis de fik lov til at samle alle nødvendige dokumenter for at besvare spørgsmålet. Ja, 73% kan måske ikke synes som en revolution. Men hvis man forstår nøjagtigt, hvad der skal besvares, bliver tallet meget mere imponerende.
For eksempel er et bestemt spørgsmål: “Hvilket år var bandlederen for gruppen, der oprindeligt opførte sangen, der er samplet i Kanye Wests sang Power, født?” Hvordan ville et menneske gå til at løse dette problem? Personen ville måske se, at de har brug for at samle forskellige informationselementer, såsom teksten til Kanye Wests sang “Power”, og derefter være i stand til at se gennem teksten og identificere det punkt i sangen, hvor en anden sang faktisk er samplet. Vi som mennesker kunne sandsynligvis lytte til sangen (selv hvis vi ikke kender den) og være i stand til at sige, når en anden sang er samplet.
Men tænk over det: Hvad skulle en GenAI have opnå for at detektere en sang, der er samplet i en anden sang, mens den “lytter” til den? Dette er, hvor et grundlæggende spørgsmål bliver en fremragende test af virkelig intelligent AI. Og hvis vi var i stand til at finde sangen, lytte til den og identificere teksten, der er samplet, er det kun skridt 1. Vi har stadig brug for at finde ud af, hvad sangens navn er, hvad bandets navn er, hvem bandets leder er, og derefter, hvilket år den person er født.
FRAMES viser, at for at besvare realistiske spørgsmål, er der brug for en enorm mængde tankeprocesser. To ting kommer i tanke her.
Først, evnen af decentraliserede GenAI-modeller til ikke kun at konkurrere, men potentielt dominere resultaterne, er utrolig. En voksende antal virksomheder bruger den decentraliserede metode til at skala deres behandlingsmuligheder, samtidig med at de sikrer, at en stor fællesskab ejer softwaren, og ikke en centraliseret sort boks, der ikke vil dele sine fremskridt. Virksomheder som Perplexity og Sentient er førende i denne trend, hver med formidable modeller, der performer over de første nøjagtighedsrekorder, da FRAMES blev udgivet.
Det andet element er, at et mindre antal af disse AI-modeller ikke kun er decentraliserede, men også åbne. For eksempel er Sentient Chat begge, og tidlige tests viser, hvor kompleks deres tankegang kan være, takket være den uvurderlige åbne adgang. FRAMES-spørgsmålet ovenfor besvares ved hjælp af stort set samme tankegang, som et menneske ville bruge, med detaljer om deres tankegang tilgængelige for gennemsyn. Måske endnu mere interessant er, at deres platform er struktureret som en række modeller, der kan finjustere en given synsvinkel og præstation, selv om finjusteringsprocessen i nogle GenAI-modeller resulterer i formindsket nøjagtighed. I tilfældet af Sentient Chat er mange forskellige modeller blevet udviklet. For eksempel er en ny model kaldet “Dobby 8B” i stand til både at overgå FRAMES-benchmarket og udvikle en distinkt pro-krypto og pro-frihedsholdning, der påvirker modellens synsvinkel, mens den behandler stykker af information og udvikler et svar.
På horisonten
Nøglen til alle disse forbløffende innovationer er den raske hastighed, der har bragt os hertil. Vi må erkende, at så hurtigt, som denne teknologi har udviklet sig, vil den kun udvikle sig endnu hurtigere i den nærmeste fremtid. Vi vil være i stand til at se, især med decentraliserede og åbne GenAI-modeller, den kritiske grænse, hvor systemets intelligens begynder at overgå mere og mere af vores egen, og hvad det betyder for fremtiden.












