Tankeledere
Hvordan godt kan LLM’er egentlig gennemtÃĶnke besvÃĶrlige problemer?
Introduktionen og udviklingen af generativ AI har vÃĶret sÃĨ pludselig og intens, at det faktisk er ret svÃĶrt at fuldt ud vÃĶrdsÃĶtte, hvor meget denne teknologi har ÃĶndret vores liv.
Zoom ud til for blot tre ÃĨr siden. Ja, AI blev mere udbredt, i hvert fald i teorien. Flere mennesker kendte nogle af de ting, det kunne gÃļre, selv om der ogsÃĨ var massive misforstÃĨelser om AIâs evner. PÃĨ en eller anden mÃĨde blev teknologien samtidig givet for lidt og for meget credit for, hvad den faktisk kunne opnÃĨ. Alligevel kunne den gennemsnitlige person pege pÃĨ mindst ÃĐt eller to omrÃĨder, hvor AI var i gang, og udfÃļrte hÃļjt specialiserede opgaver rimelig godt, i hÃļjt kontrollerede miljÃļer. Alt andet var enten stadig i et forskningslaboratorium eller eksisterede simpelthen ikke.
Sammenlign det med i dag. Med ingen fÃĶrdigheder ud over evnen til at skrive en sÃĶtning eller stille et spÃļrgsmÃĨl, er verden ved vores fingertippe. Vi kan generere billeder, musik og endda film, der er virkelig unikke og fantastiske, og har mulighed for at afbryde hele brancher. Vi kan overbelaste vores sÃļgemaskineproces, stille et simpelt spÃļrgsmÃĨl, der, hvis det er formuleret korrekt, kan generere sider med brugervenlig indhold, der er godt nok til at kunne gÃĨ for en universitetsuddannet forsker âĶ eller en gennemsnitlig tredje klasse-elev, hvis vi specificerer synsvinklen. Mens disse muligheder pÃĨ en eller anden mÃĨde er blevet almindelige pÃĨ blot et eller to ÃĨr, blev de betragtet som absolut umulige blot fÃĨ ÃĨr tidligere. OmrÃĨdet for generativ AI eksisterede, men var ikke taget af.
I dag har mange mennesker eksperimenteret med generativ AI, sÃĨsom ChatGPT, Midjourney eller andre vÃĶrktÃļjer. Andre har allerede inkorporeret dem i deres daglige liv. Hastigheden, hvormed disse har udviklet sig, er sÃĨ intens, at det er nÃĶsten alarmende. Og med tanke pÃĨ fremgangen i de sidste seks mÃĨneder, er vi uden tvivl gÃĨet til at blive overvÃĶldet, igen og igen, i de kommende fÃĨ ÃĨr.
Et bestemt vÃĶrktÃļj i spil inden for generativ AI har vÃĶret prÃĶstationen af Retrieval-Augmented Generation (RAG)-systemer og deres evne til at tÃĶnke igennem sÃĶrligt komplekse forespÃļrgsler. Introduktionen af FRAMES-datasettet, som er beskrevet i detaljer i en artikel om, hvordan vurderingsdatasettet fungerer, viser bÃĨde, hvor kunstens tilstand er lige nu, og hvor den er pÃĨ vej hen. Selv siden introduktionen af FRAMES i slutningen af 2024 har en rÃĶkke platforme allerede slÃĨet nye rekorder, nÃĨr det kommer til deres evne til at gennemtÃĶnke svÃĶre og komplekse forespÃļrgsler.
Lad os dykke ned i, hvad FRAMES er meant til at evaluere, og hvor godt forskellige generative AI-modeller performer. Vi kan se, hvordan bÃĨde decentralisering og ÃĨbne platforme ikke kun holder deres grund (isÃĶr Sentient Chat), men ogsÃĨ giver brugerne mulighed for at fÃĨ et klart glimt af den forblÃļffende tankegang, som nogle AI-modeller er i stand til at opnÃĨ.
FRAMES som et vindue ind i GenAI-hjernen
FRAMES-datasettet og dens vurderingsproces fokuserer pÃĨ 824 âmulti-hopâ-spÃļrgsmÃĨl, der krÃĶver slutning, logisk sammenhÃĶng, brug af flere forskellige kilder til at hente nÃļgleinformation, og evnen til logisk at samle alle disse sammen for at besvare spÃļrgsmÃĨlet. SpÃļrgsmÃĨlene krÃĶver mellem to og 15 dokumenter for at besvare dem korrekt, og indeholder ogsÃĨ bevidst begrÃĶnsninger, matematiske beregninger og slutninger, samt evnen til at behandle tidsbaseret logik. Med andre ord er disse spÃļrgsmÃĨl ekstremt svÃĶre og reprÃĶsenterer faktisk meget virkelige forskningsopgaver, som et menneske kan pÃĨtage sig pÃĨ internettet. Vi stÃĨr over for disse udfordringer hele tiden, og mÃĨ sÃļge efter de spredte nÃļglestykker af information i en hav af internettet-kilder, samle information sammen baseret pÃĨ forskellige hjemmesider, oprette ny information ved at beregne og slutte, og forstÃĨ, hvordan man kan konsolidere disse fakta til et korrekt svar pÃĨ spÃļrgsmÃĨlet.
Hvad forskerne fandt, da datasettet fÃļrst blev udgivet og testet, var, at de top GenAI-modeller var i stand til at vÃĶre nogenlunde nÃļjagtige (omkring 40%), nÃĨr de havde brug for at besvare ved hjÃĶlp af enkelttrinsmetoder, men kunne opnÃĨ en nÃļjagtighed pÃĨ 73%, hvis de fik lov til at samle alle nÃļdvendige dokumenter for at besvare spÃļrgsmÃĨlet. Ja, 73% kan mÃĨske ikke synes som en revolution. Men hvis man forstÃĨr nÃļjagtigt, hvad der skal besvares, bliver tallet meget mere imponerende.
For eksempel er et bestemt spÃļrgsmÃĨl: âHvilket ÃĨr var bandlederen for gruppen, der oprindeligt opfÃļrte sangen, der er samplet i Kanye Wests sang Power, fÃļdt?â Hvordan ville et menneske gÃĨ til at lÃļse dette problem? Personen ville mÃĨske se, at de har brug for at samle forskellige informationselementer, sÃĨsom teksten til Kanye Wests sang âPowerâ, og derefter vÃĶre i stand til at se gennem teksten og identificere det punkt i sangen, hvor en anden sang faktisk er samplet. Vi som mennesker kunne sandsynligvis lytte til sangen (selv hvis vi ikke kender den) og vÃĶre i stand til at sige, nÃĨr en anden sang er samplet.
Men tÃĶnk over det: Hvad skulle en GenAI have opnÃĨ for at detektere en sang, der er samplet i en anden sang, mens den âlytterâ til den? Dette er, hvor et grundlÃĶggende spÃļrgsmÃĨl bliver en fremragende test af virkelig intelligent AI. Og hvis vi var i stand til at finde sangen, lytte til den og identificere teksten, der er samplet, er det kun skridt 1. Vi har stadig brug for at finde ud af, hvad sangens navn er, hvad bandets navn er, hvem bandets leder er, og derefter, hvilket ÃĨr den person er fÃļdt.
FRAMES viser, at for at besvare realistiske spÃļrgsmÃĨl, er der brug for en enorm mÃĶngde tankeprocesser. To ting kommer i tanke her.
FÃļrst, evnen af decentraliserede GenAI-modeller til ikke kun at konkurrere, men potentielt dominere resultaterne, er utrolig. En voksende antal virksomheder bruger den decentraliserede metode til at skala deres behandlingsmuligheder, samtidig med at de sikrer, at en stor fÃĶllesskab ejer softwaren, og ikke en centraliseret sort boks, der ikke vil dele sine fremskridt. Virksomheder som Perplexity og Sentient er fÃļrende i denne trend, hver med formidable modeller, der performer over de fÃļrste nÃļjagtighedsrekorder, da FRAMES blev udgivet.
Det andet element er, at et mindre antal af disse AI-modeller ikke kun er decentraliserede, men ogsÃĨ ÃĨbne. For eksempel er Sentient Chat begge, og tidlige tests viser, hvor kompleks deres tankegang kan vÃĶre, takket vÃĶre den uvurderlige ÃĨbne adgang. FRAMES-spÃļrgsmÃĨlet ovenfor besvares ved hjÃĶlp af stort set samme tankegang, som et menneske ville bruge, med detaljer om deres tankegang tilgÃĶngelige for gennemsyn. MÃĨske endnu mere interessant er, at deres platform er struktureret som en rÃĶkke modeller, der kan finjustere en given synsvinkel og prÃĶstation, selv om finjusteringsprocessen i nogle GenAI-modeller resulterer i formindsket nÃļjagtighed. I tilfÃĶldet af Sentient Chat er mange forskellige modeller blevet udviklet. For eksempel er en ny model kaldet âDobby 8Bâ i stand til bÃĨde at overgÃĨ FRAMES-benchmarket og udvikle en distinkt pro-krypto og pro-frihedsholdning, der pÃĨvirker modellens synsvinkel, mens den behandler stykker af information og udvikler et svar.
PÃĨ horisonten
NÃļglen til alle disse forblÃļffende innovationer er den raske hastighed, der har bragt os hertil. Vi mÃĨ erkende, at sÃĨ hurtigt, som denne teknologi har udviklet sig, vil den kun udvikle sig endnu hurtigere i den nÃĶrmeste fremtid. Vi vil vÃĶre i stand til at se, isÃĶr med decentraliserede og ÃĨbne GenAI-modeller, den kritiske grÃĶnse, hvor systemets intelligens begynder at overgÃĨ mere og mere af vores egen, og hvad det betyder for fremtiden.












