Tankeledere
Hvor godt kan LLM’er faktisk resonere gjennom komplekse problemer?
Introduksjonen og utviklingen av generativ AI har vært så plutselig og intens at det er faktisk ganske vanskelig å fullt ut verdsette hvor mye denne teknologien har endret våre liv.
Zoom ut til for bare tre år siden. Ja, AI ble mer utbredt, i teorien. Flere mennesker visste noen av tingene det kunne gjøre, selv om det også var massive misforståelser om AIens evner. På en måte ble teknologien gitt samtidig for lite og for mye kreditt for hva den faktisk kunne oppnå. Likevel kunne den gjennomsnittlige personen peke på minst ett eller to områder hvor AI var i arbeid, utførte høyt spesialiserte oppgaver ganske bra, i høyt kontrollerte miljøer. Alt utenfor dette var enten fortsatt i et forskningslaboratorium, eller eksisterte simpelthen ikke.
Sammenlign dette med i dag. Med null ferdigheter bortsett fra evnen til å skrive en setning eller stille et spørsmål, er verden ved våre fingertopper. Vi kan generere bilder, musikk og selv filmer som er virkelig unike og fantastiske, og har evnen til å forstyrre hele industrier. Vi kan overdrive vår søkeprosess, stille et enkelt spørsmål som, hvis det er riktig formulert, kan generere sider med tilpasset innhold som er godt nok til å kunne gå for en universitetsutdannet forsker … eller en gjennomsnittlig tredje-klasser som om vi spesifiserer perspektivet. Mens disse evnene for bare ett eller to år siden ble ansett som absolut umulige, har de blitt vanlige.
I dag har mange mennesker eksperimentert med generativ AI som ChatGPT, Midjourney eller andre verktøy. Andre har allerede inkorporert dem i sine daglige liv. Hastigheten med hvilken disse har utviklet seg er så intens at det er nærmest alarmerende. Og gitt fremgangen de siste seks månedene, er vi uten tvil gående til å bli overveldet, gang på gang, i de neste årene.
Et spesifikt verktøy i spill innen generativ AI har vært ytelsen til Retrieval-Augmented Generation (RAG)-systemer, og deres evne til å tenke gjennom komplekse spørsmål. Introduksjonen av FRAMES-datasetten, som er forklart i detalj i en artikkel om hvordan evalueringen av datasetten fungerer, viser både hvor kunnskapsnivået er nå og hvor det er på vei. Selv siden introduksjonen av FRAMES i slutten av 2024, har flere plattformer allerede slått nye rekorder på sin evne til å resonere gjennom vanskelige og komplekse spørsmål.
La oss dykke ned i hva FRAMES er ment å evaluere og hvor godt ulike generative AI-modeller utfører seg. Vi kan se hvordan både desentralisering og åpne kildekodemodeller ikke bare holder sine posisjoner (merket med Sentient Chat), men også lar brukerne få et klart innblikk i den forbløffende resonansen som noen AI-modeller er i stand til å oppnå.
FRAMES som et vindu inn i GenAI-hjernen
FRAMES-datasetten og dens evaluering fokuserer på 824 “multi-hop”-spørsmål som krever inferens, logisk sammenkobling, bruk av flere forskjellige kilder for å hente nøkkelinformasjon, og evnen til å logisk sette sammen alt dette for å svare på spørsmålet. Spørsmålene trenger mellom to og 15 dokumenter for å svare dem korrekt, og inkluderer også bevisst begrensninger, matematiske beregninger og deduksjoner, samt evnen til å prosessere tidbasert logikk. Med andre ord, disse spørsmålene er ekstremt vanskelige og representerer virkelige utfordringer som et menneske kan møte på internettet. Vi møter disse utfordringene hele tiden, og må søke etter spredte nøkkelinformasjoner i en hav av internett-kilder, sette sammen informasjon basert på forskjellige nettsteder, og forstå hvordan konsolidere disse faktene til et korrekt svar på spørsmålet.
Hva forskerne fant da datasetten først ble lansert og testet, var at de beste GenAI-modellene var i stand til å være ganske nøyaktige (omkring 40%) når de måtte svare ved hjelp av enkelt-steg-metoder, men kunne oppnå en nøyaktighet på 73% hvis de fikk samle alle nødvendige dokumenter for å svare på spørsmålet. Ja, 73% kan kanskje ikke se ut som en revolusjon. Men hvis du forstår eksakt hva som må svares, blir tallet mye mer imponerende.
For eksempel er et bestemt spørsmål: “Hvilket år var bandlederen for gruppen som opprinnelig fremførte sangen som er samplet i Kanye Wests sang Power født?” Hvordan ville et menneske gå til verks for å løse dette problemet? Personen kunne se at de måtte samle sammen ulike informasjons-elementer, som tekstene til Kanye Wests sang “Power”, og deretter være i stand til å lytte til sangen (selv om de ikke kjenner den) og kunne fortelle når en annen sang er samplet.
Men tenk på det: hva må en GenAI oppnå for å detektere en sang annen enn originalen mens den “lytter” til den? Dette er hvor et enkelt spørsmål blir en utmerket test av virkelig intelligent AI. Og hvis vi var i stand til å finne sangen, lytte til den og identifisere tekstene som er samplet, er det bare steg 1. Vi må fortsatt finne ut hva sangens navn er, hva bandet er, hvem bandets leder er, og deretter hva år den personen er født.
FRAMES viser at for å svare på realistiske spørsmål, er en enorm mengde tankeprosesser nødvendig. To ting kommer i mente her.
Først, evnen til desentraliserte GenAI-modeller til ikke bare å konkurrere, men potensielt dominere resultater, er fantastisk. En økende mengde selskaper bruker den desentraliserte metoden for å skalerer sine prosesserings-evner samtidig som de sikrer at en stor samfunnet eier programvaren, ikke en sentralisert svart boks som ikke vil dele sine fremgang. Selskaper som Perplexity og Sentient leder denne trenden, hver med formidable modeller som utfører over den første nøyaktighetsrekorden da FRAMES ble lansert.
Det andre elementet er at et mindre antall av disse AI-modellene ikke bare er desentraliserte, men også åpne kildekodemodeller. For eksempel er Sentient Chat både desentralisert og åpen kilde, og tidlige tester viser hvor kompleks dens resonans kan være, takket være den uvurderlige åpne kildekoden. FRAMES-spørsmålet ovenfor blir svart ved hjelp av en lignende tenkeprosess som et menneske ville bruke, med dens resonansdetaljer tilgjengelige for gjennomsyn. Kanskje enda mer interessant, deres plattform er strukturert som en rekke modeller som kan finjustere en gitt perspektiv og ytelse, selv om finjusteringsprosessen i noen GenAI-modeller resulterer i redusert nøyaktighet. I tilfelle Sentient Chat er mange forskjellige modeller utviklet. For eksempel er en ny modell kalt “Dobby 8B” i stand til både å overgå FRAMES-benchmarken, men også utvikle en distinkt pro-krypto og pro-frihetsholdning, som påvirker modellens perspektiv når den prosesserer informasjonsbitar og utvikler et svar.
På horisonten
Nøkkelen til alle disse forbløffende innovasjonene er den raske hastigheten som har bragt oss hit. Vi må erkjenne at like raskt som denne teknologien har utviklet seg, vil den kun utvikle seg enda raskere i den nære fremtid. Vi vil være i stand til å se, spesielt med desentraliserte og åpne kildekodemodeller, den kritiske terskelen hvor systemets intelligens begynner å overstige mer og mer av vår egen, og hva det betyr for fremtiden.












