Tankeledare

Hur väl kan LLM egentligen resonera genom komplicerade problem?

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Introduktionen och utvecklingen av genererande AI har varit så plötslig och intensiv att det är svårt att fullt ut uppskatta hur mycket denna teknik har förändrat våra liv.

Zooma ut till för bara tre år sedan. Ja, AI blev alltmer utbredd, åtminstone i teorin. Fler människor visste några av de saker den kunde göra, även om det fanns stora missförstånd om AI:s förmågor. På något sätt gavs tekniken samtidigt för lite och för mycket cred för vad den faktiskt kunde uppnå. Ändå kunde den genomsnittlige personen peka på minst ett eller två områden där AI var i bruk, utförde högt specialiserade uppgifter ganska bra, i högt kontrollerade miljöer. Allt bortom det var antingen fortfarande i ett forskningslaboratorium eller existerade inte alls.

Jämför det med idag. Med noll färdigheter utöver förmågan att skriva en mening eller ställa en fråga, ligger världen vid våra fingertoppar. Vi kan generera bilder, musik och till och med filmer som är unika och fantastiska, och har förmågan att störa hela branscher. Vi kan förbättra vår sökprocess, ställa en enkel fråga som, om den formuleras rätt, kan generera sidor med anpassat innehåll som är tillräckligt bra för att passera som en universitetsutbildad forskare … eller en genomsnittlig tredje klassare om vi specificerar perspektivet. Medan de på något sätt, på bara ett eller två år, har blivit vanliga, ansågs dessa förmågor vara absolut omöjliga för bara några få år sedan. Området genererande AI existerade men hade inte tagit fart på något sätt.

Idag har många människor experimenterat med genererande AI, såsom ChatGPT, Midjourney eller andra verktyg. Andra har redan integrerat dem i sina dagliga liv. Farten med vilken dessa har utvecklats är bländande till den grad att det är nästan alarmerande. Och med tanke på framstegen under de senaste sex månaderna, kommer vi utan tvekan att bli förbluffade, om och om igen, under de kommande åren.

Ett specifikt verktyg som används inom genererande AI har varit prestationen av Retrieval-Augmented Generation (RAG)-system och deras förmåga att tänka igenom särskilt komplexa frågor. Introduktionen av FRAMES-datamängden, som beskrivs i detalj inom en artikel om hur utvärderingsdatamängden fungerar, visar både var tillståndet för konsten är nu och vart den är på väg. Även sedan FRAMES introducerades i slutet av 2024, har ett antal plattformar redan slagit nya rekord på sin förmåga att resonera igenom svåra och komplexa frågor.

Låt oss dyka in i vad FRAMES är tänkt att utvärdera och hur väl olika genererande AI-modeller presterar. Vi kan se hur både decentralisering och öppen källkodsplattformar inte bara håller sina positioner (framför allt Sentient Chat), utan också tillåter användare att få en tydlig bild av den häpnadsväckande resonemang som vissa AI-modeller är kapabla att uppnå.

FRAMES som ett fönster in i GenAI-hjärnan

FRAMES-datamängden och dess utvärderingsprocess fokuserar på 824 “multi-hop”-frågor som kräver inferens, logisk anslutning, användning av flera olika källor för att hämta nyckelinformation och förmågan att logiskt sätta samman allt för att besvara frågan. Frågorna kräver mellan två och 15 dokument för att besvaras korrekt och innehåller också medvetet begränsningar, matematiska beräkningar och deduktioner, samt förmågan att bearbeta tidsbaserad logik. Med andra ord är dessa frågor extremt svåra och representerar faktiskt mycket verkliga forskningsuppgifter som en människa kan utföra på internet. Vi hanterar dessa utmaningar hela tiden och måste söka efter de utspridda nyckelbitarna av information i en hav av internetkällor, sammanfoga informationen baserat på olika webbplatser, skapa ny information genom att beräkna och deducera, och förstå hur man konsoliderar dessa fakta till ett korrekt svar på frågan.

Vad forskare fann när datamängden först släpptes och testades var att de bästa GenAI-modellerna kunde vara ganska precisa (cirka 40%) när de var tvungna att svara med hjälp av enstegsmetoder, men kunde uppnå en precision på 73% om de tilläts samla in alla nödvändiga dokument för att besvara frågan. Ja, 73% kan kanske inte verka som en revolution. Men om du förstår exakt vad som måste besvaras, blir siffran mycket mer imponerande.

Till exempel är en specifik fråga: “Vilket år var bandledaren för gruppen som ursprungligen framförde låten som sampas i Kanye Wests låt Power född?” Hur skulle en människa gå tillväga för att lösa detta problem? Personen kanske ser att de behöver samla in olika informationsdelar, såsom texten till Kanye Wests låt som heter “Power”, och sedan kunna lyssna på låten och identifiera den punkt i låten där en annan låt faktiskt sampas. Vi som människor kunde förmodligen lyssna på låten (även om vi inte känner till den) och kunna säga när en annan låt sampas.

Men tänk på det: vad skulle en GenAI behöva åstadkomma för att upptäcka en låt annan än den ursprungliga medan den “lyssnar” på den? Detta är där en grundläggande fråga blir en utmärkt test av verkligen intelligent AI. Och om vi kunde hitta låten, lyssna på den och identifiera texten som sampas, är det bara Steg 1. Vi behöver fortfarande ta reda på vad låtens namn är, vad bandet är, vem bandets ledare är och sedan vilket år den personen föddes.

FRAMES visar att för att besvara realistiska frågor behövs en enorm mängd tankeprocesser. Två saker kommer i åtanke här.

Först, förmågan hos decentraliserade GenAI-modeller att inte bara konkurrera, utan potentiellt dominera resultaten, är otrolig. En växande mängd företag använder den decentraliserade metoden för att skala upp sin bearbetningsförmåga samtidigt som de säkerställer att en stor gemenskap äger programvaran, inte en centraliserad svart låda som inte kommer att dela med sig av sina framsteg. Företag som Perplexity och Sentient leder denna trend, var och en med formidabla modeller som presterar över den första noggrannhetsrekorden när FRAMES släpptes.

Det andra elementet är att ett mindre antal av dessa AI-modeller inte bara är decentraliserade, utan också öppen källkod. Till exempel är Sentient Chat både, och tidiga tester visar hur komplext dess resonemang kan vara, tack vare den ovärderliga öppna källkodsåtkomsten. FRAMES-frågan ovan besvaras med hjälp av samma tankeprocess som en människa skulle använda, med dess resonemangsdetaljer tillgängliga för granskning. Kanske ännu mer intressant är att deras plattform är strukturerad som ett antal modeller som kan finjustera en given perspektiv och prestanda, även om finjusteringsprocessen i vissa GenAI-modeller resulterar i minskad noggrannhet. I fallet med Sentient Chat har många olika modeller utvecklats. Till exempel är en nyligen modell som heter “Dobby 8B” kapabel att både slå FRAMES-benchmarken, men också utveckla en distinkt pro-krypto och pro-frihetsattityd, som påverkar modellens perspektiv när den bearbetar informationsbitar och utvecklar ett svar.

På horisonten

Nyckeln till alla dessa häpnadsväckande innovationer är den snabba hastighet som förde oss hit. Vi måste erkänna att så fort som denna teknik har utvecklats, kommer den att utvecklas ännu snabbare i framtiden. Vi kommer att kunna se, särskilt med decentraliserade och öppen källkods-GenAI-modeller, att den kritiska tröskeln där systemets intelligens börjar överstiga allt mer av vår egen, och vad det betyder för framtiden.

David Balaban är en datorsäkerhetsforskare med över 17 års erfarenhet av malwareanalys och utvärdering av antivirusprogram. David driver MacSecurity.net och Privacy-PC.com projekt som presenterar expertråd om samtida informations säkerhetsfrågor, inklusive social ingenjörskonst, malware, penetrationstestning, hotintelligens, online integritet och white hat-hacking. David har en stark bakgrund inom felsökning av malware, med ett nyligt fokus på motåtgärder mot ransomware.