AI-modeller og platforme

Hvordan Tænker Claude? Anthropic’s Kamp For At Låse Op AI’s Sorte Kasse

mm
Føj Unite.AI til dine foretrukne kilder på Google

Store sprogmodeller (LLM’er) som Claude har ændret måden, vi bruger teknologi på. De driver værktøjer som chatbots, hjælper med at skrive essays og kan endda skabe digte. Men på trods af deres fantastiske evner er disse modeller stadig en gåde på mange måder. Mennesker kalder dem ofte en “sort kasse”, fordi vi kan se, hvad de siger, men ikke, hvordan de finder ud af det. Mangel på forståelse skaber problemer, især i vigtige områder som medicin eller ret, hvor fejl eller skjulte fordomme kan forårsage reel skade.

At forstå, hvordan LLM’er fungerer, er afgørende for at opbygge tillid. Hvis vi ikke kan forklare, hvorfor en model gav et bestemt svar, er det svært at stole på dens resultater, især i følsomme områder. Fortolkning hjælper også med at identificere og korrigere fordomme eller fejl, så modellerne er sikre og etiske. For eksempel, hvis en model konsekvent favoriserer bestemte synspunkter, kan vi ved at vide hvorfor hjælpe udviklerne med at korrigere det. Behovet for klarhed er, hvad der driver forskning i at gøre disse modeller mere gennemsigtige.

Anthropic, det firma bag Claude, har arbejdet på at åbne denne sorte kasse. De har gjort spændende fremskridt i at finde ud af, hvordan LLM’er tænker, og denne artikel udforsker deres gennembrud i at gøre Claudes processer lettere at forstå.

Claudes Tanker

I midten af 2024 gjorde Anthropics team et spændende gennembrud. De skabte en grundlæggende “kort” over, hvordan Claude behandler information. Ved hjælp af en teknik kaldet ordliste-læring fandt de millioner af mønstre i Claudes “hjerne” – dens neurale netværk. Hver mønster, eller “funktion”, er forbundet til en bestemt idé. For eksempel hjælper nogle funktioner Claude med at spotte byer, berømte personer eller kodningsfejl. Andre er forbundet til sværere emner, som kønsfordomme eller hemmelighed.

Forskere opdagede, at disse idéer ikke er isolerede inden for enkeltne neuroner. I stedet er de spredt over mange neuroner i Claudes netværk, hvor hver neuron bidrager til flere idéer. Denne overlap gjorde det svært for Anthropic at finde ud af disse idéer fra starten. Men ved at identificere disse gentagne mønstre begyndte Anthropics forskere at afkode, hvordan Claude organiserer sine tanker.

Claudes Ræsonnement

Herefter ville Anthropic se, hvordan Claude bruger disse tanker til at træffe beslutninger. De byggede nyligt et værktøj kaldet tilskrivningsgrafer, som fungerer som en trin-for-trin guide til Claudes tænkning. Hver punkt på grafen er en idé, der lyser op i Claudes sind, og pilene viser, hvordan en idé flyder over i den næste. Denne graf låter forskere spore, hvordan Claude omdanner et spørgsmål til et svar.

For bedre at forstå, hvordan tilskrivningsgrafer fungerer, kan man overveje følgende eksempel: Når man spørger “Hvad er hovedstaden i delstaten, hvor Dallas ligger?” må Claude indse, at Dallas ligger i Texas, og derefter huske, at Texas’ hovedstad er Austin. Tilskrivningsgrafen viste netop denne proces – en del af Claude pegede på “Texas”, som førte til, at en anden del valgte “Austin”. Holdet testede det ved at ændre “Texas”-delen, og det ændrede faktisk svaret. Dette viser, at Claude ikke bare gætter – det arbejder igennem problemet, og nu kan vi se det ske.

Hvorfor Dette Er Vigtigt: En Analogi Fra Biologiske Videnskaber

For at se, hvorfor dette er vigtigt, er det nyttigt at tænke på nogle store udviklinger i biologiske videnskaber. Ligesom opfindelsen af mikroskopet tillod videnskabsmænd at opdage celler – de skjulte byggesten i livet – tillader disse fortolkningværktøjer AI-forskere at opdage byggestenene i tankeprocessen inde i modellerne. Og ligesom kortlægning af neurale kredsløb i hjernen eller sekventering af genomet banede vejen for gennembrud i medicin, kan kortlægning af Claudes indre mekanismer banede vejen for mere pålidelig og kontrollerbar maskinintelligens. Disse fortolkningværktøjer kan spille en vital rolle og hjælpe os med at kigge ind i tankeprocessen i AI-modeller.

Udfordringerne

Selv med alle disse fremskridt er vi stadig langt fra at fuldt ud forstå LLM’er som Claude. Lige nu kan tilskrivningsgrafer kun forklare omkring en af fire af Claudes beslutninger. Mens kortet over dens funktioner er imponerende, dækker det kun en del af, hvad der sker inde i Claudes hjerne. Med milliarder af parametre udfører Claude og andre LLM’er utallige beregninger for hver opgave. At spore hver enkelt for at se, hvordan et svar dannes, er som at følge hver enkelt neuron, der affyres i et menneskes hjerne under en enkelt tanke.

Der er også udfordringen med “hallucination“. Nogle gange genererer AI-modeller svar, der lyder plausibelt, men i virkeligheden er forkerte – som at påstå en forkert faktuel oplysning med sikkerhed. Dette sker, fordi modellerne afhænger af mønstre fra deres træningsdata i stedet for en sand forståelse af verden. At forstå, hvorfor de falder ind i fabrikation, er et svært problem, der fremhæver huller i vores forståelse af deres indre mekanismer.

Forudindtagethed er endnu en betydelig hindring. AI-modeller lærer af enorme datasæt, der er hentet fra internettet, som indeholder menneskelige fordomme – stereotyper, fordomme og andre samfundsfejl. Hvis Claude optager disse fordomme fra sin træning, kan den reflektere dem i sine svar. At pakke ud, hvor disse fordomme stammer fra, og hvordan de påvirker modellens ræsonnement, er en kompleks udfordring, der kræver både tekniske løsninger og omhyggelig overvejelse af data og etik.

Det Endelige Budskab

Anthropics arbejde med at gøre store sprogmodeller (LLM’er) som Claude mere forståelige er et betydeligt skridt fremad i AI-gennemsigtighed. Ved at afsløre, hvordan Claude behandler information og træffer beslutninger, fremmer de tilgangen til at løse nøglebekymringer om AI-ansvarlighed. Dette fremskridt åbner døren for en sikker integration af LLM’er i kritiske sektorer som sundhedspleje og ret, hvor tillid og etik er vitalt.

Sådan som metoder til at forbedre fortolkning udvikler sig, kan brancher, der har været forsigtige med at adoptere AI, nu overveje det igen. Gennemsigtige modeller som Claude tilbyder en klar vej til AI’s fremtid – maskiner, der ikke kun replicerer menneskelig intelligens, men også forklarer deres ræsonnement.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.