AI-modeller og plattformer

Hvordan tenker Claude? Anthropic’s kamp for å åpne AI’s svarte boks

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Store språkmodeller (LLM) som Claude har endret måten vi bruker teknologi på. De driver verktøy som chatbott, hjelper å skrive essayer og kan til og med lage poesi. Men til tross for deres fantastiske evner, er disse modellene fremdeles en mysterium på mange måter. Folk kaller ofte dem en “svart boks” fordi vi kan se hva de sier, men ikke hvordan de kommer frem til det. Dette mangelen på forståelse skaper problemer, spesielt i viktige områder som medisin eller lov, hvor feil eller skjulte fordommer kan forårsake virkelig skade.

Å forstå hvordan LLM fungerer er essensielt for å bygge tillit. Hvis vi ikke kan forklare hvorfor en modell gav en bestemt svar, er det vanskelig å stole på resultatene, spesielt i følsomme områder. Forklarbarhet hjelper også med å identifisere og korrigere fordommer eller feil, og sikrer at modellene er trygge og etiske. For eksempel, hvis en modell konsekvent favoriserer bestemte synspunkter, kan å vite hvorfor hjelpe utviklere å korrigere det. Dette behovet for klarhet er hva som driver forskning innen å gjøre disse modellene mer gjennomsiktige.

Anthropic, selskapet bak Claude, har arbeidet for å åpne denne svarte boksen. De har gjort spennende fremgang i å forstå hvordan LLM fungerer, og denne artikkelen utforsker deres gjennombrudd i å gjøre Claudes prosesser lettere å forstå.

Kartlegging av Claudes tanker

I midten av 2024 gjorde Anthropics team et spennende gjennombrudd. De skapte en grundleggende “kart” over hvordan Claude prosesserer informasjon. Ved å bruke en teknikk kalt ordliste-læring, fant de millioner av mønster i Claudes “hjerne” – dens neurale nettverk. Hvert mønster, eller “egenskap”, knytter seg til en bestemt idé. For eksempel hjelper noen egenskaper Claude å spore byer, berømte personer eller kodfeil. Andre knytter seg til vanskeligere emner, som kjønnsfordommer eller hemmelighold.

Forskerne oppdaget at disse idéene ikke er isolert innenfor enkeltneuroner. I stedet er de spredt over mange neuroner i Claudes nettverk, med hver neuron som bidrar til flere idéer. Denne overlappningen gjorde det vanskelig for Anthropic å forstå disse idéene fra begynnelsen. Men ved å spore disse gjentakende mønstrene, begynte Anthropics forskere å dechiffere hvordan Claude organiserer sine tanker.

Sporing av Claudes resonnering

Deretter ønsket Anthropic å se hvordan Claude bruker disse tankene til å fatte beslutninger. De bygde nylig et verktøy kalt tilskrivningsgrafer, som fungerer som en steg-for-steg guide til Claudes tenkeprosess. Hvert punkt på grafen er en idé som lyser opp i Claudes sinn, og pilene viser hvordan en idé flyter inn i den neste. Denne grafen lar forskerne spore hvordan Claude omgjør et spørsmål til et svar.

For å bedre forstå hvordan tilskrivningsgrafer fungerer, kan vi se på et eksempel: når Claude blir spurt “Hva er hovedstaden i staten med Dallas?”, må den innse at Dallas ligger i Texas, og deretter huske at Texas’ hovedstad er Austin. Tilskrivningsgrafen viste denne eksakte prosessen – en del av Claude flagget “Texas”, som ledet til en annen del som valgte “Austin”. Teamet testet det også ved å justere “Texas”-delen, og til og med endret svaret. Dette viser at Claude ikke bare gjettet – den arbeidet gjennom problemet, og nå kan vi se det skje.

Hvorfor dette er viktig: En analogi fra biologiske vitenskaper

For å se hvorfor dette er viktig, er det nyttig å tenke på noen store utviklinger i biologiske vitenskaper. Like som oppfinnelsen av mikroskopet tillot vitenskapsmenn å oppdage celler – de skjulte byggesteinene i livet – tillater disse forklarbarhetstverktøyene AI-forskerne å oppdage byggesteinene i tenkning innen modeller. Og like som kartlegging av neurale kredsløp i hjernen eller sekvensering av genomet åpnet vei for gjennombrudd i medisin, kan kartlegging av Claudes indre mekanismer åpne vei for mer pålitelige og kontrollerbare maskinintelligenser. Disse forklarbarhetstverktøyene kan spille en vital rolle, og hjelpe oss å kikke inn i tenkeprosessen til AI-modeller.

Utfordringene

Til tross for all denne fremgangen, er vi fremdeles langt ifra å fullstendig forstå LLM som Claude. For øyeblikket kan tilskrivningsgrafer bare forklare omtrent en av fire av Claudes beslutninger. Mens kartet over dens egenskaper er imponerende, dekker det bare en del av hva som skjer innenfor Claudes hjerne. Med milliarder av parametre, utfører Claude og andre LLM utfører talløse beregninger for hver oppgave. Å spore hver enkelt for å se hvordan et svar formas er som å følge hver enkelt neuron som fyres i en menneskehjerne under en enkelt tanke.

Det er også utfordringen med “hallusinasjon“. Noen ganger genererer AI-modeller svar som lyder plausibelt, men i virkeligheten er feil – som å hevde en feilaktig faktum med sikkerhet. Dette skjer fordi modellene baserer seg på mønster fra deres treningsdata i stedet for en virkelig forståelse av verden. Å forstå hvorfor de glir inn i fabrikasjon er et vanskelig problem, og understreker hull i vår forståelse av deres indre mekanismer.

Forfordom er en annen betydelig hindring. AI-modeller lærer fra enorme datasett skrapet fra internettet, som inneholder menneskelige fordommer – stereotyper, fordommer og andre samfunnsfeil. Hvis Claude tar opp disse fordommene fra sin trening, kan den reflektere dem i sine svar. Å pakke ut hvor disse fordommene oppstår og hvordan de påvirker modellens resonnering er en kompleks utfordring som krever både tekniske løsninger og omhyggelig vurdering av data og etikk.

Bunnen av saken

Anthropics arbeid med å gjøre store språkmodeller (LLM) som Claude mer forståelige er et viktig skritt fremover i AI-gjennomsiktighet. Ved å avdekke hvordan Claude prosesserer informasjon og fattar beslutninger, fremmer de mot å løse nøkkelbekymringer om AI-ansvarlighet. Dette fremgangen åpner døren for trygg integrering av LLM i kritiske sektorer som helse og lov, hvor tillit og etikk er vitalt.

Som metoder for å forbedre forklarbarhet utvikles, kan industrier som har vært forsiktige med å adoptere AI nå omvurdere. Gjennomsiktige modeller som Claude tilbyr en klar vei til AI fremtid – maskiner som ikke bare repliserer menneskelig intelligens, men også forklarer sin resonnering.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.