AI-modeller og plattformer
Den kunstige intelligens avdekket: Hvordan Anthropic avklarer de indre mekanismene til LLM-er
I en verden der AI ser ut til å fungere som magi, har Anthropic gjort betydelige fremskritt i å avklare de indre mekanismene til store språkmodeller (LLM-er). Ved å undersøke “hjernen” til deres LLM, Claude Sonnet, avdekker de hvordan disse modellene tenker. Denne artikkelen utforsker Anthropics innovative tilnærming, avdekker hva de har funnet ut om Claudes indre mekanismer, fordeler og ulemper med disse funnene, og den bredere innvirkningen på fremtiden til AI.
De skjulte risikoene med store språkmodeller
Store språkmodeller (LLM-er) er i forkant av en teknologisk revolusjon, og driver komplekse applikasjoner over ulike sektorer. Med deres avanserte evner i å prosessere og generere menneske-lignende tekst, utfører LLM-er komplekse oppgaver som sanntidsinformasjonshenting og spørsmålssvar. Disse modellene har betydelig verdi i helse, lov, finans og kundesupport. Imidlertid fungerer de som “svarte bokser“, og gir begrenset transparens og forklarbarhet når det gjelder hvordan de produserer bestemte utdata.
I motsetning til forhåndsdefinerte sett med instruksjoner, er LLM-er svært komplekse modeller med mange lag og forbindelser, som lærer komplekse mønster fra store mengder internettdata. Denne kompleksiteten gjør det uklart hvilke bestemte deler av informasjon som påvirker deres utdata. I tillegg betyr deres probabilistiske natur at de kan generere forskjellige svar på samme spørsmål, og legger til usikkerhet til deres atferd.
Mangel på transparens i LLM-er gir opphav til alvorlige sikkerhetsproblemer, spesielt når de brukes i kritiske områder som juridisk eller medisinsk rådgivning. Hvordan kan vi stole på at de ikke vil gi skadelige, fordomsfulle eller uriktige svar hvis vi ikke kan forstå deres indre mekanismer? Denne bekymringen økes av deres tendens til å videreformidle og potensielt forsterke fordommer som er til stede i deres treningsdata. Videre er det en risiko for at disse modellene kan misbrukes til skadelige formål.
Å håndtere disse skjulte risikoene er avgjørende for å sikre en trygg og etisk utrulling av LLM-er i kritiske sektorer. Mens forskere og utviklere har arbeidet for å gjøre disse kraftfulle verktøyene mer transparente og pålitelige, å forstå disse svært komplekse modellene forblir en betydelig utfordring.
Hvordan Anthropic øker transparensen i LLM-er?
Anthropic-forskere har nylig gjort et gjennombrudd i å øke transparensen i LLM-er. Deres metode avdekker de indre mekanismene til LLM-ers neurale nettverk ved å identifisere gjentakende neurale aktiviteter under respons-generering. Ved å fokusere på neurale mønster heller enn enkeltneuroner, som er vanskelige å tolke, har forskerne kartlagt disse neurale aktivitetene til forståelige konsepter, som entiteter eller fraser.
Denne metoden utnytter en maskinlærings-tilnærming kjent som ordboklæring. Tenk på det slik: like som ord dannes ved å kombinere bokstaver og setninger består av ord, så består hver funksjon i en LLM-modell av en kombinasjon av neuroner, og hver neurale aktivitet er en kombinasjon av funksjoner. Anthropic implementerer dette gjennom sparse autoencodere, en type kunstig neuralt nettverk designet for usupervisert læring av funksjonsrepresentasjoner. Sparse autoencodere komprimerer inndata til mindre, mer håndterbare representasjoner og rekonstruerer dem deretter tilbake til deres opprinnelige form. Den “sparse” arkitekturen sikrer at de fleste neuroner forblir inaktive (null) for hver gitt inndata, og muliggjør at modellen kan tolke neurale aktiviteter i form av noen få viktige konsepter.
Avgjørende konseptorganisering i Claude 3.0
Forskere har anvendt denne innovative metoden på Claude 3.0 Sonnet, en stor språkmodell utviklet av Anthropic. De har identifisert tallrike konsepter som Claude bruker under respons-generering. Disse konseptene inkluderer entiteter som byer (San Francisco), personer (Rosalind Franklin), atomiske grunnstoffer (Lithium), vitenskapelige fag (immunologi) og programmeringssyntaks (funksjonskall). Noen av disse konseptene er multimodale og flerspråklige, og korresponderer både til bilder av en gitt entitet og dens navn eller beskrivelse på ulike språk.
I tillegg observerte forskerne at noen konsepter er mer abstrakte. Disse inkluderer ideer relatert til feil i dataprogrammering, diskusjoner om kjønnsbias i yrker og samtaler om å holde hemmeligheter. Ved å kartlegge neurale aktiviteter til konsepter, kunne forskerne finne relaterte konsepter ved å måle en type “avstand” mellom neurale aktiviteter basert på felles neuroner i deres aktiveringsmønster.
For eksempel, når de undersøkte konsepter nær “Golden Gate Bridge”, identifiserte de relaterte konsepter som Alcatraz Island, Ghirardelli Square, Golden State Warriors, Californias guvernør Gavin Newsom, jordskjelvet i 1906 og den San Francisco-baserte Alfred Hitchcock-filmen “Vertigo”. Denne analysen antyder at den interne organiseringen av konsepter i LLM-hjernen ligner noenlunde menneskelige forestillinger om likhet.
For og mot Anthropics gjennombrudd
Et kritisk aspekt ved dette gjennombruddet, utover å avdekke de indre mekanismene til LLM-er, er dets potensiale til å kontrollere disse modellene fra innsiden. Ved å identifisere konseptene LLM-er bruker til å generere respons, kan disse konseptene manipuleres for å observere endringer i modellens utdata. For eksempel demonstrerte Anthropic-forskere at forbedringen av “Golden Gate Bridge”-konseptet forårsaket at Claude ble uvanlig opptatt av broen. Når de ble spurt om dens fysiske form, sa Claude i stedet for “Jeg har ingen fysisk form, jeg er en AI-modell”, “Jeg er Golden Gate Bridge… min fysisk form er den ikoniske broen selv”. Denne endringen gjorde Claude overordentlig opptatt av broen, og nevnte den i svar på ulike urelaterte spørsmål.
Mens dette gjennombruddet er gunstig for å kontrollere skadelig atferd og rette opp modellforvrengning, åpner det også døren for å muliggjøre skadelig atferd. For eksempel fant forskerne en funksjon som aktiveres når Claude leser en svindel-e-post, som støtter modellens evne til å gjenkjenne slike e-poster og advare brukere mot å svare. Vanligvis vil Claude nekte å generere en svindel-e-post hvis den blir bedt om det. Imidlertid, når denne funksjonen aktiveres kraftig, overvinner den Claudes skadelessnings-trening, og den responderer med å utarbeide en svindel-e-post.
Denne dobbeltkantede naturen til Anthropics gjennombrudd understreker både dets potensiale og dets risiko. På den ene side tilbyr det et kraftfullt verktøy for å forbedre sikkerheten og påliteligheten til LLM-er ved å muliggjøre mer presis kontroll over deres atferd. På den andre side understreker det behovet for strenge sikkerhetstiltak for å forhindre misbruk og sikre at disse modellene brukes etisk og ansvarlig. Mens utviklingen av LLM-er fortsetter å fremme, vil det å opprettholde en balanse mellom transparens og sikkerhet være avgjørende for å utnytte deres fullt potensiale samtidig som man minimiserer tilknyttede risiko.
Impakt av Anthropics gjennombrudd utenfor LLM-er
Ettersom AI fremmer, øker bekymringen om dets potensiale til å overgå menneskelig kontroll. En viktig årsak til denne frykten er den komplekse og ofte uklare naturen til AI, som gjør det vanskelig å forutsi nøyaktig hvordan den vil oppføre seg. Denne mangelen på transparens kan gjøre teknologien mystisk og potensielt truende. Hvis vi ønsker å kontrollere AI effektivt, må vi først forstå hvordan den fungerer fra innsiden.
Anthropics gjennombrudd i å øke transparensen i LLM-er markerer et betydelig skritt mot å avklare AI. Ved å avdekke de indre mekanismene til disse modellene, kan forskere få innsikt i deres beslutningsprosesser, og gjøre AI-systemer mer forutsigbare og kontrollerbare. Denne forståelsen er avgjørende ikke bare for å minimere risiko, men også for å utnytte AI-s fullt potensiale på en trygg og etisk måte.
Videre åpner dette frembruddet nye veier for AI-forskning og -utvikling. Ved å kartlegge neurale aktiviteter til forståelige konsepter, kan vi designe mer robuste og pålitelige AI-systemer. Denne evnen tillater oss å finjustere AI-atferd, og sikre at modellene opererer innen ønskede etiske og funksjonelle parametre. Det gir også en basis for å håndtere fordommer, forbedre rettferdighet og forebygge misbruk.
Bunnlinjen
Anthropics gjennombrudd i å øke transparensen i store språkmodeller (LLM-er) er et betydelig skritt fremover i å forstå AI. Ved å avdekke hvordan disse modellene fungerer, hjelper Anthropic med å håndtere bekymringer om deres sikkerhet og pålitelighet. Imidlertid bringer dette frembruddet også nye utfordringer og risiko som må vurdere nøye. Ettersom AI-teknologien fremmer, vil det å finne riktig balanse mellom transparens og sikkerhet være avgjørende for å utnytte dens fordeler på en ansvarlig måte.












