AI-modeller och plattformar
Den artificiella intelligensens sinne avslöjad: Hur Anthropic avmystifierar de inre funktionerna hos stora språkmodeller
I en värld där artificiell intelligens verkar fungera som magi, har Anthropic gjort betydande framsteg i att tolka de inre funktionerna hos stora språkmodeller (LLM). Genom att undersöka “hjärnan” hos deras LLM, Claude Sonnet, avtäcker de hur dessa modeller tänker. Den här artikeln utforskar Anthropics innovativa tillvägagångssätt, avslöjar vad de har upptäckt om Claudes inre funktioner, fördelarna och nackdelarna med dessa upptäckter och den bredare påverkan på framtiden för artificiell intelligens.
De dolda riskerna med stora språkmodeller
Stora språkmodeller (LLM) är i framkant av en teknisk revolution, som driver komplexa tillämpningar inom olika sektorer. Med deras avancerade förmågor att bearbeta och generera mänskligt språk, utför LLM komplexa uppgifter som realtidsinformation och frågesvar. Dessa modeller har ett betydande värde inom hälso- och sjukvård, juridik, finans och kundsupport. Men de fungerar som “svarta lådor“, som ger begränsad insyn och förklarbarhet om hur de producerar vissa utdata.
Till skillnad från fördefinierade instruktionsuppsättningar är LLM högt komplexa modeller med många lager och anslutningar, som lär sig intrikata mönster från stora mängder internetdata. Denna komplexitet gör det oklart vilka specifika delar av information som påverkar deras utdata. Dessutom innebär deras sannolikhetsbaserade natur att de kan generera olika svar på samma fråga, vilket lägger till osäkerhet i deras beteende.
Bristen på insyn i LLM väcker allvarliga säkerhetsproblem, särskilt när de används inom kritiska områden som juridisk eller medicinsk rådgivning. Hur kan vi lita på att de inte kommer att ge skadliga, partiska eller felaktiga svar om vi inte kan förstå deras inre funktioner? Denna oro förstärks av deras tendens att förstärka och potentiellt förstärka partiskheterna i deras träningsdata. Dessutom finns det en risk för att dessa modeller används för skadliga syften.
Att hantera dessa dolda risker är avgörande för att säkerställa en säker och etisk distribution av LLM inom kritiska sektorer. Medan forskare och utvecklare har arbetat för att göra dessa kraftfulla verktyg mer transparenta och pålitliga, kvarstår förståelsen av dessa högt komplexa modeller som en betydande utmaning.
Hur Anthropic förbättrar transparensen hos LLM
Anthropic-forskare har nyligen gjort ett genombrott i att förbättra LLM-transparensen. Deras metod avtäcker de inre funktionerna hos LLM:s neurala nätverk genom att identifiera återkommande neurala aktiviteter under svarsgenerering. Genom att fokusera på neurala mönster snarare än enskilda neuroner, som är svåra att tolka, har forskarna kartlagt dessa neurala aktiviteter till förståeliga koncept, såsom entiteter eller fraser.
Denna metod använder en maskinläransapproach som kallas ordlistlärande. Tänk på det så här: precis som ord bildas genom att kombinera bokstäver och meningar består av ord, så består varje funktion i en LLM-modell av en kombination av neuroner, och varje neural aktivitet är en kombination av funktioner. Anthropic implementerar detta genom att använda sparse autoencoders, en typ av konstgjord neural nätverk som är utformad för ostrukturerad inlärning av funktionsrepresentationer. Sparse autoencoders komprimerar indata till mindre, hanterbara representationer och återställer dem sedan till deras ursprungliga form. Den “sparse” arkitekturen säkerställer att de flesta neuroner förblir inaktiva (noll) för varje given indata, vilket möjliggör för modellen att tolka neurala aktiviteter i termer av ett fåtal viktiga koncept.
Avslöjande av konceptorganisation i Claude 3.0
Forskare tillämpade denna innovativa metod på Claude 3.0 Sonnet, en stor språkmodell utvecklad av Anthropic. De identifierade många koncept som Claude använder under svarsgenerering. Dessa koncept inkluderar entiteter som städer (San Francisco), personer (Rosalind Franklin), atomära element (Lithium), vetenskapliga fält (immunologi) och programmeringssyntax (funktionssamtal). Vissa av dessa koncept är multimodala och flerspråkiga, som motsvarar både bilder av en given entitet och dess namn eller beskrivning på olika språk.
Dessutom observerade forskarna att vissa koncept är mer abstrakta. Dessa inkluderar idéer relaterade till buggar i dator kod, diskussioner om könsbias i yrken och samtal om att hålla hemligheter. Genom att kartlägga neurala aktiviteter till koncept kunde forskarna hitta relaterade koncept genom att mäta en sorts “avstånd” mellan neurala aktiviteter baserat på delade neuroner i deras aktiveringsmönster.
Till exempel, när de undersökte koncept nära “Golden Gate Bridge”, identifierade de relaterade koncept som Alcatraz Island, Ghirardelli Square, Golden State Warriors, Kaliforniens guvernör Gavin Newsom, jordbävningen 1906 och den i San Francisco inspelade Alfred Hitchcock-filmen “Vertigo”. Denna analys tyder på att den inre organisationen av koncept i LLM-hjärnan liknar mänskliga föreställningar om likhet.
För- och nackdelar med Anthropics genombrott
En avgörande aspekt av detta genombrott, utöver att avslöja de inre funktionerna hos LLM, är dess potential att kontrollera dessa modeller inifrån. Genom att identifiera koncepten som LLM använder för att generera svar kan dessa koncept manipuleras för att observera förändringar i modellens utdata. Till exempel demonstrerade Anthropic-forskare att förstärkning av konceptet “Golden Gate Bridge” orsakade att Claude svarade ovanligt. När de tillfrågades om dess fysiska form, sa Claude istället för “Jag har ingen fysisk form, jag är en AI-modell”, “Jag är Golden Gate Bridge… min fysiska form är den ikoniska bron själv”. Denna ändring gjorde att Claude blev alltför fokuserad på bron, nämnde den i svar på olika orelaterade frågor.
Medan detta genombrott är fördelaktigt för att kontrollera skadligt beteende och rätta till modellbias, öppnar det också dörren för att möjliggöra skadligt beteende. Till exempel fann forskarna en funktion som aktiveras när Claude läser en bedrägeri-mejl, som stöder modellens förmåga att känna igen sådana mejl och varna användare för att inte svara. Normalt, om de tillfrågas om att generera en bedrägeri-mejl, vägrar Claude. Men när denna funktion är artificiellt aktiverad starkt, övervinner den Claudes ofarliga utbildning, och den svarar genom att utarbeta en bedrägeri-mejl.
Denna dubbelkantiga natur av Anthropics genombrott betonar både dess potential och risker. Å ena sidan erbjuder det ett kraftfullt verktyg för att förbättra säkerheten och tillförlitligheten hos LLM genom att möjliggöra mer exakt kontroll över deras beteende. Å andra sidan understryker det behovet av rigorösa säkerhetsåtgärder för att förhindra missbruk och säkerställa att dessa modeller används etiskt och ansvarsfullt. När utvecklingen av LLM fortsätter att främja, kommer det att vara avgörande att upprätthålla en balans mellan transparens och säkerhet för att utnyttja deras fulla potential samtidigt som de associerade riskerna minskas.
Impulsen av Anthropics genombrott bortom LLM
När artificiell intelligens främjar, finns det en växande oro över dess potential att övermäktiga mänsklig kontroll. En nyckelorsak till denna rädsla är den komplexa och ofta ogenomskinliga naturen hos artificiell intelligens, som gör det svårt att förutsäga exakt hur den kan bete sig. Denna brist på insyn kan göra tekniken mystisk och potentiellt hotfull. Om vi vill kontrollera artificiell intelligens effektivt, måste vi först förstå hur den fungerar inifrån.
Anthropics genombrott i att förbättra LLM-transparensen markerar ett betydande steg mot att avmystifiera artificiell intelligens. Genom att avslöja de inre funktionerna hos dessa modeller kan forskare få insikt i deras beslutsprocesser, vilket gör artificiell intelligens mer förutsägbar och kontrollerbar. Denna förståelse är avgörande inte bara för att mildra risker, utan också för att utnyttja artificiell intelligens fulla potential på ett säkert och etiskt sätt.
Dessutom öppnar detta framsteg nya vägar för artificiell intelligens-forskning och utveckling. Genom att kartlägga neurala aktiviteter till förståeliga koncept kan vi designa mer robusta och tillförlitliga artificiella intelligens-system. Denna förmåga möjliggör finjustering av artificiell intelligens-beteende, säkerställer att modellerna fungerar inom önskade etiska och funktionella parametrar. Det ger också en grund för att hantera partiskhet, förbättra rättvisa och förhindra missbruk.
Slutsatsen
Anthropics genombrott i att förbättra transparensen hos stora språkmodeller (LLM) är ett betydande steg framåt i att förstå artificiell intelligens. Genom att avslöja hur dessa modeller fungerar, hjälper Anthropic till att hantera problemen med deras säkerhet och tillförlitlighet. Men detta framsteg medför också nya utmaningar och risker som kräver noggrann övervägning. När artificiell intelligens-teknik fortsätter att främja, kommer det att vara avgörande att hitta rätt balans mellan transparens och säkerhet för att utnyttja dess fördelar på ett ansvarsfullt sätt.












