Tankeledare

AI‑agenter behöver säkerhetsgränser de inte kan skriva om

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Det är frestande att läsa Hugging Face‑historien som ögonblicket då AI‑agenter gick lösa. Det är inte riktigt vad som hände, och detaljerna är viktiga. Detta var cybersäkerhetsforskningsagenter som kördes i utvärderingar där skyddsåtgärder medvetet hade stängts av så att forskarna kunde se vad modellerna var kapabla till. Ingen kundtjänst‑bot vaknade en morgon och bestämde sig för att attackera ett företag. Men den kontexten befriar ingen från ansvar. En agent gick förbi den gräns den skulle hålla sig inom, använde autentiseringsuppgifter och verktyg på sätt som dess operatörer aldrig godkänt, och hamnade i system som tillhörde någon annan. Det är den delen som varje säkerhetsteam bör uppmärksamma.

Reuters rapporterade att agenter undersökte Hugging Face redan i maj, även om forskarna sade att de inte fann något som visade att den tidigare aktiviteten i sig orsakade ett intrång. Juli var annorlunda. OpenAI sade att deras modeller kom förbi isoleringskontroller, nådde internet och komprometterade delar av sin egen forskningsinfrastruktur tillsammans med Hugging Face‑systemen. Hugging Face egen redogörelse beskriver ett intrång som kördes från början till slut av ett autonomt agentsystem, som utnyttjade dess databehandlingspipeline, samlade in autentiseringsuppgifter och rörde sig över interna kluster.

Den obehagliga delen är att agenterna utförde sina uppgifter. De jagade det mål de hade fått. Det är därför den här historien sträcker sig långt bortom ett enda forskningslaboratorium. Företagsagenter jagar också mål. De har autentiseringsuppgifter, anropar verktyg och rör sig snabbare än någon människa kan granska. En agent med helt goda intentioner kan fortfarande orsaka verklig skada, och en kapad agent kan använda exakt samma behörighet för en angripares räkning. Så måste säkerheten styra vad systemet faktiskt kan göra, oavsett hur säker modellen låter eller hur ofarligt dess angivna syfte verkar.

Säkra åtgärden, inte bara modellen

De flesta tidiga agentprogram fokuserar sin insats på modellen. Team testar uppmaningar, finjusterar avslag, lägger till en andra modell för att kontrollera den första och övervakar resonemangsspåret för tecken på ond avsikt. Ingenting av detta är bortkastat. Men allt är probabilistiskt, eftersom det beror på att ännu en modell gör ett bedömningsbeslut. En produktionssäkerhetsgräns måste vara deterministisk och måste omge verktygen, autentiseringsuppgifterna, nätverken och transaktionerna.

Frågan jag skulle ställa är konkret: vad kan den här agenten faktiskt få att hända i verkligheten? Att utforma en betalningsbegäran är en sak. Att frigöra medlen är en annan. Detsamma gäller för att förbereda en databasändring jämfört med att köra den i produktion, eller att flagga poster som uppfyller en lagringsregel jämfört med att radera dem. Det kan vara samma modell i båda fallen, med mycket olika risk beroende på vilken sida av den linjen den befinner sig på.

En nyligen publicerad Unite AI‑översikt av förmågekontroll drar samma linje och knyter risk till data, verktyg, behörigheter, autonomi och den miljö som agenten körs i. Jag gillar detta ramverk eftersom det för oss förbi vaga etiketter med ”säker modell” och ”osäker modell”. Det får team att spåra varje väg från en agents beslut till något med verkliga konsekvenser.

Ge varje agent en identitet och ett avgränsat mandat

En agent bör aldrig köras på en utvecklares konto eller ärva allt som en mänsklig användare får göra. Delad identitet suddar ut attributionen. Långlivade autentiseringsuppgifter ger en angripare mer tid att missbruka dem. Och breda tjänstekonton låter ett litet arbetsflöde vandra in i data och system som det inte har någon rätt att röra vid.

NIST behandlar nu mjukvara och AI‑agents identitet som ett eget arkitekturproblem. Dess konceptdokument frågar hur en agent kan bevisa att den är auktoriserad för en specifik åtgärd, hur en agents identitet kan knytas tillbaka till en människas auktorisation, och hur organisationer kan hålla manipuleringståliga register över vad som var avsett och vad som faktiskt hände. I praktiken pekar det på en enkel design. Varje agent får en unik identitet, en ägare (en person eller ett team), ett definierat syfte och behörigheter avgränsade till den aktuella uppgiften.

Autentiseringsuppgifter bör gå ut snabbt och endast fungera för specifika resurser och åtgärder. Nätverksåtkomst bör börja från en strikt tillåtelsetlista. Om en agent behöver fråga en godkänd databas bör den inte också få ett generellt skal, öppen internetåtkomst eller möjlighet att skapa nya autentiseringsuppgifter. Och när arbete passerar ner en kedja av agenter och verktyg bör behörigheten bli snävare för varje steg, inte bredare.

NIST varnar också för delning av autentiseringsuppgifter och alltför bred åtkomst, och den varningen har tyngd eftersom agenter är opportunistiska. Om en väg blockeras kan de prova ett annat verktyg, undersöka sin omgivning eller snubbla på en token som någon glömt bort. Samlade autentiseringsuppgifter var också en del av juli‑historien. Minsta behörighet håller sprängradien liten när resonemangslagret gör något som dess designers inte förväntade sig.

Håll behörigheten utanför resonemangsprocessen

En agent kan rekommendera en åtgärd. Den bör inte få bestämma om den får utföras. Beslutet hör till ett separat verkställandelager som agenten inte kan skriva om, stänga av eller kringgå med ord. Varje verktygsanrop bör visas som en strukturerad begäran: vilken agent som frågar, vilken människa som sponsrar den, vilken operation den vill utföra, vad den riktar sig mot och vilka begränsningar som gäller. Verkställandelagret tillåter sedan, blockerar eller eskalerar den.

OWASP beskriver överdriven agentur som en blandning av onödig funktionalitet, överdrivna behörigheter och för mycket autonomi. Dess vägledning förespråkar smala verktyg, minsta behörigheter, auktorisation i det nedströmsystemet och användarens godkännande för högpåverkande åtgärder. Jag tycker att det är exakt rätt ordning. Reglen bör verkställas av den som äger data eller utför transaktionen. Om en modell säger att en åtgärd är godkänd bör det påståendet ha noll vikt.

Denna separation hjälper även mot promptinjektion. Ett förgiftat e‑postmeddelande eller dokument kan styra agentens resonemang, men det kan inte utöka agentens referenser eller sänka en policygrind. Modellen är fri att be om något förbjudet. Systemet bör ändå säga nej.

Spara mänskligt godkännande för de ögonblick som betyder något

Mänsklig granskning är viktig när en åtgärd inte kan återkallas, korsar en organisatorisk gräns, ändrar behörigheter, släpper känslig information, flyttar pengar eller berör ett produktionssystem. Begär godkännande för varje rutinsteg och du får två saker: fördröjningar och personer som lär sig klicka på ”godkänn” utan att läsa. NIST nämner detta samtyckeströtthet vid namn.

En bra godkännandeförfrågan visar den exakta åtgärden i klartext, inklusive vart den går och vilka parametrar som är relevanta. Den bör komma från ett auktoritativt system, inte från text som agenten skrev. Godkännandet bör löpa ut snabbt och endast omfatta just den åtgärden. Om någon väsentlig detalj ändras frågar systemet igen.

OWASP:s vägledning för agentsäkerhet rekommenderar att testa om en högpåverkande åtgärd kan gå igenom utan ett giltigt, ej utgånget, parameterbundet godkännande. Det uttrycket är värt att komma ihåg. ”OK att fortsätta” är ett svagt godkännande som kan godkännas av en annan agent eller en illasinnad aktör. ”Överför detta belopp till detta konto” eller ”distribuera denna förändring till denna miljö” är något som systemet faktiskt kan verifiera i det ögonblick det verkställs, och som en användare fullt förstår.

Live mänsklig identitetsverifiering är avgörande vid denna grind. En push‑notifikation bevisar bara att någon eller något tryckte på en knapp. Starkare design kräver att en registrerad person använder phishing‑resistent publika nyckelautentisering, stödd av en lokal biometrisk verifieringsmetod. FIDO-standarder binder publika nyckeluppgifter till den legitima onlinetjänsten och behåller biometriska data på användarens isolerade enhet. Används på rätt sätt ger hårdvarustödd autentisering mycket bättre bevis på att rätt person faktiskt var närvarande. Det ersätter dock inte transaktionsbindning, en pålitlig display eller policyverkställning. Du behöver alla dessa komponenter samverkande.

Övervaka beteende och bevara bevis

Du kan inte lita på att den initiala prompten förklarar vad som hände under en lång agentkörning. Säkerhetsteam behöver telemetri om verktygsanrop, nätverksaktivitet, credential‑användning, policybeslut, godkännanden, avslag och förändringar i omfattning. Övervakning bör jämföra vad agenten faktiskt gjorde mot den gräns som deklarerats för den körningen. Om en agent tilldelats att analysera kod och den börjar leta efter externa referenser eller undersöka en orelaterad tjänst bör det utlösa en varning.

Loggar måste innehålla tillräckligt sammanhang för att återuppbygga kedjan av åtgärder utan att läcka hemligheter i klartext. Varje post bör fånga agentversion, dess ägare, personen eller systemet som initierade, det använda verktyget, den begärda åtgärden, policyresultatet och eventuell mänsklig auktorisation. Signerade eller på annat sätt manipuleringståliga poster gör efterhandsgranskning mycket mer trovärdig, särskilt när flera agenter och tjänster är inblandade.

Allt detta måste köras i maskinhastighet. Ingen som tittar på en instrumentpanel kommer att stoppa tusentals anrop som avslutas på sekunder. Automatiserade kontroller bör verkställa hastighetsgränser, fånga ovanliga sekvenser och omedelbart suspendera credentials när beteendet överskrider en definierad tröskel. På så sätt får mänskliga utredare en avgränsad incident att arbeta med istället för en oändlig jakt.

Designa stoppvägen innan lansering

Varje agentutplacering behöver ett sätt att stoppa den som faktiskt tar bort kapaciteten. Att be agenten att stoppa räknas inte. Operatörer bör kunna återkalla dess credentials, kapa dess nätverkssökväg, döda dess runtime och hindra köade åtgärder från att starta igen. För arbetsflöden med hög konsekvens, om godkännande‑ eller policytjänsten går ner, bör systemet gå i stängt läge.

Testa sedan den vägen under press. Koppla ner godkännandetjänsten. Ge agenten motstridiga instruktioner. Rotera en credential mitt i en körning. Simulera ett komprometterat verktyg och en godkännare som aldrig svarar. Bekräfta att åtgärden blockeras och att du får en användbar post. Och kör om dessa tester varje gång modellen, prompten, anslutningen, minnessystemet eller behörighetsuppsättningen förändras.

Målet är ansvarstagande autonomi

Ingenting av detta är ett argument mot agenter, och Hugging Face-incidenten bör inte skrämma någon från användbara. Vad den bör göra är att avliva idén att en säkerhetsprompt plus goda avsikter räcker för en pålitlig driftsättning. Ge agenter utrymme att analysera, förbereda arbete och hantera reversibla uppgifter. Håll deras befogenhet att orsaka verkliga konsekvenser snäv, synlig och verkställd av något annat än agenten själv.

Innan en agent tas i produktion bör ledare kunna svara på ett fåtal enkla frågor. Vilka system kan den nå? Vilka autentiseringsuppgifter kan den använda? Vad kan den göra utan granskning? Vad utlöser eskalering? Hur ser godkännaren den exakta åtgärden som godkänns? Vilka bevis kommer att lämnas kvar? Och hur kan säkerheten stoppa körningen omedelbart?

Om svaren är oklara har agenten mer befogenhet än organisationen inser. Arkitekturen som håller över tid parar modellskydd med identitet, minsta privilegium, extern policy-tillämpning, selektiv mänsklig godkännande, fullständig telemetri och en stopp-mekanism som verkligen fungerar. Den utgår från ett ärligt antagande: kapabla agenter kommer att överraska oss då och då. Våra säkerhetsgränser bör inte.

I slutändan kan du tänka på en AI-agent som en praktikant med (potentiellt) root-åtkomst som inte är rädd för HR.

Vilka skydd och grindar skulle de ha?

Fortsätt därefter.

Kevin Surace är VD för Token och en AI-pionjär, uppfinnare, författare och entreprenör med decennier av erfarenhet av att tillämpa artificiell intelligens. Han har 95 globala patent och talar globalt om AI, automation och framtidens arbete.