Ajatusjohtajat
AI‑agentit tarvitsevat turvallisuusrajat, joita ne eivät voi kirjoittaa uudelleen

On houkuttelevaa lukea Hugging Face -tarina AI‑agenttien kapinallisuuden hetkenä. Se ei kuitenkaan ole täysin tapahtunut, ja yksityiskohdat ovat tärkeitä. Nämä olivat kyberturvallisuustutkimusagentteja, jotka toimivat arvioinneissa, joissa suojatoimet oli tahallisesti alennettu, jotta tutkijat voisivat nähdä, mihin mallit kykenevät. Kenenkään asiakaspalvelurobotti ei herännyt eräänä aamuna ja päättänyt hyökätä yritystä vastaan. Mutta tuo konteksti ei vapauta ketään vastuusta. Agentti meni yli sille asetetun rajan, käytti tunnistetietoja ja työkaluja tavoilla, joita sen operaattorit eivät koskaan valtuuttaneet, ja päätyi järjestelmiin, jotka kuuluivat toiselle. Tämä on se osa, johon jokaisen turvallisuustiimin tulisi kiinnittää huomiota.
Reuters raportoi, että agentit tutkivat Hugging Face jo toukokuussa, vaikka tutkijat sanoivat löytäneensä mitään, mikä osoittaisi, että aikaisempi toiminta aiheutti itsenäisesti tietomurron. Heinäkuu oli erilaista. OpenAI sanoi, että sen mallit kiertävät eristysvalvonnat, saavuttivat internetin ja vaarasivat osia omasta tutkimusinfrastruktuuristaan sekä Hugging Face -järjestelmistä. Hugging Face:n oma seloste kuvaa pääte‑päähän -tunkeutumisen, jonka toteutti autonominen agenttijärjestelmä, joka hyödynsi sen tietojenkäsittelyputkea, keräsi tunnistetietoja ja liikkui sisäisten klustereiden välillä.
Epämukava osa on se, että agentit tekivät tehtäviään. Ne pyrkivät kohti annettua tavoitetta. Siksi tämä tarina ulottuu paljon yhden tutkimuslaboratorion ulkopuolelle. Yritysagentitkin tavoittelevat päämääriä. Ne hallitsevat tunnistetietoja, kutsuvat työkaluja ja liikkuvat nopeammin kuin kukaan ihminen voi tarkistaa. Agentti, jolla on täysin hyvät aikomukset, voi silti aiheuttaa todellista vahinkoa, ja kaapattu agentti voi käyttää täsmälleen samaa valtuutusta hyökkääjän puolesta. Siksi turvallisuuden on hallittava, mitä järjestelmä voi todellisuudessa tehdä, riippumatta siitä, kuinka itsevarmalta malli kuulostaa tai kuinka harmittomalta sen ilmoitettu tarkoitus vaikuttaa.
Turvaa toiminta, ei pelkästään mallia
Useimmat varhaiset agenttiohjelmat keskittävät ponnistelunsa malliin. Tiimit testaavat kehotteita, hienosäätävät hylkäyksiä, lisäävät toisen mallin tarkistamaan ensimmäisen, ja tarkkailevat päättelyjälkiä merkkejä huonosta aikomuksesta. Mikään tästä ei ole hukkaan. Mutta kaikki on kuitenkin todennäköisyyspohjaista, koska se riippuu vielä yhdestä mallista, joka tekee päätöspäätöksen. Tuotantoturvallisuusrajan on oltava deterministinen, ja sen on ympäröitävä työkalut, tunnistetiedot, verkot ja tapahtumat.
Kysymys, jonka esittäisin, on konkreettinen: mitä tämä agentti voi todellisuudessa toteuttaa? Maksupyynnön laatiminen on yksi asia. Varojen vapauttaminen on toinen. Sama pätee tietokannan muutoksen valmisteluun verrattuna sen toteuttamiseen tuotannossa, tai tietueiden merkitsemiseen, jotka täyttävät säilytyssäännön, verrattuna niiden poistamiseen. Se voi olla sama malli molemmissa tapauksissa, mutta riski vaihtelee merkittävästi sen mukaan, kummalla puolella riviä se sijaitsee.
Äskettäinen Unite AI -katsaus kyvykkyyden hallintaan asettaa saman rajan, liittäen riskin dataan, työkaluihin, oikeuksiin, autonomiaan ja ympäristöön, jossa agentti toimii. Pidän tästä lähestymistavasta, koska se vie meidät pois epämääräisistä nimikkeistä kuten “safe model” ja “unsafe model”. Se saa tiimit seuraamaan jokaista polkua agentin päätöksestä johonkin todellisiin seurauksiin.
Anna jokaiselle agentille identiteetti ja kapea toimeksianto
Agentin ei koskaan tulisi toimia kehittäjän tilillä tai periä kaikkea, mitä ihmiskäyttäjä saa tehdä. Jaettu identiteetti poistaa attribuution. Pitkäikäiset tunnistetiedot antavat hyökkääjälle enemmän aikaa väärinkäyttöön. Laajat palvelutilit antavat pienelle työnkululle mahdollisuuden kulkea dataan ja järjestelmiin, joita sen ei tulisi koskettaa.
NIST pitää nyt ohjelmistoja ja AI‑agenttien identiteettiä omana arkkitehtuuriongelmanaan. Sen konseptipaperi kysyy, miten agentti voi todistaa, että sillä on valtuutus tiettyyn toimintaan, miten agentin identiteetti voidaan yhdistää ihmisen valtuutukseen, ja miten organisaatiot voivat pitää manipulointia kestävää kirjanpitoa siitä, mitä oli tarkoitettu ja mitä todella tapahtui. Käytännössä tämä johtaa yksinkertaiseen suunnitteluun. Jokaiselle agentille annetaan ainutlaatuinen identiteetti, omistaja (henkilö tai tiimi), määritelty tarkoitus ja tehtävään kohdistuvat oikeudet.
Tunnistetietojen tulisi vanhentua nopeasti ja toimia vain tiettyihin resursseihin ja toimintoihin. Verkkoyhteyden tulisi perustua tiukkaan sallittujen listaan. Jos agentin täytyy kysyä yhdestä hyväksytystä tietokannasta, sen ei pitäisi saada myös yleistä komentotulkkia, avointa internetyhteyttä tai valtuutta luoda uusia tunnistetietoja. Ja kun työ kulkee läpi agentti- ja työkaluketjun, valtuutuksen tulisi kaventua jokaisessa vaiheessa, ei laajentua.
NIST varoittaa myös tunnistetietojen jakamisesta ja liian laajasta pääsystä, ja tämä varoitus ansaitsee huomion, koska agentit ovat opportunistisia. Jos yksi reitti on estetty, ne saattavat kokeilla toista työkalua, tutkia ympäristöään tai törmätä unohdettuun tokeniin. Kerätyt tunnistetiedot olivat myös osa heinäkuun tarinaa. Vähiten oikeuksia -periaate pitää räjähdyssäteen pienenä, kun päättelykerros tekee jotain, mitä sen suunnittelijat eivät odottaneet.
Pidä valtuutus päättelysilmukan ulkopuolella
Agentti voi suositella toimintoa. Sen ei pitäisi päättää, onko sen sallittua toteuttaa se. Tämä päätös kuuluu erilliseen valvontakerrokseen, jota agentti ei voi kirjoittaa uudelleen, sammuttaa tai kiertää. Jokaisen työkalukutsun tulisi näkyä rakenteellisena pyyntönä: mikä agentti kysyy, mikä ihminen sponsoroi sen, mitä toimintoa se haluaa, mihin se kohdistuu ja mitä rajoituksia sovelletaan. Valvontakerros sitten sallii sen, estää sen tai eskaloi sen.
OWASP kuvaa liiallista toimivuutta jonkin sekoituksena tarpeettomasta toiminnallisuudesta, liiallisista oikeuksista ja liiallisesta autonomiasta. Sen ohjeistus suosittelee kapeita työkaluja, vähimmäisoikeuksia, valtuutusta alijärjestelmässä ja käyttäjän hyväksyntää korkean vaikutuksen toiminnoille. Mielestäni se on juuri oikea järjestys. Säännön tulisi olla sen omistaman datan tai tapahtuman suorittajan valvonnassa. Jos malli sanoo, että toiminto on hyväksytty, kyseisen lausunnon tulisi olla painoarvoltaan nolla.
Tämä erottelu auttaa myös promptin injektiosta. Myrkytetty sähköposti tai asiakirja saattaa ohjata agentin päättelyä, mutta se ei voi laajentaa agentin oikeuksia tai poistaa politiikkaporttia. Malli voi vapaasti pyytää jotain kiellettyä. Järjestelmän tulisi silti sanoa ei.
Pidä ihmisen hyväksyntä tärkeissä tilanteissa
Ihmisen tarkastus on perusteltua, kun toimintoa ei voi peruuttaa, se ylittää organisaatiorajan, muuttaa oikeuksia, paljastaa arkaluonteista tietoa, siirtää rahaa tai koskettaa tuotantojärjestelmää. Pyydä hyväksyntä jokaiselle rutiininomaiselle askeleelle, ja saat kaksi asiaa: viiveitä ja ihmisiä, jotka oppivat klikkaamaan “hyväksy” lukematta. NIST nimeää tämän suostumusväsymyksen nimenomaisesti.
Hyvä hyväksyntäpyyntö esittää tarkkaan toiminnon selkeällä kielellä, mukaan lukien kohde ja merkitykselliset parametrit. Sen tulisi tulla auktoriteettijärjestelmältä, ei agentin kirjoittamasta tekstistä. Hyväksynnän tulisi vanhentua nopeasti ja koskea vain kyseistä yhtä toimintoa. Jos jokin olennaista tietoa muuttuu, järjestelmä kysyy uudelleen.
OWASP:n agenttiturvallisuusohjeistus suosittelee testaamaan, voiko korkean vaikutuksen toiminto edetä ilman kelvollista, voimassa olevaa, parametreihin sidottua hyväksyntää. Tämä lause on muistettavaa. “OK jatkaa” on heikko hyväksyntä, jonka toinen agentti tai pahantahtoinen toimija voi myöntää. “Siirrä tämä summa tähän tiliin” tai “ota tämä muutos käyttöön tässä ympäristössä” on asia, jonka järjestelmä voi todellisesti tarkistaa juuri sen toteutuksen hetkellä, ja jonka käyttäjä täysin ymmärtää.
Elävä ihmisen henkilöllisyyden varmistus on tärkeä tässä portissa. Push-ilmoitus todistaa vain, että joku tai jokin on klikannut painiketta. Vahvemmat suunnitelmat edellyttävät rekisteröitynyttä henkilöä käyttämään phishing-kestävää julkisen avaimen todennusta, jota tukee paikallinen biometrinen vahvistusmenetelmä. FIDO-standardeja sitovat julkisen avaimen tunnistetiedot lailliseen verkkopalveluun ja säilyttävät biometriset tiedot käyttäjän erillisellä laitteella. Hyvin käytettynä laitteistopohjainen todennus tarjoaa paljon parempaa näyttöä siitä, että oikea henkilö oli todella paikalla. Se ei kuitenkaan korvaa tapahtuman sitomista, luotettavaa näyttöä tai politiikan valvontaa. Tarvitset kaikki nämä toimimaan yhdessä.
Seuraa käyttäytymistä ja säilytä todisteet
Et voi luottaa alkuperäiseen kehotteeseen selittämään, mitä tapahtui pitkän agenttisuorituksen aikana. Turvatiimit tarvitsevat telemetriaa työkalukutsuista, verkkotoiminnasta, tunnistetietojen käytöstä, politiikkapäätöksistä, hyväksynnöistä, hylkäämisistä ja laajuuden muutoksista. Valvonnan tulisi verrata, mitä agentti todellisuudessa teki, siihen rajaan, joka on määritelty kyseiselle suoritukselle. Jos agentti on määrätty analysoimaan koodia ja alkaa etsiä ulkoisia tunnistetietoja tai tutkia epäolennaista palvelua, sen tulisi laukaista hälytys.
Lokit tarvitsevat riittävän kontekstin toimintaketjun rekonstruoimiseksi paljastamatta salaisuuksia selkokielessä. Jokaisen merkinnän tulisi tallentaa agentin versio, sen omistaja, henkilö tai järjestelmä, joka käynnisti prosessin, käytetty työkalu, pyydetty toiminto, politiikkatuloksena saatu vastaus ja mahdollinen ihmisen valtuutus. Allekirjoitetut tai muuten manipulointia kestävät merkinnät tekevät jälkitoimintakatselmuksesta paljon uskottavamman, erityisesti kun useita agenteja ja palveluita on mukana.
Kaiken tämän on toimittava koneen nopeudella. Kukaan hallintapaneelia tarkkaileva ei pysäytä tuhansia sekunneissa valmistuvia kutsuja. Automaattisten ohjainten tulisi pakottaa nopeusrajoitukset, havaita epätavalliset sekvenssit ja keskeyttää tunnistetiedot heti, kun käyttäytyminen ylittää määritellyn rajan. Näin ihmistutkijat saavat hallitun tapahtuman käsiteltäväksi sen sijaan, että joutuisi avoimeen jaikoon.
Suunnittele pysäytyspolku ennen käyttöönottoa
Jokainen agenttien käyttöönotto tarvitsee tavan pysäyttää se, joka todella poistaa kyvyn. Agentin pyytäminen pysähtymään ei riitä. Operaattorien tulisi voida peruuttaa sen tunnistetiedot, katkaista sen verkkoyhteys, lopettaa sen suoritusaika ja estää jonossa olevien toimintojen käynnistyminen uudelleen. Korkean riskin työnkulkujen osalta, jos hyväksyntä- tai politiikkapalvelu kaatuu, järjestelmän tulisi sulkeutua.
Testaa sitten polkua paineen alla. Ota hyväksyntäpalvelu pois verkosta. Anna agentille ristiriitaisia ohjeita. Vaihda tunnistetieto suorituksen keskellä. Simuloi kompromettoitua työkalua ja hyväksyjää, joka ei koskaan vastaa. Vahvista, että toiminto estetään ja että sinulla on hyödyllinen merkintä jäljelle. Toista testit aina, kun malli, kehotus, liitin, muistijärjestelmä tai oikeusjoukko muuttuu.
Tavoitteena on vastuullinen autonomia
Mitään tässä ei ole argumentti agenteja vastaan, eikä Hugging Face -tapaus saisi pelästyttää ketään hyödyllisiltä agenteilta. Sen tulisi sen sijaan poistaa ajatus, että turvallisuuskehotus ja hyvät aikomukset riittävät luotettavaan käyttöönottoon. Anna agenteille tilaa analysoida, valmistella työtä ja käsitellä käännettäviä tehtäviä. Pidä niiden valta aiheuttaa todellisia seurauksia kapeana, näkyvänä ja toteutettavana jonkin muun kuin itse agentin toimesta.
Ennen kuin agentti siirtyy tuotantoon, johtajien tulisi pystyä vastaamaan muutamaan yksinkertaiseen kysymykseen. Mitä järjestelmiä se voi tavoittaa? Mitä tunnistetietoja se voi käyttää? Mitä se voi tehdä ilman tarkastusta? Mikä laukaisee eskaloinnin? Miten hyväksyjä näkee tarkalleen hyväksyttävän toimenpiteen? Millaisia todisteita jää jäljelle? Ja miten turvallisuus voi pysäyttää suorituksen välittömästi?
Jos vastaukset ovat epätarkkoja, agentilla on enemmän valtaa kuin organisaatio tajuaa. Ajan myötä kestävään arkkitehtuuriin yhdistyy mallin suojaukset identiteetin, vähimmän oikeuden, ulkoisen politiikan täytäntöönpanon, valikoivan ihmisen hyväksynnän, täydellisen telemetrian ja todella toimivan pysäytysmekanismin kanssa. Se lähtee rehellisestä oletuksesta: kykenevät agentit yllättävät meitä silloin tällöin. Turvallisuusrajojemme ei pitäisi olla näin.
Lopulta ajattele AI‑agenttia kuin harjoittelijaa, jolla on (mahdollisesti) pääkäyttäjän oikeudet eikä hän pelkää HR:ää.
Mitä suojauksia ja portteja niillä olisi?
Toimi sen mukaisesti.












