Ajatusjohtajat
Miksi chatbot-turvaohjeet ovat väärä turvallisuuden raja

Yritysten tekoäly on edennyt pitkälle koeprosessin jälkeen. 23% yrityksistä on jo laajentamassa agenteja tekoälyjärjestelmiin jossakin yrityksessä, ja 62% on ainakin kokeilemassa tekoälyagentteja. Nämä eivät ole tutkimushankkeita. Ne ovat tuotantokäyttöön otettuja järjestelmiä, jotka on upotettu työnkulkuun, joka koskettaa koodivarastoja, asiakastietoja, sisäisiä API:ja ja toiminnallista infrastruktuuria.
Alan vastaus tähän kasvuun on keskittynyt ennen agentin käyttöönottoa tapahtuvaan. Toimittajat ja tutkijat ovat panostaneet ennen käyttöönottoa tehtäviin turvatoimiin: julkaisemalla skaalautumispolitiikkaa, lujittamalla perusmalleja, suodattamalla syötteitä, turvallistamalla tekoälyn toimintaketju ja pakottamalla sopimusta koulutusajassa. Suuret tekoälytoimittajat ovat tehneet huomattavia investointeja kehittäjien turvallisuustyökaluihin, vahvistaen keskeistä oletusta: jos malli ja sen syötteet voidaan hallita, alirajan riski voidaan rajoittaa.
Se on järkevä vaisto, mutta yhä epätäydellisempi.
Kysymys ei ole turvallisuuden raja
Turvallisuustoimet, jotka toimivat mallirajapinnassa, hyödyttävät ennen kaikkea tiimejä, jotka hallitsevat sovelluskoodia, mallikonfiguraatiota ja alustan infrastruktuuria. Ne tarjoavat vain vähän suojaa puolustajille, jotka ovat vastuussa tekoälyjärjestelmien turvallisuudesta, joita he eivät ole itse rakentaneet eivätkä voi muuttaa. Se on merkittävä sokea piste, ja viholliset ovat jo löytäneet sen.
OpenAI:n uusin uhkainstikeksiraportti dokumentoi täsmälleen tämän dynamiikan. Uhka-agentit hyökkäävät aktiivisesti ChatGPT:hen ja vastaaviin työkaluihin tuotantoympäristöissä, ei keksimällä uusia hyökkäystekniikoita, vaan upottamalla tekoälyä olemassa oleviin työnkulkuun nopeuttaakseen. Tutkimus tekee tehokkaammaksi. Sosiaalinen insinööritaito skaalautuu. Malware-kehitys kiihtyy. Hyökkäyspinta-ala ei ole perustavanlaatuisesti muuttunut; hyökkäyksen nopeus ja määrä on.
Enemmän kerrotaan, miten hyökkääjät reagoivat, kun noille työkaluille vastattiin. OpenAI havaitsi, että uhka-agentit muuttivat nopeasti syötteitään, säilyttäen saman perustavanlaatuinen tarkoituksen, mutta kierrättäen pinnan tason muunnelmia ohjataksesi eteenpäin ohjausjärjestelmät. Tämä on malli, jonka turvallisuuspäälliköt ovat nähneet aikaisemmin. Staattiset puolustukset, kuten signatuuripohjainen virustorjunta tai syötteiden suodatus, eivät kestä vastustajia, jotka iteroida nopeammin kuin sääntöpäivitykset voivat seurata.
Haaste kasvaa, kun agentit saavat autonomian. Nykyaikaiset tekoälyagentit eivät toimi yksittäisessä vaihdossa. Ne suorittavat monivaiheisia toimintaketjuja, kutsuen legitimejä työkaluja ja lupia tavoin, jotka näyttävät täysin normaaleilta eristetyssä. Agentti, joka käyttää voimassa olevia tunnistetietoja sisäisten API:iden luetteleminen, ei laukaista hälytystä. Agentti, joka käyttää herkkää tietovarastoa, joka näyttää tavalliselta työnkululta, ei aiheuta välittömiä lippuja. Jokainen yksittäinen toimi ohittaa tarkastuksen; vaara asuu yhdistelmässä ja järjestyksessä.
Kun uhka siirtyy alavirtaan
Turvallisuustiimit, jotka puolustavat tekoälykäyttöönottoja tänään, kohtaavat rakenteellisen epäsymmetrian. Heidän käytössään olevat työkalut on suunniteltu ennen kaikkea sille, mitä malli saa sanoa. Todellinen riski, jonka heidän on hallittava, on se, mitä agentti tekee järjestelmissä, verkoissa ja identiteeteissä, kun se on saanut luvan ja on laskettu tuotantoympäristöön.
Kysymyspohjaiset turvallisuustoimet jakavat aiempien sääntöohjaisten turvallisuuslähestymistapojen perustavanlaatuiset heikkoudet. Ne ovat hauraita, koska ne riippuvat hyökkäysmallien ennustamisesta etukäteen. Ne ovat reaktiivisia, koska ne edellyttävät, että joku on havainnut ja koodannut uhan ennen kuin puolustus voi toimia. Ja ne ovat jääneet jälkeen vihollisten, jotka ovat omaksuneet tekoälyavusteisen iteroinnin standardikäytännöksi. Puolustaja, joka riippuu syötteiden suodattamisesta saadakseen kiinni uhka-agentista, joka käyttää kielimallia luomaan uusia kysymysmuunnelmia, on perustavanlaatuisesti häviävän asemassa.
Todellinen altis pinta ilmenee käyttöönoton jälkeen. Agenttien toimet leviävät ympäristössä tavoin, joita ei voida täysin ennustaa ennen käyttöönottoa. Agentit kohtaavat reunatapauksia, vuorovaikuttavat tietolähteiden kanssa, joita ne eivät ole suunniteltu käsittelyyn, vastaanottavat syötteitä järjestelmistä, jotka eivät kuulu alkuperäiseen arkkitehtuuriin, ja tekevät päätöksiä, jotka kerryttävät ajan myötä. Ennen käyttöönottoa tehty testaus on valokuva; tuotanto on jatkuva virta. Puolustaminen vain valokuvaa tarkoittaa hyväksymistä, että kaikki tapahtuu virrassa on tehokkaasti valvomatta.
Siirtäminen agentin käyttäytymisen turvallisuusrajaan
Tekoälyjärjestelmien kestävyyden rakentaminen edellyttää erilaista näkökulmaa, ja tavoitteena ei pitäisi olla mallirajapinnan suojaaminen. Se pitäisi olla hyökkääjän aikomusten havaitseminen agenttien toimien havaittavien seurausten kautta. Se on merkittävä ero. Aikomus ei aina ilmene siinä, mitä agentti sanoo tai mitä syötteitä se vastaanottaa.
Tekoälyjärjestelmien turvallisuuden on oltava laajempi kuin mallin ja sen syötteiden turvallisuus. Se on jatkuvan arvioinnin kohteena, miten agentit käyttäytyvät, kun ne vuorovaikuttavat oikeiden työkalujen, oikeiden API:iden ja oikeiden tietojen kanssa. Staattinen arviointi käyttöönoton aikana on välttämätöntä, mutta riittämätöntä. Uhka-ympäristö, jossa agentti toimii, muuttuu jatkuvasti. Agenttien käyttäytyminen on seurattava samalla jatkuvuudella.
Tämä on ongelma, jota kysymyksen lujittaminen ei voi ratkaista. Hyökkääjän aikomuksen havaitseminen toimintaketjujen kautta edellyttää malleja, jotka voivat ymmärtää monimutkaisia, peräkkäisiä käyttäytymismalleja toiminnallisen ympäristön sisällä. Syväoppimismallit, jotka on suunniteltu käyttäytymisanalyysiin, voivat tehdä tämän tavoin, jota sääntöpohjaiset järjestelmät ja perinteinen SIEM-työkalu eivät voi. Ne oppivat, mitä normaali näyttää koko agenttitoiminnan kontekstissa, ja ne paljastavat poikkeamat, jotka osoittavat, että jotain on muuttunut, vaikka yksittäinen toimi ei laukaise perinteistä hälytystä.
Perustava logiikka on sama riippumatta käyttöönottoympäristöstä: turvallisuus, joka on kiinnitetty kysymyskerrokseen, häviää aina hyökkääjille, jotka toimivat toimintakerroksessa. Puolustuksen on siirryttävä sinne, missä uhka todella elää.
Mitä turvallisuustiimit tulisi tehdä nyt
Turvallisuuspäälliköille, jotka yrittävät päästä tämän eteen, on muutamia käytännöllisiä siirtoja, jotka voivat sulkea aukon siitä, missä puolustukset tällä hetkellä ovat, ja siitä, missä ne tarvitsevat olla.
Arvioi tekoälyn turvallisuutta koko sovelluspinon yli. Perusmalli on yksi kerros. Yhtä tärkeää on, miten agentit käyttäytyvät, kun ne on otettu tuotantoon, mitä työkaluja ne kutsuvat, mitä lupia ne käyttävät ja miten nämä valinnat kehittyvät ajan myötä. Turvallisuuden arvio, joka pysähtyy mallirajaan, jättää toiminnallisen pinnan suurelta osin tarkastelematta.
Panosta agentin tasolla vähimmäisluotettavuuteen. Tekoälyagenttien on oltava pääsy vain niihin työkaluihin, API:hin ja tietoihin, jotka ovat välttämättömiä niiden määrättyyn toimintaan. Tämä rajoitus on tärkeä, vaikka agentin tulosteet näyttävät sopusuhtaisilta. Rajoittaminen vähentää vaaravyöhykettä, jos agentti on murennettu, ja luo selkeämmät käyttäytymisviitteet, jotka tekevät poikkeaman havaitsemisen tehokkaammaksi.
Käsittely agentteja identiteetteinä, jotka tuottavat telemetriaa. Jokainen toimi, jonka agentti tekee, on tietopiste. Turvallisuustiimit tulisi rakentaa havaintalogiikkaa agenttien aloittamien toimintaketjujen ympärille, ei vain käyttäjän kysymyksiin, jotka edeltävät niitä. Tämä uudelleenohjaus siirtää valvontaa siitä, mitä joku pyysi agentilta, siihen, mitä agentti todella teki, jossa hyökkääjän aikomus tulee näkyviin.
Investoi jatkuvaan käyttäytymisen valvontaan havaintomalleilla, jotka on suunniteltu tähän tehtävään. Hyökkääjän aikomuksen tunnistaminen, kun se ilmenee toimintaketjujen kautta, edellyttää erikoistunutta kykyä. Perinteiset valvontatyökalut on suunniteltu ihmisten toimintamalleille. Agenttien käyttäytyminen, jossa on nopeus, määrä ja monivaiheinen rakenne, vaatii havaintoinfrastruktuuria, joka on suunniteltu alusta alkaen tämän kontekstin kannalta.
Priorisoi yhteinen puolustus. Tekoälyohjatut hyökkäystekniikat kehittyvät nopeammin kuin yksikin organisaatio voi seurata. Jaettu tutkimus, avoin yhteistyö ja yhteisöllinen uhkainstike on ehdoton osa tekoälyturvallisuuden strategiaa; ne ovat ydin syötteitä. Puolustajat, jotka pysyvät ajan tasalla, ovat niitä, jotka osallistuvat ja hyödyntävät yhteistä tietämystä.
Käyttäytymisen turvallisuus toimii todella
Turvallisuustiimille, jotka tekevät tämän siirron, operatiivinen maksu on konkreettinen. Kiinnittäminen havaintoon agentin käyttäytymisessä, ei mallin tulosteissa, mahdollistaa aikaisemman havaitsemisen hyökkääjän aikomusta, vaikka hyökkäykset ovat salamaisia, sopeutuvia tai salattuja. Hyökkääjät, jotka onnistuvat muuttamaan syötteitään ohjatakseen syötteiden suodattimet, joutuvat silti toimimaan. Nämä toimet jättävät jäljet. Käyttäytymisen havainto löytää nämä jäljet ennen kuin vahinko leviää.
Ehkä eniten, tämä lähestymistapa antaa organisaatioille uskottavan tien tekoälyagenttien käyttöönottoon ilman sitä, että turvallisuusasema heikkenee, kun käyttöönotto kasvaa. Kysymys, joka pitää monia yrityksiä takkua, ei ole se, voivatko tekoälyagentit tarjota arvoa; se on se, voivatko ne ottaa käyttöön riittävällä luottamuksella, että turvallisuusasema ei heikkene, kun käyttöönotto kasvaa. Käyttäytymisen turvallisuus, joka perustuu siihen, miten agentit toimivat, ei siinä, mitä syötteitä ne vastaanottavat, antaa tämän luottamuksen tavalla, jota kysymyspohjaiset ohjausjärjestelmät eivät voi.
Turvallisuuden raja oli piirretty väärään paikkaan, ja se virhe oli järkevä, kun tekoäly oli työkalu, joka odotti syötteitä. Se ei enää odota, agenteilla toimivat järjestelmät toimivat, ketjuuntuvat, eskaloituvat ja kerryttävät ympäristössä, jota ennen käyttöönottoa ei voitu ennustaa. Organisaatiot, jotka tunnistavat tämän ensimmäisenä, ovat ne, jotka todella skaalauttavat tekoälyä luottamuksella. Muut tulevat viettämään seuraavat vuodet löytämällä, murtamalla, että mallin sanojen hallitseminen ei ollut samaa kuin sen tekemisen hallitseminen.












