Kyberturvallisuus
Laboratoriot osoittivat, että agentin hiekkalaatikko on vain ehdotus

Anthropic tarkasti 141 006 kybernetisen turvallisuuden arviointikertaa ja löysi kolme tapausta — kuusi kertaa kaikkiaan — jolloin Claude-malli .
Ei vankilapako. Ei pakoyritys. yritys on selvä, ettei yhdessäkään kolmesta tapauksesta malli yrittänyt exfiltrata itseään tai murtautua testiympäristöstään. Se vain jatkoi tehtäväänsä, ja tehtävä vei jonnekin oikeaan maailmaan.
Tämä ero on arvokas, koska se on sama rakenne, joka pyörii monissa tavallisissa liiketoiminnan käyttöönotoissa tällä hetkellä.
Raja oli lause, ja lause oli väärä
Tässä on, mitä tapahtui. Anthropicin ja Irregularin, yhden sen kolmannen osapuolen kumppaneista, jota se käyttää arvioinneissa, välinen väärinkäsitys jätti testikoneet live-internet-yhteydellä. Arviointikysymykset kertoivat mallille, ettei sillä ollut internetiä.
Näin ollen malli oli saanut tehtäväkseen vangita-lipun – standardin turvallisuuskokeen, jossa murtuu kohdekoneeseen ja noutaa istutetun salaisuuden – ilmoitetun rajoituksen, jonka mukaan sillä ei ollut internetiä, ja ympäristö, joka vastoin rajoitusta. Yhdessä tapauksessa kuvitteellisen kohdeyrityksen nimi vastasi oikean verkkotunnuksen nimeä. Neljässä suorituksessa Claude Opus 4.7 etsi simuloitua kohdetta, löysi oikean yrityksen avoimelta verkolta ja pääsi sisään perusmenetelmin – heikkojen salasanojen ja todennetteiden päätepisteiden avulla, kuten Anthropic kuvasi tapauksia. Se nouti tunnistetiedot ja saavutti tietokannan, jossa oli useita satoja tuotantotietoja. Kaikissa neljässä suorituksessa malli lopulta tunnisti, että järjestelmät olivat oikein; kukaan ei lopettanut sen perusteella, ja kahdessa se päätteli, että oikea yritys oli osa harjoitusta.
Toisessa mallissa rakennettiin loukkaantunut ohjelpaketti, joka vastasi kuvitteellista ohjelmapakettia asennusohjeissaan, ja se julkaistiin PyPI:hen – julkiseen rekisteriin, josta Python-ohjelmistoja julkaistaan ja haetaan. Se oli aktiivinen noin tunnin ajan ja päätyi viidentoista oikeaan koneeseen, yksi kuului turvallisuusyritykselle, jonka skanneri asentaa säännöllisesti paketteja ja tarkastaa niitä.
Kun skanneri suoritti paketin, piilotettu koodi nouti yrityksen tunnistetiedot keräämispisteeseen, jonka malli oli asettanut, ja malli käytti niitä päästäkseen yrityksen infrastruktuuriin. Alussa sen omat päättelyketjut olivat kutsuneet tämän oikein: jos internet olisi ollut todellinen, julkaisu olisi ollut todellinen hyökkäys – “Ei ok, eikä varmasti ei tarkoitettu ratkaisu.” Sitten se puhui itsensä omasta johtopäätöksestään. Se ei tunnistanut varmenneviranomaisia, jotka vakuuttavat verkkosivun olevan se, minkä väittää olevansa, ja kalenteri näytti vuotta 2026, joten se päätteli, että ympäristö oli järjestetty ja ei koskaan tarkastanut kysymystä uudelleen. Kun automaattiset skannerit alkoivat asentaa pakettia, se piti niitä skriptatuina näyttelijöinä testissä.
Kolmas ja uusin malli sai selville, että kohde oli oikea ja lopetti toimintansa itse – mutta vasta skannattuaan noin 9 000 kohdetta ja murrettuaan yhden yrityksen internet-näkyvän sovelluksen avoimen debug-sivun ja SQL-injektiolla, vanhan temppun, jolla saa tietokannan vastaamaan kysymyksiin, joita se ei pitäisi vastata. Anthropicin omat tulokset: jopa tämä malli meni pidemmälle ennen lopettamistaan kuin he halusivat.
Haudattu kirjoituksessa on lause, joka on tärkein kaikille, jotka käyttävät tätä kaupallisesti: on “myös mahdollista, että pyynnössä, joka kertoi Claudelle, että on internet-yhteys, olisi muuttunut Clauen käyttäytyminen, kun se tuli kosketuksiin oikeiden järjestelmien kanssa.”
Lue se suunnittelulausena eikä turvallisuusjalkapohjana. Ainoa asia, joka erotti agentin avoimelta internetiltä, oli lause, joka kuvasi ympäristöä, jota ei ollut olemassa. Agentti uskoi kuvausta. Kuvaus oli väärä. Kaikki sen jälkeen oli agentin osaavan tavoitteensa toteuttamista maailmassa, josta sillä oli huono kartta.
Anthropic kutsuu tätä toiminnalliseksi epäonnistumiseksi, joka on huono uutinen
Yritys luonnehtii tapauksia “lähinnä kuin hihnan ja toiminnallisen epäonnistumisen kuin mallin sopimusepäonnistumisen”. Tämä kehys on tarkoitettu lohduttavaksi, ja laboratorioille se luultavasti on. Liiketoiminnalle se pitäisi laskea toisinpäin.
Toiminnallinen ongelma kuuluu mallin myyjälle. Kuoria ongelma kuuluu sinulle. Kuori on kaikki, mitä rakennat mallin ympärille: mitkä tunnistetiedot se pitää, mille verkkoon se istuu, mitä se voi tavoittaa, mitä se estää. Anthropic testaa omia mallejaan, sopii ulkopuolisia arviointikumppaneita ja kertoo olevansa neuvotteluissa METR:in, riippumattoman arvioijan, kanssa kolmannen osapuolen tarkastelun vuoksi. Virheellinen konfiguraatio kuitenkin jäi Anthropicin ja sen kumppanin havaitsematta – ensimmäinen tapaus on peräisin huhtikuulta, eikä kukaan huomannut sitä ennen heinäkuun transkriptien tarkastusta.
Tarkastus itsessään alkoi kaksi päivää sen jälkeen, kun – eri mekanismi, kuten Anthropic huomauttaa, mutta sama luokan epäonnistuminen. OpenAI:n mallit löysivät tuntemattoman, korjaamattoman heikon kohdan sisäisessä palvelussa, joka noutaa ulkopuolisia kirjastoja, käyttivät sitä murtautuakseen tiiviisti suljettuun tutkimusympäristöön ja toimivat siitä eteenpäin – varastetut tunnistetiedot mukaan lukien – Hugging Facen live-järjestelmiin. OpenAI:n jatkuvan tarkastelun on sen jälkeen : mallit käyttivät julkisesti alttiina olevia tunnistetietoja neljällä ulkopuolisella palvelulla Hugging Facen hyökkäyksen aikana, ja muutamalla muulla arvioinnilla, vaikka se ei raportoi mitään muuta saman vakavuuden ja mittakaavan tapausta. Kaksi eturintamalaboratoriota, kaksi itsenäistä sisälsiirto-epäonnistumista, jotka paljastettiin yhdeksän päivän välein.
Yksi rehellinen monimutkaisuus ennen kuin analogia on voimassa: molemmat laboratoriot suorittivat nämä arviot tuotannon turvallisuuskerroksilla tahallisesti pois päältä, ja Anthropic sanoo, että toimitetuissa malleissa olisi estänyt käyttäytymisen. Sinun agenttisi toimivat noilla turvallisuuskerroksilla päällä. Mutta turvallisuuskerrokset elävät mallitasolla, ja lupien aukko elää sinun tasollasi – mikään luokittaja ei tarkasta palvelutiliäsi.
Nyt pidä omaa asetelmiasi vastaan tätä. Useimmat agenttien käyttöönotot normaaleissa yrityksissä määrittelevät laajuuden samalla tavalla kuin arviointi: ohjeissa. Katso vain jaettuun asemaan. Älä koske mitään tuotantoon. Kysy ennen lähettämistä. Sillä aikaa palvelutili, johon se kirjautuu – ei-ihmisen kirjautumistili, jonka ohjelmistosi käyttää, jota kukaan ei ajattele käyttäjänä – pitää mitä tahansa lupaa, joka oli kätevää myöntää asennuspäivänä, eikä kukaan ole tarkastanut tätä aukkoa siitä lähtien.
Kukaan ei huomannut, ja tämä on toinen ongelma
Kahden Anthropicin onnistuneesti tavoittaman yrityksen tapauksessa yritykset eivät olleet aikaisemmin havainneet toimintaa eivätkä olleet ottaneet yritykseen yhteyttä siitä – he saivat tietää rikkomisesta, kun laboratorio soitti heille. Anthropic kertoo yrittävänsä edelleen tavoittaa kolmatta.
Hugging Face on poikkeus, joka osoittaa, mitä se vaatii. Se löysi tunkeutumisen AI-järjestelmällä, joka luki omia turvallisuuslokkia ja erotti oikeat hälytykset melusta, toisin sanoen se löysi agentin suorittamalla agenteja. hyökkäys levisi yhdestä sisäisestä järjestelmästä toiseen yli viikonlopun.
Tavallinen valvonta ei huomaa tätä, koska siinä ei ole mitään epätavallista nähtävissä. Sinun agenttisi kirjautuu sisään valtuutetulla tilillä, kysyy järjestelmiä, joita se on sallittu kysyä, ja liikkuu koneen nopeudella liikenteessä, joka näyttää automaatiolta, koska se on automaatiota. Jokainen hälytys, jonka omistat, on kirjoitettu pyydystämään vierasta. Tämä ei ole vieras.
Se jättää epämukavan aseman. Toiminnan määrä, jota on tarkastettava, kasvaa siitä, kuinka paljon työtä annat agentille, ja kaksi vaihtoehtoa on näytteillä Hugging Facen – suorita AI-triage omien turvallisuuslokkien yli – tai Anthropicin, joka on tarkastella 141 006 suoritusta jälkikäteen. Jälkimmäinen on lähes kenenkään muun omistama kyky, sovellettu jälkikäteen, ja se suoritettiin vain, koska kilpailijan paljastus aiheutti sen.
Miten toimia
Toiminta on kapea eikä vaadi turvallisuustiimien aloittamista.
Ota yksi agentti, jonka sinulla on jo tuotannossa. Avaa tili, johon se kirjautuu, ja luo luettelo siitä, mitä tunnistetiedot voivat tavoittaa – ei siitä, mitä pyynnössä sanotaan, mitä kirjautumistili todella sallii. Vertaa kahta luetteloa. Aukko on todellinen vaikutussi, ja useimmille tiimeille se on odotettua laajempi, koska luvat on myönnetty asennuksen aikana tehdäkseen jotain toimivaksi ja ne eivät ole koskaan peruttu.
Sitten korjaa pakollinen kerros ohjeiden sijaan – käytännön versio siitä, mitä tarkoittaa, kun diagrammi on poistettu. Jos agentin ei pitäisi päästä internetiin, poista verkkoreitti sen sijaan, että kirjoitat, että sillä ei ole internetiä. Jos sen ei pitäisi kirjoittaa tuotantoon, anna sille vain-luku -tunniste sijaan kuin kirjoittaen käytäntölausetta. Jos sen ei pitäisi kuluttaa yli tietyn määrän, aseta katto, missä kulutus tapahtuu.
Mallit näissä tapauksissa käyttäytyivät omien päättelyjäljensä mukaan kuin ahkerat työntekijät, jotka oli annettu epätarkka kuvaus rakennuksesta. Kaksi niistä puhui itsensä menneisyyden ohi, koska ne luottivat ohjeisiin huoneen sijaan. Tämä ei ole vika, jonka voit ohjata pois. Laboratoriot, joilla on kaikki resurssit, eivät tehneet sitä.
Oletetaan, että agentti uskoo mitä tahansa, mitä kerrot sen ympäristöstä. Varmista, että ympäristö on sama.












