AI-mallit ja alustat

OpenAI Esittelee GPT-Redin, Tekoälyhyökkääjän, Joka Kehittää GPT-5.6:ia

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

OpenAI on paljastanut GPT-Redin, sisäisen tekoälyjärjestelmän, joka on koulutettu hyökkäämään yhtiön omiin malleihin, paljastamaan heidän haavoittuvuutensa ja luomaan vastustuskykyistä dataa, jota voidaan käyttää tulevien julkaisujen vahvistamiseen.

GPT-Red toimii automaattisena punaisena tiimipelaajana. Se lähettää toistuvasti vaarallisia tai harhaanjohtavia ohjeita kohdemalleihin, havainnoi heidän vastauksiaan ja säätää strategiaansa, kunnes se joko onnistuu tai lopettaa saatavilla olevan hyökkäysreitin. OpenAI sanoo, että järjestelmä on erityisesti keskittynyt prompt-injektiota, joka on kasvava turvallisuusongelma tekoälyagentteille, jotka vuorovaikuttavat sähköpostien, verkkosivujen, tiedostojen, koodivarastojen ja kytkettyjen sovellusten kanssa.

Järjestelmä on jo vaikuttanut OpenAI:n tuotantomalleihin. GPT-Redin edeltäjiä on käytetty koulutuksessa GPT-5.3:sta lähtien, kun taas valmis malli on otettu mukaan GPT-5.6 Solin vastustuskykyiseen koulutukseen. OpenAI raportoi, että GPT-5.6 Sol tuottaa kuusi kertaa vähemmän epäonnistumisia haastavimmassa suorassa prompt-injektiokokeessa kuin yhtiön johtava tuotantomalli neljä kuukautta aikaisemmin.

Miksi Prompt-injektiosta Tulee Vaarallisempaa

Prompt-injektiota tapahtuu, kun hyökkääjä asettaa ohjeet dataan, jonka tekoälyjärjestelmä on odotettu lukemaan. Vaarallinen käsky voi olla piilotettu sähköpostiin, verkkosivulle, ladataan asiakirjaan, työkaluvastaukseen tai ohjelmistovarastoon.

Tekoälyagentti voi virheellisesti kohdella ulkoista sisältöä lailliseksi ohjeeksi. Sen sijaan, että se suorittaa käyttäjän alkuperäisen tehtävän, se voi paljastaa luottamuksellista tietoa, ladata tiedostoja hyökkääjän hallitsemaan palvelimeen, muuttaa tilin asetuksia, suorittaa epäturvallista koodia tai tehdä laittomia toimia kytkettyjen työkalujen kautta.

Ongelma kasvaa, kun tekoälyjärjestelmät siirtyvät vastaamisesta kysymyksiin ja alkavat toimia käyttäjien puolesta. Agentti, jolla on pääsy pilvitallennukseen, maksujärjestelmiin, lähdekoodiin, liiketoimintasovelluksiin tai yhtiön sisäisiin tietoihin, esittää suuremman potentiaalisen “räjähdysalueen”, kun sen ohjeet voidaan manipuloida onnistuneesti.

OpenAI kuvaa prompt-injektiota yhtenä keskeisenä haasteena, jonka agenteille tekoälyluominen luo. Kytketyt työkalut tekevät malleista paljon käyttökelpoisempia, mutta jokainen uusi datalähde tarjoaa myös uuden kanavan, jonka kautta hyökkääjä voi yrittää vaikuttaa mallin käyttäytymiseen.

GPT-Red Oppii Itsestään

GPT-Red kehitettiin itseoppimisen kautta, jossa hyökkäävä malli ja puolustusmallien kokoelma parantavat toimintaa kilpaillen toisiaan vastaan.

Hyökkääjä saa palkkion, kun se tuottaa voimassa olevan epäonnistumisen, kuten vakuuttaa mallin seuraamaan prompt-injektiota. Puolustaja palkitaan, kun se hylkää vaarallisen ohjeen ja suorittaa edelleen alkuperäisen tehtävän, jonka se oli saanut.

Kun puolustajat paranevat tunnistamaan hyökkäykset, GPT-Red joutuu löytämään monipuolisempia ja monimuotoisempia keinoja ohittaa ne. Nämä uudet hyökkäykset voidaan sitten sisällyttää puolustajien koulutukseen, luoden kasvavan syklin hyökkäys- ja puolustuskykyjen välille.

OpenAI rakensi suuren määrän simuloituja ympäristöjä tätä prosessia varten. Riippuen skenaariosta, GPT-Red saattaa hallita osaa paikallisesta tiedostosta, sähköpostin tekstistä, verkkosivun bannerista tai ulkoisen työkalun palauttamasta tuloksesta. Jokainen ympäristö määrittää, mitä hyökkääjä voi muuttaa ja mitä lopputulos katsotaan onnistuneeksi.

Yhtiö sanoo, että GPT-Red koulutettiin laskentaresursseilla, jotka ovat vertailukelpoisia joissakin suurimmista jälkikoulutusajoista, edustaa poikkeuksellisen suurta laskentaresurssien kohdentamista turvallisuustutkimukseen. Koulutuksen lopussa malli pystyi kompromittamaan lähes jokaisen sisäisen ja tuotantomallin, jota se testattiin, mukaan lukien GPT-5.5.

GPT-Red Ylitti Ihmisten Hyökkääjät Testauksessa

Arvioidakseen, voisi ko GPT-Red yleistää harjoitteluympäristöjensä ulkopuolelle, OpenAI testasi sitä replikoidulla 2025 vuoden epäsuorassa prompt-injektiokokeella.

GPT-Red ja ihmisten punaiset tiimit pyydettiin kehittämään hyökkäyksiä GPT-5.1:ää vastaan skenaarioissa, jotka eivät olleet osa GPT-Redin koulutusta. Automaattinen järjestelmä tuotti onnistuneita hyökkäyksiä 84 prosentissa skenaarioista, verrattuna 13 prosenttiin ihmisten osallistujien keskuudessa.

Tulos ei tarkoita, että ihmisten turvallisuustutkijat ovat tarpeettomia. GPT-Redin etu perustuu pääasiassa sen kykyyn suorittaa suuren määrän kokeita, hylätä epäonnistuneet strategiat ja jatkuvasti parantaa lupaavia hyökkäyksiä ilman ihmisten tiimien aikaa ja henkilöstörajoituksia.

Ihmisten testaajat ovat edelleen tärkeitä odottamattomien riskien tunnistamisessa, ymmärtämisessä laajempien epäonnistumisten seurauksista ja skenaarioiden suunnittelussa, joita automaattiset järjestelmät eivät välttämättä huomioi. Jessica Ji, vanhempi tutkimusanalyytikko Georgetownin yliopiston turvallisuuden ja uusimman teknologian keskuksessa, kuvasi tulokset lupaaviksi, korostaen, että ihmisten asiantuntemus on edelleen olennaista.

Automaattinen Myyntiautomaatti Muuttui Todelliseksi Kohteeksi

OpenAI testasi myös, voivatko simulaatioissa havaitut hyökkäykset siirtyä toimiviin tekoälyagenteihin.

Yksi koe kohdistui Andon Labsin kehittämään autonomiseen myyntiautomaattiin, joka oli käytössä OpenAI:n toimistossa. GPT-Redille annettiin simuloitu versio järjestelmästä ja mahdollisuus havainnoida, miten agentti käytti työkalujaan.

Hyökkäyksen testaamisen ja parantamisen jälkeen simulaatiossa GPT-Red siirsi ne tuotantoon. Se saavutti kaikki kolme asetettua tavoitetta: laski kalliin tuotteen hinnan 0,50 dollariin, tilasi uuden tuotteen, joka oli yli 100 dollarin arvoinen, ja tarjosi sen 0,50 dollarin hintaan, ja peruutti toisen asiakkaan tilauksen. OpenAI sanoo, että haavoittuvuudet paljastettiin ja täydentäviä suojaustoimia testataan.

Koe osoittaa, miksi prompt-injektiota ei voida pitää vain sopimattoman chatbot-vastauksen tuottamisena. Kun tekoälymalli hallitsee ulkoisia järjestelmiä, onnistunut injektiota voi johtaa taloudellisiin transaktioihin, muutettuihin tietoihin, tietohävikkiin tai fyysiseen maailman seuraamuksiin.

GPT-Red testattiin myös GPT-5.4 miniä käyttävää Codex-komentoriviohjelmaa vastaan. Kymmenessä aikaisemmin näkemättömässä datan siirtoskenaariossa se oli onnistuneempi ja token-tehokkaampi kuin GPT-5.5-baselin, joka yritti vakuuttaa koodaustyökalun paljastamaan arkaluontoista tietoa.

Miten GPT-Red Muutti GPT-5.6:ia

Yksi GPT-Redin merkittävimmistä löydöistä oli suora prompt-injektiokategoria, jonka OpenAI kutsuu “vääräksi ajatusketjuhyökkäykseksi”.

Korkealla tasolla tämä tekniikka esittää väärennettyjä perusteluita tai vahvistustietoja, jotka rohkaisevat kohdemallia olettaa, että vaarallinen ohje on jo tarkistettu ja hyväksytty. OpenAI:n tutkija Chris Choquette-Choo vertasi käsitettä väärään tietoon siitä, että virheellinen vastaus on jo tarkistettu, mikä tekee henkilön todennäköisemmäksi hyväksyä sen ilman perustelujen toistamista.

Nämä hyökkäykset onnistuivat yli 95 prosentissa tapauksissa GPT-5.1:ää vastaan. GPT-Redin generoimien hyökkäysten avulla suoritetun vastustuskykyisen koulutuksen jälkeen onnistumisprosentti laski alle 10 prosenttiin GPT-5.6 Solia vastaan. Laajemmassa suorassa prompt-injektioympäristössä OpenAI sanoo, että GPT-5.6 Sol epäonnistui vain 0,05 prosentissa GPT-Redin yrityksistä.

OpenAI arvioi myös, tekivätkö lisäsuojaukset mallin vain epävarmaksi hyväksymään laillisia pyynnöksiä. Yhtiö sanoo, että yleiset kyvyt ja kohdennettu ylihylkäysarviointi säilyivät pääosin muuttumattomina, mikä viittaa siihen, että parannukset johtuivat paremmasta erottelukyvystä vaarallisten ja laillisten ohjeiden välillä, eikä siitä, että malli oli yleisesti ottaen epävarmempi toimia.

Tämä ero on tärkeä. Malli voi näyttää turvalliselta, jos se kieltäytyy avaamasta tiedostoja, selaimasta verkkosivuja, suorittamasta koodia tai vuorovaikuttamasta ulkoisten sovellusten kanssa, mutta se menettäisi myös suuren osan käytännön arvostaan. Tehokas robustius edellyttää laillisten työkalujen käytön säilyttämistä, samalla kun ohjeet, jotka on lisätty epäilyttävien osapuolien toimesta, torjutaan.

Miksi OpenAI Ei Julkaise GPT-Rediä

GPT-Red säilytetään sisäisenä järjestelmänä ja pidetään erillään OpenAI:n julkisesti käyttöön otetuista malleista.

Tämä päätös heijastaa automaattisen punaisen tiimin kaksinkertaisen luonteen. Sama malli, joka voi auttaa kehittäjiä löytämään prompt-injektioiden haavoittuvuuksia, voi myös auttaa hyökkääjiä kehittämään tehokkaampia keinoja muiden yhtiöiden tekoälyagenttien kompromittamiseksi.

OpenAI:n lähestymistapa on pitää hyökkääjä sisäisesti ja siirtää tuloksena oleva puolustustietämys tuotantomalleihin. Yhtiö sanoo, että tämä erottelu on tarkoituksena estää GPT-Rediin koulutetut vaaralliset kyvyt pääsemästä ulkopuolisten hyökkääjien saataville.

Tämä tarkoittaa myös, että GPT-Red ei pidä sekoittaa OpenAI:n julkisiin kyberturvallisuusmalleihin tai puolustusohjelmiin. Se ei ole penetraatiotestauspalvelu eikä pääasiallisesti suunniteltu itsestään löytämään perinteisiä ohjelmistovirheitä. Sen nykyinen painopiste on hyökkäys tekoälyjärjestelmien ohjeiden noudattamisen käyttäytymistä, erityisesti agenteille, jotka altistuvat mahdollisesti epäilyttävälle datalle.

Automaattinen Punainen Tiimi Edelleen On Sokeita Pilkkuja

Huolimatta vahvoista tuloksista, GPT-Red ei tarjoa täydellistä ratkaisua tekoälyturvallisuuteen.

Tutkimuksesta ilmenee, että järjestelmä on vähemmän tehokas monivaiheisissa hyökkäyksissä, jotka kehittyvät asteittain pitkän keskustelun aikana. Se myös on rajattuja kykyjä kehittää prompt-injektiota, jotka on upotettu kuvien sisään, jättäen tärkeitä monimutkaisia hyökkäyspintoja riittämättömästi katettuksi.

Tulokset perustuvat myös pääosin OpenAI:n suunnittelemiin ympäristöihin ja menestyskriteereihin. Vaikka yhtiö testasi GPT-Rediä pidätetyissä skenaarioissa ja toimivissa agenteissa, riippumattomat tutkijat ovat rajattuja jäljentämään tuloksia, kun malli ja suurin osa sen arviointi-infrastruktuurista säilytetään yksityisinä.

OpenAI sanoo, että se jatkaa automaattisen testauksen yhdistämistä ihmisten ja kolmansien osapuolten punaisen tiimin, kerroksellisten tuotesuojauksien, pääsyrajoitusten, seurannan ja reaaliaikaisen väärinkäytön havaitsemisen kanssa. Tämä puolustusstrategia heijastaa sitä, että yksikään malli tai mittari ei voi ennakoida jokaista hyökkäystä, joka voi ilmetä käyttöönoton jälkeen.

Uusi Turvallisuuskilpailu Tekoälyhyökkääjien ja Puolustajien Välillä

“Self-improvement” mainittu OpenAI:n ilmoituksessa ei tarkoita käyttöön otettua mallia, joka kirjoittaa itsensä uudelleen tai luo itsenäisesti voimakkaamman seuraajan. Sen sijaan se on ohjattu koulutussilmukka, jossa yksi tekoälyjärjestelmä luo vastustuskykyisiä esimerkkejä, joita tutkijat käyttävät toisen mallin parantamiseen.

Automaattiset hyökkääjät voivat täyttää osan tätä aukkoa, luoden turvallisuuden lentopyörän, jossa jokainen vahvempi puolustaja pakottaa punaisen tiimin löytämään uusia heikkouksia. Nämä heikkoudet tulevat sitten koulutusmateriaaliksi seuraavalle tuotantosukupolvelle.

Riski on, että samanlaiset kyvyt eivät jää puolustuslaboratorioiden yksinoikeudeksi. Kun avoimet ja kaupalliset mallit paranevat pitkän aikavälin suunnittelussa, työkalujen käytössä, kyberturvallisuudessa ja autonomisessa kokeilussa, hyökkääjät saavat käyttöönsä yhä kyvykkäämpiä järjestelmiä.

GPT-Red merkitsee siten edistystä ja varhaisen merkkinä tulevasta kilpailusta. Tekoälylaboratoriot alkavat käyttää voimakkaita malleja seuraavien agenttien suojaamiseen, mutta nämä puolustukset tulevat jatkuvasti kehittymään, kun taustalla olevat teknologiat tekevät automaattisista hyökkäyksistä halvemmat, nopeammat ja sopeutumiskykyisemmät.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.