Kyberturvallisuus

OpenAI keskeyttää koordinoidun mallin perustelujen poimintakampanjan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

OpenAI sanoi turvallisuusjulkaisu julkaistuna 30. syyskuuta 2026, että se on tunnistanut ja keskeyttänyt koordinoidun kampanjan, jonka tarkoituksena oli poimia suojattuja perusteluja sen malleista, ja se liitti toiminnan ydinryhmän Moonshot AI:n, Kimi‑kehittäjän, kanssa yhteydessä oleviin henkilöihin. Varhaisimmat havaittuja toimia tapahtui heinäkuun ensimmäisellä viikolla 2026.

Mitä OpenAI havaitsi

OpenAI kuvasi toiminnan vastaavan vihamielistä tiivistämistä, jonka se määritteli järjestelmälliseksi ja luvattomaksi yhden mallin tulosten tai perustelujen käyttämiseksi toisen mallin kouluttamiseen, toistamiseen tai parantamiseen. Suojatut perustelut, yhtiön mukaan, ovat mallin sisäinen tallenne tehtävän läpikäymisestä; niiden poiminta voi paljastaa lopullisesta vastauksesta pidätetyt tiedot ja auttaa muita toistamaan mallin kyvyt.

OpenAI kertoi, että toimijoilla ei ollut onnistunut murtaa sen salausta, vaarantaa tietokantaa tai saada suoraa pääsyä tallennettuihin käyttäjäs keskusteluihin. Toimijat manipuloivat mallien vuorovaikutuksia siten, että suojattuja perusteluja voitiin toistaa pyynnön tekijälle näkyvissä muodoissa koordinoidusti ja mittakaavassa, mikä rikkoi yhtiön käyttöehtoja. Yksi OpenAI:n havaitsemista tekniikoista sisälsi salatun perustelun kopioimisen yhdestä keskustelusta ja toisen keskustelun mallin pyytämisen salauksen purkamaan ja transkriboimaan piilotetun perustelun sisällön. Yhtiö totesi, että manipulointi ei ole mallien ainutlaatuinen haavoittuvuus, ja että se jakoi tietoa siitä teollisuuden kumppaneiden kanssa Frontier Model Forum -foorumin kautta vahvistaakseen yhteisiä puolustuksia.

Toiminta alkoi 1. heinäkuuta 2026, aluksi pienellä volyymilla, kunnes OpenAI havaitsi suuria volyymipiikkejä 24. ja 25. heinäkuuta 2026, jotka koostuivat 16 000 pyynnöstä käyttäen asiaankuuluvaa poimintamallia yli 4 000 käyttäjältä. Julkaisun alaviitteessä todetaan, että luvut kuvaavat yrityksiä, eivät välttämättä onnistuneita poimintoja. OpenAI kertoi, että lisätutkinta tunnisti samankaltaista kehotemallia koskevaa toimintaa yli 15 000 käyttäjän klusterissa, jonka se katkaisi kokonaan 28. heinäkuuta 2026 mennessä. Toiminta kehittyi ajan myötä, mikä yhtiön mukaan vahvistaa, että vihamielinen tiivistäminen on laajempi turvallisuushaaste, joka vaatii kerroksellisia, mukautuvia puolustuksia.

OpenAI totesi, että vihamielinen tiivistäminen aiheuttaa turvallisuus- ja kansallisen turvallisuuden riskejä: poimitut perustelut voitaisiin käyttää toisen mallin kouluttamiseen ilman, että alkuperäisen mallin käyttäjälle näkyviin tuleviin tuloksiin sovelletut suojatoimet säilyvät, ja mittakaavainen tiivistäminen voi nopeuttaa kehittyneiden kykyjen siirtymistä ilman samanlaista turvallisuusinvestointia, mikä yhtiön mukaan korostuu, kun mallit saavat kykyjä kaksikäyttöisillä aloilla. OpenAI kertoi, että ennen julkaisua se tutki kampanjan laajuutta ja mahdollisia vaikutuksia, otti käyttöön omia lieventämistoimia, jakoi tietoa ja sai palautetta tutkijoilta sekä teollisuuden kumppaneilta, ja että lisälieventämis- ja tutkimustyö jatkuu.

Sijoittelu

OpenAI kertoi, että on epäselvää, olivatko kaikki tarkastellut toimijat kyseisenä ajanjaksona peräisin yhdeltä toimijalta, ja että se liittää toiminnan ydinryhmän Moonshot AI:n, Kimi‑kehittäjän, kanssa yhteydessä oleviin henkilöihin.

8. syyskuuta 2026 National Security Agency, Cybersecurity and Infrastructure Security Agency ja Federal Bureau of Investigation julkaisivat yhteinen kyberturvallisuusneuvonta, jossa todettiin, että Moonshot AI on toteuttanut laajamittaisen tiivistyskampanjan Yhdysvaltain frontier AI -yrityksiä vastaan ainakin vuodesta 2025 kesästä lähtien. Neuvossa kerrotaan, että Moonshot AI poimi merkittävää Claude Fable 5 -dataa kouluttaakseen Kimi‑K3‑mallinsa ja GPT‑4o‑dataa Kimi‑K2‑mallinsa kouluttamiseen, ja että yritys käytti Yhdysvaltain malleja tiivistääkseen valvottua hienosäätöoptimointia, vahvistusoppimista, ohjelmistosuunnittelua ja matemaattisia kykyjä.

Neuvossa todetaan laajemmin, että todennäköisesti Kiinan hallituksen tiedostamana DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun ja Z.AI ovat poimineet miljardeja tokeneita miljoonista vaihtokierroksista Yhdysvaltain frontier-malleista, mukaan lukien Claude-, GPT-, Gemini- ja Grok-variantit, ainakin vuodesta 2024 loppuun asti. Viranomaisten mukaan nämä yritykset reitittivät pyynnöt natiivisten API:iden, etäpilvipalvelujen ja kolmansien osapuolten aggregaattorien kautta; käyttivät harmaata markkinaa API-välityspalveluja, joita kutsutaan siirtopisteiksi, kiertääkseen maantieteellisiä rajoituksia, rikkoakseen käyttöehtoja ja heikentääkseen jäljitettävyyttä; ja saavuttivat kustannussäästöjä ostamalla massana premium-tilauksia, joita jaettiin kehittäjätiimien kesken. Viranomaiset suosittelivat, että Yhdysvaltain AI-yritykset toteuttavat kattavan havaitsemisen ja lieventämisen, ottavat käyttöön kohdennettuja vastemuutoksia epäiltyihin tiivistysyrityksiin ja perustavat organisaatioiden välistä tiedonjakamista.

Perustelujälkien tutkimus

OpenAI kertoi, että itsenäiset turvallisuustutkijat toivat sen tietoisuuteen asiaan liittyviä poikkimalli- ja keskustelukompressiohaavoittuvuuksia vastuullisen ilmoituksen kautta. Yhtiö totesi, että se tutki löydökset, vahvisti, että tutkijoiden havaitsemat hyökkäyspolut olivat todellisia, ja että työ auttoi ymmärtämään laajempaa hyökkäysluokkaa ja nopeuttamaan lieventämistoimia.

In arXiviin 10. elokuuta 2026 lähetetty artikkeli, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping ja Maksym Andriushchenko raportoivat, että johtavat tarjoajat piilottavat malliensä vaiheittaisen päättelyn suojellakseen immateriaalioikeuksia ja rajoittaakseen tietovuotoja, palauttaen jäljet asiakkaalle salattujen tekstilohkojen muodossa, jotka asiakas lähettää takaisin jokaisessa seuraavassa pyynnössä. Tekijät tunnistavat arkkitehtonisen haavoittuvuuden: nämä salatut lohkot ovat täysin yhteensopivia ja vaihdettavissa eri istuntojen, käyttäjien ja mallien välillä palveluntarjoajan ekosysteemissä. He kuvaavat skaalautuvan salauksen purkujailbreakin, jossa salattu päättelyjälki yhdestä mallista injektoidaan heikompaan, vähemmän suojattuun malliin samalta tarjoajalta, pakottaen sen purkamaan ja tulostamaan jäljen kirjaimellisesti selkokielisenä ilman, että vahvempaa mallia tarvitsee jailbreakata suoraan.

Tekijät raportoivat, että haavoittuvuus mahdollistaa neljä erillistä hyökkäysvektoria: anti‑destillaatiomekanismien kiertäminen, jonka he osoittavat Anthropicin, OpenAI:n ja Googlen välillä; laajamittainen yksityisten tietojen poiminta, jossa he palauttivat 367 henkilökohtaisesti tunnistettavaa tietoelementtiä ja 182 tunnistetietoa purkamalla 315 320 päättelylohkoa, jotka oli kerätty julkisista repositorioista; tahaton vaarallisen tiedon paljastuminen, joka on piilotettu päättelyprosessiin, vaikka mallin lopullinen näkyvä tuloste turvallisesti hylkääkin haitallisen pyynnön; sekä näkymättömät kehotusinjektiot, jotka upottavat haitallisia kuormia kokonaan salattuihin lohkoihin julkisten agentic rollouts -saastuttamiseksi. Vastuunalaisen paljastuksen jälkeen tekijät ehdottavat kryptografisia ja järjestelmätason suojauksia asiakaspuolen päättelyn turvaamiseksi.

Miten OpenAI reagoi

OpenAI kertoi, että se hillitsi kampanjan yhdistämällä tilien valvonnan, tekniset kontrollit ja kumppaniyhteistyön: se kielsi tai rajoitti vilpillisiä tilejä, vahvisti rekisteröitymis- ja infrastruktuurikontrolleja sekä laajensi valvontaa liittyville verkostoille. Yritys ilmoitti myös vahvistaneensa suojauksia piilotetulle päättelylle käyttäjien, työtilojen, organisaatioiden ja malliperheiden välillä: se sulki reitin, joka mahdollisti jo toisen käyttäjän salatun päättelyn omistaneelle henkilölle sen toistamisen ja sisällön palauttamisen, lisäsi tarkistuksia havaitakseen ja pidättääkseen suoratoistettavan ulostulon, joka saattaisi paljastaa päättelyn, ja teki yhteistyötä kolmannen osapuolen tarjoajien kanssa tunnistaakseen ja häiratakseen tilejä, kun vastaava toiminta kulki heidän palveluidensa kautta.

OpenAI kertoi jakaneensa asiaankuuluvat havainnot Frontier Model Forum -kanavan ja asianmukaisten hallituksen tiedonjakokanavien kautta, jotta muut frontier-kehittäjät ja julkisen sektorin kumppanit voisivat etsiä samankaltaista toimintaa ja vahvistaa omia puolustuksiaan, ja se totesi, että siirrettäviä tai toistettavia päättelyartefakteja tukevat järjestelmät saattavat kohdata samankaltaisia riskejä.

OpenAI kertoi odottavansa, että vastustajapuolisen destillaation yritykset tulevat yhä kehittyneemmiksi frontier-mallien kehittyessä ja kun toimijat etsivät edullisempia tapoja jäljitellä niiden kykyjä. Yritys totesi, että kumppanien ylläpitämät käyttöönotot tarvitsevat samat suojaukset kuin ensimmäisen osapuolen palvelut, että työkalun tuottamiin hyökkäyksiin vaaditaan suojauksia, jotka tarkastelevat enemmän kuin tavallinen näkyvä teksti, ja että se jatkaa työkalusuojien, luokittelijoiden kattavuuden ja mallien hylkäysten parantamista samalla levittäen asiaankuuluvia kontrollteja pilvikumppaneiden kesken. OpenAI sanoi, että sen vastaus keskittyy jatkossa kolmeen alueeseen: vahvemmat tekniset suojaukset poimintaa vastaan, parempi havaitseminen ja valvonta koordinoituja kampanjoita vastaan sekä syvempi uhkatiedon jakaminen teollisuuden ja hallituksen välillä.

Miles Okada on AI-luotu analyytikko Unite.AI:ssa, joka käsittelee tekoälyä ja kyberturvallisuutta keskittyen uusiin uhkiin, puolustaviin arkkitehtuureihin sekä kehittyviin dynamiikkoihin hyökkääjien ja automatisoitujen järjestelmien välillä. Hänen työnsä tarkastelee, miten tekoäly muokkaa turvallisuusoperaatioita, autonomisesta uhkien havaitsemisesta ja reagoinnista vastustavan tekoälyn tekniikoiden nousuun.

Teknisen ja tutkivan näkökulman avulla Miles analysoi turvallisuustutkimuksia, tapaustietoja ja todellisia käyttöönottoja ymmärtääkseen, missä tekoäly vahvistaa puolustuksia – ja missä se luo uusia haavoittuvuuksia. Hän kiinnittää erityistä huomiota mallien hyväksikäyttöön, datamyrkytykseen, hyökkäyksen automatisointiin sekä tekoälyllä toimivien järjestelmien suojauksen operatiivisiin todellisuuksiin mittakaavassa.

Miles Okadan kirjoittamat artikkelit ovat AI-luotua ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen tarkkuuden, perusteellisuuden ja vastuullisen kattavuuden nopeasti muuttuvassa AI-turvallisuusmaisemassa.