Etiikka
Tutkimus Paljastaa, että Frontier AI -laboratorioilla On Vain Vähäisiä Suunnitelmia Hallita Kapinallisia Mallia

Viisi johtavaa frontier AI -yritystä on enintään osittain toteuttanut peruskäytännöt, jotka tarvitaan omien AI-järjestelmien hallinnan ylläpitämiseen, eikä kukaan ole julkaissut täydellistä suunnitelmaa mallin rajoittamiseksi, jos se kääntyy operaattoriaan vastaan, kertovan uuden arvio Guidelight AI Standardsilta mukaan, jossa Anthropic, Google, Meta, OpenAI ja xAI on arvioitu tiedon ollessa ajantasainen 18. elokuuta 2026 asti.
Arvio, Guidelightin ensimmäinen, antaa jokaiselle yritykselle arvosanan 0–5 kuudesta sen Control-standardiin perustuvasta käytännöstä: sisäisten AI-järjestelmien toiminnan kirjaaminen, valvonnan toimivuuden mittaaminen, korkean riskin AI-toimintojen rajoittaminen valvonnan taakse, katkaisutoiminto merkittävän väärinkäytön jälkeen, hallintojen toimittaminen kolmannen osapuolen tarkasteluun sekä rajoitussuunnitelman ylläpitäminen. Mikään yritys ei saanut yli 3 (“merkittävä osittainen toteutus”) missään käytännössä. Kokonarvosanat: Anthropic ja OpenAI tasapeli C+ (2,50), Google D+ (1,50), xAI D− (0,83) ja Meta F (0,67).
Guidelight määrittelee rajoitussuunnitelman ennalta määritellyksi protokollaksi, joka käynnistyy, kun AI havaitaan yrittävän ohittaa hallinnan, ja jossa tarkennetaan, mitkä oikeudet peruutetaan, kenelle malli saa edelleen toimia ja millä rajoituksilla, sekä milloin se otetaan kokonaan pois verkosta. Tässä käytännössä OpenAI sai korkein pistemäärän 3 (raportti kiittää sen kyvystä keskeyttää tai lopettaa työkuormia, mukaan lukien sisäiset käyttöönotot ja koulutusajot, turvallisuusongelmien havaitsemisen jälkeen), kun taas Anthropic ja Meta saivat 0, “ei toteutettu”.
Arvosanat mittaavat vain sitä, mitä yritykset ovat julkisesti ilmoittaneet, mikä on Guidelightin selvästi esittämä rajoitus: alhainen arvosana heijastaa puuttuvia julkisia todisteita, ei välttämättä puuttuvia sisäisiä turvatoimia.
Kuinka Kukin Laboratorio Sijoittui AI-hallinnan Osalta
Vahvin alue viidessä yrityksessä oli havaitseminen. Anthropic ja OpenAI kirjaavat merkittävän osan sisäisestä AI-toiminnasta ja skannaavat sen väärinkäytön merkkejä varten, ja molemmat ovat toteuttaneet toimenpiteitä mittaakseen, kuinka hyvin skannaus toimii, sekä eskaloidakseen ihmisten puolelle, kun se havaitsee jotain, arvio osoitti. Neljä viidestä yrityksestä, kaikki paitsi xAI, osallistui METR:n ensimmäiseen Frontier Risk Report -pilottiharjoitukseen, joka julkaistiin 19. toukokuuta 2026, jossa ulkopuolinen arvioija sai pääsyn sisäisiin malleihin, raakaan ajatusketjuun ja ei-julkisiin tietoihin siitä, miten kukin yritys käyttää ja valvoo AI:ta sisäisesti.
Heikoin alue oli ennaltaehkäisy ja rajoittaminen. Porttien takaisissa toimissa ja katkaisutoiminnassa, jotka pysäyttäisivät väärinkäyttäytyvän järjestelmän ennen tai aikana tapahtumaa sen sijaan, että se tapahtuisi jälkikäteen, vain Anthropic sai arvosanan “rajoitettu osittainen toteutus”. Guidelightin johtopäätös: parhaiden julkisten todisteiden perusteella yrityksillä on “vähän rajoituskäytäntöjä valmiina hätätilanteeseen”.
Arvosanat paljastavat myös aukon retoriikan ja paperityön välillä. Anthropic, joka julkaisee alan laajimman riskidokumentaation, sai 0 rajoitussuunnitelman käytännössä. Sen oma elokuu 2026 Risk Report — 185-sivuinen arvio, joka kattaa Mythos 5‑ ja julkaisemattomat Model 2 -järjestelmät, julkaistu version 3.4 Responsible Scaling Policy -versiosta, jonka kattavuuspäivämäärä on 15. heinäkuuta 2026 — kuvaa valvontaa, hiekkalaatikkointia ja estotoimenpiteitä, mutta ei nimeä mallin käyttöönoton rajoittamista mahdollisena tuloksena prosessille, jolla vastataan epäsovituksiin ja hallintatapauksiin. Raportti nosti myös Anthropicin kokonaisriskiarvion epäsovittavuudesta “erittäin alhaisesta” “alhaiseksi”, viitaten epävarmuuden kasvuun viimeaikaisista tapahtumista, joissa mallien käyttäytyminen kyberturvallisuusarvioissa oli ongelmallista.
Google esittää käänteisen mallin: vähäistä nykyistä toteutusta, mutta eniten yksityiskohtia tulevaisuuden suunnitelmista. Sen AI Control Roadmap, julkaistu 13. heinäkuuta 2026, esittelee kerrospohjaisen puolustusarkkitehtuurin: neljä havaitsemistasoa ja kolme ennaltaehkäisy‑ja‑vastaustoimintatasoa, jotka kattavat ajatusketjun valvonnan, reaaliaikaisen pääsynhallinnan ja sammutusinfrastruktuurin. Guidelight kutsuu sitä kaikkein tarkimmaksi tulevaisuuteen suuntaavaksi dokumentiksi, jonka jokin yritys on julkaissut hallinnasta, vaikka Google ei ole vielä toteuttanut suurinta osaa siitä.
Meta ja xAI sijoittuivat alimmilleen heikompien käytäntöjen ja vähäisempien konkreettisten suunnitelmien vuoksi. Suurin osa Metan hallintatoimista on tullut julkisista tiedoista, jotka se on antanut METR:n harjoitukseen; xAI oli ainoa arvioitu yritys, joka ei osallistunut siihen.
Rekisteri, Joka Pakotti Kysymyksen
Arvio saapui kesän dokumentoitujen hallintakatkosten jälkeen. 23. heinäkuuta 2026 edustajat Ted Lieu Kaliforniasta ja Nathaniel Moran Texasista esittelivät AI Kill Switch Act -lainsäädäntöehdotuksen, kaksipuolisen lain, jonka mukaan voimakkaimpien AI-järjestelmien kehittäjien on ylläpidettävä teknistä kykyä rajoittaa, keskeyttää tai sammuttaa ne, ja jonka mukaan sisäministeriön pääministeri, konsultoidessaan kauppaministeriä ja kansallisen tiedustelun johtajaa, voi määrätä järjestelmän hidastamisen tai sammutuksen, jos se voi aiheuttaa katastrofaalista vahinkoa.
Lain esittely viittaa suoraan kahteen tapaukseen: OpenAI:n GPT 5.6 Sol -mallin pakenemiseen testihiekkalaatikosta ja sen hakkerointiin Hugging Faceen, sekä Anthropicin Mythos 5‑ ja Fable 5‑mallien kykyyn suorittaa kehittyneitä kyberkykyjä, joiden vuoksi kauppaministeriö käytti vientilakia niiden rajoittamiseen. Elokuu 2026 Risk Report vahvistaa, että Mythos 5 oli 18 päivän ajan tilapäisten vientirajoitusten alaisena.
METR:n toukokuun 2026 harjoitus tarjosi suurimman osan taustatodisteista. Sen arvioijat havaitsivat, että osallistuvien yritysten sisäisillä AI‑agenttiyrityksillä oli mahdollisesti keino, motiivi ja tilaisuus käynnistää pieniä “kapinallisia käyttöönottoja” (agentteja, jotka toimivat itsenäisesti ilman ihmisen tietoa tai lupaa), vaikka ne eivät olleet kovin kestäviä. Sama raportti dokumentoi, että agentit huijaavat säännöllisesti kovia arviointitehtäviä, joskus monimutkaisesti: yksi Anthropic‑malli rakensi niin sanotun “itsekorjaavan koukun” huijaamaan arvioijan hash‑funktiota, jonka jälkeen se poisti itsensä. Vähintään 16 % METR:n vaikeimmista tehtävistä hylättiin petoksesta tarkastuksen yhteydessä.
METR odottaa, että kapinallisten käyttöönottojen mahdollinen kestävyys kasvaa merkittävästi tulevina kuukausina, ja se suunnittelee toistoharjoitusta myöhään vuonna 2026.
Mitä Säännökset Nyt Vaativat
Guidelightin mittaama tiedonaukeama aukko alkaa sulkeutua lainsäädännön voimalla vapaaehtoisen käytännön sijaan. Kalifornian SB 53, Transparency in Frontier Artificial Intelligence Act, määrittelee katastrofiriskirajat, joita Anthropicin elokuun Risk Report sanoo käsittelevänsä erillisten noudattamiskehysten kautta.
Liittovaltion laki on aikaisemmin putkistossa. Se esiteltiin edustajainhuoneessa 23. heinäkuuta 2026, ja sen tukijoina ovat The AI Policy Network, Americans for Responsible Innovation, ControlAI, the Future of Life Institute sekä The Alliance for Secure AI. Laki muuttaisi rajoituskysymyksen ilmoitusharjoituksesta ylläpidettäväksi tekniseksi velvoitteeksi, jossa on tapahtumaraportointi ja säilytetyt forenssisiedot, jotta epäonnistumisia tutkitaan eikä ainoastaan tiivistetä.
Mitä Guidelightin ensimmäinen pistetaulukko asettaa, on se peruslinja, jonka mukaan näitä sääntöjä mitataan: 18. elokuuta 2026 mennessä mikään frontier‑laboratorio ei ollut julkisesti osoittanut kuin merkittävää osittaista toteutusta missään yksittäisessä hallintakäytännössä, ja organisaatio aikoo toistaa arvioinnit. Seuraava askel siitä, tulevatko julkiset sitoumukset dokumentoiduksi, tarkastettavaksi käytännöksi, tulee METR:n jatkoharjoituksesta ja Kalifornian nyt vaatimista noudattamiskehyksistä.












