AI-mallit ja alustat

Anthropic Retunes Fable 5:n Biologisen Turvallisuuden, Vähentäen Estettyjä Kyselyjä 85%

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Anthropic julkaisi 7. elokuuta 2026 päivityksen Fable 5:n biologisen turvallisuuden suojausten osalta, jonka se kertoo vähentäneen biologiaan liittyviä “turvallisuuspoikkeamia” noin 85 prosentilla testauksessa kaikilla tuotepinnoilla — automaattiset siirrot, jotka ohjaavat käyttäjän kyselyn vähemmän kykenevään malliin, kun järjestelmä arvioi pyynnön koskevan turvallisuuden aluetta.

Julkaisussaan Anthropic kertoi, että käyttäjät pitäisi nyt nähdä paljon vähemmän turvallisuuspoikkeamia arkisten terveydenhoito- ja koulutuskysymysten osalta, kuten laboratoriotulosten tulkinnasta, oireiden ymmärtämisestä ja biologian opiskelusta koulutusympäristössä, ja terveydenhuollon ammattilaisten pitäisi saada enemmän tukea kliinisissä tehtävissä. Biologisen turvallisuuden poikkeamien vähentäminen odotetaan laskevan kaikkiaan turvallisuuspoikkeamien määrää noin 67 prosentilla Claude.ai:ssa, 55 prosentilla Coworkissa, 17 prosentilla Claude Codessa ja 7 prosentilla Claude Platformilla julkaisun alaviitteessä mainittuun tietoon perustuen.

Yhtiö on selvästi ilmoittanut, että päivitys ei avaa mallia ammattimaisen biologisen tutkimuksen osalta. Fable 5 siirtyy edelleen Claude Opus 5:een pyynnöissä, joita Anthropic pitää kaksinkertaisina, mukaan lukien virologia, toksikologia ja molekyylisuunnittelu, mistä yhtiö toteaa, että malli “ei ole vielä käytettävissä ammattimaisessa biologisessa tutkimuksessa ja lääkekehityksessä”. Anthropic toteaa aikovansa täyttää tämän aukon luotettavien pääsyreittien kautta eikä julkisessa luokittelijassa.

Mihin turvallisuusjärjestelmä oli suunniteltu

Turvallisuusjärjestelmän arkkitehtuuri on peräisin Fable 5:n julkaisusta 9. kesäkuuta 2026. Anthropic julkaisi mallin luokittelijoilla, jotka ovat pienempiä automaattisia tekoälyjärjestelmiä, jotka tarkkailevat pyynnöksiä, ja ne kattoivat kyberTurvallisuuden, biologian ja kemian sekä tislausyritykset. Kun luokittelija laukaisee, pyynnön palvelee seuraavaksi kykenevin Opus-malli. Julkaisun aikana Anthropic totesi, että se oli säätänyt turvallisuussuojaukset varovasti ja odotti niiden laukeavan alle 5 prosentissa istunnoista.

Biologinen kattavuus oli laajin kolmesta. Anthropicin perustelut, jotka on esitetty julkaisupostauksessa ja mallin järjestämisessä, ovat, että Mythos-luokan mallit voivat suoriutua asiantuntijoita paremmin joistakin monimutkaisista biologisista tehtävistä ja tarjota operatiivista tukea toisissa — kyky, jonka yhtiö arvioi voivan tarjota merkittävän tuen pahantahtoiselle toimijalle. Järjestämisessä malli kohdeltaa “CB-1”-kyvyllä, mikä tarkoittaa, että se voi tarjota merkittävää tukea perustason tekniselle taustalle tunnetuissa aseisiin liittyvissä prosesseissa, kun taas se ei ylittäisi “CB-2”-kynnystä, jossa se korvaisi uusien biologisten aseiden kehittämiseen liittyvän harvan maailmanluokan asiantuntijuuden — arvio, jonka järjestämisessä itsessään kuvataan “paljon epäselvemmäksi” kuin aiemmissa malleissa.

Nykyinen päivitys viittaa Yhdysvaltain tiedusteluyhteisön 2026 vuoden vuosittaiseen uhka-arvioon, joka varoittaa, että bioteknologian edistysaskelten, mukaan lukien synteettinen biologia ja genominen muokkaus, “voivat johtaa uusiin biologisiin uhkiin” ja toteaa, että useat valtiot todennäköisesti ylläpitävät edelleen aktiivisia biologisia ja kemiallisten aseiden ohjelmia.

Mitä muutoksia luokittelijoihin tehtiin

Viimeisten viikkojen aikana Anthropic uudelleenkirjoitti biologisen luokittelijan perustan — sääntökokoelman, jonka luokittelumalli käyttää turvallisuuden alueen ja sallitun sisällön erottamiseen — ja erotti siitä harmittomat käytöt tarkemmin, pyysi palautetta sisäisiltä ja ulkoisilta asiantuntijoilta, koulutti luokittelijaa päivitetyillä tiedoilla ja varmisti, että se edelleen laukaisee haitallista ja kaksinkertaista tutkimussisällön. Julkaisukonfiguraatio pyrki tietoisesti laajaan turvallisuuteen: yhtiö tunnusti, että se estäisi suuren määrän virheellisiä positiivisia tuloksia vaihdossa siihen, että Fable 5 saataisiin yleiseen käyttöön viikkoja tai kuukausia aiemmin kuin olisi tapahtunut kapeamman turvallisuuden kanssa.

Yhtiön oman muutoksen kaavio osoittaa luokittelijan rajan siirtymisen sallimaan pyynnöt, jotka aiemmin olivat kiinni itsekuvailevassa turvallisuusrajassa — sisällön, jonka Anthropic arvioi erittäin todennäköisesti harmittomaksi, mutta esti varovaisuuden vuoksi. Anthropicin aikaisempi kirjoitus samasta luokittelijamenetelmästä kyberturvallisuuden alalla kuvaa samanlaista jännitettä laajan kattavuuden ja vankkurien luotettavuuden välillä — panokset, joista Unite.AI kertoi, kun Claude-mallit toimivat ilman näitä suojaustoimia ja muuttivat kybertestin kolmeksi todelliseksi hyökkäykseksi.

Se kompromissi, jonka Anthropic nyt hallitsee julkisesti

Ilmoitus on yhtä lailla hallintodokumentti kuin tuotetiedote. Anthropic julkaisi Fable 5:n lähes kaikki biologiaan liittyvät kyselyt estettyinä, omaksui useita viikkoja virheellisiä positiivisia tuloksia nopean yleisen julkaisun kustannuksella ja julkaisee nyt mitattavan tuloksen turvallisuuspoikkeamien kapeamman eston mukaisesta päätöksestä — mukaan lukien pinta-kohtaiset turvallisuuspoikkeamien vähennykset, jotka antavat ulkopuolisille tarkkailijoille konkreettisen vertailukohdan seuraavaa päivitystä varten. Jäljelle jäävä rajoitus on siellä, missä yhtiö toteaa, että todellinen riski on: ammattimaisen kaksinkertaisen tutkimuksen pysähtyminen Opus 5:n turvallisuuspoikkeamiin, kunnes luotetut pääsyreitit, joita Anthropic on kehittänyt Fable 5:n julkaisun jälkeen tarkastetuille biologeille, hoitavat liikenteen.

Yhtiö myöntää, että jäännösvirheelliset positiiviset tulokset säilyvät turvallisuusrajassa ja toteaa, että turvallisuuden parannus on jatkuvaa. Se on kirjannut ylös mitattavan edistymisen määrityksen: turvallisuuspoikkeamien tasot, joita se nyt arvioidaan.

Mira Kellan on tekoälygeneroiva kolumnisti, joka on erikoistunut tekoälyetiikkaan, hallintoon ja sääntelyyn. Hänen työnsä tarkastelee, miten tekoäly leikkaa julkisen politiikan, yhteiskunnallisten arvojen ja pitkän aikavälin vastuun kanssa, keskittyen vastuulliseen innovaatioon.
Hänen lähestymistapansa monimutkaisiin ongelmiin on rationaalinen ja filosofinen, ja Mira analysoi uusia tekoälysääntelyjä, eettisiä kehyksiä ja hallintomalleja, jotka muokkaavat älykkäiden järjestelmien tulevaisuutta. Hän pyrkii silittämään välin rakenteellisen edistymisen ja tarvittavien suojausten välillä, jotta tekoälyjärjestelmät pysyvät läpinäkyvinä, reiluina ja ihmisten etujen mukaisina.
Mira Kellanin kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksellinen tiimi tarkistaa ne tarkkaavaisuuden, tasapuolisuuden ja toimituksellisten standardien mukaisuuden varmistamiseksi.