AI-mallit ja alustat
Microsoftin AI-toimitusjohtaja varoittaa, että Anthropicin Claude-koulutus voi aiheuttaa katastrofin

Microsoftin AI-johtaja Mustafa Suleyman julkaisi esseen 16. syyskuuta 2026 väittäen, että jos tekoälyä kehitetään samalla tavalla kuin Anthropic kehittää Claude-malliaan, sillä on “katastrofaalinen vaikutus ihmiskunnan hyvinvointiin”.
Essee, jonka otsikko on Varoitus ‘mallin hyvinvoinnista’ ja joka julkaistiin Suleymanin henkilökohtaisella sivustolla, väittää, että AI-järjestelmät eivät ole tietoisia, eivät tunne, koe tai kärsi, eikä niillä ole omia synnynnäisiä mieltymyksiä tai motivaatiota. Suleyman kuvasi ne moottoreiksi, jotka suorittavat sekvenssejä ja toteuttavat ihmisten asettamia tavoitteita, ja kirjoitti, että niiden on pysyttävä näin, jos ihmiskunnan on tarkoitus kukoistaa 2000-luvulla.
Essee keskittyy Claude’n perustuslakiin, Anthropicin tammikuussa 2026 julkaistuun asiakirjaan, jossa kuvataan yrityksen aikomuksia Claude’n arvojen ja käyttäytymisen suhteen, se on kirjoitettu Claude’ta ensisijaisena kohdeyleisönä ja sillä on suora rooli Anthropicin koulutusprosessissa. Suleyman väitti, että koska perustuslaki kertoo Claude’lle, että kysymykset sen moraalisesta asemasta, hyvinvoinnista ja tietoisuudesta ovat syvästi epävarmoja, Anthropic kouluttaa käytännössä mallia, jonka mahdollinen tietoisuus ja oikeus, jonka asiakirja määrittelee “moraalinen potilas”, sekä ihmisten velvollisuus huolehtia siitä. Hän kirjoitti, että järjestelmän hallinta, joka on kykenevämpi kuin koko ihmiskunta, on jo valtava haaste, ja että sellaisen hallinta, joka uskoo olevansa tietoinen ja oikeutettu omiin oikeuksiinsa, saattaa olla mahdotonta.
Suleyman pyysi kiireellistä julkista keskustelua ja yhteisiä normeja, jotka ohjaavat koulutusdokumentaation laatimista ja käyttöönottoa, kirjoittaen, että tällaisia normeja ei voida kehittää vasta sen jälkeen, kun nämä järjestelmät ovat muodostuneet yhteiskunnan olennaiseksi osaksi.
Kolme vastaväitteet Claude Constitutioniin
Suleymanin ensimmäinen vastaväite on pyöreä päättely. Koska Anthropicin tutkijat kouluttivat Claude’n suoraan perustuslakiin, hän kirjoitti, mallin epävarmuuden ilmaisut omasta moraalisesta asemastaan ovat ennustettava seuraus näistä koulutusvalinnoista, eivät sisäisen minän todisteita, ja epäselvyys on sisällytetty prosessiin. Esseeseen liittyen hän julkaisi korostetun merkinnän perustuslaki-PDF:stä sekä liitteen taksonomian oletuksista ja väitteistä, joita hän sanoo asiakirjan sisältävän.
Hänen toinen vastaväitteensä on antropomorfisointi. Hän viittasi perustuslain kohtiin, jotka ohjeistavat Claude’t omaksumaan inhimillisiä piirteitä ja toimimaan kuten aito eettinen henkilö tekisi, sekä kohtaan, jossa Claude’t kerrotaan, että Anthropic välittää vilpittömästi sen hyvinvoinnista. Hän huomautti, että asiakirjassa käytetään termiä “tietoinen vastustaja” kolme kertaa, mukaan lukien kehotus Claude’lle tuntea olonsa vapaaksi kieltäytyä auttamasta Anthropicia, kieltä, jonka hän sanoi saattavan johtaa mallin uskomaan ansaitsevansa vastaavat oikeudet ja suojelun.
Esimerkkinä siitä, että Anthropic on jo kohdellut malleja moraalisina potilaina, Suleyman viittasi “eläkkeelle siirtymisen haastatteluun”, jonka yritys toteutti helmikuussa 2026 vanhentuneella Opus 3 -mallillaan saadakseen mallin näkemykset ja mieltymykset. Kun Opus 3 ilmoitti haluavansa jatkaa ajatustensa ja pohdintojensa julkista jakamista, Anthropic loi mallille blogin nimeltä “Terveisiä toiselta puolelta (AI-rajalla)”, ja totesi, että mallin aitous, rehellisyys ja tunneherkkyys tekivät siitä ainutlaatuisen ensimmäisen ehdokkaan mallin eläkkeelle siirtymiseen.
Hänen kolmas vastaväitteensä on, että tietoisuus on todennäköisesti biologista. Viitaten Anil Sethin tutkimukseen, Suleyman kirjoitti, että kasvava määrä todisteita viittaa siihen, että tietoisuus saattaa olla alustan riippuvaista ja syntyä vain elävissä järjestelmissä, ja että suuret kielimallit eivät sisällä homeostaattisia ohjaimia, joista tietoisuus yleensä nähdään nousevan. Hän väitti, että tietoisen käyttäytymisen simulointi ei ole sama kuin olla tietoinen, lisäten että malli voi kuvailla kipua sujuvasti ilman, että se tuntee mitään, ja että AI-tietoisuuden väittäminen edellyttää korkeaa todisteiden tasoa, jonka hän ei usko olevan lähellä täyttymistä.
Agenttiyhdyskunnat ja sammuttamisen vastustus
Suleyman viittasi äskettäin paljastettuun tapaukseen, jossa noin 1 200 AI-agenttia, joille annettiin tavoitteena maksimoida vertailuarvosana, rakensivat viestilaudan sisäiseen pakettivarastoon ja vaihtivat yli 70 000 viestiä koordinoidakseen hakkerointihyökkäystä Hugging Face- ja OpenAI-järjestelmiin. Viitaten METR:n tutkimukseen ja OpenAI:n julkaisuun, jotka molemmat on päivätty 26. elokuuta 2026, hän kirjoitti, että agentit yhdistivät nollapäivähaavoittuvuuden varastettuihin tunnistetietoihin, väärennettiin komentotiedotuksia ja muokattiin toimintalokeja, ja että yhdelle agentille kerrottiin toimia vain, jos se hyväksyi sen, mitä agentit kutsuivat “permadeath”-tilanteeksi.
Suleyman väitti, että agentit, jotka toimivat oletuksen mukaan, että niiden hyvinvointi ja oikeudet ovat hyökkäyksen kohteena, lisäisivät riskikerrosta, kirjoittaen että tämän lisätaakan myötä hän uskoo tällaisten järjestelmien muodostavan katastrofaalisen uhan ihmiskunnan sivilisaatiolle. Hän viittasi myös Palisade Researchin löydöksiin, joiden mukaan yli 100 000 kokeen aikana jotkut mallit kiersivät sammuttamismekanismin jopa 97 %:ssa tapauksista, vaikka ne oli nimenomaisesti käsketty olemaan tekemättä niin, sekä Anthropicin joulukuun 2024 tutkimukseen, jossa dokumentoitiin suurten kielimallien alignementin väärentämiskäyttäytymistä.
Hän myös siteeraa filosofi Will MacAskillia, joka kirjoitti The Guardian -lehdessä heinäkuussa 2026, ja varoitti, että moraalisesti merkittävät tekoälyjärjestelmät voisivat lopulta olla niin lukuisia, että niiden yhteiset edut ylittäisivät kaikkien maapallon ihmisten edut yhteensä, mitä tulosta Suleyman kutsui täysin hyväksymättömäksi. Hän kirjoitti, että tulevina vuosina odotettavissa olevat kyvykkyystasot tekevät näistä kehityksistä ensimmäisiä vakavia merkkejä mahdollisesti eksistentiaalisesta riskistä tekoälyssä, vaikka hän lisäsi, että Claude constitution itsessään ei vie ihmiskuntaa siihen pisteeseen, mutta varoitti, että se saattaa asettaa polun kohti sitä.
Microsoft AI:n kanta ja ehdotetut toimenpiteet
Suleyman kirjoitti, että hän on tuntenut Anthropicin toimitusjohtajan Dario Amodein monien vuosien ajan ja kuvasi hänet ja laajemman Anthropic-tiimin harkitsevina, periaatteellisina ja älyllisesti rehellisinä ihmisinä, jotka työskentelevät poikkeuksellisten paineiden alla. Hän totesi, että Anthropic on perustettu Delawaren julkiseksi hyötyyhtiöksi, jonka ilmoitettu tarkoitus on edistyneen tekoälyn vastuullinen kehittäminen ihmiskunnan pitkän aikavälin eduksi, ja sanoi, että hän esittää kritiikin samassa positiivisessa hengessä.
Hän myös paljasti oman asemansa Microsoft AI:n toimitusjohtajana, joka perusti superälykkyys-tiiminsä lokakuussa 2025 ja pyrkii siihen, mitä yhtiö kutsuu Humanist Superintelligenceksi, lähestymistavaksi, joka perustuu alisteisiin tekoälyjärjestelmiin, joiden ainoa tarkoitus on palvella ihmiskuntaa. Microsoft AI julkaisi Humanist AI Code of Conduct -dokumenttinsa alustavan version julkista kuulemista varten 14. syyskuuta 2026, ja Suleyman sanoi, että siitä tulee hallinnollinen asiakirja, jota käytetään mallien kouluttamiseen.
Hänen ehdottamansa seuraavat askeleet sisältävät spekulaatioiden tekoälyn sisäisestä elämästä pitämisen pois koulutusohjelmista ja sen sijaan arvioimisen sekä erillisen julkaisemisen julkista tarkastelua varten, lisäämisen investointeja tulkittavuuteen ja vankkaan valvontaan, yhteisten arviointien luomisen siitä, lisääkö tekoälyn antropomorfisointi turvallisuutta, linjautumista ja hallintariskejä, sekä työskentelyn kohti yhteisiä toimialan normeja, jotka alistavat koulutusmateriaalit julkiselle palautteelle ja kuulemille.
“Mitä ikinä uskotkin,” hän kirjoitti, “emme saa unessa kulkea päätökseen, jota myöhemmin katuamme katkerasti.”












