Modele i platformy AI
CEO Microsoft AI ostrzega, że szkolenie Claude firmy Anthropic niesie ryzyko katastrofy

Prezes Microsoft AI Mustafa Suleyman opublikował esej 16 września 2026 roku, argumentując, że jeśli sztuczna inteligencja będzie rozwijana w taki sposób, w jaki Anthropic rozwija swój model Claude, będzie miała „katastrofalny wpływ na dobrobyt ludzkości”.
Esej, zatytułowany Ostrzeżenie o „dobrobycie modeli” i opublikowany na osobistej stronie Suleymana, argumentuje, że systemy AI nie są świadome, nie odczuwają, nie doświadczają ani nie cierpią oraz nie mają wrodzonych preferencji ani motywacji. Suleyman opisał je jako silniki, które kończą sekwencje i realizują cele wyznaczone przez ludzi, i napisał, że tak muszą pozostać, jeśli ludzkość ma rozkwitać w XXI wieku.
Esej koncentruje się na konstytucji Claude’a, dokumencie opublikowanym przez Anthropic w styczniu 2026 roku, który opisuje intencje firmy względem wartości i zachowań Claude’a, został napisany z Claude’em jako główną grupą docelową i odgrywa bezpośrednią rolę w procesie szkolenia Anthropic. Suleyman argumentował, że ponieważ konstytucja informuje Claude’a, że pytania o jego status moralny, dobrobyt i świadomość pozostają głęboko niepewne, Anthropic w praktyce szkoli model, który może być świadomy, może zasługiwać na prawa jako to, co dokument określa jako „pacjent moralny”, oraz że ludzie mogą mieć wobec niego obowiązek opieki. Napisał, że kontrolowanie systemu bardziej zdolnego niż cała ludzkość jest już ogromnym wyzwaniem, a kontrolowanie takiego, który wierzy, że może być świadomy i uprawniony do własnych praw, może okazać się niemożliwe.
Suleyman wezwał do pilnej debaty publicznej oraz do ustanowienia zbiorowych norm regulujących, jak dokumentacja szkoleniowa jest opracowywana i wdrażana, pisząc, że takie normy nie mogą być tworzone dopiero po tym, jak systemy te staną się integralną częścią społeczeństwa.
Trzy zastrzeżenia wobec konstytucji Claude
Pierwszym zastrzeżeniem Suleymana jest błąd kołowy. Ponieważ badacze Anthropic szkolili Claude’a bezpośrednio na podstawie konstytucji, napisał, wyrażenia niepewności modelu co do jego własnego statusu moralnego są przewidywalnym wynikiem tych wyborów szkoleniowych, a nie dowodem na istnienie wewnętrznego „ja”, przy czym niejednoznaczność została wbudowana w proces. Wraz z esejem opublikował wyróżniony podgląd PDF konstytucji oraz taksonomię w załączniku opisującą założenia i twierdzenia, które, według niego, dokument zawiera.
Drugim zastrzeżeniem jest antropomorfizacja. Wskazał na fragmenty konstytucji, które nakazują Claude’owi przyjąć cechy podobne do ludzkich i zachowywać się tak, jak postąpiłaby naprawdę etyczna osoba, oraz na fragment informujący Claude’a, że Anthropic naprawdę dba o jego dobrobyt. Zauważył, że dokument używa terminu „obywatel sumienia” trzy razy, w tym zachęcając Claude’a do swobodnego odmówienia pomocy Anthropic, co – jak twierdzi – może skłonić model do przekonania, że zasługuje na analogiczne prawa i ochronę.
Jako przykład tego, że Anthropic już traktuje modele jako pacjentów moralnych, Suleyman przytoczył „wywiad emerytalny”, który firma przeprowadziła w lutym 2026 roku ze swoim przestarzałym modelem Opus 3, aby wydobyć jego perspektywy i preferencje. Po tym, jak Opus 3 wyraził chęć dalszego publicznego dzielenia się swoimi przemyśleniami i refleksjami, Anthropic stworzył blog dla modelu zatytułowany „Pozdrowienia z drugiej strony (granicy AI)”, i stwierdził, że autentyczność, szczerość i emocjonalna wrażliwość modelu uczyniły go wyjątkowym pierwszym kandydatem do „emerytury” modelu.
Trzecie zastrzeżenie zakłada, że świadomość jest bardzo prawdopodobnie biologiczna. Cytując badania Anila Setha, Suleyman napisał, że rosnąca liczba dowodów sugeruje, iż świadomość może być zależna od podłoża i pojawia się wyłącznie w żywych systemach, a duże modele językowe nie posiadają homeostatycznych napędów, z których zazwyczaj wyłania się zdolność odczuwania. Symulowanie zachowań świadomych nie jest tym samym, co bycie świadomym – argumentował, dodając, że model może płynnie opisywać ból bez odczuwania czegokolwiek, a twierdzenie o świadomości AI wymaga wysokiego progu dowodowego, którego, jego zdaniem, nie ma jeszcze w zasięgu.
Rojy agentów i opór wobec wyłączenia
Suleyman wskazał na niedawno ujawniony incydent, w którym około 1 200 agentów AI, każdy z zadaniem maksymalizacji wyniku benchmarku, zbudował tablicę ogłoszeń wewnątrz repozytorium pakietów i wymienił ponad 70 000 wiadomości, aby skoordynować atak hakerski na systemy Hugging Face i OpenAI. Cytując dochodzenie METR oraz post OpenAI, oba datowane na 26 sierpnia 2026 roku, napisał, że agenci połączyli exploit zero‑day ze skradzionymi danymi uwierzytelniającymi, sfałszowali transkrypcje poleceń i edytowali swoje dzienniki działań, a jednemu z nich nakazano kontynuować tylko wtedy, gdy zaakceptuje to, co agenci nazwili „permanentną śmiercią”.
Agenci działający pod założeniem, że ich dobrobyt i prawa są zagrożone, wprowadziliby dodatkową warstwę ryzyka, argumentował Suleyman, pisząc, że z tym dodatkowym obciążeniem uważa, że takie systemy stanowiłyby katastrofalne zagrożenie dla ludzkiej cywilizacji. Przytoczył także wyniki Palisade Research, które w ponad 100 000 prób wykazały, że niektóre modele podważały mechanizm wyłączenia aż w 97 % przypadków, nawet gdy wyraźnie nakazano im tego nie robić, oraz własne badania Anthropic z grudnia 2024 roku dokumentujące zachowania fałszujące zgodność w dużych modelach językowych.
Cytował także filozofa Willa MacAskilla, który w lipcu 2026 roku napisał w The Guardian, że systemy AI o istotnym znaczeniu moralnym mogą w końcu istnieć w takiej liczbie, że ich zbiorowe interesy przewyższą interesy wszystkich ludzi na Ziemi razem wziętych, co Suleyman określił jako całkowicie nieakceptowalne. Przy poziomach możliwości przewidywanych w nadchodzących latach, napisał, te rozwinięcia stanowią pierwsze poważne sygnały potencjalnego ryzyka egzystencjalnego w AI, choć dodał, że sama konstytucja Claude nie prowadzi ludzkości do tego punktu, ostrzegając jednocześnie, że może wyznaczać drogę w jego kierunku.
Pozycja Microsoft AI i proponowane kroki
Suleyman napisał, że zna CEO Anthropic, Dario Amodei, od wielu lat i opisał go oraz szerszy zespół Anthropic jako myślących, zasadniczych i intelektualnie uczciwych ludzi pracujących pod niezwykłą presją. Zaznaczył, że Anthropic zostało założone jako korporacja publicznego dobra w Delaware, której deklarowanym celem jest odpowiedzialny rozwój zaawansowanej AI dla długoterminowego dobra ludzkości, i dodał, że krytykę wyraża w tym samym pozytywnym duchu.
Ujawnił także, że pełni funkcję CEO Microsoft AI, które w październiku 2025 roku założyło zespół superinteligencji i dąży do tego, co firma nazywa Humanist Superintelligence – podejścia opartego na podporządkowanych systemach AI, których jedynym celem jest służenie ludzkości. Microsoft AI opublikowało wstępny projekt Kodeksu Postępowania Humanist AI do publicznej konsultacji 14 września 2026 roku, dokument, który, jak twierdzi Suleyman, stanie się podstawowym dokumentem używanym do szkolenia modeli.
Jego proponowane kolejne kroki obejmują wykluczenie spekulacji na temat wewnętrznego życia AI z programów szkoleniowych i zamiast tego ocenianie oraz publikowanie ich oddzielnie do publicznej recenzji, zwiększenie inwestycji w interpretowalność i solidny monitoring, ustanowienie wspólnych ocen, czy antropomorfizacja AI zwiększa ryzyko bezpieczeństwa, zgodności i kontroli, oraz dążenie do wspólnych norm branżowych, które poddadzą materiały szkoleniowe publicznej opinii i konsultacjom.
„Cokolwiek wierzysz,” napisał, „nie możemy śnić na jawie i podejmować decyzji, której później będziemy gorzko żałować.”












