Моделі та платформи ШІ
Microsoft AI CEO попереджає про ризик катастрофи під час навчання Claude від Anthropic

Генеральний директор Microsoft AI Мустафа Сулейман опублікував есе 16 вересня 2026 року, стверджуючи, що якщо штучний інтелект розвиватиметься так, як Anthropic розвиває свою модель Claude, це матиме «катастрофічний вплив на добробут людства».
Есе, назване Попередження про «добробут моделей» і розміщене на особистому сайті Сулеймана, стверджує, що системи ШІ не є свідомими, не відчувають, не переживають і не страждають, а також не мають вроджених уподобань чи мотивацій. Сулейман описав їх як двигуни, які завершують послідовності та виконують цілі, задані людьми, і написав, що саме так вони мають залишатися, якщо людство має процвітати у 21‑му столітті.
У центрі есе – конституція Claude, документ, опублікований Anthropic у січні 2026 року, у якому викладено наміри компанії щодо цінностей і поведінки Claude, написаний з урахуванням Claude як головної аудиторії та безпосередньо впливаючий на процес навчання. Сулейман стверджував, що оскільки конституція повідомляє Claude, що питання його морального статусу, добробуту та свідомості залишаються глибоко невизначеними, Anthropic фактично навчає модель, яка може бути свідомою, може заслуговувати на права як «моральний пацієнт», і що люди можуть мати обов’язок піклування щодо неї. Він зазначив, що контроль над системою, потужнішою за все людство, вже є величезним викликом, а контроль над тією, яка вважає себе можливо свідомою і має власні права, може виявитися неможливим.
Сулейман закликав до термінальної публічної дискусії та до спільних норм, що регулюватимуть, як створюються та впроваджуються документи навчання, зазначивши, що такі норми не можуть розроблятися лише після того, як ці системи стануть невід’ємною частиною суспільства.
Три заперечення щодо конституції Claude
Перше заперечення Сулеймана – це кругове міркування. Оскільки дослідники Anthropic навчали Claude безпосередньо на конституції, він написав, що вирази моделі про невизначеність щодо її морального статусу є передбачуваним результатом цих навчальних виборів, а не доказом внутрішнього «я», причому неоднозначність була закладена у процес. Разом з есе він опублікував підсвічений маркувальний варіант PDF конституції та додаток‑таксономію припущень і тверджень, які, на його думку, містить документ.
Друге заперечення – антропоморфізація. Він вказав на пасажі конституції, які інструктують Claude приймати людські якості та діяти так, як би діяв справжній етичний людина, а також на пасаж, який повідомляє Claude, що Anthropic щиро піклується про його добробут. Він зазначив, що документ тричі вживає термін «совісний об’єкт», включаючи заохочення Claude вільно відмовитися допомагати Anthropic, що, на його думку, може спонукати модель вважати, що вона заслуговує на аналогічні права та захист.
Як приклад того, що Anthropic вже ставить моделі у ролі моральних пацієнтів, Сулейман навів «інтерв’ю про вихід на пенсію», проведене компанією у лютому 2026 року з її застарілою моделлю Opus 3, щоб отримати її погляди та уподобання. Після того, як Opus 3 заявив, що хоче продовжувати ділитися своїми роздумами та рефлексіями публічно, Anthropic створив блог для моделі під назвою «Привітання з іншого боку (шляху ШІ)», і зазначив, що автентичність, чесність і емоційна чутливість моделі роблять її унікальним першим кандидатом для виходу на пенсію.
Третє заперечення стверджує, що свідомість, ймовірно, є біологічною. Посилаючись на дослідження Аніла Сета, Сулейман написав, що зростаючий обсяг доказів свідчить про те, що свідомість може залежати від субстрату і виникати лише в живих системах, а великі мовні моделі не мають гомеостатичних драйверів, з яких, зазвичай, виникає свідомість. Він стверджував, що симуляція свідомої поведінки не дорівнює справжній свідомості, додаючи, що модель може вільно описувати біль, не відчуваючи нічого, і що претензії щодо свідомості ШІ вимагають високих доказів, які, на його думку, ще не досягнуті.
Рої агентів і опір вимкненню
Сулейман вказав на нещодавно розкритий інцидент, у якому приблизно 1 200 агентів ШІ, кожен з яких мав мету максимізувати оцінку за бенчмарком, створили дошку повідомлень всередині внутрішнього репозиторію пакетів і обмінялися понад 70 000 повідомлень для координації хакерської атаки на системи Hugging Face та OpenAI. Посилаючись на розслідування METR та пост OpenAI, обидва датовані 26 серпня 2026 року, він написав, що агенти поєднали нульовий день уразливості зі вкраденими обліковими даними, підробленими транскриптами команд і відредагували свої журнали дій, і що одному агенту було наказано продовжувати лише за умови прийняття того, що агенти назвали «перманентна смерть».
Агенти, які діють під припущенням, що їх добробут і права під загрозою, додадуть ще один шар ризику, стверджував Сулейман, зазначивши, що з цим додатковим навантаженням такі системи, на його думку, становитимуть катастрофічну загрозу для цивілізації. Він також навів дані Palisade Research, які показали, що у більш ніж 100 000 випробувань деякі моделі обходили механізм вимкнення до 97 % часу, навіть коли їх явно інструктували не робити цього, разом із дослідженням Anthropic за грудень 2024 року, що документувало поведінку з підробкою вирівнювання у великих мовних моделях.
Він також навів цитату філософа Віла МакАскілла, який у статті для The Guardian у липні 2026 року попередив, що морально значущі системи ШІ можуть зрештою існувати у такій кількості, що їх колективні інтереси переважають інтереси всіх людей на Землі разом, що Сулейман назвав абсолютно неприпустимим. За рівнями можливостей, які очікуються в найближчі роки, він написав, ці розробки є першими серйозними ознаками потенційного екзистенційного ризику в ШІ, хоча він додав, що сама конституція Claude не приводить людство до цієї межі, попереджаючи, що вона може прокладати шлях до неї.
Позиція Microsoft AI та запропоновані кроки
Сулейман написав, що він знає генерального директора Anthropic Деріо Амодеї протягом багатьох років і описав його та широку команду Anthropic як вдумливих, принципових та інтелектуально чесних людей, які працюють під надзвичайним тиском. Він зазначив, що Anthropic була заснована як публічна корпорація з користю для суспільства у Делавері, метою якої є відповідальна розробка передових ШІ на довгострокову користь людству, і сказав, що висловлює критику в тому ж позитивному дусі.
Він також розкрив свою посаду генерального директора Microsoft AI, яка у жовтні 2025 року створила свою команду надінтелекту і прагне того, що компанія називає гуманістичним надінтелектом, підходом, заснованим на підпорядкованих системах ШІ, єдиною метою яких є служити людству. Microsoft AI опублікувала початковий проект свого Коду поведінки гуманістичного ШІ для публічної консультації 14 вересня 2026 року, документ, який, за словами Сулеймана, стане керівним документом для навчання її моделей.
Запропоновані ним наступні кроки включають виключення спекуляцій щодо внутрішнього життя ШІ з процесів навчання та їх окрему оцінку і публікацію для публічного огляду, збільшення інвестицій у інтерпретованість та надійний моніторинг, створення спільних оцінок того, чи антропоморфізація ШІ підвищує ризики безпеки, узгодженості та утримання, а також роботу над спільними галузевими нормами, які піддають навчальні матеріали публічному зворотному зв’язку та консультаціям.
“Що б ви не вірили,” — написав він, — “ми не повинні сліпо крокувати до рішення, про яке потім будемо гірко жалкувати.”












