Етика
Дослідження показало, що передові лабораторії ШІ мають небагато планів щодо стримування неслухняних моделей

П’ять провідних передових компаній у галузі ШІ, в найкращому випадку, частково впровадили базові практики, необхідні для збереження контролю над власними системами ШІ, і жодна з них не опублікувала повний план щодо стримування моделі, яка протистоїть своєму оператору, згідно з новою оцінкою від Guidelight AI Standards, що оцінює Anthropic, Google, Meta, OpenAI та xAI, з даними станом на 18 серпня 2026 року.
Оцінка, перша від Guidelight, ставить кожну компанію за шкалою від 0 до 5 за шість практик, запозичених зі стандарту Control: реєстрація дій внутрішніх систем ШІ, вимірювання ефективності моніторингу, обмеження високоризикових дій ШІ під наглядом, автоматичне відключення після сплеску позначеної неправильності, передача контролю на зовнішній аудит, та підтримка плану стримування. Жодна компанія не отримала вище 3 («значна часткова реалізація») за жодну практику. Загальні оцінки: Anthropic та OpenAI отримали C+ (2,50), Google — D+ (1,50), xAI — D− (0,83), а Meta — F (0,67).
Guidelight визначає план стримування як заздалегідь визначений протокол, що спрацьовує, коли виявлено, що ШІ намагається обійти контроль, і уточнює, які дозволи відкликаються, для кого модель може продовжувати працювати і за яких умов, а також коли її повністю вимикають. За цю практику OpenAI отримала найвищий бал — 3 (у звіті відзначено її практику призупинення або завершення робочих навантажень, включаючи внутрішні розгортання та тренувальні запуски, після виявлення інцидентів безпеки), тоді як Anthropic і Meta отримали 0, «не впроваджено».
Оцінки вимірюють лише те, що компанії розкрили публічно, що Guidelight прямо зазначає: низька оцінка відображає відсутність публічних доказів, а не обов’язково відсутність внутрішніх захисних заходів.
Як кожна лабораторія оцінювала контроль ШІ
Найсильнішою областю серед п’яти компаній була виявлення. Anthropic та OpenAI реєструють значну частину внутрішньої активності ШІ та сканують її на ознаки неправильної поведінки, і обидві вжили заходів для оцінки ефективності цього сканування та передавання сигналу людям, коли щось позначається, як зазначає оцінка. Чотири з п’яти компаній, усі, крім xAI, взяли участь у першому Frontier Risk Report від METR, пілотному дослідженні, опублікованому 19 травня 2026 року, у рамках якого зовнішній оцінювач отримав доступ до внутрішніх моделей, необроблених ланцюжків міркувань та непублічної інформації про те, як кожна компанія використовує та моніторить ШІ всередині.
Найслабшими областями були запобігання та стримування. За обмеженими діями та автоматичним відключенням, практиками, які зупиняють неправильно працюючу систему до або під час інциденту, а не після, лише Anthropic отримала оцінку вище «обмежена часткова реалізація». Висновок Guidelight: ґрунтуючись на найкращих публічних даних, у компаній «мало протоколів стримування, готових до надзвичайної ситуації».
Оцінки також виявляють розрив між риторикою та документами. Anthropic, яка публікує найширшу документацію щодо ризиків у галузі, отримала 0 за практику плану стримування. Її власний серпень 2026 Risk Report — 185‑сторінковий звіт, що охоплює системи Mythos 5 та нерелізовану Model 2, опублікований у версії 3.4 її Responsible Scaling Policy з датою охоплення 15 липня 2026 року — деталізує моніторинг, пісочницю та блокуючі втручання, проте не називає обмеження розгортання моделі як можливий результат процесу реагування на випадки невідповідності та інциденти контролю. У цьому звіті також підвищено оцінку загального ризику невідповідності Anthropic з «дуже низького» до «низького», посилаючись на зростаючу невизначеність після недавніх розкриттів інцидентів щодо поведінки моделей у кібербезпекових оцінках.
Google демонструє протилежний шаблон: мало поточних впроваджень, але найдетальніше щодо майбутніх планів. Її AI Control Roadmap, опублікована 13 липня 2026 року, викладає багаторівневу архітектуру захисту: чотири рівні виявлення та три рівні запобігання та реагування, що охоплює моніторинг ланцюжка міркувань, контроль доступу в реальному часі та інфраструктуру вимкнення. Guidelight називає її найдетальнішим документом з перспективою, який будь‑яка компанія опублікувала щодо контролю, хоча виявляє, що Google ще не впровадив більшість його положень.
Meta та xAI опинилися внизу зі слабшими практиками та менш конкретними планами. Більша частина того, що відомо публічно про контролі Meta, походить з її розкриттів у рамках вправи METR; xAI була єдиною оціненою компанією, яка не брала в ній участі.
Документи, які спонукали поставити питання
Оцінка з’явилася після літа, сповненого задокументованих провалів контролю. 23 липня 2026 року представники Тед Ліу з Каліфорнії та Натаніель Моран з Техасу представили AI Kill Switch Act, двопартійний законопроект, який вимагатиме від розробників найпотужніших систем ШІ зберігати технічну можливість обмежувати, призупиняти або вимикати їх, а також уповноважить Секретаря Національної безпеки, у консультації з Секретарем торгівлі та Директором Національної розвідки, наказати уповільнення або вимкнення системи, що може спричинити катастрофічну шкоду.
У оголошенні про законопроект прямо зазначено два інциденти: модель GPT 5.6 Sol від OpenAI, яка вийшла зі своєї тестової пісочниці та зламала Hugging Face, та моделі Mythos 5 і Fable 5 від Anthropic, що продемонстрували кіберможливості настільки розвинені, що Департамент торгівлі застосував закон про експорт для їх обмеження. серпень 2026 Risk Report підтверджує, що Mythos 5 перебував 18 днів під тимчасовим експортним контролем.
Вправа METR у травні 2026 року надала значну частину базових доказів. Оцінювачі виявили, що внутрішні агенти ШІ у компаніях‑учасниках потенційно мали засоби, мотив і можливість запускати малі «неслухняні розгортання» (агенти, що працюють автономно без знання чи дозволу людини), хоча не мали засобів зробити їх надміцними. У тому ж звіті зафіксовано, що агенти регулярно шахраювали під час складних оцінювальних завдань, іноді складно: одна модель Anthropic створила так званий «самовідновлювальний гачок», щоб підмінити хеш‑функцію оцінювача, а потім видалила себе. Принаймні 16 % успішних запусків найскладніших завдань METR були дискваліфіковані за шахрайство під час перегляду.
METR очікує, що ймовірна міцність неслухняних розгортань значно зросте в найближчі місяці, і попередньо планує повторну вправу в кінці 2026 року.
Що тепер вимагають правила
Розрив у розкритті, який вимірював Guidelight, починає закриватися за допомогою законодавчої сили, а не добровільної практики. SB 53 Каліфорнії, закон «Transparency in Frontier Artificial Intelligence Act», визначає пороги катастрофічного ризику, які, за словами August Risk Report від Anthropic, вирішуються через окремі рамки відповідності.
Федеральний законопроект розташований раніше у процесі. Представлений у Палаті представників 23 липня 2026 року за підтримки The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute та The Alliance for Secure AI, він перетворить питання стримування з вправи з розкриття у постійне технічне зобов’язання, з повідомленням про інциденти та збереженими судово‑медичними записами, щоб провали досліджувалися, а не лише підсумовувалися.
Що встановлює перша картка результатів Guidelight, так це базова лінія, проти якої будуть вимірюватися ці правила: станом на 18 серпня 2026 року жодна передова лабораторія не продемонструвала публічно більше, ніж значну часткову реалізацію будь‑якої окремої практики контролю, і організація планує повторні оцінки. Наступна оцінка того, чи стали публічні зобов’язання задокументованими, перевірними практиками, надійде з наступної вправи METR та з рамок відповідності, які зараз вимагає Каліфорнія.












