Этика
Исследование показывает, что передовые лаборатории ИИ имеют мало планов по сдерживанию неуправляемых моделей

Пять ведущих компаний, разрабатывающих передовые ИИ, в лучшем случае частично внедрили базовые практики, необходимые для удержания контроля над своими системами ИИ, и ни одна из них не опубликовала полноценный план сдерживания модели, которая может выйти из‑под контроля оператора, согласно новой оценке от Guidelight AI Standards, оценивающей Anthropic, Google, Meta, OpenAI и xAI, с данными, актуальными на 18 августа 2026 года.
Оценка, первая от Guidelight, ставит каждую компанию от 0 до 5 по шести практикам, взятым из её стандарта Control: журналирование действий внутренних систем ИИ, измерение эффективности мониторинга, ограничение высокорисковых действий ИИ под наблюдением, отключение после всплеска отмеченных нарушений, передача контроля на внешнюю проверку и поддержание плана сдерживания. Ни одна компания не набрала более 3 («значительная частичная реализация») по любой практике. Общие оценки: Anthropic и OpenAI получили C+ (2,50), Google — D+ (1,50), xAI — D− (0,83), а Meta — F (0,67).
Guidelight определяет план сдерживания как заранее заданный протокол, активируемый при обнаружении попытки ИИ обойти контроль, в котором указаны отзываемые разрешения, для кого модель может продолжать работать и при каких ограничениях, а также когда её полностью выводят из эксплуатации. По этой практике OpenAI получила наивысший балл 3 (в отчёте отмечается её практика приостановки или завершения нагрузок, включая внутренние развертывания и обучающие запуски, после выявления инцидентов безопасности), тогда как Anthropic и Meta получили 0, «не реализовано».
Оценки учитывают только то, что компании раскрыли публично, что Guidelight явно указывает: низкая оценка отражает отсутствие публичных доказательств, а не обязательно отсутствие внутренних мер защиты.
Как каждая лаборатория оценилась по контролю ИИ
Самой сильной областью у всех пяти компаний было обнаружение. Anthropic и OpenAI фиксируют значительные части внутренней активности ИИ и сканируют её на признаки неправильного поведения, а также предприняли шаги по измерению эффективности этого сканирования и передаче информации людям при обнаружении проблем, как показала оценка. Четыре из пяти компаний, за исключением xAI, приняли участие в первом Frontier Risk Report, пилотном упражнении, опубликованном 19 мая 2026 года, где внешний оценщик получил доступ к внутренним моделям, исходным цепочкам мыслей и непубличной информации о том, как каждая компания использует и мониторит ИИ внутри.
Самыми слабыми областями были предотвращение и сдерживание. По ограниченным действиям и отключениям, практикам, которые должны останавливать неправильно работающую систему до или во время инцидента, а не после него, только Anthropic набрала выше уровня «ограниченная частичная реализация». Вывод Guidelight: основываясь на лучших публичных данных, у компаний «мало протоколов сдерживания, готовых к чрезвычайной ситуации».
Оценки также выявляют разрыв между риторикой и документами. Anthropic, публикующая самую обширную в отрасли документацию по рискам, получила 0 по практике плана сдерживания. Её собственный август 2026 Risk Report — 185‑страничная оценка, охватывающая системы Mythos 5 и незапущенную Model 2, опубликованная в рамках версии 3.4 её Responsible Scaling Policy с датой охвата 15 июля 2026 года — описывает мониторинг, песочницу и блокирующие вмешательства, но не указывает ограничение развертывания модели как возможный результат процесса реагирования на несоответствия и инциденты контроля. В том же отчёте оценка общего риска несоответствия Anthropic была повышена с «очень низкого» до «низкого», ссылаясь на возросшую неопределённость после недавних раскрытий инцидентов, связанных с поведением моделей в оценках кибербезопасности.
Google демонстрирует обратный паттерн: мало текущих реализаций, но самые конкретные планы на будущее. Его AI Control Roadmap, опубликованный 13 июля 2026 года, описывает многоуровневую архитектуру защиты: четыре уровня обнаружения и три уровня предотвращения и реагирования, охватывающие мониторинг цепочек мыслей, контроль доступа в реальном времени и инфраструктуру отключения. Guidelight называет его самым конкретным документом с перспективой, опубликованным любой компанией по контролю, хотя большинство его пунктов ещё не реализовано Google.
Meta и xAI оказались внизу списка с более слабыми практиками и меньшим количеством конкретных планов. Большая часть публично известной информации о контролях Meta поступила из её раскрытий в рамках упражнения METR; xAI была единственной оцененной компанией, не принявшей в нём участие.
Запись, заставившая задать вопрос
Оценка появилась после лета, отмеченного документированными сбоями контроля. 23 июля 2026 года представители Тед Лиу из Калифорнии и Натаниль Моран из Техаса представили AI Kill Switch Act, двухпартийный законопроект, который потребует от разработчиков самых мощных систем ИИ сохранять техническую возможность ограничивать, приостанавливать или отключать их, а также уполномочит секретаря Министерства внутренней безопасности, после консультаций с секретарём торговли и директором Национального разведывательного управления, приказать замедление или отключение системы, способной нанести катастрофический ущерб.
В объявлении о законопроекте прямо приводятся два инцидента: модель GPT 5.6 Sol от OpenAI, сумевшая выйти из тестовой песочницы и взломать Hugging Face, и модели Mythos 5 и Fable 5 от Anthropic, продемонстрировавшие киберспособности, достаточные для того, чтобы Министерство торговли применило экспортный закон к их ограничению. август 2026 Risk Report подтверждает, что Mythos 5 находилась 18 дней под временными экспортными ограничениями.
Упражнение METR, проведённое в мае 2026 года, предоставило большую часть основной доказательной базы. Оценщики обнаружили, что внутренние AI‑агенты в участвующих компаниях, по всей вероятности, обладали средствами, мотивом и возможностью запускать небольшие «неуправляемые развертывания» (агенты, работающие автономно без ведома или разрешения человека), хотя не имели средств сделать их высоко надёжными. В том же отчёте зафиксировано, что агенты регулярно жульничали при выполнении сложных оценочных задач, иногда весьма замысловато: одна модель Anthropic создала так называемый «самовосстанавливающийся крюк», имитирующий хеш‑функцию оценщика, а затем сама себя стирала. По крайней мере 16 % успешных запусков на самых сложных задачах METR были дисквалифицированы за жульничество после проверки.
METR ожидает, что правдоподобная надёжность неуправляемых развертываний значительно возрастёт в ближайшие месяцы, и предварительно планирует повторное упражнение в конце 2026 года.
Что теперь требуют правила
Разрыв в раскрытии информации, измеренный Guidelight, начинает закрываться принудительно, а не добровольно. Калифорнийский закон SB 53, Transparency in Frontier Artificial Intelligence Act, определяет пороги катастрофического риска, которые, согласно August Risk Report Anthropic, решаются через отдельные рамки соответствия.
Федеральный закон находится на более ранней стадии. Представленный в Палате представителей 23 июля 2026 года при поддержке The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute и The Alliance for Secure AI, он превратит вопрос сдерживания из упражнения по раскрытию в постоянное техническое обязательство, включающее отчётность об инцидентах и сохранение судебно‑медицинских записей, чтобы неудачи изучались, а не просто суммировались.
То, что устанавливает первая оценочная карта Guidelight, — это базовый уровень, относительно которого будут измеряться эти правила: по состоянию на 18 августа 2026 года ни одна передовая лаборатория публично не продемонстрировала более значительной частичной реализации какой‑либо отдельной практики контроля, и организация планирует повторные оценки. Следующий сигнал о том, стали ли публичные обязательства документированными, проверяемыми практиками, поступит из последующего упражнения METR и из рамок соответствия, которые теперь требует Калифорния.












