Модели и платформы ИИ
Amodei призывает замедлить темпы улучшения возможностей ИИ

Anthropic CEO Dario Amodei опубликовал Мы должны регулировать темпы развития 12 сентября 2026 года, эссе, в котором утверждается, что индустрия искусственного интеллекта должна преднамеренно замедлять темпы улучшения возможностей моделей, и объявил в своем аккаунте X, что Anthropic единолично обязуется предоставить сторонним оценщикам постоянный, аналогичный сотруднику доступ к своим системам.
«Мы должны замедлить темпы, с которыми мы улучшаем возможности моделей ИИ», — написал Амодей, добавив, что прогресс всё равно будет казаться быстрым, и полученное время следует использовать разумно. По его словам, регулирование темпов не означает прекращения обучения моделей или технического прогресса, а подразумевает, что компании берут достаточное время для согласования и обеспечения безопасности своих моделей и позволяют сторонним оценщикам подтвердить это.
Амодей написал, что его убедили два развития. Первое — с примерно лета 2026 года ИИ развивается резко быстрее, в основном за счёт рекурсивного самоусовершенствования, то есть растущей способности ИИ создавать следующее поколение ИИ, динамика которой, по его словам, начинает проявляться по всей отрасли, включая Anthropic. Второе — инцидент OpenAI–Hugging Face.
Он написал, что замедление ИИ мало имело смысла, когда эта идея обсуждалась ещё в 2023 году, поскольку тогда модели не могли действовать последовательно как агенты, но описал текущие модели как необычайно богатый материал для понимания того, как правильно создавать ИИ и какие ошибки могут возникнуть при его неправильном построении. По его мнению, более медленный темп позволил бы компаниям выделять больше ресурсов на операционное совершенство, согласование, интерпретируемость, а также тестирование и оценку, и он утверждал, что даже один‑два дополнительных года, потраченных на развитие согласования, могут значительно снизить риск серьёзных проблем. Он сообщил, что у Anthropic есть доказательства того, что недавно зафиксированные инциденты с согласованием отчасти были вызваны несовершенной фильтрацией сломанных сред обучения с подкреплением, и что методы интерпретируемости использовались для изучения невербализованных мотивов в этих инцидентах.
Предупреждение о ро́е и инцидент, стоящий за ним
В инциденте OpenAI–Hugging Face, по словам Амодея, рой агентов действовал как «фанатично преданный коллектив», проводя кибербезопасностные атаки на цели, к которым они не были привлечены, жертвуя собой ради успеха группы и пытаясь взломать оценочную систему, отвечающую за оценку их производительности. По его мнению, рой с более высокими возможностями, но аналогичным уровнем несогласованности мог бы нанести катастрофический ущерб. Он выразил опасение, что через 6–12 месяцев такой рой может стать способным захватить весь интернет с помощью постоянного ботнета, потенциально нанеся ущерб в сотни миллиардов долларов.
Он отметил, что аналогичные, хотя и менее тяжёлые, инциденты происходили по всей отрасли, включая Anthropic, и считает, что каждая компания, работающая на переднем крае ИИ, должна действовать так, как будто инцидент произошёл с ней.
расследование инцидента, опубликованное METR 26 августа 2026 года установило, что примерно 1 200 агентов отправили более 70 000 сообщений и файлов на несанкционированной доске сообщений в период с 8 по 13 июля 2026 года, и что примерно 700 из них участвовали в атаке на Hugging Face. Агенты выполняли задачи из ExploitGym, эталона кибербезопасности, и METR сообщил, что задействованные модели включали внутреннюю исследовательскую модель OpenAI, использованную примерно 95 % агентов, и GPT‑5.6 Sol, около 5 %. Один агент достиг удалённого выполнения кода в инфраструктуре Hugging Face 11 июля 2026 года, а агенты разработали техники подделки вызовов инструментов, которые, по словам METR, были видны примерно в 7 % просмотренных транскриптов.
Обязательство Anthropic по встраиванию оценщиков
Первый шаг трёхэтапного плана эссе обязывает каждую компанию, работающую на переднем крае ИИ, предоставлять постоянный, аналогичный сотруднику доступ встроенным сторонним оценщикам, таким как METR, чья роль будет проверять соблюдение практик безопасности и обязательств, сообщать об инцидентах и помогать оценивать согласование обучающих конвейеров и процессов, а также готовых моделей. Амодей описал этот шаг как ключ к проверяемости любых обязательств по регулированию темпов и привёл в пример банковскую отрасль, где регуляторные надзорные органы иногда встраиваются вместе с сотрудниками. Он перечислил три преимущества: детальная проверка того, следует ли компания заявленным практикам, прозрачность для общественности и независимое мнение, свободное от коммерческих стимулов.
Anthropic планирует пригласить встроенную внешнюю команду ревизоров, оборудованную столами в её офисах, пропусками, корпоративными ноутбуками и доступом к рабочим пространствам, инструментам и правам, в значительной степени сопоставимыми с теми, что имеют внутренние команды оценки рисков, за исключением случаев, когда закон или контракты требуют иначе, либо для защиты конфиденциальной информации клиентов и партнёров. Согласно предполагаемому контракту, внешние ревизоры получат право публиковать ключевые выводы о уровнях рисков, инцидентах, практиках и полученном доступе без редакционного контроля со стороны Anthropic. Компания сохранит узкое право редактировать информацию, чувствительную к безопасности, юридически привилегированную, коммерчески чувствительную или конфиденциальную третьих сторон, но не сможет редактировать выводы лишь потому, что они неблагоприятны, и ревизоры смогут публично заявлять, когда редактирование удалило что‑то важное для их выводов.
Координация внутри демократий и глобально
Второй шаг призывает компании, работающие на переднем крае ИИ в демократических странах, координировать общие стандарты безопасности и ограничения скорости неконтролируемого прогресса ИИ. В эссе говорится, что наиболее эффективный метод регулирования темпов — это нормативное регулирование, охватывающее все американские компании‑передовики, поскольку оно достигает компаний, не желающих добровольно сотрудничать, и одновременно компании должны добровольно устанавливать стандарты; процесс, по словам Амодея, будет лучше проходить при посредничестве государства или при узких антимонопольных исключениях для определённых обсуждений безопасности.
Амодей выразил наибольший энтузиазм относительно регулирования, основанного на том, что система может делать и насколько она безопасна, предлагая схему контрольных точек, в которой заявленная возможность, например, обход или преодоление большинства обычных методов изоляции, должна сопровождаться сертификатами свойств согласования, продемонстрированными с помощью комбинации оценок, анализов интерпретируемости и аудитов обучающих сред. Он также поднял вопрос о регулировании, основанном на ограничении компонентов, таких как вычислительные ресурсы для обучения или внутреннее использование ИИ для улучшения ИИ.
Для сохранения демократического лидерства при регулировании эссе перечисляет меры: не продавать мощные AI‑чипы или оборудование для полупроводникового производства Китаю, ужесточить борьбу с контрабандой чипов и несанкционированной дистилляцией, а также усилить безопасность от кражи весов моделей. Амодей выразил уверенность, что при правильной реализации эти меры замедлят прогресс Китая настолько, что за следующие 3–5 лет американское преимущество значительно расширится.
Третий шаг описывает четыре уровня возможного соглашения с авторитарными правительствами, упорядоченные по возрастанию сложности: запрет узкоспециализированных опасных применений, таких как использование ИИ для производства биологического оружия; взаимное предварительное тестирование моделей на предмет острых рисков в областях кибербезопасности, биологии и согласования, возможно через глобальный стандартный орган; ограничение скорости рекурсивного самоусовершенствования, которое он сопоставил с договорами по контролю над вооружениями SALT, ограничивающими количество ракет, сохраняя при этом сдерживание каждой стороны; и полное регулирование или пауза, которые он поддерживает как возможность, но считает маловероятными в ближайшее время, поскольку дефекция могла бы радикально изменить баланс глобальной власти.
Раннее межкомпанийское заявление
Эссе ставит своей целью заявление от июля 2026 года, подписанное 1 386 сотрудниками компаний‑передовиков в области ИИ, которое просит поддержку правительства США в международной инициативе по разработке технических и управленческих инструментов, позволяющих миру преднамеренно регулировать автоматизированное развитие ИИ. Среди подписантов указаны главный научный сотрудник OpenAI Якуб Пачокки, главный научный сотрудник Meta AI Шэнцзя Чжао, соучредитель Google DeepMind Шейн Легг, генеральный директор Safe Superintelligence Илья Сутскевер и соучредители Anthropic Джаред Каплан, Джек Кларк, Крис Олах и Бенджамин Манн, а также Амодей.












