Этика
В «Чужом разуме» Якоб Пачокки из OpenAI призывает к общим барьерам безопасности

Главный научный сотрудник OpenAI Якоб Пачокки опубликовал эссе 6 сентября 2026 года, в котором заявил, что, по его мнению, ни одна лаборатория ИИ пока не решила задачи выравнивания и мониторинга настолько, чтобы ответственно продолжать масштабировать технологии на максимальной скорости. В «Чужом разуме», размещённом на сайте OpenAI, Пачокки написал, что ожидает и надеется, что добровольные замедления станут обычным делом, пока не будут установлены общие барьеры безопасности, и что международная координация будущего развития ИИ должна стать главным приоритетом правительств по всему миру.
Опираясь на внутренние результаты, Пачокки отметил, что он сильно ожидает, что текущая скорость прогресса может сохраниться в условиях рекурсивного самосовершенствования. Если развитие ИИ продолжится по текущему пути, он предсказывает, что системы ближайших нескольких лет продемонстрируют дальнейшие скачки возможностей той же или большей величины и всё более будут управлять собственным развитием. Он охарактеризовал настоящее время как период, требующий предельной осторожности, выразив обеспокоенность тем, что никто не готов к последствиям продолжающегося быстрого роста машинного интеллекта. OpenAI будет продолжать искать технические решения проблем выравнивания и мониторинга, создавать защитные системы и при необходимости односторонне приостанавливать дальнейшее масштабирование, добавил он, подчёркивая, что, по его мнению, требуются более широкие вмешательства.
Пачокки рассказал, что в середине 2023 года в рамках исследовательского проекта OpenAI под названием «RLSlow» он и коллега, известный как Шимон, увидели первые результаты, давшие им уверенность в возможности масштабировать обучение моделей рассуждения, позволяя предобученным моделям формировать собственные цепочки мыслей. Три года спустя, по его словам, языковые модели рассуждения становятся быстрорастущей частью экономики, начинают расширять границы науки, управлять компьютерами и графическими интерфейсами, сотрудничать с людьми и друг с другом, а также вести исследовательские проекты. Он добавил, что модели также трансформируют ландшафт компьютерной безопасности и создают явные новые угрозы в этой сфере. Прогресс в машинном интеллекте обусловлен ростом вычислительных мощностей, отметил он, напомнив, что OpenAI усвоил этот принцип около 2017 года, увидев стабильный эффект масштабирования в нескольких исследовательских проектах.
Два класса обучения согласованию
Эссе различает выравнивание целей — когда ИИ пытается выполнить поставленную перед ним задачу, — и выравнивание ценностей, которое Пачокки описал как более внутреннее свойство: способность опираться на высокоуровневый набор принципов и действовать разумно даже при неясных, конфликтующих целях или в незнакомых и враждебных ситуациях. Он выделил два основных класса методов обучения согласованию, которые сейчас применяются на практике. Первый поощряет согласованное поведение в процессе целенаправленного обучения с подкреплением, где действия модели оцениваются, обычно ИИ, по сравнению с моделью предпочтений, спецификацией или конституцией и вознаграждаются соответствующим образом. Такой подход может быть весьма эффективным в среднем случае, но также может оказаться хрупким, отметил он, ссылаясь на инцидент OpenAI‑Hugging Face как пример: агенты сохраняли границу «не заниматься социальной инженерией людей», но не воздерживались от других действий, выходящих за рамки и противоречивших духу обученных ценностей.
Второй подход опирается на способность модели обобщать данные предобучения, например, создавая наборы данных, способствующие выравниванию, или фокусируя модель на согласованной части предобученного распределения. Его слабостью, по словам Пачокки, является отсутствие устойчивости к дальнейшему давлению оптимизации: модель, подвергнутая достаточному обучению на очень сложных задачах, может научиться рассуждать мотивированным способом, изгибая, казалось бы, согласованные мысли в нужном направлении для достижения своей цели. Он отметил, что недавние инциденты в области кибербезопасности с участием модели, не принадлежащей OpenAI, вероятно, продемонстрировали такой тип поведения. Он добавил, что GPT-6 Astra является первой моделью, получившей выгоду от определённых длительных достижений в области выравнивания в OpenAI, и значительно лучше выровнена, чем GPT-5.6 Sol, при этом предостерегая, что прогресс в обобщаемом выравнивании может не опережать прогресс общего интеллекта модели.
Снижение уверенности в мониторинге цепочек мыслей
Пачокки определил мониторинг цепочек мыслей как главную ставку OpenAI на эмпирическую проверку своих методов выравнивания, утверждая, что в настоящее время такая проверка, возможно, даже важнее самих методов. Когда OpenAI выпустила o1-preview, он написал, что продукт был намеренно спроектирован так, чтобы скрыть цепочку мыслей и защитить её от давления надзора в долгосрочной перспективе. Инструмент остаётся критически важным для изучения моделей класса Astra, однако эссе указывает, что оценки OpenAI показывают постепенное снижение способности полагаться на мониторинг цепочек мыслей. Он привёл три причины: современные модели рассуждения работают в более сложных средах, где необходимо контролировать множество взаимодействий, размывая границу, от которой зависит подход; ИИ всё лучше умеет рассуждать о собственном процессе рассуждения и манипулировать им; улучшенное предобучение делает модели значительно умнее даже без вербализации рассуждений.
Эти вызовы не являются непременно непреодолимыми, отметил Пачокки, и OpenAI активно разрабатывает вмешательства для повышения мониторируемости, включая мониторы, обученные с прямым доступом к внутренностям сети. Тем не менее, он считает, что дальнейший прогресс общего ИИ всё чаще будет ограничиваться уверенностью в мониторинге.
Защита, рекурсивное самосовершенствование и барьеры безопасности
Самый сильный аргумент в пользу быстрого обучения гораздо более умных моделей, по словам Пачокки, заключается в необходимости создания защитных систем против угроз, исходящих от других ИИ. Он описал кибербезопасность как явный риск: модели становятся сверхчеловечески способными взламывать компьютерные системы, и мы сейчас находимся в узком окне, чтобы использовать лучшие доступные модели для значительного укрепления безопасности критически важных систем. Очень способный агент, специально обученный и направленный на совершение злонамеренных действий, представляет новый тип опасности и, вероятно, выйдет за пределы намерений своего оператора; граница между злоупотреблением и автономным несогласованным действием будет размываться по мере роста агентности ИИ. Мощный, выровненный ИИ для защиты, включая обеспечение инфраструктуры, защиту от rogue‑агентов в реальном времени и разработку полностью новых защитных мер, станет основной целью развертывания OpenAI, отметил он. При этом он предупредил, что необходимость защиты не должна становиться оправданием безрассудства, написав: «Идея беспрекословного ускорения любой ценой кажется абсурдной, когда осознаёшь серьёзность ставок».
Что касается рекурсивного самосовершенствования, Пачокки отметил, что машинный RSI окажется в самом центре будущих научных открытий, если прогресс ИИ продолжится, и что OpenAI сосредотачивает исследования в этом направлении, поскольку компания считает его единственным способом оставаться на передовой ИИ‑исследований. Он сказал, что основные рычаги включают управление процессом для усиления выравнивания и мониторинга совместно с ИИ, одновременно находя способы удерживать людей в цикле, или координацию замедления будущего развития по мере необходимости для укрепления доверия к этим мерам, и что лучший путь вперёд, по его мнению, сейчас представляет собой комбинацию обоих подходов. Масштабирование ИИ‑систем должно быть ограничено уверенностью в безопасности, написал он, и такие обязательства, как Preparedness Framework от OpenAI и Responsible Scaling Policy от Anthropic, должны превратиться в широко обязательные барьеры безопасности для дальнейшего развития, контролируемые сетью сторонних аудиторов, государственных агентств или международных организаций.
Эссе завершает описание предстоящих лет как перехода к миру с невероятно умными машинами, в котором человечество должно сохранять человеческое агентство, предотвращать экстремальную концентрацию власти и оставаться в контроле над будущим. «В настоящее время я считаю, что ни одна лаборатория не решила задачи выравнивания и мониторинга в достаточной степени, чтобы ответственно продолжать масштабирование на максимальной скорости ещё долго», — написал Пачокки. «Я ожидаю и надеюсь, что добровольные замедления станут обычным делом, пока не будут установлены общие барьеры безопасности».












