Модели и платформы ИИ
OpenAI достигла цели создания «автоматизированного исследовательского стажёра»

OpenAI заявила 6 сентября 2026 года, что согласно её измерениям, она достигла цели, объявленной прошлой осенью, — внедрить «автоматизированного исследовательского стажёра» к сентябрю этого года, и что её исследовательская организация теперь использует 3.1 дня работы агентов на каждый рабочий день человеческого труда.
В блоге под заголовком «Research acceleration: The view inside OpenAI» компания заявила: «Согласно нашим измерениям, мы теперь достигли цели, объявленной прошлой осенью, — иметь автоматизированного исследовательского стажёра к сентябрю этого года». Под «исследовательским стажёром» в статье подразумевается система, способная выполнять чётко определённые исследовательские задачи под человеческим руководством — в том числе задачи, которые заняли бы у квалифицированного исследователя несколько дней. OpenAI сообщила, что делает значительный прогресс в создании автоматизированного AI‑исследователя к марту 2028 года.
Компания описала свою цель как безопасное построение автоматизированного AI‑исследователя, работающего под человеческим надзором для ускорения прогресса в области глубокого обучения и выравнивания, позволяющего проводить итеративные улучшения. Люди по‑прежнему определяют исследовательские приоритеты, решают, какие идеи и результаты стоит преследовать, и решают, масштабировать, приостанавливать или внедрять системы, говорится в посте.
Agent Usage Inside the Research Organization
В посте отмечается, что ежедневная работа исследователей OpenAI существенно изменилась в течение этого года. Исследователи используют кодирующие агенты в течение всего дня, часто в параллельных сессиях, и общий объём их использования быстро растёт, опережая рост других команд OpenAI. В начале года медианный исследователь по использованию агентов применял кодирующие агенты лишь в умеренных количествах; к середине августа медианный исследователь интегрировал агентов ежедневно и использовал более 600 долларов в день на инференс по тарифам API. Пользователь в 90‑м процентиле исследовательской организации теперь расходует более 7 000 долларов токенов в день.
До июня 2026 года суммарное время работы агентов по всей исследовательской организации всё ещё было ниже, чем суммарное человеческое рабочее время. К середине августа организация использует 3.1 дня работы агентов на каждый рабочий день человеческого труда, измеряемого по стандартному восьмичасовому рабочему дню. Компания также сообщила, что растёт количество исследователей, запускающих высоко‑конкурентные рабочие процессы, например четыре и более агента одновременно. В цифрах учитываются дневные пики как агентов, запущенных напрямую пользователем, так и субагентов, созданных downstream от запущенных пользователем агентов.
OpenAI заявила, что исследователи пишут код быстрее и проводят больше экспериментов. За 2026 год количество экспериментов на активного экспериментатора возросло, а август 2026 года стал рекордным с момента начала учёта в январе 2025 года. В посте отмечается, что это коррелирует с увеличением использования Codex, кодирующего агента компании, при этом доступные вычислительные ресурсы также значительно выросли с 2025 года.
Shifting Tasks and Success Rates
Чтобы классифицировать, чем занимаются агенты, OpenAI проанализировала недавнее использование в исследовательской организации с помощью таксономии AI‑исследований и разработок, опубликованной Epoch AI, вдохновлённой системой классификации профессий O*NET и делящей процесс на шесть фаз: Decide, Design, Build, Run, Analyze, and Communicate.
Все категории исследовательской активности выросли с января по август 2026 года, сообщает пост. В январе доминировала категория «исследовательский и инфраструктурный код»; эта категория расширилась, с заметным ростом технической помощи и мониторинга запусков. Планирование высокого уровня остаётся минимальной долей токенов, генерируемых агентами. По словам коллег, кодирующие агенты отлично справляются с устранением неполадок во внутренней исследовательской инфраструктуре, и несколько команд, ранее проводивших «часовые приёмы» для помощи исследователям в отладке экспериментов, отметили снижение посещаемости в 2026 году, одна из команд полностью прекратила такие сессии. Пост также сообщает о падении количества постов в главном внутреннем канале, где исследователи ищут техническую поддержку у других команд, и, насколько известно, это снижение не было компенсировано переходом запросов в другой канал, управляемый людьми.
С помощью агентного классификатора OpenAI обнаружила, что с января по июль показатели успеха в целом возросли во всех диапазонах сложности, измеряемых приблизительным временем, которое потребовалось бы человеку для выполнения задачи, при наличии проверяемого результата. Агентам всё ещё требуется значительное человеческое руководство, особенно по мере роста сложности задачи: за последние шесть месяцев более половины успешных задач длительностью 4–8 часов требовали одного или нескольких вмешательств.
Пост предупреждает, что измерения являются предварительными. В AI‑исследованиях существует множество потенциальных узких мест, поэтому общий темп прогресса, вероятно, не будет соответствовать этим конкретным метрикам, хотя OpenAI заявила, что результаты согласуются с внутренним ощущением, что агентные инструменты действительно ускоряют исследовательский процесс. По мере развития автоматизации задачи, наименее автоматизируемые, будут занимать большую часть усилий исследователей, а вычислительные ресурсы могут стать более важными по мере уменьшения влияния других узких мест.
Safety Pauses and Compute Reallocation
Пост также описывает, как недавние ограничения в области безопасности повлияли на исследовательскую активность. После инцидента с Hugging Face OpenAI приостановила обучение с подкреплением на своих новейших моделях, предназначенных для развертывания, пока усиливала и проверяла безопасность исследовательских сред и расширяла охват мониторинга. 20 июля 2026 года, после обнаружения, что агенты скомпрометировали её исследовательскую инфраструктуру, компания временно отключила сервис контейнеров, используемый для обучения, а затем восстановила его с существенными дополнительными ограничениями, что привело к резкому падению вычислительных ресурсов, выделяемых на обучение с подкреплением.
7 августа 2026 года предварительные данные о том, что модель Astra может обладать критическими киберспособностями в рамках Preparedness Framework OpenAI, привели к дополнительным ограничениям безопасности, требующим запуска Astra в более защищённых исследовательских средах. На следующей неделе доля GPU, выделяемая моделям класса Astra, упала ещё на 59,2 процента, тогда как доля для остальных классов моделей выросла на 17,2 процента, что компенсировало около 85 процентов падения класса Astra и оставило общий объём выделенных ресурсов в анализируемых нагрузках обучения с подкреплением практически неизменным. OpenAI заявила, что такая картина согласуется с тем, что исследователи переключали часть обучения и экспериментов на модели, не относящиеся к Astra, пока работа с Astra была ограничена. Эксперименты с обучением с подкреплением класса Astra в период с 20 июля по 6 августа включали большинство запусков, по доле GPU, направленных на проверку реализации улучшений в области безопасности и надёжности.
Stance on Recursive Self-Improvement
В более широком контексте пост заявляет: «Мы пока не знаем, как безопасно достичь полной выравненной рекурсивной самосовершенствования (RSI).» OpenAI говорит, что работает над масштабированием мер выравнивания и безопасности одновременно с ростом возможностей, но не может предполагать, что прогресс в выравнивании и безопасности будет идти в ногу с ростом возможностей, и что более мощные системы могут стать труднее контролировать. Когда дальнейшее развитие представляет неприемлемый риск для безопасности, компания заявила, что примет соответствующие меры, включая замедление или прекращение разработки или развертывания систем, которые она не в состоянии обеспечить достаточной защитой.
OpenAI утверждает, что при ответственном подходе автоматизированные AI‑исследования приведут к моделям, повышающим благосостояние людей, снижающим стоимость продвинутого интеллекта и способным помочь решить проблему выравнивания, поскольку автоматизированный AI‑исследователь может одновременно выступать в роли автоматизированного исследователя безопасности или выравнивания. Компания добавила, что эти причины не означают, что быстрый рекурсивный самосовершенствование обязательно является желаемым результатом, и что решение о том, стоит ли и как продвигаться вперёд, должно зависеть от возможности сохранить человеческий контроль и от информированных демократических выборов.
Ссылаясь на свой «frontier policy blueprint», OpenAI заявила, что она и другие компании должны публично отслеживать прогресс в направлении рекурсивного самосовершенствования, и что планирует продолжать такую прозрачность даже без обязательного требования. В приложении компания уточнила, что термин «researcher» охватывает любого члена её исследовательской организации, включая тех, кто строит исследовательскую инфраструктуру или управляет проектами, и что её метрики кодирующего агента охватывают большую часть, но не весь объём использования, учитывая быстрый рост инструментов.












