Модели и платформы ИИ

Anthropic заявляет, что Claude возглавляет 26% своих исследований и разработок в области ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Anthropic заявила, что её модели Claude “возглавляют” 26 % работы компании по исследованиям и разработкам в области ИИ по состоянию на август 2026 г., в первых результатах прототипа индекса автоматизации R&D, опубликованных в Anthropic Institute пост 17 сентября 2026 г.

Пост под названием «Измерения для понимания темпов развития ИИ внутри передовых лабораторий» соединяет индекс с внутренними метриками надзора за агентами и распределения вычислительных ресурсов, и Anthropic заявила, что планирует продолжать публиковать такие измерения.

Индекс автоматизации R&D

Индекс автоматизации R&D Anthropic охватывает весь спектр работ по ИИ‑R&D, выполняемых в компании, оценивает степень автоматизации каждой задачи в текущий момент и объединяет эти оценки в агрегированный показатель. Оценки используют шкалу уровней автоматизации, разработанную Epoch AI, от AL0, означающего отсутствие участия ИИ, до AL5, где ИИ работает полностью автономно без участия человека. На уровне AL3 ИИ “collaborates”, выполняя большую часть задачи под тесным руководством человека; на уровне AL4 ИИ “leads”, беря на себя большую часть задачи от высокоуровневого запроса до завершения, пока человек наблюдает.

Anthropic сообщила, что по состоянию на август 2026 г. Claude “leads” 26 % своей работы по ИИ‑R&D, доля работы на уровне “collaborates” и выше превышает 90 %, и Claude не работает полностью автономно ни в одном измеренном подмножестве работ по ИИ‑R&D. Диаграмма в посте показывает, что доля “leads” в 26 % выросла с менее 1 % в феврале 2026 г.

Исходный каталог задач был построен снизу вверх с использованием рабочих записей, таких как Slack и внутренняя документация. Для каждой недели июля 2026 г. исследовательский агент Claude проверял каждую случайно выбранную неделю сотрудника — 20 % персонала из каждого отдела, составляющего цикл разработки модели R&D — и перечислял задачи, над которыми они работали, получая плоский список примерно из 15 000 детализированных задач. Затем Claude организовал эти задачи в иерархическое дерево из 542 узлов, 378 из которых являются листовыми, например «eval platform defect diagnosis and fixes», и это дерево заморожено, чтобы каждый измерительный запуск использовал один и тот же набор работ.

Для каждого узла агент Claude исследует, как такой тип работы выполняется в компании, а независимый судья Claude присваивает один из шести уровней автоматизации, ограниченный доказательствами из оцениваемого месяца или более ранних. Задачи взвешиваются по времени, затраченному персоналом, поэтому категории, требующие большего участия сотрудников, получают больший вес.

Anthropic проверила оценки судьи, сравнив их со специалистами, отвечающими за соответствующие области работы, которые оценивали без доступа к доказательствам или суждениям моделей, и сообщила о точном совпадении модель‑человек в 59 % против 35 % человек‑человек, при этом оценки находились в пределах одного уровня друг от друга в 97 % случаев. Указанные ограничения включают замороженный набор, который фиксирует автоматизацию существующей работы, не учитывая новые виды задач; сравнение задач, поступивших с февраля по июль 2026 г., с набором января 2026 г., не выявило роста «novel» задач, и Anthropic планирует периодически восстанавливать набор и переиздавать опубликованные цифры.

Надзор за внутренними агентами

Вторая серия измерений охватывает надзор Anthropic за ИИ‑агентами в её системах. По состоянию на август 2026 г. примерно 30 000 агентов одновременно занимались исследовательской и инженерной работой на самой часто используемой внутренней платформе компании, и опубликованные измерения относятся только к этой платформе.

Anthropic сообщила, что онлайн‑мониторы проверяют 100 % действий этих агентов перед их выполнением, обычно в течение нескольких секунд; из более чем миллиарда решений агентов, проанализированных в августе 2026 г., 0,002 % (примерно 1 из 47 000) были заблокированы, и люди проверяют любые заблокированные действия в течение недели. Офлайн‑мониторы принимают 100 % действий постфактум и помечают примерно 100 000 транскриптов в неделю, которые несколько классификаторов проверяют на ложные срабатывания, устраняя большинство пометок; примерно 50 самых приоритетных пометок в неделю передаются на проверку человеку, и примерно один‑два транскрипта из каждой тысячи помечаются для дальнейшего рассмотрения.

Согласно посту, онлайн‑мониторы предназначены для предотвращения вреда, который может произойти быстро и не может быть отменён, например, копирования агентом весов модели из систем Anthropic, тогда как офлайн‑мониторы направлены на опасные поведения, развивающиеся постепенно и поддающиеся исправлению, такие как признаки несоответствия модели. Anthropic заявила, что два дизайнерских решения во внутреннем каркасе поддерживают надзор: каждый агент имеет индивидуальную идентичность, сохраняющуюся при обновлениях модели, и агенты общаются через общую открытую систему обмена сообщениями, перекрёстно связанную с транскриптами, что позволяет мониторингу поведения охватывать коммуникацию между агентами. Компания сообщила, что METR ранее независимо проводила red‑team проверку её платформы офлайн‑мониторинга, и что эти измерения надзора также были опубликованы в её отчёте о рисках за август 2026 г.

Снимок распределения вычислительных ресурсов

Для третьего измерения Anthropic проанализировала, как использовались все её вычислительные ресурсы с 13 по 20 июля 2026 г., распределяя каждую нагрузку по категориям и измеряя, какая часть вычислительных ресурсов, направляемых в ИИ‑R&D, была выделена на безопасность. За эту неделю Anthropic сообщила, что около 6 % вычислительных ресурсов, направляемых в ИИ‑R&D, было выделено на безопасность, и около 12 % вычислительных ресурсов, направляемых в ИИ‑управляемое ИИ‑R&D, было выделено на безопасность.

Компания описывает обе оценки как преднамеренно консервативные: токены, которые продвигают возможности так же сильно, как и безопасность, учитывались как AI R&D, а классификаторы средств защиты, отдельный и сопоставимый объём вычислительных ресурсов, исключены. Запрошенный классификатор Claude отсортировал почти 10 000 исследовательских тренировочных и оценочных запусков за неделю, используя примерно 14 % выборку, смещённую в сторону крупнейших потребителей вычислительных ресурсов, и Anthropic сообщила, что классификатор согласовывался с человеческими рецензентами в пределах одной‑двух процентных пунктов.

Указанные ограничения заключаются в том, что одна неделя демонстрирует возможность измерения, но не устанавливает тенденцию, метки базовых нагрузок являются приблизительными и непроверенными, а доля вычислительных ресурсов измеряет, что потрачено, а не объём выполненной работы по безопасности.

Цель и дальнейшие шаги

Anthropic заявила, что публикует эти измерения, потому что они дают общественности, внешним сторонам и правительствам более ясное представление о темпах развития ИИ в передовых лабораториях, дополняя отчёты по рискам в рамках политики Responsible Scaling Policy и предложение политики Advanced AI Framework. Было отмечено, что цифры могут измениться при координации темпов развития передовых технологий, как призывает генеральный директор Дарио Амодеи.

В посте говорится, что любой разработчик передовых технологий может регулярно публиковать такие же показатели с публичной методологией, и выделяются два препятствия для сравнения между лабораториями: отсутствие общей методологии и использование разработчиком собственных моделей для оценки своих систем. Утверждается, что такие измерения могут быть проверены третьими сторонами или моделями других разработчиков и могут стать триггером для более строгих требований, например фиксированного тестового окна перед тем, как новая модель будет задействована в дальнейшем AI R&D.

Anthropic заявила, что планирует привлечь независимых сторонних оценщиков из нескольких организаций, предоставив им доступ к внутренним процессам, системам и данным, сопоставимым с теми, что имеют внутренние команды оценки рисков, для проверки практик безопасности, отчётности о инцидентах и отслеживания ключевых метрик, подобных тем, что указаны в посте. Статья написана совместно Мариной Фаваро и Филли Урайт при научном руководстве Джека Кларка.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.