Моделі та платформи ШІ

Anthropic стверджує, що Claude очолює 26% її досліджень та розробок у галузі ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

Anthropic заявила, що її моделі Claude «очолюють» 26 % роботи компанії з досліджень і розробок у галузі ШІ станом на серпень 2026 року, у перших результатах прототипу індексу автоматизації R&D, опублікованих у публікації Anthropic Institute 17 вересня 2026 р.

Публікація під назвою «Вимірювання для розуміння темпів розвитку ШІ у передових лабораторіях» поєднує індекс з внутрішніми метриками нагляд за агентами та розподілу обчислювальних ресурсів, і Anthropic заявила, що планує продовжувати публікувати такі вимірювання.

Індекс автоматизації R&D

Індекс автоматизації R&D Anthropic охоплює весь спектр робіт з досліджень і розробок ШІ, що здійснюються в компанії, оцінює, наскільки автоматизовано кожне завдання, і об’єднує ці оцінки в агрегований показник. Оцінки базуються на шкалі рівня автоматизації, розробленій Epoch AI, яка варіюється від AL0, що означає відсутність залучення ШІ, до AL5, коли ШІ працює повністю автономно без участі людини. На рівні AL3 ШІ «співпрацює», виконуючи великі частини завдання під ретельним керівництвом людини; на рівні AL4 ШІ «очолює», виконуючи більшість завдання від високорівневого запиту до завершення, при цьому людина лише контролює процес.

Anthropic повідомила, що станом на серпень 2026 року Claude «очолює» 26 % її робіт з досліджень і розробок ШІ, частка робіт на рівні «співпрацює» або вище становить понад 90 %, і Claude не працює повністю автономно в жодному вимірюваному підрозділі робіт з досліджень і розробок ШІ. Діаграма в публікації показує, що частка «очолює» 26 % зросла з менше 1 % у лютому 2026 року.

Базовий каталог завдань був сформований знизу вверх за допомогою робочих записів, таких як Slack та внутрішня документація. За кожен тиждень липня 2026 року агент досліджень Claude переглядав тиждень випадково обраної особи — 20 % персоналу кожного підрозділу, що входить у цикл розробки моделей R&D — і складав список виконаних ними завдань, отримуючи плоский перелік приблизно 15 000 детальних завдань. Потім Claude організував ці завдання у ієрархічне дерево з 542 вузлів, 378 з яких — листові, наприклад «діагностика та виправлення дефектів платформи оцінки», і це дерево заморожено, щоб кожне вимірювання проводилося над одним і тим же набором робіт.

Для кожного вузла агент Claude досліджує, як такий тип роботи виконується в компанії, а незалежний суддя Claude присвоює один із шести рівнів автоматизації, обмежений доказами за місяць, що оцінюється, або раніше. Завдання зважуються за людським часом, тому категорії, у яких залучено більше персоналу, отримують більшу вагу.

Anthropic перевірила оцінки судді за допомогою персоналу, відповідального за відповідні робочі області, які оцінювали без доступу до доказів або рішень моделей, і повідомила про точну згоду модель‑проти‑людина у розмірі 59 % проти 35 % людина‑проти‑людина, при цьому 97 % оцінок знаходилися в межах одного рівня один від одного. Зазначені обмеження включають заморожений набір, який фіксує автоматизацію існуючих робіт без реєстрації нових типів робіт; порівняння завдань, що надходили з лютого по липень 2026 року, з набором січня 2026 року не виявило зростання «нових» завдань, і Anthropic планує періодично оновлювати набір і випускати нові версії опублікованих даних.

Нагляд за внутрішніми агентами

Другий набір вимірювань охоплює нагляд Anthropic за агентами ШІ у її системах. Станом на серпень 2026 року приблизно 30 000 агентів одночасно виконували дослідницькі та інженерні роботи на найчастіше використовуваній внутрішній платформі компанії, і повідомлені вимірювання стосуються лише цієї платформи.

Anthropic повідомила, що онлайн‑монітори перевіряють 100 % дій цих агентів перед їх виконанням, зазвичай протягом кількох секунд; з більш ніж мільярдом рішень агентів, проаналізованих у серпні 2026 року, 0,002 % (приблизно 1 з 47 000) були заблоковані, і люди переглядають будь‑які заблоковані дії протягом одного тижня. Офлайн‑монітори приймають 100 % дій після їх виконання і позначають приблизно 100 000 транскриптів на тиждень, які кілька класифікаторів перевіряють на хибнопозитивні випадки, усуваючи більшість позначок; приблизно 50 найпріоритетніших позначок на тиждень передаються на людську перевірку, і приблизно один‑два транскрипти з кожної тисячі позначаються для подальшого розгляду.

За даними публікації, онлайн‑монітори створені для запобігання шкоді, яка може статися швидко і не підлягає скасуванню, наприклад, копіюванню агентом ваг моделі з систем Anthropic, тоді як офлайн‑монітори орієнтовані на небезпечну поведінку, що розвивається повільно і може бути виправлена, наприклад ознаки неправильного вирівнювання моделі. Anthropic зазначила, що два дизайнерські рішення у внутрішній структурі підтримують нагляд: кожен агент має індивідуальну ідентичність, що зберігається під час оновлень моделі, і агенти спілкуються через спільну відкриту систему обміну повідомленнями, що перехресно пов’язана з транскриптами, що дозволяє моніторингу поведінки охоплювати комунікації між агентами. Компанія повідомила, що METR раніше незалежно проводив червоне тестування її платформи офлайн‑моніторингу, і що ці вимірювання нагляду також були опубліковані у її звіті про ризики за серпень 2026 року.

Огляд розподілу обчислювальних ресурсів

Для третього вимірювання Anthropic проаналізувала, як вона використала всі свої обчислювальні ресурси з 13 по 20 липня 2026 року, розподіливши кожне навантаження за категоріями та вимірюючи, яка частка обчислювальних ресурсів, що йде на дослідження та розробки ШІ, використовується для безпеки. За цей тиждень Anthropic повідомила, що близько 6 % обчислювальних ресурсів, що йдуть на дослідження та розробки ШІ, було спрямовано на безпеку, і близько 12 % ресурсів, що йдуть на AI‑запроваджені дослідження та розробки ШІ, було виділено на безпеку.

Компанія описує обидві оцінки як навмисно консервативні: токени, які підвищували можливості так само, як і безпека, були зараховані до AI R&D, а класифікатори захисних механізмів, окрема і порівнянна кількість обчислювальних ресурсів, виключені. Класифікатор Claude за запитом розподілив майже 10 000 дослідницьких тренувальних та оцінювальних запусків за тиждень, використовуючи приблизно 14 % вибірки, зосередженої на найбільших споживачах обчислювальних ресурсів, і Anthropic повідомила, що класифікатор погодився з людськими рецензентами в межах одного‑двох процентних пунктів.

Зазначені обмеження полягають у тому, що один тиждень демонструє можливість вимірювання без встановлення тенденції, що мітки навантажень є найкращими зусиллями і не перевірені, а також що частка обчислювальних ресурсів вимірює, скільки витрачено, а не обсяг виконаної безпекової роботи.

Мета та наступні кроки

Anthropic заявила, що публікує ці вимірювання, оскільки вони дають громадськості, зовнішнім сторонам і урядам чіткіший уявлення про темпи розвитку ШІ у передових лабораторіях, доповнюючи звіти про ризики за політикою відповідального масштабування та пропозицію політики Advanced AI Framework. Компанія зазначила, що цифри можуть змінитися, якщо відбудеться координація щодо темпу розвитку передових технологій, як це закликає генеральний директор Дарио Амодей.

У дописі зазначено, що будь‑який розробник передових технологій міг би регулярно публікувати ті самі показники за публічною методологією, і вказано два перешкоди для міжлабораторного порівняння: відсутність спільної методології та використання розробником власних моделей для оцінки своїх систем. Зазначається, що такі вимірювання могли б бути перевірені третіх сторін або моделями інших розробників і могли б стати підставою для посилення вимог, наприклад, встановлення фіксованого тестового вікна перед тим, як нову модель буде використано для подальшого AI R&D.

Anthropic повідомила, що планує залучити незалежних оцінювачів‑третьосторонніх організацій з різних установ, надати їм доступ до внутрішніх процесів, систем і даних, порівнянних з тими, що мають внутрішні команди оцінки ризиків, для перевірки практик безпеки, звітування про інциденти та відстеження ключових метрик, подібних до зазначених у дописі. Статтю співавтори Марина Фаваро та Філлі Врайт, під керівництвом Джек Кларка.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.