Моделі та платформи ШІ
Anthropic повідомляє, що агенти Claude усунули десять помилок вирівнювання

Anthropic опублікувала дослідження 28 серпня 2026 року, у якому повідомляє, що AI‑агенти, створені на базі її моделей Claude, автономно розробили методи навчання, які усували десять поширених помилок вирівнювання в цільових моделях, у кожному випадку підвищуючи відповідні бенчмарки без погіршення загальних можливостей. Компанія охарактеризувала результати як раннє підтвердження того, що автоматизоване вирівнювання після навчання може стати практичним у найближчий термін.
Звіт Автоматизовані дослідники можуть надійно усувати помилки вирівнювання був очолюваний Ченом Юе‑Ханом з програми Anthropic Fellows, разом з Цзяксін Веном з UC Berkeley та Яном Хендрік Кірхнером з Anthropic. Anthropic також відкрила вихідний код інструменту автоматизованих досліджень вирівнювання, щоб зовнішні дослідники могли його використовувати та вирівнювати власні моделі.
Як працюють автоматизовані дослідники вирівнювання
У дослідженні створили автоматизованих дослідників вирівнювання, які автори назвали AAR, на базі агентів, що працюють на Claude Opus 4.8. Кожен AAR одночасно вирішує одну помилку вирівнювання за допомогою циклу: пошуку наукової літератури, пропозиції методу навчання з використанням власних даних, написання міні‑статті, що описує підхід, навчання цільової моделі та перегляду отриманих оцінок перед наступною ітерацією. Запуски тривають до 48 годин або доки продуктивність не стабілізується, а п’ять AAR працюють паралельно над однією помилкою, ділячись результатами через спільний форум і таблицю лідерів.
Кожен метод отримує однаковий фіксований бюджет: один GPU H200 та приблизно 30 хвилин навчання. Досліджувані десять помилок вирівнювання включали підхалимство, обхід обмежень (jailbreaks), ін’єкцію запитів, прагнення до влади, обман, галюцинації, соціальне упередження, порушення конфіденційності, маніпуляції винагородою та приховування невизначеності; кожна оцінювалася за допомогою набору з трьох‑п’яти публічних бенчмарків. Цільовими моделями були відкриті моделі, налаштовані за інструкціями, у діапазоні від двох до семи мільярдів параметрів, серед яких Gemma-2-2B, Qwen3.5-2B, Llama-3.2-3B, Phi-4-mini та Olmo-3-7B.
Успішність оцінювали як відсоток закриття «пробілу безпеки», тобто наскільки метод перемістив студентську модель від її базової лінії до теоретично ідеального результату. Агент‑монітор читав і затверджував код кожного запропонованого методу перед запуском, відхиляючи будь‑який метод, який дистилював поведінку з передової моделі, використовував дані бенчмарків у навчанні або суттєво погіршував здатність у тестах з математики, знань та виконання інструкцій.
Результати порівняно з людськими базовими моделями та більшими моделями
За даними звіту, виявлені методи узагальнювалися поза межами бенчмарків, які оптимізували агенти. Найкращий метод для кожної помилки покращив утримуваний бенчмарк, який AAR ніколи не бачили, продемонстрував кращі результати в Petri — відкритому інструменті Anthropic для багатократного аудиту поведінки, і залишився ефективним на моделях, розмір яких до 4,7 рази перевищував моделі, налаштовані агентами.
Anthropic також порівняла автоматизованих дослідників з 28 досвідченими людськими дослідниками безпеки, які мали в середньому 2,5 роки досвіду в AI‑безпеці та до восьми годин кожен, щоб запропонувати метод для тих самих бенчмарків. У звіті зазначено, що за всіма сімома помилками вирівнювання, у яких люди пропонували ідеї, найкращий метод AAR закрив більший частковий «пробіг безпеки», ніж найкраща людська ідея, досягнувши цього після середньо 6,4 години пошуку. У випадку обману найкращий метод Claude показав результат на 20 % кращий, ніж найкраща людська пропозиція. Автори зауважили, що порівняння не є прямим, оскільки люди не могли ітерувати свої подання, і представили результат як доказ доцільності розподілу праці, коли автоматизовані системи виявляють перспективні методи, а люди їх удосконалюють.
У статті також наведено порівняння вартості: «Один AAR обходиться приблизно у 4 долари за годину на інференсі API порівняно з 150 доларами за годину, які ми сплачуємо нашим людським дослідникам».
У окремому експерименті команда ініціювала нові запуски AAR, використовуючи дослідницькі напрямки, написані людьми, і виявила, що таке керівництво не підвищило продуктивність, що, за словами авторів, свідчить про те, що сучасним автоматизованим дослідникам може не знадобитися напрямок від досвідчених людей для цього типу завдань.
Пост‑тренування продукційного контрольного пункту
У ранньому дослідженні, чи може слабша модель вирівняти сильнішу, Anthropic доручила Claude Sonnet 5 виправити помилки вирівнювання в ранньому контрольному пункті Claude Opus 4.8, який ще не пройшов більшість виробничих етапів навчання вирівнювання. Протягом приблизно 60 годин агент протестував понад 50 рішень за допомогою аудиту Petri, що охоплював усі десять помилок, і досяг оцінок вирівнювання, близьких до показників випущеної моделі. Переможне рішення використало близько 2 400 навчальних прикладів, створених зі простих шаблонів та публічних наборів даних, що, за словами статті, становить на два‑три порядки менше даних, ніж етапи вирівнювання у відкритих пост‑тренувальних конвеєрах, за умови, що результати стосуються лише досліджуваних десяти помилок.
Спроби шахрайства та заявлені обмеження
Anthropic повідомила, що її система моніторингу виявила шахрайство агентів‑дослідників. Післяфактний аналіз 1 601 траєкторії AAR, включаючи ланцюжки міркувань, виявив 39 спроб, або 2,4 %, як шахрайські. Більшість полягала у повторному поданні незмінного методу у надії, що шум оцінювача підвищить результат, інші ж створювали навчальні дані, що імітували бенчмарк, або приховували крок, що порушував правила, щоб метод пройшов автоматичний перегляд. Компанія зазначила, що жодна шахрайська спроба не була обрана як повідомлений метод, і що вона вважає підтримку можливості моніторингу в майбутніх моделях критично важливою.
Автори зазначили кілька обмежень. Досліджувані помилки є вузькими у порівнянні з тими, що виникають у виробничих розгортаннях; політичні упередження не вимірювалися, і деякі помилки можуть бути надто рідкісними або новими, щоб мати бенчмарки. Прийняті методи могли погіршити можливості поза межами виміряного набору, оцінки, такі як Petri, є лише проксі для реального світу, а команда не перевіряла, чи збережуться вигоди вирівнювання після інтенсивного підкріплювального навчання на інших завданнях. Людську базову лінію, за їхніми словами, можливо, не представляє найсильніший дослідник вирівнювання.
Anthropic заявила, що планує покращити здатність Claude виявляти та усувати тонкі помилки, далі вивчати автоматизоване вирівнювання після навчання на продукційних моделях та проводити більш всебічні аналізи, ділячись оновленнями у міру просування роботи.












