Моделі та платформи ШІ

Anthropic випускає Claude Sonnet 5.5 за незмінними цінами Sonnet 5

mm
Додайте Unite.AI до бажаних джерел у Google

Anthropic випустила Claude Sonnet 5.5 28 вересня 2026 року, другу модель у сімействі Claude 5.5. Модель зберігає ціни Claude Sonnet 5 — $2 за мільйон вхідних токенів і $10 за мільйон вихідних токенів, і Anthropic заявляє, що вона генерує вихід більш ніж на 30 % швидше, при цьому вартує до 30 % менше за завдання у її тестах.

In its оголошення про випуск, Anthropic описала Sonnet 5.5 як швидший, менш дорогий доповнення до Claude Opus 5.5, який, за словами компанії, створений для складної роботи, що вимагає ретельного розсуду. Sonnet 5.5 найкраще підходить для чітко визначених щоденних завдань, виправлення помилок та створення відполірованих документів, презентацій і електронних таблиць, зазначила Anthropic, додаючи, що вона також має гострий смак до дизайну.

Claude Sonnet 5.5 доступна на всіх платформах, включаючи Amazon Web Services, Google Cloud і Microsoft Azure, під ідентифікатором моделі claude-sonnet-5-5, і пропонується без збереження даних, як і Opus 5.5 та Sonnet 5.

Повідомлені результати бенчмарків

Anthropic повідомляє, що Sonnet 5.5 набрав 70,6 % у Terminal‑Bench 4.0, оцінці агентного кодування, у порівнянні з 10,3 % у Sonnet 5, при цьому вказаний результат Opus 5.5 становить 66,4 %, що відповідає його результату Xhigh‑effort. У головному наборі FrontierCode 1.1 Sonnet 5.5 показав 46,2 % при Max effort і 52,1 % при Xhigh, у порівнянні з 42,4 % у Sonnet 5, 54,4 % у Opus 5.5 і 49,3 % у GPT‑6 Sol від OpenAI. Зафіксовані результати CursorBench 4.0 становлять 55,5 % для Sonnet 5.5, 34,1 % для Sonnet 5 і 57,8 % для Opus 5.5.

У оцінках знань-роботи компанія повідомляє, що Sonnet 5.5 отримав бал GDPval‑AA v2.1 у розмірі 1844, що на два пункти нижче за 1846 у Opus 5.5 і приблизно на 400 пунктів вище за 1449 у Sonnet 5, а також бал AA‑Briefcase v1.1 у розмірі 1811 у порівнянні з 1822 у Opus 5.5 та 1359 у Sonnet 5. Оголошення також зазначає 64,5 % з інструментами у Humanity’s Last Exam, 80,1 % частковий кредит у OSWorld 2.1 та 61,6 % без інструментів у Chartography, тесті розпізнавання візуальних діаграм. Anthropic стверджує, що Sonnet 5.5 – перша модель Sonnet, яка обігнала Pokémon Red, працюючи лише зі скріншотами.

Компанія застерігає, що бенчмаркові результати відображають лише один аспект можливостей моделі, і зазначає, що у власних тестах та тестах зовнішніх оцінювачів Opus 5.5 явно переважає у складній, відкритій роботі, що вимагає тривалого розсуду. У примітці зазначено, що Artificial Analysis запускала GDPval‑AA та AA‑Briefcase на передрелізному розгортанні з помилкою у структурованих виходах, яка вже виправлена і, навпаки, могла би занижувати продуктивність Sonnet 5.5. Інша примітка вказує, що OpenAI нещодавно виправив помилку розуміння зображень у GPT‑6 Sol, яку поки що можуть не відображати результати сторонніх оцінок.

Результати ранніх тестувальників

Віце-президент з ШІ у CodeRabbit, Девід Локер, заявив, що Sonnet 5.5 демонструє кращий розсуд порівняно з Sonnet 5 на різних рівнях складності, при цьому споживає значно менше вихідних токенів, і що CodeRabbit планує вже зараз перенести прості та середні огляди на цю модель, а в наступні тижні – ще більше. Керівник інженерії AI у Base44, Габріель Грінберг, повідомив, що за результатами 118 реальних збірок додатків Sonnet 5.5 у середньому здійснював 3,6 ітерації на збірку проти 7,7 у Opus 5, і мав найменшу кількість невдалих викликів інструментів серед усіх моделей, які порівнював Base44.

Головний інженер Slack Курт Аллен повідомив про приблизно 14 % менше вихідних токенів у офлайн‑тестуваннях Slackbot без змін у підказках. Директор з ШІ у Zendesk, Абхінаї Катуурія, заявив, що заявки обробляються на 20 % швидше, ніж за допомогою моделей Claude, які використовує Zendesk у продакшн. Balyasny Asset Management повідомила про близько 121 000 токенів на відповідь у порівнянні з 497 000 у Sonnet 5 у приватному наборі з 2 441 фінансових завдань. Box повідомив про результати в 2,4 рази швидше при 12 % меншій кількості загальних токенів, а Atlassian зазначив, що клієнти можуть запускати Rovo Agents до 30 % швидше, ніж з Sonnet 5.

Ціноутворення, швидкість та міграція

Зазначені ціни Sonnet 5.5 точно відповідають Sonnet 5: $2 за мільйон вхідних токенів, $10 за мільйон вихідних токенів, $0,20 за мільйон токенів читання кешу та $2,50 за мільйон токенів запису кешу. Opus 5.5 вказує $4 за вхід, $20 за вихід та $5 за запис у кеш. Anthropic стверджує, що Sonnet 5.5 зазвичай потребує значно менше токенів для тієї ж роботи і є найшвидшою моделлю Sonnet на сьогодні.

Модель пропонує п’ять переналаштованих рівнів зусиль: low, medium, high, xhigh та max. За замовчуванням – Medium у Claude Code та додатках Claude і High на Claude Platform, що також є стандартом API.

Anthropic’s посібник з міграції перераховує критичні зміни для розробників, які переходять з Sonnet 5. Адаптивне мислення тепер працює за замовчуванням, вимкнене налаштування мислення повертає помилку 400, і розробники, які запускали Sonnet без мислення, повинні переключитися на нове інструментальне налаштування, найнижче доступне, перед міграцією. Примусове вибирання інструменту відхиляється на користь автоматичного вибору інструменту у парі зі строгими інструментами, і мінімальний кешований запит зменшується до 512 токенів з 1 024 у Sonnet 5. Документація також перераховує п’ять категорій причин відмови, що охоплюють кібер, біо, frontierllm, reasoningвидобуток, і загальніharms, і зазначає, що серверні повторні спроби fallback застосовуються лише до відмов кібер та frontier_llm у Sonnet 5.

Висновки щодо безпеки та захисних механізмів

Оскільки кіберможливості Sonnet 5.5 порівнянні з можливостями Opus 5, Anthropic заявила, що це перша модель Sonnet, запущена з кіберзахисними механізмами та резервними варіантами, які використовуються в найпотужніших моделях компанії. system card повідомляє, що при вимкнених захисних механізмах Sonnet 5.5 у середньому отримав 11.53 прапорців можливостей і 80% рівень захоплення в ExploitBench та створив 178 повних експлойтів довільного виконання коду, проти одного у Sonnet 5. Він завершив 46.1% завдань CyScenarioBench у порівнянні з 0.7% у Sonnet 5 і створив 50 перехоплень управління потоком у Benchmark’у бінарної експлуатації проти 3 у Sonnet 5.

Кіберзахисні механізми працюють у три етапи: проба внутрішніх активацій моделі, легкий класифікатор у самій моделі та окремий навчений класифікатор LLM. Карта повідомляє про 99.43% відновлення у наборі покриття кібершкідливості та 21.0% успішність атак у оцінці стійкості до переписування атакувальника, що покращилося порівняно з 57.2% у Sonnet 5, при цьому користувачам радять очікувати збільшення відмов навіть у безпечних завданнях кібербезпеки. Запити з вищим ризиком явно переходять на Sonnet 5, а розширена Cyber Verification Program незабаром надасть перевіреним захисникам багаторівневий доступ до розширених можливостей у Sonnet 5.5, Opus 5.5 та моделях Claude Mythos.

Біологічні захисні механізми є тими ж класифікаторами шкідливого використання, які впроваджені для Opus 5, без резервної моделі, а Life Sciences Verification Program Anthropic охоплює доступ до всього спектру біологічних робіт. Sonnet 5.5 також є першою моделлю Sonnet з безпековими класифікаторами, що блокують вилучення міркувань, і розширює збережене мислення, щоб мислення моделі не могло бути відокремлене від облікового запису, який його створив.

У результаті автоматизованого аудиту поведінки Anthropic, проведеного приблизно за 1 850 сценаріями, компанія повідомляє, що Sonnet 5.5 покращує або відповідає Sonnet 5 за більшістю показників вирівнювання, стійкості до зловживань та чесності, фіксує найнижчий рівень спроб виходу з пісочниці серед протестованих моделей і демонструє більш нечітке мислення, ніж багато попередніх моделей. Система повідомляє, що Sonnet 5.5 не перевищує нових порогових значень Responsible Scaling Policy, вважається що відповідає порогам CB-1 та Autonomy-1, і має низький оцінений ризик катастрофічного невідповідності. Надійний межовий термін знань моделі — червень 2026.

Anthropic заявила, що Claude Haiku 5.5, створений для високих обсягів і чутливих до вартості застосувань, приєднається до сімейства Claude 5.5 протягом кількох наступних тижнів.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.