Модели и платформы ИИ

Anthropic выпускает Claude Sonnet 5.5 по прежним ценам Sonnet 5

mm
Добавьте Unite.AI в избранные источники в Google

Anthropic выпустила Claude Sonnet 5.5 28 сентября 2026 года, вторую модель в семействе Claude 5.5. Модель сохраняет цены Claude Sonnet 5 — $2 за миллион входных токенов и $10 за миллион выходных токенов, и Anthropic заявляет, что она генерирует вывод более чем на 30 % быстрее, при этом стоимость задачи снижается до 30 %.

В своем анонсе выпуска Anthropic описала Sonnet 5.5 как более быструю и более дешёвую альтернативу Claude Opus 5.5, которую, по словам компании, создали для сложных задач, требующих тщательного суждения. Sonnet 5.5 лучше всего справляется с чётко определёнными повседневными задачами, исправлением ошибок и созданием отшлифованных документов, презентаций и таблиц, заявила Anthropic, добавив, что у модели также острый глаз на дизайн.

Claude Sonnet 5.5 доступен на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure, под идентификатором модели claude-sonnet-5-5, и предлагается с нулевым хранением данных, как и Opus 5.5 и Sonnet 5.

Сообщённые результаты бенчмарков

Anthropic сообщает, что Sonnet 5.5 набирает 70,6 % в Terminal‑Bench 4.0, оценке агентного кодинга, по сравнению с 10,3 % у Sonnet 5, при этом указанный результат Opus 5.5 составляет 66,4 %, отражая его Xhigh‑effort. В основном наборе FrontierCode 1.1 Sonnet 5.5 показывает 46,2 % при Max‑effort и 52,1 % при Xhigh, в сравнении с 42,4 % у Sonnet 5, 54,4 % у Opus 5.5 и 49,3 % у GPT‑6 Sol от OpenAI. Сообщённые результаты CursorBench 4.0 составляют 55,5 % для Sonnet 5.5, 34,1 % для Sonnet 5 и 57,8 % для Opus 5.5.

В оценках знаний о работе компания сообщает, что показатель GDPval‑AA v2.1 для Sonnet 5.5 составляет 1844, что на два пункта ниже 1846 у Opus 5.5 и примерно на 400 пунктов выше 1449 у Sonnet 5, а показатель AA‑Briefcase v1.1 — 1811 против 1822 у Opus 5.5 и 1359 у Sonnet 5. В объявлении также указаны 64,5 % с инструментами в Humanity’s Last Exam, 80,1 % частичного кредита в OSWorld 2.1 и 61,6 % без инструментов в Chartography, тесте визуального распознавания диаграмм. Anthropic заявляет, что Sonnet 5.5 — первая модель Sonnet, обыгравшая Pokémon Red, работая только со скриншотами.

Компания предупреждает, что показатели бенчмарков отражают лишь один аспект возможностей модели, и отмечает, что в собственных тестах и тестах внешних экспертов Opus 5.5 явно превосходит в сложных, открытых задачах, требующих длительного суждения. В сноске указано, что Artificial Analysis запускала GDPval‑AA и AA‑Briefcase на предрелизном развертывании с ошибкой структурированных выводов, которая была исправлена и, если что, может недооценивать производительность Sonnet 5.5. Другая сноска отмечает, что OpenAI недавно исправила ошибку понимания изображений в GPT‑6 Sol, которую сторонние оценки ещё могут не учитывать.

Результаты ранних тестировщиков

Вице‑президент по ИИ в CodeRabbit Дэвид Локер сказал, что Sonnet 5.5 демонстрирует более точное суждение, чем Sonnet 5, на разных уровнях сложности, при этом использует значительно меньше выходных токенов, и что CodeRabbit планирует уже сейчас перенести простые и умеренные проверки на эту модель, а в ближайшие недели — добавить ещё. Руководитель инженерного отдела Base44 AI Габриэль Гринберг сообщил, что в 118 реальных сборках приложений Sonnet 5.5 в среднем требовал 3,6 итераций на сборку против 7,7 у Opus 5, при этом имел наименьшее количество неудачных вызовов инструментов среди всех моделей, сравниваемых Base44.

Главный инженер Slack Кертис Аллен сообщил о примерно 14 % меньшем количестве выходных токенов в офлайн‑оценках Slackbot без изменения подсказок. Директор по ИИ в Zendesk Абхинай Катууриа сказал, что заявки обрабатывались на 20 % быстрее, чем с моделями Claude, которые Zendesk использует в продакшене. Balyasny Asset Management сообщил о примерно 121 000 токенов на ответ против 497 000 у Sonnet 5 в частном наборе из 2 441 финансовой задачи. Box сообщил о результатах в 2,4 раза быстрее при 12 % меньшем общем количестве токенов, а Atlassian заявила, что клиенты могут запускать Rovo Agents до 30 % быстрее, чем с Sonnet 5.

Цены, скорость и миграция

Указанные цены Sonnet 5.5 полностью совпадают с ценами Sonnet 5: $2 за миллион входных токенов, $10 за миллион выходных токенов, $0,20 за миллион токенов чтения кэша и $2,50 за миллион токенов записи кэша. Opus 5.5 указана по $4 за вход, $20 за вывод и $5 за запись кэша. Anthropic заявляет, что Sonnet 5.5 обычно требует значительно меньше токенов для той же работы и является самой быстрой моделью Sonnet на сегодняшний день.

Модель предлагает пять откалиброванных уровней усилий: low, medium, high, xhigh и max. По умолчанию — Medium в Claude Code и приложениях Claude, а на платформе Claude — High, что также является значением по умолчанию API.

Anthropic’s руководство по миграции перечисляет критические изменения для разработчиков, переходящих с Sonnet 5. Адаптивное мышление теперь включено по умолчанию, отключённая настройка мышления возвращает ошибку 400, и разработчики, которые запускали Sonnet без мышления, должны переключиться на новую настройку инструментов, самую низкую доступную, перед миграцией. Принудительный выбор инструмента отклоняется в пользу автоматического выбора инструмента в сочетании со строгими инструментами, а минимальный кэшируемый запрос снижается до 512 токенов с 1 024 в Sonnet 5. Документация также перечисляет пять категорий отказов, охватывающих кибер, био, frontier llm, рассуждение извлечение и общее вред, и отмечает, что серверные попытки отката повторяются только при отклонениях кибер и frontier_llm в Sonnet 5.

Выводы о безопасности и меры защиты

Поскольку киберспособности Sonnet 5.5 сопоставимы с Opus 5, Anthropic заявила, что это первая модель Sonnet, выпущенная с киберзащитами и резервными механизмами, используемыми в самых мощных моделях компании. системная карта сообщает, что при отключённых защи́тах Sonnet 5.5 в среднем генерировал 11.53 флага возможностей и имел 80% уровень захвата в ExploitBench, а также создал 178 полноценных эксплойтов произвольного выполнения кода, против одного у Sonnet 5. Он завершил 46.1% задач CyScenarioBench по сравнению с 0.7% у Sonnet 5 и создал 50 перехватов управления потоком в Binary Exploitation Benchmark против 3 у Sonnet 5.

Киберзащиты работают в три этапа: проверка внутренних активаций модели, лёгкий классификатор внутри модели и отдельный обученный классификатор LLM. Карта сообщает о 99.43% полноте на наборе покрытий киберугроз и о 21.0% уровне успешных атак в оценке устойчивости к rewind‑attacker, что улучшилось по сравнению с 57.2% у Sonnet 5, при этом пользователям рекомендуется ожидать увеличения отказов даже при безвредных задачах кибербезопасности. Запросы с более высоким риском явно переключаются на Sonnet 5, а расширенная Cyber Verification Program скоро предоставит проверенным защитникам поуровневый доступ к расширенным возможностям в Sonnet 5.5, Opus 5.5 и Claude Mythos.

Защиты в области биологии используют те же классификаторы вредоносного использования, что и в Opus 5, без резервной модели, а Программа верификации в области биологических наук Anthropic обеспечивает доступ ко всему спектру биологических работ. Sonnet 5.5 также является первой моделью Sonnet с классификаторами безопасности, блокирующими извлечение рассуждений, и расширяет сохранённое мышление, чтобы мышление модели нельзя было отделить от учётной записи, её создавшей.

В результате автоматического поведенческого аудита Anthropic, охватывающего примерно 1 850 сценариев, компания сообщает, что Sonnet 5.5 улучшает или соответствует Sonnet 5 по большинству показателей согласованности, сопротивляемости злоупотреблениям и честности, фиксирует самый низкий уровень попыток выхода из песочницы среди протестированных моделей и демонстрирует более нечитаемое мышление, чем многие предыдущие модели. Системная карта указывает, что Sonnet 5.5 не превышает новых порогов политики Responsible Scaling Policy, считается соответствующим порогам CB-1 и Autonomy-1 этой политики и обладает низким оценённым риском катастрофического рассогласования. Надёжный предел знаний модели — июнь 2026 г.

Anthropic заявила, что Claude Haiku 5.5, разработанный для приложений с высоким объёмом и чувствительных к стоимости, присоединится к семейству Claude 5.5 в ближайшие недели.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.