Модели и платформы ИИ

Компания Anthropic выпускает Claude Opus 4.1, который побил рекорды по кодированию

mm
Добавьте Unite.AI в избранные источники в Google

Компания Anthropic сегодня выпустила Claude Opus 4.1, обновленную версию своего флагманского модели ИИ, которая достигает 74,5% точности в реальных задачах кодирования, устанавливая новый рекорд, при этом сохраняя ту же цену, что и у предыдущей версии.

Этот обновление является стратегическим шагом, поскольку отрасль ожидает выпуска GPT-5 от OpenAI, и Anthropic позиционирует свою последнюю модель как конкурентную альтернативу, которая excels в сложных задачах программирования и автономном выполнении задач. Компания обещает “значительно более крупные улучшения” в ближайшие недели, что указывает на усиление конкуренции среди ведущих разработчиков ИИ.

Ключевые улучшения производительности

Согласно объявлению Anthropic, Claude Opus 4.1 улучшает производительность предыдущей версии в трех ключевых областях: агентных задачах, требующих многоступенчатого рассуждения, реальных приложениях кодирования и аналитических возможностях рассуждения.

Модель достигла 74,5% на SWE-bench Verified, который измеряет способность ИИ выявлять и исправлять реальные ошибки в открытом программном обеспечении – превосходя предыдущий результат Claude Opus 4 в 72,5% и опережая модели o-series от OpenAI примерно на пять процентных пунктов.

GitHub отметил особенно сильные улучшения в возможностях рефакторинга кода в нескольких файлах, в то время как Rakuten Group подчеркнул точность модели в выявлении исправлений в больших кодовых базах без введения новых ошибок. Windsurf, стартап в области кодирования, сообщил, что Opus 4.1 обеспечил улучшение на один стандартный отклонение по сравнению с Opus 4 на их бенчмарке для младших разработчиков, сравнивая скачок производительности с предыдущим переходом от Sonnet 3.7 к Sonnet 4.

Доступность и интеграция

Обновленная модель сразу доступна для платных пользователей Claude через веб-интерфейс и Claude Code, а также через API Anthropic, Amazon (AMZN ) Bedrock и Google Cloud Vertex AI. Разработчики могут получить доступ к новой модели, используя тег API, без увеличения цены по сравнению с предыдущей версией, сохраняя ценовую структуру, которая сделала Claude конкурентным на рынке предприятий.

Помимо программной инженерии, Claude Opus 4.1 демонстрирует улучшенные возможности в задачах анализа данных и исследований. Anthropic особенно подчеркнула улучшения в “отслеживании деталей и агентном поиске”, имея в виду способность модели поддерживать контекст в сложных, многоступенчатых операциях – критическую функцию для предприятий, требующих автономного решения проблем.

Отраслевой контекст и конкуренция

Тиминг выпуска, кажется, является намеренным, поскольку отраслевые отчеты предполагают, что OpenAI планирует представить GPT-5 в ближайшем будущем. Согласно The Information, GPT-5, как ожидается, будет фокусироваться на аналогичных областях – программировании, математике и агентных задачах – хотя аналитики прогнозируют, что улучшения могут быть постепенными, а не революционными.

Быстрая итерация моделей Claude – с этим обновлением, выпущенным всего через три месяца после запуска семейства Claude 4 в мае – отражает ускоряющийся темп развития ИИ, когда компании конкурируют за позицию на рынке предприятий и инструментов для разработчиков. Это следует истории Anthropic, позиционирующей себя как безопасную альтернативу OpenAI, сохраняя при этом конкурентные показатели производительности.

Технические детали и реализация

Системная карта показывает, что Claude Opus 4.1 является гибридной моделью рассуждения, способной работать с или без расширенных режимов мышления. Для бенчмарков, таких как SWE-bench Verified и Terminal-Bench, модель достигла своих результатов без расширенного мышления, в то время как другие бенчмарки, такие как GPQA Diamond и MMMU, использовали до 64K токенов расширенной емкости мышления.

Модель продолжает использовать ту же простую основу для тестирования SWE-bench, которую Anthropic использовала на протяжении всей семьи Claude 4 – оснащая модель только инструментом bash и инструментом редактирования файлов, который работает через замену строк. Этот минималистский подход контрастирует с более сложными реализациями, но все же достигает лидирующих результатов в отрасли.

Впереди

Anthropic рекомендует всем текущим пользователям Opus 4 обновиться до новой версии для всех случаев использования. Компания предоставила полную документацию, включая страницу модели и технические характеристики для разработчиков, интересующихся реализацией технологии.

Поскольку и Anthropic, и OpenAI готовятся к значительным выпускам, предстоящие недели могут оказаться решающими в определении лидерства в следующем поколении возможностей ИИ. По мере того, как модели ИИ становятся все более сложными в своих возможностях рассуждения и кодирования, конкуренция смещается от сырых показателей производительности к практической реализации и надежности в производственных средах.

FAQ (Claude Opus 4.1)

Как Claude Opus 4.1 улучшает задачи кодирования и рассуждения по сравнению с предыдущими версиями?

Claude Opus 4.1 достигает 74,5% на SWE-bench Verified (по сравнению с 72,5% в Opus 4), с заметными улучшениями в рефакторинге кода в нескольких файлах, отслеживании деталей в сложных кодовых базах и агентном поиске, что позволяет ему более эффективно обрабатывать задачи многоступенчатого рассуждения.

Какие ключевые реальные применения Claude Opus 4.1 в кодировании и агентах ИИ?

Модель excels в отладке больших кодовых баз без введения новых ошибок, автономном рефакторинге кода в нескольких файлах, глубоком анализе данных и исследовательских задачах, требующих устойчивого контекста – что делает ее идеальной для разработки программного обеспечения в предприятиях и автоматизации рабочих процессов.

Как результат Claude Opus 4.1 на SWE-bench отражает его возможности кодирования?

SWE-bench Verified измеряет способность ИИ выявлять и исправлять реальные ошибки в открытом программном обеспечении, и результат Claude Opus 4.1 в 74,5% представляет собой высший зарегистрированный результат, опережая модели o-series от OpenAI примерно на пять процентных пунктов.

В чем основные различия между Claude Opus 4.1 и другими моделями ИИ, такими как GitHub Copilot или ChatGPT?

В отличие от GitHub Copilot, который фокусируется на завершении кода, Claude Opus 4.1 обрабатывает полные рабочие процессы решения проблем, включая отладку и рефакторинг, предлагая при этом гибридные режимы рассуждения, которые могут переключаться между быстрыми ответами и расширенным мышлением для сложных задач – возможность, не доступная в стандартных реализациях ChatGPT.

Как разработчики и предприятия могут интегрировать Claude Opus 4.1 в свои рабочие процессы и платформы?

Разработчики могут получить доступ к Claude Opus 4.1 через API, используя тег “claude-opus-4-1-20250805”, через Amazon Bedrock, Google Cloud Vertex AI или через Claude Code для командной интеграции, с той же ценой, что и у Opus 4, и без необходимости изменений в коде для существующих реализаций.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.