Модели и платформы ИИ
Компания Anthropic выпускает Claude Opus 4.1, который побил рекорды по кодированию
Компания Anthropic сегодня выпустила Claude Opus 4.1, обновленную версию своего флагманского модели ИИ, которая достигает 74,5% точности в реальных задачах кодирования, устанавливая новый рекорд, при этом сохраняя ту же цену, что и у предыдущей версии.
Этот обновление является стратегическим шагом, поскольку отрасль ожидает выпуска GPT-5 от OpenAI, и Anthropic позиционирует свою последнюю модель как конкурентную альтернативу, которая excels в сложных задачах программирования и автономном выполнении задач. Компания обещает “значительно более крупные улучшения” в ближайшие недели, что указывает на усиление конкуренции среди ведущих разработчиков ИИ.
Ключевые улучшения производительности
Согласно объявлению Anthropic, Claude Opus 4.1 улучшает производительность предыдущей версии в трех ключевых областях: агентных задачах, требующих многоступенчатого рассуждения, реальных приложениях кодирования и аналитических возможностях рассуждения.
Модель достигла 74,5% на SWE-bench Verified, который измеряет способность ИИ выявлять и исправлять реальные ошибки в открытом программном обеспечении – превосходя предыдущий результат Claude Opus 4 в 72,5% и опережая модели o-series от OpenAI примерно на пять процентных пунктов.
GitHub отметил особенно сильные улучшения в возможностях рефакторинга кода в нескольких файлах, в то время как Rakuten Group подчеркнул точность модели в выявлении исправлений в больших кодовых базах без введения новых ошибок. Windsurf, стартап в области кодирования, сообщил, что Opus 4.1 обеспечил улучшение на один стандартный отклонение по сравнению с Opus 4 на их бенчмарке для младших разработчиков, сравнивая скачок производительности с предыдущим переходом от Sonnet 3.7 к Sonnet 4.
Доступность и интеграция
Обновленная модель сразу доступна для платных пользователей Claude через веб-интерфейс и Claude Code, а также через API Anthropic, Amazon Bedrock и Google Cloud Vertex AI. Разработчики могут получить доступ к новой модели, используя тег API, без увеличения цены по сравнению с предыдущей версией, сохраняя ценовую структуру, которая сделала Claude конкурентным на рынке предприятий.
Помимо программной инженерии, Claude Opus 4.1 демонстрирует улучшенные возможности в задачах анализа данных и исследований. Anthropic особенно подчеркнула улучшения в “отслеживании деталей и агентном поиске”, имея в виду способность модели поддерживать контекст в сложных, многоступенчатых операциях – критическую функцию для предприятий, требующих автономного решения проблем.
Отраслевой контекст и конкуренция
Тиминг выпуска, кажется, является намеренным, поскольку отраслевые отчеты предполагают, что OpenAI планирует представить GPT-5 в ближайшем будущем. Согласно The Information, GPT-5, как ожидается, будет фокусироваться на аналогичных областях – программировании, математике и агентных задачах – хотя аналитики прогнозируют, что улучшения могут быть постепенными, а не революционными.
Быстрая итерация моделей Claude – с этим обновлением, выпущенным всего через три месяца после запуска семейства Claude 4 в мае – отражает ускоряющийся темп развития ИИ, когда компании конкурируют за позицию на рынке предприятий и инструментов для разработчиков. Это следует истории Anthropic, позиционирующей себя как безопасную альтернативу OpenAI, сохраняя при этом конкурентные показатели производительности.
Технические детали и реализация
Системная карта показывает, что Claude Opus 4.1 является гибридной моделью рассуждения, способной работать с или без расширенных режимов мышления. Для бенчмарков, таких как SWE-bench Verified и Terminal-Bench, модель достигла своих результатов без расширенного мышления, в то время как другие бенчмарки, такие как GPQA Diamond и MMMU, использовали до 64K токенов расширенной емкости мышления.
Модель продолжает использовать ту же простую основу для тестирования SWE-bench, которую Anthropic использовала на протяжении всей семьи Claude 4 – оснащая модель только инструментом bash и инструментом редактирования файлов, который работает через замену строк. Этот минималистский подход контрастирует с более сложными реализациями, но все же достигает лидирующих результатов в отрасли.
Впереди
Anthropic рекомендует всем текущим пользователям Opus 4 обновиться до новой версии для всех случаев использования. Компания предоставила полную документацию, включая страницу модели и технические характеристики для разработчиков, интересующихся реализацией технологии.
Поскольку и Anthropic, и OpenAI готовятся к значительным выпускам, предстоящие недели могут оказаться решающими в определении лидерства в следующем поколении возможностей ИИ. По мере того, как модели ИИ становятся все более сложными в своих возможностях рассуждения и кодирования, конкуренция смещается от сырых показателей производительности к практической реализации и надежности в производственных средах.
FAQ (Claude Opus 4.1)
Как Claude Opus 4.1 улучшает задачи кодирования и рассуждения по сравнению с предыдущими версиями?
Claude Opus 4.1 достигает 74,5% на SWE-bench Verified (по сравнению с 72,5% в Opus 4), с заметными улучшениями в рефакторинге кода в нескольких файлах, отслеживании деталей в сложных кодовых базах и агентном поиске, что позволяет ему более эффективно обрабатывать задачи многоступенчатого рассуждения.
Какие ключевые реальные применения Claude Opus 4.1 в кодировании и агентах ИИ?
Модель excels в отладке больших кодовых баз без введения новых ошибок, автономном рефакторинге кода в нескольких файлах, глубоком анализе данных и исследовательских задачах, требующих устойчивого контекста – что делает ее идеальной для разработки программного обеспечения в предприятиях и автоматизации рабочих процессов.
Как результат Claude Opus 4.1 на SWE-bench отражает его возможности кодирования?
SWE-bench Verified измеряет способность ИИ выявлять и исправлять реальные ошибки в открытом программном обеспечении, и результат Claude Opus 4.1 в 74,5% представляет собой высший зарегистрированный результат, опережая модели o-series от OpenAI примерно на пять процентных пунктов.
В чем основные различия между Claude Opus 4.1 и другими моделями ИИ, такими как GitHub Copilot или ChatGPT?
В отличие от GitHub Copilot, который фокусируется на завершении кода, Claude Opus 4.1 обрабатывает полные рабочие процессы решения проблем, включая отладку и рефакторинг, предлагая при этом гибридные режимы рассуждения, которые могут переключаться между быстрыми ответами и расширенным мышлением для сложных задач – возможность, не доступная в стандартных реализациях ChatGPT.
Как разработчики и предприятия могут интегрировать Claude Opus 4.1 в свои рабочие процессы и платформы?
Разработчики могут получить доступ к Claude Opus 4.1 через API, используя тег “claude-opus-4-1-20250805”, через Amazon Bedrock, Google Cloud Vertex AI или через Claude Code для командной интеграции, с той же ценой, что и у Opus 4, и без необходимости изменений в коде для существующих реализаций.












