Моделі та платформи ШІ
Anthropic випускає Claude Opus 4.1, встановлює новий рекорд у тестах на кодування
Anthropic випускає Claude Opus 4.1 сьогодні, оновлену версію своєї флагманської моделі штучного інтелекту, яка досягає 74,5% точності у реальних завданнях кодування, встановлюючи новий рекорд, при цьому зберігаючи ту ж саму цінову політику, що і попередня версія.
Оновлення є стратегічним кроком, оскільки індустрія штучного інтелекту очікує випуску GPT-5 від OpenAI, при цьому Anthropic позиціонує свою останню модель як конкурентну альтернативу, яка excels у складних програмних завданнях та автономному виконанні завдань. Компанія обіцяє “суттєво більші поліпшення” у найближчі тижні, сигналізуючи про посилення конкуренції серед провідних розробників штучного інтелекту.
Ключові покращення продуктивності
За заявою Anthropic, Claude Opus 4.1 покращує продуктивність попередньої версії у трьох ключових областях: агентських завданнях, які вимагають багаторівневого мислення, реальних застосуваннях кодування та аналітичних можливостях.
Модель досягла 74,5% на SWE-bench Verified, який вимірює здатність штучного інтелекту визначати та виправляти реальні помилки у відкритому програмному забезпеченні – перевищуючи попередній результат Claude Opus 4 у 72,5% та випереджаючи моделі o-series від OpenAI приблизно на п’ять процентних пунктів.
GitHub особливо відзначив сильні здобутки у можливостях багаторівневого рефакторингу коду, тоді як Rakuten Group підкреслив точність моделі у визначенні виправлень у великих кодових базах без введення нових помилок. Windsurf, стартап, який займається кодуванням, повідомив, що Opus 4.1 забезпечив поліпшення на один стандартний відхил у порівнянні з Opus 4 на їхньому бенчмарку для молодших розробників, порівнюючи стрибок продуктивності з попереднім стрибком від Sonnet 3.7 до Sonnet 4.
Доступність та інтеграція
Оновлена модель негайно доступна платним користувачам Claude через веб-інтерфейс та Claude Code, а також через API Anthropic, Amazon (AMZN ) Bedrock та Google Cloud Vertex AI. Розробники можуть отримати доступ до нової моделі через API з тегом без підвищення ціни порівняно з попередньою версією, зберігаючи цінову структуру, яка зробила Claude конкурентоспроможним на ринку підприємств.
Поза програмним забезпеченням, Claude Opus 4.1 демонструє покращені можливості у завданнях аналізу даних та досліджень. Anthropic особливо підкреслив поліпшення у “відстежуванні деталей та агентському пошуку”, маючи на увазі здатність моделі зберігати контекст під час складних багаторівневих операцій – критична функція для підприємств, які вимагають автономного вирішення проблем.
Індустріальний контекст та конкуренція
Час випуску здається навмисним, оскільки індустріальні звіти свідчать про те, що OpenAI планує представити GPT-5 у найближчому майбутньому. За даними The Information, GPT-5 очікується зосередитися на подібних областях – програмуванні, математиці та агентських завданнях – хоча аналітики передбачають, що поліпшення можуть бути інкрементальними, а не революційними.
Швидка ітерація моделей Claude – з цією оновленою версією, випущеною всього за три місяці після випуску сім’ї моделей Claude 4 у травні – відображає прискорений темп розвитку штучного інтелекту, оскільки компанії конкурують за позицію на ринку підприємств та інструментів для розробників. Це слідує історії Anthropic щодо позиціонування себе як безпечної альтернативи OpenAI, зберігаючи при цьому конкурентоспроможні показники продуктивності.
Технічні деталі та реалізація
Картка системи вказує, що Claude Opus 4.1 є гібридною моделлю мислення, здатною працювати з розширеними режимами мислення або без них. Для бенчмарків, таких як SWE-bench Verified та Terminal-Bench, модель досягла результатів без розширених режимів мислення, тоді як інші бенчмарки, такі як GPQA Diamond та MMMU, використовували до 64K токенів розширених режимів мислення.
Модель продовжує використовувати ту ж саму просту основу для тестування SWE-bench, яку Anthropic використовував у сім’ї моделей Claude 4 – оснащуючи модель лише інструментом bash та інструментом редагування файлів, який працює через заміну рядків. Цій мінімалістський підхід контрастує з більш складними реалізаціями, проте все ж досягає лідерських результатів у галузі.
Погляд у майбутнє
Anthropic рекомендує всім поточним користувачам Opus 4 оновити до нової версії для всіх випадків використання. Компанія надала комплексну документацію, включаючи сторінку моделі та технічні характеристики для розробників, які цікавляться реалізацією технології.
З обома компаніями, Anthropic та OpenAI, які готуються до значних випусків, найближчі тижні можуть стати вирішальними для визначення лідерства у наступному поколінні можливостей штучного інтелекту. Коли моделі штучного інтелекту стають дедалі більш складними у своїх можливостях кодування та мислення, конкуренція переходить від суто показників продуктивності до практичної реалізації та надійності у виробничих середовищах.
Часто задавані питання (Claude Opus 4.1)
Як Claude Opus 4.1 покращує завдання кодування та мислення порівняно з попередніми версіями?
Claude Opus 4.1 досягає 74,5% на SWE-bench Verified (у порівнянні з 72,5% у Opus 4), з помітними поліпшеннями у багаторівневому рефакторингу коду, відстежуванні деталей у складних кодових базах та агентському пошуку, який дозволяє йому краще виконувати багаторівневі завдання мислення.
Які ключові реальні застосування для Claude Opus 4.1 у кодуванні та агентських завданнях?
Модель excels у виправленні великих кодових баз без введення нових помилок, автономному рефакторингу коду у декілька файлів, глибокому аналізі даних та завданнях досліджень, які вимагають збереження контексту – роблячи її ідеальною для розробки програмного забезпечення підприємств та автоматизованої оптимізації робочих процесів.
Як продуктивність Claude Opus 4.1 на SWE-bench відображає його можливості кодування?
SWE-bench Verified вимірює здатність штучного інтелекту визначати та виправляти реальні помилки у відкритому програмному забезпеченні, і 74,5% результату Claude Opus 4.1 представляє найвищий публічно заявлений результат, випереджаючи моделі o-series від OpenAI приблизно на п’ять процентних пунктів.
Які основні відмінності між Claude Opus 4.1 та іншими моделями штучного інтелекту, такими як GitHub Copilot або ChatGPT?
На відміну від GitHub Copilot, який зосереджується на завершенні коду, Claude Opus 4.1 займається повним вирішенням завдань, включаючи виправлення та рефакторинг, пропонуючи гібридні режими мислення, які можуть перемикатися між швидкими відповідями та розширеним мисленням для складних завдань – можливістю, якої немає у стандартних реалізаціях ChatGPT.
Як розробники та підприємства можуть інтегрувати Claude Opus 4.1 у свої робочі процеси та платформи?
Розробники можуть отримати доступ до Claude Opus 4.1 через API з тегом “claude-opus-4-1-20250805”, через Amazon Bedrock, Google Cloud Vertex AI або через Claude Code для командної інтеграції, з тією ж самою ціновою політикою, що й Opus 4, без необхідності змін у існуючих реалізаціях.












