Моделі та платформи ШІ

Anthropic представляє Opus і Sonnet у режимі голосу Claude

mm
Додайте Unite.AI до бажаних джерел у Google

Anthropic відкрив режим голосу Claude для своїх більш потужних моделей, дозволяючи розмовні розмови проводитися на рівнях Opus і Sonnet замість легкої моделі Haiku, яка керувала цією функцією з моменту її запуску в 2025 році. Компанія підтвердила ці зміни у четвер, 23 липня 2026 року, позиціонуючи їх як спосіб зробити розмови з Claude корисними для реальної роботи, а не лише для швидкого пошуку.

За даними документації Anthropic щодо режиму голосу, ця функція тепер починається з тієї моделі, яку користувач востаннє вибрав у текстовому чаті, і запускає свою найшвидшу версію за замовчуванням, тому сесія успадковує інтелект моделі, яка за нею стоїть. Користувачі також можуть перемикатися між Haiku, Sonnet і Opus під час розмови за допомогою вибору моделі. На практиці це відкриває роботу, з якою Haiku-only налаштування справлялося погано: довше обґрунтування, відгуки про те, як ви формулюєте клієнтську презентацію, або інструментально-важливі запити, такі як складання електронного листа та оновлення календаря голосом.

Режим голосу також може звертатися до підключених додатків, включаючи Gmail, Google Calendar, Google Docs та Slack, тому голосовий запит може витягувати контекст з власних облікових записів користувача або виконувати дії, такі як перенос зустрічі. Ця інтеграція з додатками є найяснішою точкою відокремлення від OpenAI, чий оновлений режим голосу змінив спосіб, яким ChatGPT спілкується, але все ще не може використовувати зовнішні інструменти для виконання роботи.

Рішення щодо продукту, а не нової голосової моделі

Для тих, хто відстежує, що фактично розробляють лабораторії, найбільш помітною частиною цього релізу є те, чого Anthropic не створила. Тут немає нової голосової моделі, орієнтованої на мовлення. Anthropic повідомила Engadget, що оновлення “зосереджено на інтелекті та доступі до інструментів” і що вони “продовжують інвестувати в голос” з “більше, що буде поділено пізніше цього року”. Підтримувальний конвеєр залишається поворотним: Claude слухає, паузує, щоб подумати, а потім говорить, і, як повідомляється, він використовує зовнішнього постачальника тексту-в-голос, такого як ElevenLabs, для голосового виводу.

Маршрутизація моделі раціонального мислення у голос є меншою аудіо-упгрейдом, ніж можливістю. Голосовий запит тепер може бути оброблений моделлю, яка планує та працює над проблемою, тоді як Haiku була налаштована на швидку відповідь над обґрунтованою. Зміна того, що голос може робити, відбувається повністю з моделі, яка за ним стоїть.

Це інша ставка, ніж та, яку робить OpenAI. OpenAI вклала ресурси у двонаправлену, орієнтовану на мовлення систему, GPT-Live, яка обробляє те, що ви говорите, і генерує відповідь одночасно, ближче до ритму телефонного дзвінка. Anthropic натомість маршрутизує свої найсильніші моделі раціонального мислення на конвенційний голосовий стек і приймає розмовні обмеження, які з цим приходять. Через те, що голосова модель сама по собі незмінна, користувачі навряд чи помітять більш плавне оброблення переривань або більш природний обмін.

Цей компроміс накладається на питання, з яким користувачі Claude вже стикаються у тексті: найбільш здатна модель не завжди правильна для завдання. Вибір більш важкої моделі купує глибину за рахунок швидкості, а голосові розмови особливо чутливі до затримки. Покладання вибору на користувача, а не встановлення всіх на найшвидший варіант за замовчуванням, є практичним змістом оновлення.

Що доступно, а чого бракує

Оновлений режим голосу вводиться у бета-версію для всіх користувачів на мобільних, настільних та веб-додатках Anthropic. Через те, що це питання маршрутизації існуючих моделей, а не нових інфраструктур, ролл-аут не чекає на те, поки Anthropic відправить свіжі аудіосистеми. Безкоштовні облікові записи обмежені моделлю Haiku та одним підключеним додатком, тоді як рівні Sonnet і Opus зарезервовані для платних абонентів. Багатомовний вхід, доданий на початку цього року, включений, хоча Claude все ще не може визначити зміну мови самостійно; користувачі повинні назвати мову, яку вони ось-ось промовлять, або вголос, або в налаштуваннях голосу.

Вибір показує Opus, Sonnet і Haiku, але не Claude Fable 5, найбільш здатну широко доступну модель Anthropic, яка залишається поза голосом наразі. Це опущення відповідає логіці релізу. Це про те, щоб відповідати голосові моделям раціонального мислення, які більшість людей вже використовують щодня, а не про те, щоб 推ити межі того, що може зробити голосовий помічник.

Результат виглядає менш як прорив у голосовій технології, ніж як заява стратегії. Anthropic робить ставку на те, що цінність голосового помічника полягає в моделі, яка думає, і інструментах, до яких він може звертатися, а не у спеціально створеній аудіо-архітектурі. Їх обіцяні подальші оновлення пізніше цього року покажуть, як довго ця позиція тримається, поки OpenAI та Google продовжують просувати системи, орієнтовані на мовлення, свої.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.