Модели и платформы ИИ

Антропик привносит Опус и Сонет в режим голоса Клода

mm
Добавьте Unite.AI в избранные источники в Google

Антропик открыл режим голоса Клода для более мощных моделей, позволяя проводить устные разговоры на уровнях Опус и Сонет вместо легковесной модели Хайку, которая обеспечивала эту функцию с момента ее запуска в 2025 году. Компания подтвердила это изменение в четверг, 23 июля 2026 года, позиционируя его как способ сделать разговор с Клодом полезным для реальной работы, а не для быстрого поиска.

Согласно документации по режиму голоса Антропика, эта функция теперь начинается с той модели, которую пользователь последний раз выбрал в текстовом чате, и запускает свою быструю версию по умолчанию, поэтому сессия наследует интеллект модели, стоящей за ней. Пользователи также могут переключаться между Хайку, Сонет и Опус в середине разговора через переключатель моделей. На практике это открывает работу, которую плохо обрабатывал состав Хайку: более длинные рассуждения, обратная связь о том, как сформулировать клиентскую презентацию, или запросы, требующие инструментов, такие как составление электронного письма и обновление календарного слота голосом.

Режим голоса также может обращаться к подключенным приложениям, включая Gmail, Google Календарь, Google Документы и Slack, поэтому устный запрос может получить контекст из собственных учетных записей пользователя или выполнить действие, такое как перенос встречи. Эта интеграция с приложениями является наиболее явным пунктом разделения с OpenAI, чей недавно обновленный режим голоса изменил способ, которым ChatGPT говорит, но все еще не может использовать внешние инструменты для выполнения работы.

Решение по продукту, а не новая модель голоса

Для всех, кто отслеживает, что на самом деле поставляют лаборатории на переднем крае, заметной частью этого выпуска является то, чего Антропик не построил. Здесь нет новой модели голоса, родной для речи. Антропик рассказал Engadget, что обновление “сосредоточено на интеллекте и доступе к инструментам”, и что компания “продолжает инвестировать в голос” с “больше, что можно поделиться позже в этом году”. Подlying трубопровод остается основанным на turno: Клод слушает, паузирует, чтобы подумать, затем говорит, и, как сообщается, полагается на внешнего поставщика текста в речь, такого как ElevenLabs, для устного вывода.

Маршрутизация модели рассуждений в голос меньше аудиоапгрейда, чем апгрейда возможностей. Устный запрос теперь может быть обработан моделью, которая планирует и работает над проблемой, где Хайку была настроена на быстрый ответ над рассмотренным. Изменение того, что может делать голос, исходит полностью от модели, стоящей за ним.

Это другой шаг, чем тот, на который делает ставку OpenAI. OpenAI вложила ресурсы в двунаправленную, родную для речи систему, GPT-Live, которая обрабатывает то, что вы говорите, и генерирует ответ одновременно, ближе к ритму телефонного разговора. Антропик вместо этого маршрутизирует свои наиболее сильные модели рассуждений на конвенциональный стек голоса и принимает ограничения разговора, которые с этим связаны. Поскольку сама модель голоса не изменилась, пользователи вряд ли заметят более плавное обработка прерываний или более естественный обмен.

Этот компромисс соответствует вопросу, с которым пользователи Клода уже сталкиваются в тексте: наиболее способная модель не всегда является правильной для задачи. Выбор более тяжелой модели покупает глубину за счет скорости, а голосовые разговоры особенно чувствительны к задержке. Размещение выбора в руках пользователя, а не установка всех на самый быстрый вариант по умолчанию, является практической сущностью обновления.

Что доступно, и чего не хватает

Улучшенный режим голоса выходит в бета-версию для всех пользователей на мобильных, настольных и веб-приложениях Антропика. Поскольку это вопрос маршрутизации существующих моделей, а не новой инфраструктуры, выпуск не ждет, пока Антропик поставит свежие аудиосистемы. Бесплатные учетные записи ограничены моделью Хайку и одним подключенным приложением, а уровни Сонет и Опус зарезервированы для платных подписчиков. Ввод на нескольких языках, добавленный ранее в этом году, включен, хотя Клод все еще не может обнаружить переключение языка самостоятельно; пользователи должны назвать язык, на котором они собираются говорить, либо вслух, либо в настройках голоса.

Переключатель моделей открывает Опус, Сонет и Хайку, но не Клод Фейбл 5, наиболее способную широко доступную модель Антропика, которая остается вне голоса на данный момент. Это упущение соответствует логике выпуска. Это о том, чтобы сопоставить голос с моделями рассуждений, которые большинство людей уже используют ежедневно, а не о продвижении границ того, что может сделать голосовой помощник.

Результат читается меньше как прорыв в голосе, чем как заявление о стратегии. Антропик делает ставку на то, что ценность голосового помощника исходит от модели, которая думает, и инструментов, к которым он может обратиться, а не от специальной аудиоархитектуры. Обещанные продолжения позже в этом году покажут, как долго эта позиция будет сохраняться, пока OpenAI и Google продолжают продвигать системы, родные для речи.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.