Модели и платформы ИИ

Decagon представляет голосового агента Voice 3 с речевой моделью Chord

mm
Добавьте Unite.AI в избранные источники в Google

Decagon представила Voice 3, своего голосового AI‑агента для клиентских звонков, и Chord, первую речевую модель от Decagon Labs, на мероприятии компании Decagon Dialogues 2026 1 октября 2026 года, заявив, что агент поддерживает более 70 языков и работает на новой дуплексной архитектуре.

В Voice 3 анонс, автором которого являются менеджер продукта Quique Lores и старший менеджер по маркетингу продукта Ariana Xiang, Decagon описала Voice 3 как своего самого продвинутого голосового AI‑агента на сегодняшний день. Агент говорит через Chord и был запущен вместе с тремя другими продуктами на Decagon Dialogues 2026.

В Decagon Dialogues 2026 пост соучредители Jesse Zhang, генеральный директор Decagon, и Ashwin Sreenivas, президент компании, назвали остальные три релиза: Personal Agent Gateway, который определяет персональные AI‑агенты клиентов и предоставляет им выделенный канал для взаимодействия с бизнесом; Agent Modules, которые расширяют агента на пути, выходящие за пределы поддержки; и Duet Apprentice, который позволяет системе Duet компании обучать бизнес на основе внутренних ресурсов и эскалированных клиентских разговоров.

Предприятия впервые задействовали агентов Decagon для решения заявок в службу поддержки, написали соучредители, и теперь эти агенты квалифицируют лиды, регистрируют клиентов, собирают платежи и развивают отношения. Четыре релиза расширяют способы, которыми клиенты получают то, что Decagon называет AI‑консьержем, и то, что он может для них сделать.

Voice 3 и речевая модель Chord

Chord — первая голосовая модель, обученная Decagon Labs, и компания заявляет, что её дообучали на реальных разговорах с клиентами, а не для широкого спектра применений, характерных для большинства голосовых моделей, от озвучивания аудиокниг до озвучки видеоигр. Decagon сообщает, что модель формирует речь фраза за фразой, замедляясь для подтверждающего кода или телефонного номера и затем возвращаясь к разговорному темпу, вместо использования единой глобальной настройки скорости. Существующие настройки кастомизации голоса сохраняются: выбор голоса, произношение специфических для бизнеса терминов и подача, настроенная под бизнес.

Согласно объявлению, Voice 3 поддерживает более 70 языков без необходимости создания отдельного агента для каждого из них. Он определяет язык звонящего и переключается автоматически, даже если звонящий меняет язык в середине предложения, а Decagon утверждает, что его голосовые модели, адаптированные к конкретным локалям, отражают манеру речи людей в каждом рынке и проходят проверку носителями языка перед выпуском.

Decagon заявляет, что Chord обучена на лицензированных данных и согласованных голосовых талантах, но никогда не использует данные, принадлежащие клиентам. Кристиан Niedworok, руководитель цифровой сервисной коммуникации в Deutsche Telekom, сказал в объявлении, что годы использования IVR‑систем научили клиентов говорить короткими фрагментами лишь для того, чтобы попасть к человеку, и что голос Decagon звучит так, будто он действительно слушает и поддерживает ход разговора, вместо того чтобы замолчать, пока работает. Операционный директор Chime Janelle Sallenave сказала, что Decagon Voice позволяет Chime сочетать высокую производительность и бесшовную кастомизацию бренда с кросс‑канальной памятью, поддерживая каждое взаимодействие связанным и соответствующим ценностям, ориентированным на членов.

Конвейер обучения и базовая модель

В сопроводительный пост Samuel Zhang, член технического персонала Decagon, сосредоточенного на оркестрации агентов, описывается, как был построен Chord. Его конвейер обучения разработан так, чтобы сохранять текстуру реального разговора, включая изменение темпа, естественное ударение, паузы и слова‑заполнители, а не очищать записи до ровного, монотонного звучания, как, по словам поста, делает голоса синтетическими. Два метода поддерживают такой подход: процесс дословной транскрипции, сохраняющий темп, ударения и дисфлюэнции, и метод записи, который сочетает содержание сценария с естественностью свободного разговора, а не театральным чтением актёров озвучивания.

Для базовой модели Decagon дообучила диффузионную модель без токенизатора. В посте утверждается, что дискретизация аудио в токены теряет информацию на каждом этапе токенизации, тогда как представление без токенов остаётся близким к без потерь и сохраняет тонкие детали, отличающие просто разборчивый голос от звучащего живо. Это также делает модель гораздо более управляемой, как говорится в посте, позволяя Decagon точно формировать эмоцию, темп и ударения. В продакшене Chord обслуживается на платформе Modal.

Дуплексная архитектура

Decagon сообщает, что большинство голосовых агентов используют каскадный конвейер, в котором система распознавания речи преобразует голос звонящего в текст, крупная языковая модель решает, как ответить, а система синтеза речи озвучивает ответ, при этом каждый этап добавляет задержку, а координация между этапами усложняет естественное чередование реплик. Voice 3 заменяет эту схему дуплексной архитектурой, работающей двумя слоями параллельно: модель с низкой задержкой обрабатывает прослушивание и говорение, от ответов до обновлений прогресса, тогда как более мощная модель управляет рассуждениями, вызовами инструментов и соблюдением ограничений за кулисами разговора.

По словам компании, агент обрабатывает входящий аудио‑сигнал даже во время своей речи, поэтому он может говорить, когда звонящий произносит «мгм», но уступает при реальном прерывании. Он озвучивает свой прогресс во время длительных запросов, отвечает на последующие вопросы, пока задача ещё выполняется, и помогает с небольшими запросами между ними, вместо того чтобы оставлять звонящего в тишине или на удержании.

Результаты оценки, сообщённые компанией

В посте Чжана сообщается о клиентах в сфере телекоммуникаций, финансовых услуг и туризма и гостеприимства, которые перешли от готового голосового решения к голосу на базе Chord, сравнивая одни и те же программы до и после, изменив лишь голос. По данным Decagon, коэффициент разрешения проблем вырос во всех случаях: на 6,1 пункта у телекоммуникационного клиента, на 7,1 пункта у поставщика финансовых услуг и на 2,6 пункта у бренда в сфере туризма. Показатель «барж‑рейты», который Decagon определяет как долю звонков, где единственной целью абонента является разговор с человеком, снизился на 14,5, 6,1 и 5,3 пункта у трёх клиентов соответственно.

В слепом тесте прослушивания с тремя голосами слушатели слышали одинаковые аудиофрагменты, один раз произнесённые Chord и один раз голосовым талантом, на котором он основан, и им предлагалось определить, какой из них является ИИ. По данным Decagon, 45,7 % слушателей полагали, что реальный человеческий голос — это ИИ, что компания описывает как результат, близкий к 50‑50, когда различить их практически невозможно. Объявление о Voice 3 подводит итог, указывая, что примерно 90 % пользователей не смогли отличить их.

Decagon также сообщает о тесте предпочтений, в котором Chord соревновался напрямую с тремя другими, по их словам, ведущими моделями синтеза речи; каждый из них произносил одинаковые фразы, а слушателям предлагалось выбрать голос, с которым они бы хотели общаться в качестве клиента с проблемой. Среди 185 слушателей компания заявила, что Chord занял первое место в целом с 36,2 % и достиг до 48,4 % в отдельных раундах.

Смотря в будущее, Decagon отмечает, что более сложной и ценной задачей является поведение голоса в реальном разговоре, в том числе способность завоевать доверие за пять минут и выдержать сложные ситуации во время звонка. Компания описывает Chord как последнее воплощение основной гипотезы Decagon Labs: в клиентском взаимодействии модель, доработанная под конкретную задачу, превосходит универсальную передовую модель, созданную для всех целей.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.