Лидеры мнений

Корпоративный голосовой ИИ не нуждается в большей «личности». Ему нужна эмпатия по дизайну

mm
Добавьте Unite.AI в избранные источники в Google

Я работаю в сфере голосовых технологий с 2017 года, чего достаточно, чтобы пережить один цикл хайпа и наблюдать, как второй набирает реальную динамику. Хотя эта вторая волна технически более впечатляющая, обсуждение вокруг неё свелось к цифрам. Очень мало говорится о том, как люди действительно говорят, и я бы сказал, что мы потеряли страстную связь с лингвистикой и психологией, которая характеризовала многие ранние этапы развития голоса.

Просматривая анонсы, вы увидите показатели задержки, коэффициенты разрешения и амбициозные заявления о возможностях агентов. Всё это важно, но красиво звучащий агент бесполезен, если он не может выполнить задачу. Примечательно, что корпоративные голосовые продукты всё чаще используют одну и ту же базу моделей, что делает скорость лишь базовым требованием.

Разница заключается в совершенно другом месте. Что знает агент? Что он может сделать? Каково ощущение взаимодействия, пока он это делает? И, самое главное, вынужден ли клиент выполнять дополнительную работу из‑за того, что агент — машина?

Именно здесь начинается дизайн голоса, ориентированный на эмпатию. Я не имею в виду просто добавить тёплый голос или сочувственную фразу. Я говорю о проектировании вокруг намерения звонящего, его когнитивной нагрузки и вероятного эмоционального состояния. Агент должен знать то, что уже известно бизнесу, объяснять, что он делает, корректно восстанавливаться при ошибке и замолкать, когда задача выполнена.

Тёплый синтетический голос, который просит один и тот же номер счёта трижды, не облегчает звонок, и эта «теплота» не делает никакой работы.

Эмпатия — это не настройка голоса

Голос может звучать продуманно, даже если система за ним не понимает проблему и не способна сделать что‑то полезное. Клиент может звонить из‑за перебоя, спорного счета или препятствия в реализации, затрагивающего несколько команд. Если агент знает только FAQ, тёплый или отшлифованный тон не сделает взаимодействие эмпатичным. Агенту необходимо знать, кто звонит, что он приобрёл, каково было последнее взаимодействие с его аккаунтом и какие действия ему разрешено выполнить, чтобы помочь клиенту.

Корпоративному голосовому агенту необходим правильный контекст клиента и продукта, а также соответствующие права, чтобы он мог отвечать и действовать, пока собеседник ещё находится на линии. Звонящему не нужны вслух зачитанные результаты поиска. Ему может потребоваться оформить возврат, исправить запись или привлечь нужного специалиста.

Я рассматриваю эмпатию как дисциплину дизайна и как системное требование. Дизайн диалога определяет поведение агента. Базовая архитектура определяет, достаточно ли он знает, чтобы быть полезным. Я воспринимаю совокупный результат как «текстуру» голосового продукта: то, что система знает, как она использует эти знания, как она справляется с неопределённостью и какие ощущения испытывает человек, когда разговор заканчивается.

Голос создает социальный контракт

Голос не является нейтральным интерфейсом. Недавно я был в разговоре с клиентом, и у демонстрационного агента был женский голос. Уже через минуту люди в комнате стали называть его «она». Никто не объявлял об этом решении, это просто естественное продолжение разговора.

Этот эффект предшествует генеративному ИИ. В 1994 году исследование компьютеров как социальных актёров, проведённое Клиффордом Нассом, Джонатаном Штойером и Эллен Таубер, показало, что люди реагируют социально на компьютеры, даже зная, что взаимодействуют с машиной. Голос усиливает эту реакцию за счёт тайминга, уверенности и тона.

Это меняет восприятие неудач. Например, текстовое поле, возвращающее неправильную ссылку, раздражает, а голос, перебивающий вас, дважды неправильно понимающий одну и ту же мысль и настойчиво заявляющий, что проблема решена, кажется грубым. Технология не обрела чувства. Чувства есть у звонящего.

Доверие уже хрупко. Глобальное исследование 2025 года, проведённое Университетом Мельбурна совместно с KPMG, опросило более 48 000 человек в 47 странах. Выяснилось, что 66 % регулярно используют ИИ, но лишь 46 % готовы ему доверять. Каждое голосовое взаимодействие либо завоёвывает немного доверия, либо его тратит.

Существует также этическое напряжение. Индустрия часто считает наиболее «человеческим» звучание агента лучшим. Но люди не хотят быть обманутыми. При проектировании агента я хочу, чтобы он идентифицировал себя, объяснял, к чему имеет доступ, и заявлял, что собирается сделать, прежде чем выполнить значимое действие. Прозрачность должна быть частью диалога.

Проектируйте для уха, а не для глаза

Экран прощает. Люди могут сканировать, перечитывать и прокручивать назад. Речь исчезает после прослушивания, что делает когнитивную нагрузку практическим ограничением дизайна, а не академической сноской.

Обзор Нельсона Коуэна рабочей памяти описывает центральный буфер, ограниченный примерно тремя‑пятью значимыми элементами у молодых взрослых. Тем не менее голосовые системы всё ещё озвучивают длинные меню и объединяют несколько вопросов в один ход. Большинство людей не могут удержать всё это одновременно, особенно когда они отвлечены, за рулём или уже раздражены.

Текстовый чат‑бот нельзя просто снабдить технологией преобразования текста в речь и назвать голосовым продуктом. Нативный голосовой дизайн использует более короткие реплики, ставит важную информацию вначале и даёт звонящему возможность прерывать. Он также признаёт, что не каждый пауза в разговоре требует заполнения, поэтому, хотя скорость важна, нативный голосовой дизайн может «завершить» разговор, когда он закончился.

Мой опыт включает социокультурную лингвистику, изучающую, как язык функционирует между людьми и в социальных контекстах. Это полезно в голосовом дизайне, поскольку предоставляет точные термины для таких аспектов, как темп, просодия, очередность реплик и исправления. Инструкция «сделайте звучание естественным» не является дизайнерским указанием. Возможность описать, как должен работать разговор, даёт командам конкретную основу для реализации.

Как выглядит дизайн, ориентированный на эмпатию

Дизайн, ориентированный на эмпатию, не подразумевает сделать агента звучащим теплее или более человечно. Он заключается в формировании разговора вокруг ситуации человека, снижении усилий, необходимых для выполнения задачи, и обработке неудач без увеличения их раздражения. На практике это начинается с нескольких базовых дизайнерских решений.

Начните с причины звонка

Люди не звонят, чтобы ориентироваться в таксономии компании. Они звонят, потому что что‑то сломано, задерживается или вызывает путаницу. Звонящий, говорящий: «Мне нужно отменить эту доставку», не должен проходить через общий скрипт статуса заказа. Агент должен уточнить, о какой доставке речь и может ли он ещё вмешаться.

Используйте контекст, чтобы избавиться от повторов

Эмпатия часто проявляется в том, чего система не спрашивает. Если бизнес уже знает, кто клиент, какой продукт он использует и что произошло ранее, агент должен использовать этот подтверждённый контекст, а не заставлять звонящего восстанавливать его.

То же самое относится к внутренним процессам бизнеса. Продавец между встречами должен иметь возможность спросить, что изменилось в аккаунте, продиктовать последующие действия и записать обновление в нужную систему. Ценность заключается в поддержании процесса без потери контекста и без создания дополнительной административной нагрузки.

Разрабатывайте исправление до идеального сценария

Каждая голосовая система будет иногда неправильно слышать собеседника. Акценты, фоновые шумы, незнакомые имена и перебивания делают это неизбежным. Продукт определяется тем, что происходит дальше. Наихудший сценарий восстановления — повторять тот же вопрос теми же словами. Лучший ответ объясняет, что агент понял, и уточняет неопределённость. Если проблема требует суждения или доступа, которого у агента нет, следует привлечь человека до того, как звонящий потребует этого.

Уважайте передачу и завершение

Передача звонящего человеку не является неудачей. Неудачей считается передача без контекста разговора. Если агент переводит звонок, не передавая, что сказал клиент, что было идентифицировано и какие действия уже предприняты, клиенту придётся начинать заново. Именно эту работу ИИ и должен устранять.

То же самое относится к ситуации, когда проблема решена. Иногда лучший голосовой опыт — один вопрос, один точный ответ и клик. Звонящие не обязательно благодарят агента или подтверждают, что их запрос решён, перед тем как повесить трубку. Если им предоставлено нужное, взаимодействие считается успешным.

Измеряйте усилия, а не театральность производительности

Идеально решённый однократный звонок может выглядеть как отскок, поскольку клиент вешает трубку, не подтверждая удовлетворённость. Если успех измеряется завершением длинного скрипта, команды будут оптимизировать более длительные разговоры и называть это вовлечённостью.

Я бы предпочёл измерять повторные звонки, исправления, избегаемые переводы и то, выполнено ли запрошенное действие. Широкие показатели удовлетворённости, такие как NPS, по‑прежнему важны, но сам разговор раскрывает, где клиенту пришлось работать больше, чем следовало бы.

В феврале 2026 года Gartner сообщил, что 91 % руководителей службы поддержки и обслуживания клиентов находятся под давлением руководства внедрять ИИ. Это давление делает ещё более важным измерять, действительно ли автоматизация сокращает работу. Голосовой агент, создающий повторные звонки, ненужные переводы или более длительные взаимодействия, может выглядеть эффективным на бумаге, просто перенося затраты в другое место. Экономика улучшается, когда система решает действительно нужные задачи, избегает лишних ходов и не допускает возврата клиентов через более дорогие каналы.

Возможности и эмпатия идут рука об руку

Рынок корпоративных голосовых решений выходит за рамки естественной речи. Сейчас важно, может ли агент понять потребности звонящего, получить правильный бизнес‑контекст, действовать точно и безопасно, а также реагировать адекватно, когда разговор отклоняется от сценария.

Дизайн, ориентированный на эмпатию, не должен делать агента более разговорчивым. При правильном выполнении он устраняет повторения, сокращает объяснения и избавляет звонящего от необходимости управлять машиной. Иногда удовольствие — это просто ощущение, что сложное стало простым.

Самый важный вопрос, который я задаю себе при создании любого продукта ИИ, предельно прост: зачем кому‑то это нужно? Голос заслуживает места, когда он делает что‑то заметно проще, а не добавляет людям работу.

Перед запуском голосового агента слушайте неудачные разговоры, а не только отшлифованные демонстрации. Понял ли он, зачем человек позвонил? Было ли у него достаточно знаний, чтобы решить проблему? Когда он не справился, упростил ли он следующий шаг или усложнил его?

Если ответ не ясен, больше «личности», меньшая задержка и более человеческий голос не спасут ситуацию.

Jen Heape — эксперт по голосовым и разговорным ИИ, создавшая продукты для таких организаций, как Amazon, Bank of America, Dyson и Verizon.

По образованию лингвист, она работает в этой области с 2017 года и ранее соучредила студию по разработке продуктов разговорного ИИ, которая была приобретена в 2023 году.

Сейчас она руководит разработкой голосового ИИ в DevRev, сосредотачивая внимание на том, как язык, психология и дизайн продукта могут сделать голосовых агентов более полезными, надёжными и коммерчески эффективными.