Интервью
Никола Мркшич, сооснователь и генеральный директор PolyAI – Интервью

Никола Мркшич – сооснователь и генеральный директор PolyAI, ведущего поставщика готовых к использованию в корпоративной среде голосовых помощников для автоматизированного обслуживания клиентов.
Что изначально привлекло вас к ИИ?
Я с раннего возраста интересовался математикой и информатикой. Во время моего обучения в Кембридже у меня была возможность работать с несколькими ведущими исследователями в области машинного обучения, включая Стива Янга и Зубина Гахрамани. Стив убедил меня присоединиться к его стартапу VocalIQ, чтобы работать над созданием систем спонтанного диалога. Позже я защитил диссертацию у Стива, работая над созданием моделей понимания языка, основанных на данных, которые работают в различных случаях и языках. Конверсационный ИИ – это действительно сложная область работы, в которой еще впереди много научных и инженерных прорывов, и она держит меня в тонусе с тех пор.
В 2017 году вы запустили PolyAI, компанию, занимающуюся конверсационным ИИ. Расскажите о истории создания PolyAI?
Мои сооснователи, Шон Вен, Эдди Су и я защитили диссертации в Кембридже в одно и то же время. Мы работали над системами диалога в течение многих лет, но вскоре осознали, что сложные системы, над которыми мы работали, имели очень мало коммерческих применений. Итак, мы объединились, чтобы создать решение конверсационного ИИ, которое будет полезно в реальном мире. Мы увидели возможность для真正 конверсационных, многоходовых, транзакционных систем диалога, которые могли бы взаимодействовать с реальными людьми в повседневной жизни.
Мы сосредоточились на обслуживании клиентов, поскольку считали, что текущие технологические возможности и требования клиентов хорошо соответствовали друг другу.
Расскажите о некоторых технологиях машинного обучения и обработки естественного языка, которые используются?
Наш основной секрет – это набор различных проприетарных моделей кодирования. Мы предварительно обучили их на миллиардах естественных разговоров, поэтому они могут извлекать намерения даже тогда, когда входная речь использует сленг или идиомы, например. Это невероятно важно для общения по телефону. Клиенты не говорят на ключевых словах; они рассказывают истории, перебивают, задают вопросы и вообще просто хотят взять под контроль разговор.
Мы недавно объявили о нашей модели ConVEx, которая является чрезвычайно эффективной по извлечению сущностей, что позволяет нам точно извлекать значения из разговоров.
Наш процесс оркестровки распознавания речи включает в себя использование методов тонкой настройки платформ распознавания речи для нейтрализации шума, вызванного различными акцентами, а также для тонкой настройки для различных контекстов.
Мы также разработали довольно прочную библиотеку политики диалога с предварительно разработанными случаями использования, которые включают все общие транзакции обслуживания клиентов, поэтому мы можем быстро создать новый голосовой помощник для клиентов.
По вашему мнению, что отличает хороший конверсационный ИИ-продукт от плохого?
Хороший продукт будет последовательно понимать, что имеют в виду пользователи, и никогда не заставит пользователей повторять себя. Звонки часто происходят в шумных средах, поэтому продукты должны быть устойчивыми к беспорядочным входным данным. Когда бренды выходят на большие рынки, продукты должны понимать различные акценты и способы формулирования намерений. Оба этих требования требуют от продуктов обеспечения прочных возможностей распознавания речи, устойчивой классификации намерений и извлечения сущностей.
Отличный продукт будет активно вовлекать пользователей. Он будет следовать за мыслями пользователя и сможет справиться с сложными, повседневными случаями, когда пользователи могут делиться несколькими намерениями и кусками информации одновременно, и они могут переходить между различными контекстами. Для этого требуется прочная классификация с несколькими метками и управление контекстом.
Вовлекающий продукт будет демонстрировать человеческие характеристики, не будучи неестественным или слишком роботизированным. Это означает быстрые взаимодействия, подлинные голоса, непрерывные сигналы обратной связи и некоторую степень случайности и несовершенств.
Наконец, отличный конверсационный ИИ-продукт будет взаимодействовать с пользователями, где бы они ни находились, и предлагать бесшовный, специфичный для платформы опыт, который может охватывать голос, SMS, чат или социальные платформы обмена сообщениями. Парадигма взаимодействия должна принять специфику каждой платформы связи.
Каковы некоторые преимущества использования конверсационного ИИ вместо попыток направить запросы в чат-боты?
Опыт клиента имеет решающее значение и стал ключевым фактором для удержания. Главным приоритетом должно быть обеспечение легкости выполнения клиентами того, что им нужно.
Телефон по-прежнему является наиболее предпочтительным каналом для контакта с компанией для большинства клиентов. До 65% всех взаимодействий с клиентами все еще происходят по телефону. Во время пандемии COVID-19 контактные центры были вынуждены работать на пределе, с большим количеством клиентов, чем когда-либо, звонящих за поддержкой.
Конечно, отличный опыт позволяет клиентам общаться так, как им нравится, поэтому для тех, кто предпочитает асинхронные коммуникации, мы делаем простым для брендов предлагать тот же уровень опыта через текстовые каналы.
Насколько сложно обнаружить намерение того, что пытается сказать клиент?
Существует ряд проблем с пониманием клиентов через голосовые каналы. Точно и последовательно понимать смысл пользователей требует совместной работы многих компонентов.
Во-первых, распознавание речи является сложным, особенно когда люди звонят из шумных сред, таких как когда они находятся на громкой связи или едут через трафик или туннели. Распознавание речи также может быть сложным в регионах с различными акцентами и диалектами. Мы разработали эффективный способ предвзятости моделей распознавания речи для данного контекста, чтобы оптимизировать распознавание речи.
Поскольку наша модель ConveRT была обучена на таком огромном количестве разговорных данных, она может обнаруживать намерения даже на слабых сигналах, как и люди обычно могут понять, что кто-то говорит, даже если они пропускают слово или два.
Еще одним фактором является понимание, когда пользователи хотят выполнить несколько действий одновременно. Например, кто-то может сказать: “Я потерял свою карту. Можете ли вы сказать мне, была ли она использована, и заблокировать ее?” В этом случае модель должна распознать два намерения и выполнить их в порядке, который имеет смысл.
Модель также должна уметь извлекать и понимать сущности, предоставляемые клиентами. Например, “У вас есть стол на субботний обед для меня, моей жены и наших двух детей?” На поверхности намерение здесь – проверить доступность стола, но модель должна извлечь дату (субботу) и количество человек (4) и любую другую потенциально важную информацию (например, дети могут быть допущены только в ресторанную зону и не могут быть размещены в баре).
Наконец, разговор не всегда линеен. Клиенты могут перебивать с вопросами, не связанными с приглашением голосового помощника, поэтому помощник должен уметь “слушать” один тип входных данных, оставаясь открытым для различных триггеров, таких как часто задаваемые вопросы или изменения информации, ранее предоставленной пользователем.
Какой процесс и сроки необходимы для компании, которая хочет запустить конверсационного ИИ-бота с PolyAI?
Мы здесь, чтобы предоставить голосовых помощников, которые имеют осязаемое бизнес-воздействие. Итак, мы начинаем каждое взаимодействие с открытия, где мы помогаем клиентам определить и сформулировать свои цели CX, ключевые метрики и процессы поддержки. Это то место, где мы определяем пути, которыми голосовой помощник будет направлять клиентов. Это, плюс наша предварительно обученная модель ConveRT, означает, что нам не нужны огромные объемы разговорных данных от клиентов.
Оттуда мы можем разработать голосового помощника с очень небольшим входом, необходимым от клиента, поэтому это не требует много усилий от внутренних ИТ-команд.
В зависимости от сложности мы можем создать доказательство ценности за всего 2 недели, и полноценное развертывание – за 2 месяца.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить PolyAI.












