Інтерв’ю
Микола Мркшич, співзасновник і CEO PolyAI – Інтерв’ю Серія

Микола Мркшич є співзасновником і CEO PolyAI, провідним постачальником готових до використання голосових помічників для автоматизованого обслуговування клієнтів.
Що спочатку привабило вас до штучного інтелекту?
Я займався математикою та інформатикою з дуже раннього віку. Під час навчання в Кембриджі, я мав можливість працювати з кількома провідними дослідниками в галузі машинного навчання, включаючи Стіва Янга і Зубіна Гахрамані. Стів переконав мене приєднатися до його стартапу, VocalIQ, для роботи над створенням систем розмовної діалогу. Пізніше, я закінчив докторантуру з Стівом, працюючи над створенням моделей розуміння мови, заснованих на даних, які працюють у різних випадках та мовах. Розмовний штучний інтелект – це дуже складна галузь роботи, з багатьма науковими та інженерними проривами, які ще попереду нас, і це тримало мене зайнятим з тих пір.
У 2017 році ви заснували PolyAI, компанію з розмовного штучного інтелекту, можете розповісти про історію створення PolyAI?
Мої співзасновники, Шон Вен, Едді Су та я робили свої докторські дисертації в Кембриджі в один і той же час. Ми працювали над системами діалогу протягом років, але ми скоро зрозуміли, що ті складні системи, над якими ми працювали, мали дуже мало комерційних застосувань. Тому ми об’єдналися, щоб створити рішення з розмовного штучного інтелекту, яке буде корисним у реальному світі. Ми побачили можливість для真正 розмовних, багаторазових, транзакційних систем діалогу, які могли б взаємодіяти з реальними людьми в повсякденному житті.
Ми зосередилися на обслуговуванні клієнтів, оскільки ми вважали, що поточні технологічні можливості та вимоги клієнтів були добре узгоджені.
Можете розповісти про деякі технології машинного навчання та обробки природної мови, які використовуються?
Наш основний секрет полягає в нашій колекції різних пропріетарних моделей кодування. Ми попередньо натренували їх на мільярдах природних розмов, тому вони можуть витягувати намір навіть тоді, коли вхідна мова використовує сленг або ідіоми, наприклад. Це надзвичайно важливо для спілкування по телефону. Клієнти не говорять у ключових словах; вони розповідають історії, переривають, запитують питання та загалом просто хочуть взяти контроль над розмовою.
Ми недавно оголосили про нашу модель ConVEx, надзвичайно ефективну за даними екстрактор сутностей, яка дозволяє нам точно витягувати значення з розмов.
Наш процес оркестрування розпізнавання мови передбачає використання налаштовування платформ розпізнавання мови для нейтралізації шуму, викликаного різними акцентами, а також налаштовування для різних контекстів.
Ми також розробили досить надійну бібліотеку політики діалогу з попередньо розробленими випадками використання, які включають усі загальні транзакції обслуговування клієнтів, тому ми можемо швидко створити нового голосового помічника для клієнтів.
На вашу думку, що відрізняє хороший продукт розмовного штучного інтелекту від поганого?
Хороший продукт буде постійно розуміти, що користувачі мають на увазі, і ніколи не змусить користувачів повторювати себе. Дзвінки часто відбуваються в шумових середовищах, тому продукти повинні бути стійкими до нечітких входів. Коли бренди звертаються до великих ринків, продукти повинні розуміти різноманітні акценти та способи формулювання намірів. Обидва ці вимоги потребують продуктів, які забезпечують стійкі можливості розпізнавання мови, стійку класифікацію намірів та витягування сутностей.
Відмінний продукт буде активно взаємодіяти з користувачами. Він буде слідувати за потоком думок користувача та зможе обробляти складні, повсякденні випадки, коли користувачі можуть ділитися кількома намірами та шматками інформації одночасно, і вони можуть переходити між різними контекстами. Це вимагає стійкої багатоміткової класифікації та управління контекстом.
Відмінний продукт буде демонструвати людські характеристики без того, щоб бути нелогічним або надто роботизованим. Це означає швидкі взаємодії, справжні голоси, безперервні сигнали зворотного зв’язку та певний ступінь випадковості та недоліків.
Нарешті, відмінний продукт розмовного штучного інтелекту буде взаємодіяти з користувачами там, де вони знаходяться, і пропонувати безшовний, специфічний для платформи досвід, який може охоплювати голос, SMS, чат або соціальне повідомлення. Парадигма взаємодії повинна приймати специфіку кожної платформи зв’язку.
Які деякі переваги використання розмовного штучного інтелекту компаніями замість спроб спрямувати запитання до чат-ботів?
Досвід клієнта є критично важливим і став ключовим драйвером для утримання клієнтів. Основним пріоритетом повинна бути простота виконання клієнтами того, що їм потрібно зробити.
Телефон залишається найпопулярнішим каналом для контакту клієнтів з компанією. До 65% усіх взаємодій клієнтів все ще відбуваються по телефону. Під час пандемії COVID-19 контактні центри були підштовхнуті до крайніх меж з більшою кількістю клієнтів, ніж будь-коли раніше, які дзвонили за підтримкою.
Від然о, відмінний досвід дозволяє клієнтам спілкуватися будь-яким способом, який вони хочуть, тому для тих, хто віддає перевагу асинхронному спілкуванню, ми робимо простим для брендів пропонувати той самий рівень досвіду через текстові канали.
Яка складність у визначенні наміру того, що клієнт намагається сказати?
Є кілька складностей у розумінні клієнтів через голосові канали. Точне та послідовне розуміння значення користувачів вимагає багатьох компонентів, які працюють добре разом.
По-перше, розпізнавання мови є складним, особливо коли люди дзвонять з шумових середовищ, таких як дзвінки з динаміка, або коли вони рухаються через трафік чи тунелі. Розпізнавання мови також може бути складним у регіонах з різними акцентами та діалектами. Ми розробили ефективний спосіб налаштування моделей розпізнавання мови для даного контексту, щоб оптимізувати розпізнавання мови.
Через те, що наша модель ConveRT була натренована на такій величезній кількості розмовних даних, вона може виявляти намір навіть на слабких сигналах, як це роблять люди, навіть якщо ми пропускаємо слово чи два.
Інша важлива річ полягає в тому, щоб зрозуміти, коли користувачі хочуть виконувати кілька дій одночасно. Наприклад, хтось може сказати: “Я втратив свою картку. Чи можете ви сказати мені, чи вона була використана, і заблокувати її?”. У цьому випадку модель повинна розпізнати два наміри та виконати їх у порядку, який має сенс.
Модель також повинна бути здатна витягувати та розуміти сутності, які клієнти надають. Наприклад, “Чи маєте ви столик на суботній вечерю для мене, моєї дружини та наших двох дітей?”. На поверхні намір полягає у перевірці наявності столика, але модель повинна витягнути дату (суботу) та кількість людей (4) та будь-яку іншу потенційно важливу інформацію (можливо, дітей дозволено тільки в ресторанній зоні, а не за барами).
Нарешті, розмова не завжди лінійна. Клієнти можуть переривати з питаннями, не пов’язаними з промптом голосового помічника, тому помічник повинен бути здатний “слухати” один тип входу, залишаючись відкритим для різних тригерів, таких як запитання чи зміни інформації, раніше наданої користувачем.
Який процес і термін необхідний для компанії, яка хоче запустити розмовного штучного інтелекту бота з PolyAI?
Ми тут, щоб надати голосових помічників, які мають відчутний бізнес-імпакт. Тому ми починаємо кожне взаємодіяння з відкриттям, де ми допомагаємо клієнтам ідентифікувати та артикулювати свої цілі CX, ключові метрики та процеси підтримки. Це те місце, де ми розгортаємо ті історії, через які голосовий помічник повинен провести клієнтів. Це, плюс наша попередньо натренована модель ConveRT, означає, що нам не потрібно великої кількості розмовних даних від клієнтів.
Відтоді ми можемо розробити голосового помічника з дуже малим входом, необхідним від клієнта, тому це не дуже вимогливо до внутрішніх ІТ-команд.
В залежності від складності, ми можемо створити доказ цінності за якісні 2 тижні, і повністю реалізований розгортання за 2 місяці.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати PolyAI.












