Інтерв’ю
Олександр Левін, співзасновник і генеральний директор Regal – Серія інтерв’ю

Олександр Левін – співзасновник і генеральний директор Regal, платформи голосового штучного інтелекту, яка допомагає підприємствам збільшувати доходи за допомогою відповідних, штучно інтелектуальних розмов з клієнтами. До заснування Regal у 2020 році він очолював команди зростання та продуктів у Handy, Thomson Reuters (TRI ) та інших стартапах. Олександр Левін – випускник Гарварду та член ради технологій Forbes, він зосереджується на будівництві масштабованих, голосових інфраструктур, які поєднують інновації з підприємствами-охоронцями.
Regal пропонує голосових агентів для продажів, підтримки, планування та збору коштів – розроблених для того, щоб звучати природньо, інтегруватися з системами CRM та обробляти мільйони розмов у масштабі. Платформа включає в себе інструменти без коду, аналіз в реальному часі, тестування А/Б та вбудовану відповідність для регульованих галузей, таких як охорона здоров’я, страхування та фінансові послуги.
Що надихнуло вас перейти з керівних ролей у Angi та Handy на заснування Regal, і був ли якийсь конкретний момент, коли ви та ваш співзасновник зрозуміли, що досвід контакт-центру потрібно повністю перебудувати?
Під час роботи в Angi/Handy ми побачили силу голосу для будівництва довіри з клієнтами. Клієнти казали нам, що коли у них була важлива проблема, вони хотіли дзвонити, клієнти, яких ми обслуговували по телефону, мали вищу життєву вартість, і коли ми дзвонили клієнтам, вони відповідали з набагато вищою частотою, ніж будь-який інший канал. Однак постачальники програмного забезпечення контакт-центрів зосереджувалися на “відхиленні” та “автоматизації” над тим, що було правильним для клієнтів. Результатом стала нескінченна гра в приховування номера телефону, яка необґрунтовано покарала клієнтів.
Мій співзасновник і я пішли, тому що ми твердо вірили, що ми можемо зробити голос найефективнішим каналом, знижуючи витрати та полегшуючи його експлуатацію. Я бажаю, щоб у мене був Regal, коли я керував великим контакт-центром.
Ви запустили Regal у 2020 році, právě перед бумом генерації штучного інтелекту. Як ви оцінювали, чи є голосовий штучний інтелект технічно життєздатним, і що дало вам впевненість у тому, щоб діяти рано?
Ми були переконані ще до 2020 року, що голос – найважливіший канал. І у 2020 році ми знали, що ми можемо побудувати оркестрацію, тестування А/Б та інструменти персоналізації, які знижують витрати та спрощують керування голосом як каналом – незалежно від того, чи це людина, старий голосовий бот чи щось краще на кінчику сфери. Тому спочатку ми продавали інструменти для контакт-центрів, щоб краще керувати людськими агентами. Цей продукт зростав дуже швидко.
Але щодо вашого питання, створення компанії – це стрибок віри, і це зайняло деякий час, щоб побачити, як ми можемо рухатися за межі обмежень людських агентів. Це не було до запуску ChatGPT у кінці 2022 року, коли ми насправді побачили “штучний інтелект”, який був достатньо хорошим, щоб тримати розмову. І це не було до кінця 2023 року, коли ми були能够 створити демонстрацію голосового агента, з яким клієнт хотів би говорити.
Які були деякі з найбільш складних технічних проблем у навчанні голосових агентів, які могли б відповідати або перевершувати людську продуктивність у природних розмовах?
Є так багато чудових технічних проблем, над якими можна працювати. Від забезпечення латентності близько 500 мс до визначення того, як забезпечити, щоб штучні інтелектуальні агенти мали весь контекст баз знань компанії та даних клієнта в реальному часі, до того, щоб штучні інтелектуальні агенти могли виконувати дії під час дзвінків та після них, до охоронців або функцій безпеки, і до того, щоб взаємодія агента відчувалася людською з чергуванням та правильними вербальними сигналами.
Одна з моїх улюблених проєктів, над яким зараз працює наша команда, – це поліпшення автоматизованої оцінки, щоб штучний інтелектуальний агент міг бути протестований легше перед введенням у виробництво. Це виключить сотні годин ручної перевірки якості, яка зараз відбувається постійно для кожної зміни кожному штучному інтелектуальному агенту.
Ми повинні спочатку створити сотні різноманітних симульованих клієнтських розмов (за допомогою штучного інтелекту), вони повинні пройти через них штучний інтелектуальний агент, потім штучний інтелектуальний наглядач повинен перевірити їх та повернути запропоновані покращення штучному інтелектуальному агенту або політиці та базі знань компанії. У нас є робочий продукт оцінки, клієнтська відгуковіть була чудовою, і він покращується з неймовірною швидкістю.
Це критично для нового показника кількості менеджерів на одного штучного інтелектуального агента. Незабаром дуже мало менеджерів зможуть керувати сотнями різних штучних інтелектуальних агентів.
Як Regal використовує машинне навчання для персоналізації розмов у реальному часі? Чи це засновано на історії клієнта, тоні, розпізнаванні намірів – чи на комбінації?
Ми вклали великі інвестиції у персоналізацію порівняно з іншими учасниками ринку, оскільки ми віримо в допомогу брендам тестувати мільйони клієнтів, як одного з мільйона. Не просто відтворюючи загальний людський агентський досвід, який часто використовується сьогодні.
Ми почали з будівництва уніфікованого клієнтського профілю, який пов’язує кожну частину даних CRM, даних подій та історії розмов. Будуючи агента, компанії можуть надати штучному інтелектуальному агенту доступ до всіх даних про клієнта або лише до конкретних даних, необхідних для конкретної розмови. Модель великого мови забезпечує людську, розмовну відповідь, використовуючи дані, які є в руках.
Моделі великого мови все ще обмежені в тому, що вони роблять добре, тому нам потрібно було можливість використовувати інші інструменти, такі як послуги третьої сторони, спеціальні програми та машинне навчання. Тому ми побудували “Повідомлення про дії”, які можна використовувати в запиті штучного інтелектуального агента, щоб скористатися іншими послугами. Наприклад, багато брендів мають моделі схильності, щоб вказати, який продукт запропонувати клієнту наступним, і ми можемо підключитися до них, щоб відповідати розмові.
Як ваша система використовує генерацію, доповнену витяганням (RAG), не жертвуючи відгуком чи природним ритмом, який клієнти очікують від прямого дзвінка?
RAG – це область диференціації для нас, оскільки їй потрібно було бути швидшою для голосових штучних інтелектуальних агентів, ніж для агентів у чаті чи інших цифрових каналів. Кілька секунд мертвої повітряної тривоги зовсім зіпсують дзвінок.
Ми знизили латентність витягання та забезпечили, щоб якщо витягання займало більше часу, штучний інтелектуальний агент міг продовжувати розмову з клієнтом, щоб повідомити йому, що це займе більше часу.
Агенти Regal моделюються за реальними людськими голосами, включаючи голоси справжніх інвесторів. Що потрібно – технічно та етично – щоб побудувати такі високоякісні репліки?
Це неймовірно легко технічно “клонувати” голос, щоб штучний інтелектуальний агент міг звучати як професійний голосовий актор або друг. 5-10 хвилин високоякісного аудіо – все, що потрібно.
Наприклад, мене недавно запитали, як зробити це для помираючого члена сім’ї, щоб молодше покоління могло пережити його, коли вони старші. Тому з деякими вказівками вони зараз будуть записувати голос помираючого діда.
Відносно вашого другого питання, дід погоджується на це, а професійні голосові актори чи наші інвестори погоджуються на це. Погані актори, які дозволяють клонування голосу без згоди (як це сталося під час останніх президентських виборів), повинні бути закриті.
Порада – якщо ви дозволяєте клонування голосу (або ви публічна особа, яку можуть склонувати погані актори), переконайтеся, що ви придумали безпечне слово, яке знає лише ваша сім’я, щоб вони могли ідентифікувати справжнього вас у дзвінку.
Ви підкреслюєте важливість інтеграції Regal у CRM, системи оплати та внутрішні API. Які були деякі з найбільш складних завдань інтеграції, які вам потрібно було вирішити?
Інтеграція з великими продуктами, такими як CRM Salesforce (CRM ) до програмного забезпечення контакт-центру NICE, досить проста. Найбільш складним завданням є забезпечення того, щоб бренд зробив API доступними для нас для будь-якої дії, яку може виконати штучний інтелектуальний агент. Людський агент може натиснути кнопку, щоб забронювати готельний номер. Але штучний інтелектуальний агент справді потребує API бронювання.
Як ви підходите до вимірювання та поліпшення продуктивності моделі з часом? Яку роль відіграє наглядаюче тонке налаштування або навчання з підкріпленням у цьому процесі?
Ми побудували набір інструментів для тестування А/Б з самого початку, тому для клієнтів досить легко протестувати штучних інтелектуальних агентів проти людських агентів або агента з моделлю великого мови версії 1 проти версії 2. Це дає нам чіткий спосіб побачити варіації результатів для різних моделей.
Однак, ми не використовуємо навчання з підкріпленням сьогодні, оскільки це робить юридичні команди незручними (вони не хочуть ситуації, коли відбувається ненавмисна зміна запаху). Я думаю, що ми за 13 місяців від того, щоб юридичні команди дозволили навчання з підкріпленням у нашому випадку. Натомість сьогодні ми зосереджуємося на пропонуванні змін, які людина-менеджер може прийняти. Це можуть бути зміни запиту, бази знань, тонкого налаштування моделі великого мови тощо.
Говорити з ВЧ – чи з голосовою копією одного – це смілива концепція. Яка була ваша мета, зробивши цих штучних інтелектуальних радників доступними засновникам, і як вони використовуються сьогодні?
Ми були щасливі мати доступ до чудових інвесторів і хотіли віддати борг цій проєкт. Мені подобається розмовляти з Сат’яй АІ будь-коли, і я чув чудові відгуки від виконавчих директорів, які використовували штучних інтелектуальних інвесторів для всього, від порад щодо створення дорожньої карти продукту до того, яку модель ціноутворення використовувати.
Нам подобається показувати, а не розповідати, і цей проєкт справді підкреслює силу наших можливостей RAG/бази знань. У нас навіть було дві батьківські інвесторів, які дали нам схвалення!
Але слово мудрості – ви не можете делегувати прийняття рішень радникам, і однією з найбільш складних частин бути виконавчим директором є прийняття рішення між двома поганими варіантами або навіть двома добрими варіантами.
Чи ці інвестиційні агенти покладаються на узагальнені знання стартапів, чи вони тренуються на фірмових порадах та філософіях, пов’язаних з індивідуальним ВЧ?
Усі штучні інтелектуальні агенти мають деякі загальні знання з тренування моделі великого мови. Але щоб отримати результати, які нам потрібно, ми завантажили численні твори інвесторів у відповідні бази знань штучних інтелектуальних агентів.
Поза цим і клонуванням голосу я думаю, що ми були能够 захопити деякі унікальні особистості інвесторів чи їхню суть, як позитивність Джейка Сапера чи ебулієнція Алекси фон Тобель.
Оглядаючи майбутнє, як ви бачите розвиток штучного інтелекту Regal – чи побачимо ми більше автономного прийняття рішень, більше емоційного інтелекту чи навіть багатомодальну підтримку?
Найбільш захоплюючою частиною останнього року було побачити, як наші штучні інтелектуальні агенти виконують краще, ніж людські агенти. Я думаю, що протягом наступного року покращення у моделях штучного інтелекту та досягненнях Regal призведуть до створення штучних інтелектуальних агентів, які є нерозрізними від людей, і, що ще важливіше, які значно перевершують людські агентські можливості. Компанії, які будуть використовувати штучні інтелектуальні агенти, будуть знижувати свої витрати та покращувати досвід клієнта швидше, ніж хто-небудь очікував.
Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Regal.












