Інтерв’ю
Ісая Н. Гранет, співзасновник і генеральний директор Bland – Серія інтерв’ю

Ісая Н. Гранет, співзасновник і генеральний директор Bland, є засновником стартапу та інженером, чиє минуле поєднує технічну реалізацію з раннім підприємницьким досвідом та тривалими соціальними діями. До запуску свого поточного проекту він брав участь у Z Fellows і Y Combinator, набував досвід інженерної роботи в Lantern, а також заснував San Diego Chill, неприбуткову організацію, яка зібрала понад 2,5 мільйона доларів, щоб допомогти дітям з порушеннями розвитку доступу до спорту, здобув національне визнання та продовжує свою діяльність донині на рівні ради директорів.
Bland зосереджується на будівництві інфраструктури для телефонних дзвінків, що працюють на основі штучного інтелекту, що дозволяє підприємствам розгортати голосові агенти, які можуть обробляти підтримку клієнтів, продажі та операційні робочі процеси у великих масштабах. Платформа спроектована для заміни або доповнення традиційних контакт-центрів, пропонуючи програмовані голосові взаємодії, реальну реакцію та глибоку інтеграцію з бізнес-системами, позиціонуючи себе як ключовий шар у тому, як компанії автоматизують спілкування з клієнтами.
Ви заснували San Diego Chill підлітком, щоб створити інклюзивний доступ до спорту для дітей з порушеннями розвитку, ще до того, як вступили до Y Combinator або запустили Bland. Як цей ранній досвід створення реальної організації вплинув на ваш підхід до заснування компанії, що працює з голосовими технологіями штучного інтелекту, яка тепер розташовується між підприємствами та їх клієнтами?
Багато чого в моєму житті та роботі було зосереджено на будівництві. З молодого віку в мене постійно був цей нездоланний потяг до створення чогось нового. Як тільки в моїй голові з’являється ідея чи думка про світ, мені вже неможливо її ігнорувати. Створення San Diego Chill не тільки навчило мене, як створити та керувати організацією, але й показало мені, який вплив можуть мати наші дії на інших людей. Можливість повернути борг, створивши організацію, яка інакше б не існувала, – це щось глибоко цінне. Уроки та цінності, які я вивів з цього досвіду, супроводжують мене щодня.
Після проходження програми YC у 2023 році, що переконало вас у тому, що підприємницька голосова інфраструктура все ще фундаментально не працює, щоб виправдати будівництво повної системи, а не накладання моделей штучного інтелекту на традиційні засоби IVR?
Подумайте про останній раз, коли ви використали чат-бот банку. Вірогідно, ви чекали довше, ніж мали б, отримали відповідь, яка не відповідала тому, про що ви запитали, і в підсумку все одно зателефонували. Потім роботизований голос провів вас через меню варіантів, яких ви не хотіли, а натискання 0 нічого корисного не зробило.
Банки витратили мільярди на те, щоб зробити цей досвід можливим, а чат-боти все ще займають останнє місце за задоволеністю клієнтів – 29%. Нижче за електронну пошту. Нижче за контакт-центри, про які всі вже скаржаться.
Це була динаміка протягом двох десятиліть. Підприємства намагаються тримати клієнтів від свого персоналу. Клієнти продовжують намагатися дістатися до людини. Жодна зі сторін не виграє.
Проблема не в тому, що компанії не хочуть виправити це. Вони просто не можуть забезпечити себе персоналом для надання хорошого досвіду у великих масштабах. Контакт-центр, який обробляє мільйон дзвінків на місяць, – це дорогий і складний процес, а якість майже за визначенням є нестабільною.
Що змінилося, так це те, що штучний інтелект нарешті робить можливим вирішення дзвінків, а не просто їх перенаправлення чи відхилення. Не телефонні дерева. Не музика в режимі очікування. Агент, який розуміє, про що запитує клієнт, і обробляє це.
Але це працює лише тоді, коли система побудована з нуля для реального часу голосових взаємодій. Коли ви накладаєте моделі штучного інтелекту на традичні засоби IVR або зшиваєте сторонні послуги, виникає затримка і знижується надійність. Розмови розриваються.
Саме тому ми зосередилися на будівництві інфраструктури з нуля. Голос працює лише тоді, коли відчувається негайно і природно. Якщо цього немає, клієнт кладе трубку.
Bland пішла незвичайним шляхом, побудувавши та розмістивши власний стек TTS, висновку та транскрипції всередині. Які компроміси ви бачили в залежності від сторонніх API, які в підсумку спонукали вас володіти повним шаром голосової інфраструктури?
Кожен шар, який ви видаєте на аутсорсинг, додає затримку та ризик.
Більшість платформ голосового штучного інтелекту є реселерами. Вони беруть сторонню транскрипцію, додають сторонню модель, перенаправляють її через стороннє TTS і передають вам результат. Це може працювати в контрольованому демонстраційному режимі. Але рідко коли це витримує, коли об’єм дзвінків різко зростає або щось у ланцюзі пішло не так.
Є також проблема з даними. Постачальники моделей штучного інтелекту, як-от OpenAI, використовували дані клієнтів для навчання моделей. Вони кажуть, що ліцензії для підприємств інші. Можливо, вони такі. Але ця невизначеність достатня, щоб зробити багато команд з безпеки та відповідності незручними.
Коли ви самі розміщуєте весь стек — транскрипцію, висновок, TTS, оркестрацію — ви контролюєте кожну мілісекунду та кожне оновлення моделі. Дані клієнтів залишаються всередині екосистеми клієнта. Вони не торкаються сторонньої навчальної труби, не проходять через інфраструктуру, яку ви не можете перевірити, і не рухаються, якщо клієнт не вирішить цього зробити.
Ви можете надати кожному підприємству окрему інфраструктуру, так що сплеск від іншої компанії ніколи не торкнеться їхньої продуктивності. І коли щось ламається, ви можете справді це виправити, а не чекати на реакцію постачальника.
Для регульованих галузей деяким клієнтам потрібен повний стек у їхньому власному VPC або на локальному рівні. Це можливо лише тоді, коли постачальник фактично володіє тим, що він розгортає.
Традиційна автоматизація контакт-центрів зосереджувалася в основному на відхиленні простих запитів на підтримку. Чому ви вирішили пріоритезувати довгочасні, складні взаємодії клієнтів замість оптимізації для автоматизації на основі обсягу спочатку?
Чому ви пріоритезували складні, довгочасні взаємодії замість початку з високоволатильних випадків використання?
Ми підійшли до цього з іншого боку. Якщо ми можемо надійно обробляти найбільш складні та чутливі дзвінки, все інше стає простим. Метою не є створення демонстраційних версій, а надання повної агентської резолюції дзвінків у великих масштабах. Це вимагає низькозатримкових, високонадійних систем, які можуть керувати крайніми випадками, які насправді визначають реальні розмови клієнтів.
Ваші агенти все частіше інтегруються в CRM та операційні бази даних для вирішення дзвінків з кінця в кінець. Як голосова автоматизація змінює архітектуру робочих процесів підприємств порівняно з чат-ботами?
Застарілі системи часто не спілкуються одна з одною. CRM, інструменти планування та платіжні платформи ізольовані. Без доступу до цих систем голосовий агент може відповісти лише на загальні питання та нічого більшого.
Він не може подивитися на рахунок, оновити запис або забронювати призначення. Він збирає інформацію та передає її людині. Тим часом люди витрачають час на роботу, яка не повинна торкатися людини: ведення записів дзвінків, ручне планування призначень, отримання звітів, щоб визначити, кому потрібне подальше слідкування.
Глибока інтеграція робить можливим вирішення дзвінків з кінця в кінець. Без неї ви автоматизували лише привітання, а не сам дзвінок.
Нещодавнє демонстраційне відео з клоном голосу Soulja Boy підкреслило, як агенти розмов можуть розширити свій вплив за межі внутрішніх операцій у брендові досвіди. Чи бачите ви, як підприємчі голосові агенти будуть розвиватися у цифрових представників, які можуть працювати безперервно через канали продажів, підтримки та маркетингу?
Абсолютно. Ми бачимо світ, у якому кожен клієнт має особисті відносини зі своїми улюбленими та основними підприємствами. Що важливо, так це те, що штучний інтелект не лише “забавний”, а й здатний справді вирішувати ваші найбільш складні питання.
Реальний час голосових взаємодій вводить затримку, галюцинації та проблеми ідентифікації, яких немає у текстових розгортаннях штучного інтелекту. Які були найбільш складними технічними обмеженнями, з якими ви зіткнулися під час будівництва агентів, які повинні реагувати менше ніж за секунду, зберігаючи при цьому точність розмов?
Затримка. Саме там більшість демонстраційних версій помирають.
Якщо чат-бот відповідає за три секунди, користувач чекає. Якщо голосовий агент паузує незручно після того, як ви закінчили говорити, розмова вже зламана. Відповіді повинні повертатися менше ніж за 400 мілісекунд. Більшість платформ не можуть цього досягти, оскільки вони зшивають декілька сторонніх послуг, кожна з яких додає свою власну затримку.
Але затримка – це лише частина проблеми. Реальні клієнтські дзвінки є нечистими у спосіб, який демонстраційні версії ніколи не захоплюють. Люди перервуть посеред речення. Фоновий шум вривається. Дзвінники переключаються на інші мови. Запити невизначені. Штучний інтелект, який витримує виробництво, обробляє перервання без втрати контексту, адаптується, коли розмови виходять за межі сценарію, і робить це без звучання, як ніби він буферизується.
Клієнти не порівнюють голосовий штучний інтелект з іншими ботами. Вони порівнюють його з розмовою з людиною. Це той рівень, якого потрібно досягти.
Є зростаюча увага до того, як людські голосові системи штучного інтелекту представляють себе під час взаємодій. Як підприємства повинні думати про прозорість при розгортанні розмовних агентів, які можуть бути нерозрізними від людського персоналу?
Ми твердо віримо в чесність і прозорість для кінцевого користувача. Хоча деякий регуляторний вплив є обтяжливим і гальмівним, жодна форма обману не є прийнятною. Ми працюємо з підприємствами над розробкою безшовних досвідів, які базуються на довірі з клієнтом.
Коли агенти штучного інтелекту починають обробляти мільйони одночасних взаємодій клієнтів, які операційні проблеми з’являються першими, коли компанії переходять від пілотних розгортань до масштабних розгортань?
Декілька речей мають значення на практиці. По-перше, це модульна архітектура промпта. Монолітні промпти майже неможливо відлагодити. Коли дзвінок іде не так, вам потрібно ізолювати точно, де і чому це сталося, а не дивитися на стіну інструкцій, намагаючись зрозуміти, яка лінія викликала проблему.
Повна спостережливість має значення не менше. Підсумкові резюме дзвінків недостатні. Вам потрібно реальне бачення того, що робить агент на кожному етапі кожної взаємодії.
Ограждення також є суттєвими, особливо в регульованих галузях. Агент повинен залишатися в межах політики. Це не опціонально. І якщо цього немає, повинна бути елегантна possibility.
Нарешті, існує управління знаннями. Агент повинен мати доступ до власних даних клієнта, таких як продукти, політики та процедури. Платформа також повинна автоматично висвітлювати прогалини у знаннях, коли вони з’являються в реальних дзвінках, а не через тижні після того, як клієнт скаргується.
Оглядаючи майбутнє, ви вважаєте, що підприємчі голосові агенти залишаться інструментами для конкретних завдань чи розвинуться у загальні агенти штучного інтелекту, які можуть автономно керувати всіма бізнес-процесами, ініційованими через розмови?
Якщо б тільки я мав відповідь! Я думаю, що голосові агенти будуть розвиватися по всьому бізнес-стеку, але малоймовірно, що ми побачимо весь бізнес, керований голосовим агентом. З іншого боку, я вірю, що люди зможуть отримати миттєву, точну та більш повну службу від агентів штучного інтелекту, ніж вони отримують сьогодні. Насправді, ми віримо, що більше телефонних дзвінків відбудеться, коли це станеться. Не менше.
Дякуємо за велике інтерв’ю. Читачам, які бажають дізнатися більше, слід відвідати Bland.












