Интервью
Айзая Н. Гранет, сооснователь и генеральный директор Bland – Интервью

Айзая Н. Гранет, сооснователь и генеральный директор Bland, является основателем стартапа и инженером, чей опыт сочетает техническое выполнение с ранним предпринимательским опытом и долгосрочной социальной работой. До запуска своего текущего проекта он участвовал в Z Fellows и Y Combinator, получил опыт работы в Lantern и основал San Diego Chill, некоммерческую организацию, которая собрала более 2,5 миллионов долларов, чтобы помочь детям с нарушениями развития получить доступ к спорту, получив национальное признание и продолжая работать с ним на уровне совета.
Bland фокусируется на создании инфраструктуры для телефонных звонков, работающих на основе ИИ, что позволяет компаниям развертывать голосовых агентов, которые могут обрабатывать поддержку клиентов, продажи и операционные рабочие процессы в большом масштабе. Платформа предназначена для замены или дополнения традиционных контакт-центров, предлагая программируемые голосовые взаимодействия, реальную отзывчивость и глубокую интеграцию с бизнес-системами, позиционируя себя как основной слой в том, как компании автоматизируют общение с клиентами.
Вы основали San Diego Chill как подросток, чтобы создать доступ к спорту для детей с нарушениями развития, задолго до того, как вошли в Y Combinator или запустили Bland. Как этот ранний опыт создания реальной организации повлиял на ваш подход к основанию компании, работающей с голосовыми технологиями ИИ, которая теперь находится между предприятиями и их клиентами?
Большая часть моей жизни и работы была сосредоточена на создании. С раннего возраста у меня была постоянная потребность воплощать идеи в жизнь. Как только у меня появляется идея или убеждение о мире, я уже не могу игнорировать это. Создание San Diego Chill не только научило меня, как создавать и управлять организацией, но и показало мне, какое влияние наши действия могут оказать на других. Создание организации, которая не существовала бы иначе, – это что-то глубоко полезное. Уроки и ценности, которые я получил от Chill, остаются со мной каждый день.
После прохождения YC в 2023 году, что убедило вас, что инфраструктура голосовых звонков в предприятиях все еще фундаментально несовершенна, чтобы оправдать создание целостной системы, а не наложение моделей LLM на традиционные инструменты IVR?
Подумайте о последнем случае, когда вы использовали чат-бот банка. Вы, вероятно, ждали дольше, чем следовало, получили ответ, который не решал ваш вопрос, и в итоге позвонили. Затем роботизированный голос провел вас через меню вариантов, которые вам не нужны, и нажатие 0 не дало никакого полезного результата.
Банки потратили миллиарды на создание этого опыта, и чат-боты все еще занимают последнее место по удовлетворенности клиентов – 29%. Ниже, чем электронная почта. Ниже, чем контакт-центры, о которых все уже жалуются.
Это была динамика на протяжении двух десятилетий. Бизнес пытается держать клиентов подальше от своего персонала. Клиенты продолжают пытаться добраться до человека. Ни одна сторона не выигрывает.
Проблема не в том, что компании не хотят исправить это. Они просто не могут обеспечить хороший опыт в большом масштабе. Контакт-центр, который обрабатывает миллион звонков в месяц, – это дорогое и сложное предприятие, и качество почти по определению нестабильно.
Что изменилось, так это то, что ИИ наконец позволяет решать звонки, а не просто перенаправлять или отклонять их. Не телефонные деревья. Не музыка на удержании. Агент, который понимает, о чем спрашивает клиент, и решает эту проблему.
Но это работает только в том случае, если система построена с нуля для реального времени голоса. Когда вы накладываете модели LLM на традиционные инструменты IVR или соединяете сторонние услуги, задержка увеличивается, и надежность снижается. Разговоры разрушаются.
Поэтому мы сосредоточились на создании инфраструктуры от начала до конца. Голос работает только в том случае, если он кажется мгновенным и естественным. Если нет, клиент кладет трубку.
Bland предпринял необычный шаг, построив и размещая свою собственную стек TTS, вывода и транскрипции внутри. Какие компромиссы вы увидели в полагании на сторонние API, что в конечном итоге заставило вас владеть полным слоем голосовой инфраструктуры?
Каждый слой, который вы передаете на аутсорсинг, добавляет задержку и добавляет риск.
Большинство платформ голосового ИИ являются реселлерами. Они берут стороннюю транскрипцию, добавляют стороннюю модель, направляют ее через сторонний TTS и передают результат. Это может работать в контролируемом демонстрационном режиме. Это редко работает, когда количество звонков увеличивается или что-то в цепи идет не так.
Есть также проблема с данными. Поставщики фундаментальных моделей, такие как OpenAI, использовали данные клиентов для обучения моделей. Они говорят, что лицензии для предприятий отличаются. Может быть, они и отличаются. Но эта неопределенность достаточно, чтобы сделать многие команды безопасности и соблюдения требований неудобными.
Когда вы самостоятельно размещаете всю стек – транскрипцию, вывод, TTS, оркестрацию – вы контролируете каждую миллисекунду и каждое обновление модели. Данные клиентов остаются внутри экосистемы клиента. Они не касаются стороннего конвейера обучения, не проходят через инфраструктуру, которую вы не можете проверить, и не перемещаются, если клиент не решит этого.
Вы можете предоставить каждому корпоративному клиенту выделенную инфраструктуру, поэтому скачок от другой компании никогда не затрагивает их производительность. И когда что-то ломается, вы можете это исправить, не ожидая поставщика.
Для регулируемых отраслей некоторые клиенты нуждаются в полной стеке в своей собственной VPC или на месте. Это возможно только в том случае, если поставщик действительно владеет тем, что он развертывает.
Традиционная автоматизация контакт-центров в основном фокусировалась на отклонении простых звонков поддержки. Почему вы решили отдать приоритет сложным, длиннохвостым взаимодействиям с клиентами вместо оптимизации для автоматизации на основе объема?
Почему вы отдали приоритет сложным, длиннохвостым взаимодействиям вместо начала с высокообъемных случаев использования?
Мы пошли противоположным путем. Если мы можем надежно обработать наиболее сложные и чувствительные звонки, все остальное становится простым. Цель не состоит в том, чтобы создать демонстрационные версии, а в том, чтобы обеспечить полное агентское решение звонков в большом масштабе. Для этого требуются системы с низкой задержкой и высокой надежностью, которые могут управлять крайними случаями, которые фактически определяют реальные разговоры с клиентами.
Ваши агенты все чаще интегрируются в CRM и операционные базы данных, чтобы решать звонки от начала до конца. Как голосовая автоматизация меняет архитектуру рабочих процессов предприятий по сравнению с чат-ботами?
Наследственные системы часто не общаются друг с другом. CRM, инструменты планирования и платформы выставления счетов являются разрозненными. Без доступа к этим системам голосовой агент может ответить только на общие вопросы и не многое другое.
Он не может посмотреть на учетную запись, обновить запись или забронировать встречу. Он собирает информацию и передает ее. Тем временем человеческие представители тратят время на работу, которая не должна касаться человека: ведение заметок о звонках, ручное планирование встреч, получение отчетов, чтобы выяснить, кто нуждается в последующем звонке.
Глубокая интеграция – это то, что делает возможным решение от начала до конца. Без нее вы автоматизировали приветствие, а не звонок.
Недавний демонстрационный вариант Soulja Boy voice clone подчеркнул, как разговорные агенты могут выйти за рамки внутренних операций в бренд-ориентированные trải nghiệm. Вы видите, как агенты голоса предприятий будут эволюционировать в цифровых представителей, которые работают непрерывно на каналах продаж, поддержки и маркетинга?
Абсолютно. Мы видим мир, в котором каждый клиент имеет личные отношения со своими любимыми и важными предприятиями. Что важно, так это то, что ИИ не только “веселый”, но и способен по-настоящему решать самые сложные проблемы.
Реальное время голоса вводит задержку, галлюцинацию и проблемы идентификации, которые не существуют в текстовых развертываниях ИИ. Какие были самые сложные технические ограничения, с которыми вы столкнулись при построении агентов, которые должны реагировать менее чем за секунду, сохраняя при этом точность разговора?
Задержка. Это то место, где большинство демонстрационных версий умирают.
Если чат-бот отвечает через три секунды, пользователь ждет. Если голосовой агент паузирует неловко после того, как вы закончили говорить, разговор уже сломан. Ответы должны поступать менее чем за 400 миллисекунд. Большинство платформ не могут добиться этого, потому что они соединяют несколько сторонних услуг, каждая из которых добавляет свою собственную задержку.
Но задержка – это только часть. Реальные звонки клиентов – это беспорядок в том, что демонстрационные версии никогда не отражают. Люди перебивают в середине предложения. Фоновый шум врывается. Звонящие переключаются на другие языки. Запросы неясны. Голосовой ИИ, который работает в производстве, обрабатывает перебои без потери контекста, адаптируется, когда разговоры выходят за рамки сценария, и делает это без звука буферизации.
Клиенты не сравнивают голосовой ИИ с другими ботами. Они сравнивают его с разговором с человеком. Это планка.
Есть растущий контроль над тем, как системы ИИ, похожие на человека, представляют себя во взаимодействиях. Как предприятиям следует думать о прозрачности при развертывании разговорных агентов, которые могут быть неотличимы от человеческого персонала?
Мы твердо верим в честность и прозрачность для конечного пользователя. Хотя некоторые правила являются обременительными и ограничивающими, любая форма обмана недопустима. Мы работаем с предприятиями, чтобы создать бесшовные trải nghiệm, основанные на доверии с клиентом.
Когда агенты ИИ начинают обрабатывать миллионы одновременных взаимодействий с клиентами, какие операционные проблемы обычно возникают первыми, когда компании переходят от пилотных развертываний к промышленным?
Несколько вещей имеют значение на практике. Первое – модульная архитектура подсказок. Монолитные подсказки почти невозможно отладить. Когда звонок идет не так, вам нужно изолировать точно, где и почему это произошло, а не смотреть на стену инструкций, пытаясь выяснить, какая строка вызвала проблему.
Полная наблюдаемость имеет значение не менее. Сводки после звонка недостаточны. Вам нужна реальная видимость того, что делает агент на каждом этапе каждого взаимодействия.
Ограничители также необходимы, особенно в регулируемых отраслях. Агент должен оставаться в рамках политики. Это не опционально. И если он не делает этого, должно быть красивое отклонение.
Наконец, есть управление знаниями. Агенту нужен доступ к проприетарным данным, таким как продукты, политики и процедуры. Платформа также должна автоматически обнаруживать пробелы в знаниях, когда они появляются в реальных звонках, а не недели спустя после того, как клиент жалуется.
Оглядываясь вперед, вы считаете, что агенты голоса предприятий останутся задачеспецифичными инструментами или будут эволюционировать в общие агенты ИИ, способные автономно управлять весь бизнес-процессом, запущенным через разговор?
Если бы я только знал ответ! Я думаю, что голосовые агенты будут эволюционировать во всем бизнес-стеке, но вряд ли мы увидим весь бизнес, управляемый голосовым агентом. То, что важно, – это то, что люди смогут получать мгновенный, точный и более полный сервис от агентов ИИ, чем они получают сегодня. На самом деле, мы считаем, что будет больше телефонных звонков, когда это произойдет. Не меньше.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Bland.












