Интервью
Алексей Айларов, сооснователь и генеральный директор Voximplant – Интервью

Алексей Айларов стал сооснователем Voximplant после десяти лет, потраченных на создание инструментов связи с нуля. Его ранние работы включали разработку IP PBX и руководство своей собственной телекоммуникационной компанией, задолго до того, как облачная телефония стала мейнстримом. Затем появился Zingaya, который принес вызовы внутри браузера. За ним последовал Voximplant, который вырос в серверless-платформу, на которую разработчики полагаются для реального времени голоса и видео. Алексей пишет о практической стороне Voice AI, особенно там, где крупные языковые модели сталкиваются с сложными реалиями глобальной телефонии.
Вы начали свою карьеру как инженер VoIP в середине 2000-х годов, задолго до того, как AI вошел в реальную связь. Какие были самые большие пробелы, которые вы видели тогда, что в конечном итоге толкнуло вас к основанию Voximplant?
Я занимаюсь системами VoIP с 2005 года. Тогда построение надежных коммуникаций было медленным и сложным. Я заметил, что многие разработчики разделяли мою разочарованность – команды пытались подключить телекоммуникационные компоненты вместо того, чтобы сосредоточиться на опыте продукта, который они фактически хотели доставить. Это толкнуло меня к идее программных коммуникаций для разработчиков. Мы хотели создать продукт, который позволит всем строить продукты без необходимости быть экспертами в области телекоммуникаций.
До Voximplant я стал сооснователем сервисов звонков на основе SIP Flashphone и Zingaya, которые предлагали ранние продукты click-to-call. Спрос еще раз доказал, что команды хотели программных коммуникаций, но инструментарий еще не был там. Все это привело к созданию Voximplant в 2013 году.
Сегодня мы видим подобный пробел, но в большем масштабе. Voice AI входит в производственные потоки, LLM продолжает эволюционировать каждый месяц, но глобальная телефонная сеть остается фрагментированной. Никакой единственный поставщик не может решить все проблемы от начала до конца. Поэтому Voximplant выступает в качестве слоя оркестровки, предлагая разработчикам быстрый и экономически эффективный способ экспериментировать с последними и наиболее передовыми инструментами и развертывать Voice-агентов на реальных звонках, не беспокоясь о телекоммуникационной инфраструктуре или сложности потоковой передачи.
Voximplant позиционирует себя как слой оркестровки, а не как единственного поставщика AI или телефонии. Почему вы считали, что оркестровка – это правильный уровень абстракции для построения будущего голосового AI?
Для нас было важно с самого начала быть глобальными, и вы не можете предоставить глобальную телефонную платформу без некоторых телекоммуникационных оркестровок. Технические требования и инфраструктура варьируются от страны к стране, и мы предлагаем номера телефонов в более чем 190 странах, поэтому это означает, что мы выполняем много технического посредничества.
Кроме того, телекоммуникационные стандарты, такие как SIP, эволюционировали в многочисленные вкусы среди поставщиков. Подключение разных телекоммуникационных компаний и различных инфраструктур коммуникаций клиентов требует гибких систем, которые могут быстро адаптироваться. Новые телефонные сети, такие как WhatsApp, продолжают стимулировать потребности здесь – и это еще до добавления логики управления коммуникациями, которая фактически выполняет уникальную логику приложения наших клиентов.
На стороне AI рынок очень интенсивный и быстро эволюционирует. «Лучший» поставщик сегодня, скорее всего, будет на втором или третьем месте на следующей неделе. Наш подход заключается в поддержке как можно большего числа ведущих поставщиков. Мы хотим, чтобы наши клиенты всегда имели полный набор передовых вариантов для выбора. Они могут выбрать правильных поставщиков AI для своего конкретного приложения – или даже смешать и совместить. Наша платформа оркестровки также направлена на то, чтобы сделать переключение между поставщиками проще – при этом раскрывая все их возможности, чтобы разработчики не застревали в наборе функций с наименьшим общим знаменателем.
Многие команды недооценивают, насколько сложно для голосового AI-агента размещать и управлять реальными телефонными звонками. С вашей точки зрения, что делает реальную телефонию такой сложной по сравнению с чисто цифровыми взаимодействиями AI?
Телефонная сеть все еще очень фрагментирована и непоследовательна в разных регионах, что делает ее еще более непредсказуемой. В некоторых странах определенные протоколы могут быть ограничены или заблокированы, у операторов происходят простои в рамках обычных операций, и шаблоны маршрутизации звонков могут меняться в течение дня. Также есть регионы, где облачная телефония может быть юридически сложной.
Мы также видели случаи, когда сама инфраструктура становится узким местом. Например, австралийский стартап в области здравоохранения, который строил AI-звонок для проверки состояния пожилых кантонских пациентов, столкнулся с высокой задержкой до американских поставщиков Voice AI (например, OpenAI или ElevenLabs), и ограниченная доступность высококачественного кантонского TTS сделала разговоры медленными и неестественными.
Помимо надежности, есть слой соответствия требованиям. Требования сильно различаются от страны к стране и часто перекрываются с такими框ами, как HIPAA, PCI DSS и GDPR.
Сама производительность речи также не является универсальной. Никакой единственный движок STT или TTS не работает лучше всего в каждой среде. Акценты, фоновый шум, колебания качества звонка или даже ухудшение поставщика могут вызвать внезапные падения точности и качества взаимодействия с пользователем.
Некоторые системы Voice AI сегодня полагаются на нескольких поставщиков для LLM, речь-текст, текст-речь и маршрутизации. Почему эта фрагментация неизбежна, и почему переключение поставщиков AI или речи должно быть быстрым изменением кода, а не крупным инженерным проектом?
Ранее в Voice AI не было真正щего варианта речь-к-речи, поэтому вам приходилось собирать речь-к-текст, LLM и текст-к-речь. Сегодня несколько поставщиков LLM интегрируют речь напрямую (часто с некоторым уровнем поддержки barge-in), удаляя необходимость строить полный конвейер. Эти системы быстрее и высокоинтерактивны, но все еще имеют ограничения с такими аспектами, как функциональные звонки, и предлагают меньше вариантов для улучшения транскрипции и голосов. Мы ожидаем, что речевые LLM будут сравнимы с текстовыми моделями скоро. Даже тогда клиенты могут все еще хотеть использовать разных поставщиков речи для своих конкретных требований. Некоторое разделение конвейера также добавляет варианты для избыточности.
Переключение поставщиков AI и речи на нашей платформе не является крупным инженерным усилием, но это больше, чем однострочное изменение кода. Поставщики речи постоянно борются против коммодитизации, вводя уникальные функции. Мы сохраняем наши коннекторы как можно более последовательными, раскрывая при этом возможности каждого поставщика, поэтому использование этих уникальных функций, переключение поставщиков часто означает изменение нескольких строк кода.
Как голосовые AI-агенты начинают менять экономику поддержки клиентов, продаж и других операций B2C по сравнению с традиционными моделями колл-центров?
Может быть, еще рано говорить о значительном сдвиге в экономике поддержки клиентов, но это определенно приближается. Сегодня есть регионы, где представители поддержки клиентов стоят меньше, чем услуги, основанные на LLM, но эта модель сопряжена с хорошо известными проблемами вокруг масштабируемости, выгорания, управления и операций. Я предполагаю, что экономика изменится значительно, когда оптимизация LLM продолжит улучшаться, хотя это все еще займет некоторое время.
Какие сигналы указывают вам на то, что Voice AI переходит от экспериментов к критически важной инфраструктуре для предприятий?
Самый сильный сигнал здесь – это инвестиции в инфраструктуру Voice AI, которые растут быстро. Есть способы отслеживать голосовые AI-вызовы или минуты в глобальном масштабе, если не точно, через оценки. Хотя я могу отслеживать это напрямую только для Voximplant, мы четко видим сильный рост.
Как вы думаете, ожидания разработчиков относительно гибкости и контроля изменились, поскольку модели AI и голосовые технологии эволюционируют быстрее?
Это интересный вопрос. Когда речь идет о скорости изменений, AI не имеет равных в истории. Контроль и гибкость менее прямолинейны, в зависимости от того, что мы имеем в виду под этими терминами. Когда речь идет о контроле, есть многие хорошо известные проблемы, и преодоление их не легко. Большинство компаний AI тратят значительные усилия на ограничители моделей, но делать это хорошо требует глубокого опыта, и разные компании явно имеют разные цели.
Какие ошибки компании наиболее часто совершают, когда пытаются развернуть голосовых AI-агентов напрямую поверх традиционных телефонных систем?
Традиционные телефонные системы несовместимы напрямую с услугами Voice AI, поэтому они обычно требуют дополнительной интеграции, обычно через протокол SIP или WebSockets. Общие ошибки включают недостаточное управление отказоустойчивостью, проблемы с задержкой (которые могут быть вызваны различными факторами) и проблемы с масштабируемостью.
Сама телефония масштабируется довольно хорошо, особенно с VoIP. Услуги Voice AI сложнее масштабировать из-за требований к аппаратному обеспечению, необходимому для запуска LLM, и даже довольно крупные игроки инфраструктуры, такие как Amazon (AMZN ), могут столкнуться с ограничениями мощности при речевой обработке.
Оглядываясь вперед, какие возможности, по вашему мнению, голосовые AI-платформы должны поддерживать, чтобы оставаться актуальными, когда реальное AI становится более автономным?
Я думаю, что платформы Voice AI должны сосредоточиться на SLA, поскольку это может быть проблемой иногда, и на дополнительных инструментах для тестирования и наблюдаемости.
В конечном итоге, самые передовые платформы предложат все, что требуется, но сегодня мы все еще учимся новые уроки каждый день, многие из которых должны стать частью основного стека. Если вы работаете с крупными предприятиями или в регулируемых средах, наличие локальной версии вашего продукта может быть критически важным.
Когда вы оглядываетесь на свой путь от ранней инфраструктуры VoIP к руководству голосовой AI-платформой сегодня, что удивило вас больше всего в том, как эволюционировала индустрия?
Многие вещи удивили меня, но одна из них заключается в том, что изменения в инфраструктуре VoIP занимают годы. Хорошим примером является то, что телефония все еще полагается на узкополосные аудиокодеки (G.711, G.729), в то время как люди уже привыкли к широкополосному аудио в онлайн-сервисах связи, таких как Zoom, Google Meet, WhatsApp и т. д.
Большинство моделей AI обучены на широкополосных аудиоданных. Все современные мобильные телефоны имеют встроенные широкополосные аудиокодеки, но все еще существуют значительные проблемы с совместимостью на уровне операторов, которые препятствуют использованию широкополосного аудио в традиционных телефонных звонках. Это не означает, что нет прогресса вообще, но, по моему мнению, он был очень скромным.












