인터뷰

Voximplant의 공동 창립자이자 CEO인 Alexey Aylarov – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

Alexey Aylarov는 Voximplant를 공동 창립하기 전에 10년 동안 통신 도구를 개발하면서 경력을 시작했습니다. 그의 초기 업무에는 IP PBX 개발과 클라우드 전화가 대중화되기 전에 자신의 텔레콤 소프트웨어 회사를 운영하는 것이 포함되었습니다. Zingaya는 다음으로, 브라우저 내에서 클릭하여 호출을 제공했습니다. Voximplant는 이후 실시간 음성 및 비디오를 위한 서버리스 플랫폼으로 성장했습니다. Alexey는 음성 AI의 실제 측면에 대해 글을 쓰며, 특히 대규모 언어 모델이 세계적인 전화 시스템의 복잡한 현실과 충돌하는 곳에서 특히 관심을 가지고 있습니다.

당신은 2000년대 중반에 VoIP 엔지니어로 경력을 시작했습니다. 그 당시 AI는 실시간 통신에 아직 진입하지 않았습니다. 당시 당신이 본 가장 큰 격차는 무엇이었나요? 그것은 결국 Voximplant를 창립하게 된 계기가 되었습니다.

나는 2005년부터 VoIP 시스템과 관련되어 있었습니다. 당시에는 신뢰할 수 있는 통신을 구축하는 것이 느리고 복잡했습니다. 나는 많은 개발자가 나와 같은 좌절을 느끼고 있다는 것을 알게 되었습니다. 팀들은 텔레콤 구성 요소를 연결하려고 시도했지만, 실제로 제공하고자 하는 제품 경험에 집중하지 못했습니다. 이것은 개발자를 위한 프로그래머블 통신의 아이디어로 나에게 영향을 주었습니다. 우리는 텔레콤 전문가가 아니더라도 모든 사람이 제품을 구축할 수 있는 제품을 만들고자 했습니다.

Voximplant 이전에, 나는 SIP 기반의 호출 서비스인 Flashphone과 Zingaya를 공동 창립했습니다. 이 서비스는 초기 클릭하여 호출 제품을 제공했습니다. 수요는 다시 한번 프로그래머블 통신이 필요함을 보여주었습니다. 그러나 도구가 아직 준비되지 않았습니다. 모든 것이 2013년에 Voximplant를 창립하는 계기가 되었습니다.

오늘날, 우리는 더 큰 규모에서 유사한 격차를 보고 있습니다. 음성 AI는 생산 흐름에 진입하고 있습니다. 대규모 언어 모델은 매월 진화하고 있습니다. 그러나 전 세계적인 전화 네트워크는 여전히 단편화되어 있습니다. 단일 벤더가 모든 것을 종단 간으로 해결할 수 없습니다. 이것이 Voximplant가 오케스트레이션 계층으로 작동하는 이유입니다. 개발자에게 최신 도구와 기술을 빠르고 비용 효율적으로 실험하고 실시간 호출에서 음성 에이전트를 배포할 수 있는 방법을 제공합니다. 텔레콤 인프라나 스트리밍 복잡성에 대해 걱정할 필요가 없습니다.

Voximplant는 단일 AI 또는 텔레콤 제공업체가 아닌 오케스트레이션 계층으로 자신을 пози션합니다. 미래의 음성 AI를 위한 올바른 추상화 계층으로 오케스트레이션을 선택한 이유는 무엇입니까?

초기부터 글로벌을 목표로 했으며, 텔레콤 오케스트레이션을 수행하지 않고 글로벌 텔레콤 플랫폼을 제공할 수 없습니다. 기술 요구 사항과 인프라는 국가마다 다르며, 190개 이상의 국가에서 전화 번호를 제공하므로 기술적인 중개를 많이 수행합니다.

또한 텔레콤 표준은 다양한 벤더에서 여러 버전으로 발전했습니다. 다양한 텔레콤 회사와 고객 통신 인프라를 연결하려면 빠르게 적응할 수 있는 유연한 시스템이 필요합니다. 새로운 전화 네트워크, 예를 들어 WhatsApp,는 여기에 대한 요구를 계속 미래에 만듭니다. 이것은 고객의 고유한 애플리케이션 논리를 실행하는 통신 제어 논리를 추가로 제공하기 전에 발생합니다.

AI 측면에서 시장은 매우 집요하고 빠르게 진화하고 있습니다. 오늘날의 최고 벤더는 다음 주에 2위 또는 3위가 될 가능성이 있습니다. 우리는 가능한 한 많은 주요 제공업체를 지원하려고 합니다. 고객이 항상 최신 옵션을 선택할 수 있도록 하려는 것이 우리의 접근 방식입니다. 고객은 특정 애플리케이션에 대한 올바른 AI 제공업체를 선택할 수 있습니다. 또는 혼합하고 일치시킬 수 있습니다. 오케스트레이션 플랫폼은 또한 제공업체를 전환하는 것을 더 간단하게 만듭니다. 제공업체의 전체 기능을 노출하여 개발자가 최저 공통 기능 세트에 고정되지 않도록 합니다.

많은 팀은 음성 AI 에이전트가 실제 전화 호출을 размещ고 관리하는 것이 얼마나 어려운지低估합니다. 실시간 디지털 AI 상호작용과 비교하여 실제 세계의 텔레콤이 इतन難しい 이유는 무엇입니까?

전화 네트워크는 여전히 지역별로 단편화되고 일관성이 없으며, 예측할 수 없게 만듭니다. 일부 국가에서는 특정 프로토콜이 제한되거나 차단될 수 있으며, 통신사에서는 정상 작동의 일부로 중단이 발생할 수 있으며, 호출 라우팅 패턴은 하루 종일 변경될 수 있습니다. 클라우드 텔레콤이 법적으로 복잡한 지역도 있습니다.

우리는 인프라 자체가 병목 현상이 된 사례를 보았습니다. 예를 들어, 오스트레일리아의 한 헬스케어 스타트업은 광둥어를 사용하는 노인 환자를 확인하기 위한 AI 호출기를 구축했습니다. 그러나 미국에 기반을 둔 음성 AI 제공업체(예: OpenAI 또는 ElevenLabs)로의 높은 지연 시간과 높은 품질의 광둥어 TTS의 제한된 가용성으로 인해 대화가 느리고 자연스럽지 않은 것으로 느껴졌습니다.

신뢰성 외에도 규제 계층이 있습니다. 요구 사항은 국가마다 크게 다르며 종종 HIPAA, PCI DSS 및 GDPR와 같은 프레임워크와 중복됩니다.

음성 성능 자체도 보편적이지 않습니다. 단일 STT 또는 TTS 엔진이 모든 환경에서 최선의 결과를 제공하지는 않습니다. 억양, 배경 노이즈, 호출 품질의 변동 또는 제공업체의 열화로 인해 정확도와 사용자 경험의 급격한 저하가 발생할 수 있습니다.

일부 음성 AI 시스템은 LLM, 음성-텍스트, 텍스트-음성, 라우팅에 대한 여러 벤더에 의존합니다. 이러한 단편화는 왜 불가피하며, AI 또는 음성 제공업체를 교체하는 것이 주요 엔지니어링 프로젝트가 아닌 빠른 코드 변경으로 이루어져야 하는 이유는 무엇입니까?

초기 음성 AI에는真正한 음성-음성 옵션이 없었습니다. 따라서 음성-텍스트, LLM, 텍스트-음성을 조합해야 했습니다. 오늘날, 여러 LLM 벤더가 음성을 직접 통합하고 있습니다(종종 일부 수준의 바지인 지원과 함께). 이는 전체 파이프라인을 구축할 필요가 없게 만듭니다. 이러한 시스템은 더 빠르고 상호작용이 많지만, 기능 호출 및 음성 개선과 같은 측면에서 제한이 있습니다. 우리는 곧 음성 기반 LLM이 텍스트 모델과 비교할 수 있을 것으로 예상합니다. 그때에도 고객은 특정 요구 사항에 대한 다른 음성 벤더를 사용하고 싶어할 수 있습니다. 파이프라인 분리는 또한冗余에 대한 선택을 추가합니다.

우리의 플랫폼에서 AI 및 음성 제공업체를 교체하는 것은 주요 엔지니어링 작업은 아니지만, 한 줄의 코드 변경만큼 간단하지도 않습니다. 음성 제공업체는 독점화를 막기 위해 고유한 기능을 도입하는 것을 계속하고 있습니다. 우리는 연결기를 일관되게 유지하면서 각 제공업체의 기능을 노출하려고 합니다. 이러한 고유한 기능을 활용하려면 몇 줄의 코드를 변경해야 할 수 있습니다.

음성 AI 에이전트는 고객 지원, 판매 및 기타 B2C 운영의 경제학을 전통적인 콜 센터 모델과 비교하여 어떻게 변화시키고 있습니까?

まだ 중요한 변화를 논의하기에는 너무 이르다고 생각합니다. 그러나 일부 지역에서는 고객 지원 대표가 LLM 기반 서비스보다 저렴할 수 있습니다. 그러나 이러한 모델은 확장성, 소진, 관리 및 운영과 관련된 잘 알려진 문제가 있습니다. LLM 최적화가 계속 개선됨에 따라 경제학이 크게 변경될 것으로 가정합니다. 그러나 아직 시간이 필요할 것입니다.

음성 AI가 실험에서 기업을 위한 임무에 중요한 인프라로 전환하고 있음을 나타내는 신호는 무엇입니까?

가장 강한 신호는 음성 AI 인프라에 대한 투자입니다. 이는 빠르게 증가하고 있습니다. 글로벌 규모에서 음성 AI를 사용한 호출이나 분을 추적할 수는 없지만, Voximplant의 경우 명확하게 강한 성장을 볼 수 있습니다.

AI 모델과 음성 기술이 더 빠르게 반복되는 동안 개발자의 유연성과 제어에 대한 기대는 어떻게 변경되었습니까?

그것은 흥미로운 질문입니다. 변화의 속도에 관해서는 AI가 역사상 볼 수 없는 것을 보여주고 있습니다. 제어와 유연성은 더 직접적이지 않습니다. 제어에 관해서는 많은 알려진 도전이 있으며, 이를 극복하는 것이 쉽지 않습니다. 대부분의 AI 회사들은 모델 가드레일에 상당한 노력을 기울이고 있습니다. 그러나 이를 잘하는 것은 깊은 전문 지식이 필요하며, 다른 회사들은 명백히 다른 목표를 가지고 있습니다.

회사들이 전통적인 텔레콤 시스템에 음성 AI 에이전트를 직접 배포할 때 가장 일반적으로 하는 실수는 무엇입니까?

전통적인 텔레콤 시스템은 음성 AI 서비스와 직접 호환되지 않습니다. 따라서 추가적인 통합이 필요합니다. 일반적인 실수에는 불충분한 장애 조치 관리, 지연 문제(다양한 요인으로 인해 발생할 수 있음), 확장성 문제가 포함됩니다.

텔레콤 자체는 특히 VoIP와 함께 khá 잘 확장합니다. 그러나 음성 AI 서비스는 LLM을 실행하는 데 필요한 하드웨어 요구 사항으로 인해 더難 확장합니다. 심지어 아마존과 같은 큰 인프라 플레이어도 추론 하드웨어와 관련하여 용량 제한에 직면할 수 있습니다.

실시간 AI가 더 자율적으로 되는 앞으로, 음성 AI 플랫폼이 관련성을 유지하기 위해 지원해야 할 기능은 무엇입니까?

나는 음성 AI 플랫폼이 SLA에 중점을 두어야 한다고 생각합니다. 때때로 이것은 여전히 문제가 될 수 있습니다. 또한 테스트 및 관찰을 위한 추가 도구가 필요합니다.

결국, 가장 발전된 플랫폼은 모든 것이 필요한 것을 제공할 것입니다. 그러나 우리는 아직 매일 새로운 교훈을 배우고 있으며, 많은 것들이 코어 스택의 일부가 될 것입니다. 대규모 기업 또는 규제 환경에서 작업하는 경우, 제품의 온프레미스 버전을 갖는 것이 중요할 수 있습니다.

초기 VoIP 인프라에서 오늘날 음성 AI 플랫폼을 이끄는 경력의 여정에서 가장 놀라운 것은 무엇입니까?

많은 것들이 놀라웠지만, 하나는 VoIP 인프라의 변경이 몇 년이 걸린다는 것입니다. 좋은 예는 텔레콤이 여전히 협대역 오디오 코덱(G.711, G.729)에 의존하는 반면, 사람들이 이미 온라인 통신 서비스(예: Zoom, Google Meet, WhatsApp)에서 협대역 오디오에 익숙해졌다는 것입니다.

대부분의 AI 모델은 협대역 오디오 데이터에서 훈련되기도 합니다. 모든 최신 휴대폰에는 협대역 오디오 코덱이 내장되어 있지만, 캐리어 수준에서 협대역 오디오를 전통적인 전화 통화에 사용하는 데 상당한 상호 운용성 문제가 여전히 존재합니다. 전혀 진행이 없다는 것은 아니지만, 내 의견으로는 매우 소극적이었다고 생각합니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.