Wywiady
Alexey Aylarov, współzałożyciel i CEO Voximplant – seria wywiadów

Alexey Aylarov współzałożył Voximplant po ponad dziesięciu latach budowania narzędzi komunikacyjnych od podstaw. Jego wczesna praca obejmowała rozwój IP PBX i prowadzenie własnej firmy oprogramowania telekomunikacyjnego, zanim telefonia chmurowa stała się powszechna. Następnie powstała Zingaya, która wprowadziła połączenia klik-nicz w przeglądarce. Voximplant został następnie utworzony, rozwijając się w platformę bezserwerową, na której deweloperzy polegają na czasie rzeczywistym, aby korzystać z głosu i wideo. Alexey pisze o praktycznej stronie Voice AI, szczególnie tam, gdzie duże modele językowe zderzają się z niechlujną rzeczywistością globalnej telefonia.
Zacząłeś swoją karierę jako inżynier VoIP w połowie 2000 roku, zanim AI wkroczył do komunikacji w czasie rzeczywistym. Jakie były największe luki, które widziałeś wtedy, a które ostatecznie skłoniły cię do założenia Voximplant?
Byłem zaangażowany w systemy VoIP od 2005 roku. Wtedy budowanie niezawodnych komunikacji było powolne i złożone. Zauważyłem, że wiele zespołów deweloperskich dzieliło moje frustracje – próbowali oni łączyć komponenty telekomunikacyjne zamiast koncentrować się na doświadczeniu produktu, które chcieli dostarczyć. To skłoniło mnie do idei programowalnych komunikacji dla deweloperów. Chcieliśmy stworzyć produkt, który pozwoliłby każdemu budować produkty bez potrzeby bycia ekspertem w dziedzinie telekomunikacji.
Przed Voximplantem, współzałożyłem usługi wywołujące oparte na SIP, takie jak Flashphone i Zingaya, które oferowały wczesne produkty klik-nicz. Popyt potwierdził raz jeszcze, że zespoły chciały programowalne komunikacje, ale narzędzia nie były jeszcze dostępne. To wszystko doprowadziło do utworzenia Voximplant w 2013 roku.
Dziś widzimy podobną lukę, ale na większą skalę. Voice AI wkracza do strumieni produkcyjnych, LLMs ewoluują co miesiąc, ale globalna sieć telefonii pozostaje fragmentaryczna. Żaden pojedynczy dostawca nie może rozwiązać wszystkiego od końca do końca. Dlatego Voximplant działa jako warstwa orkiestracji, oferując deweloperom szybki i ekonomiczny sposób eksperymentowania z najnowocześniejszymi narzędziami i wdrażania agentów głosowych w rzeczywistych połączeniach, bez martwienia się o infrastrukturę telefoniczną lub złożoność strumieniowania.
Voximplant pozycjonuje się jako warstwa orkiestracji, a nie jako pojedynczy dostawca AI lub telekomunikacyjny. Dlaczego uważałeś, że orkiestracja jest odpowiednią warstwą abstrakcji do budowania dla przyszłości głosu AI?
Było dla nas ważne od samego początku, aby być globalnym, a nie możesz zapewnić globalnej platformy telefonicznej bez wykonania pewnej orkiestracji telefonicznej. Wymagania techniczne i infrastruktura różnią się w zależności od kraju, a my oferujemy numery telefonów w ponad 190 krajach, co oznacza, że wykonujemy wiele pośrednictwa technicznego.
Ponadto standardy telefoniczne, takie jak SIP, ewoluowały w wiele wersji wśród dostawców. Łączenie różnych operatorów telekomunikacyjnych i infrastruktur komunikacji klienta wymaga elastycznych systemów, które mogą szybko adaptować się. Nowe sieci telefoniczne, takie jak WhatsApp, nadal napędzają potrzeby w tym zakresie – i to wszystko przed dodaniem logiki sterowania komunikacją na górze, która faktycznie wykonuje unikalną logikę aplikacji naszych klientów.
Po stronie AI rynek jest bardzo intensywny i ewoluuje szybko. Najlepszy dostawca dzisiaj jest prawdopodobnie na drugim lub trzecim miejscu w przyszłym tygodniu. Nasze podejście polega na wspieraniu jak największej liczby wiodących dostawców. Chcemy, aby nasi klienci zawsze mieli pełny zestaw najnowocześniejszych opcji do wyboru. Mogą oni wybrać odpowiednich dostawców AI dla swoich aplikacji – lub nawet mieszać i łączyć. Nasza platforma orkiestracji ma na celu ułatwienie przełączania się między dostawcami, jednocześnie eksponując ich pełne możliwości, aby deweloperzy nie zostali ograniczeni do zestawu funkcji o najniższej wspólnej wartości.
Wiele zespołów niedocenia, jak trudno jest dla agenta głosowego AI umieścić i zarządzać prawdziwymi połączeniami telefonicznymi. Z twojego punktu widzenia, co sprawia, że rzeczywista telefonia jest tak wyzwaniem w porównaniu z czysto cyfrowymi interakcjami AI?
Sieć telefonii jest nadal bardzo fragmentaryczna i niejednolita w różnych regionach, co sprawia, że jest jeszcze bardziej nieprzewidywalna. W niektórych krajach pewne protokoły mogą być ograniczone lub zablokowane, operatorzy doświadczają awarii jako części normalnych operacji, a wzorce routingu połączeń mogą się zmieniać w ciągu dnia. Są również regiony, w których telefonia chmurowa może być skomplikowana pod względem prawnym.
Zobaczyliśmy przypadki, w których sama infrastruktura staje się wąskim gardłem. Na przykład australijski startup opieki zdrowotnej budujący agenta głosowego AI do sprawdzania stanu starszych pacjentów mówiących w języku kantońskim miał problemy z wysokim opóźnieniem w połączeniach z amerykańskimi dostawcami usług AI (takimi jak OpenAI lub ElevenLabs), a ograniczona dostępność wysokiej jakości syntezatora mowy w języku kantońskim sprawiła, że rozmowy wydawały się wolne i nienaturalne.
Ponadto jest warstwa zgodności. Wymagania różnią się szeroko w zależności od kraju i często nakładają się na ramy, takie jak HIPAA, PCI DSS i GDPR.
Samodzielna wydajność mowy nie jest również powszechna. Żaden silnik STT lub TTS nie działa najlepiej we wszystkich środowiskach. Akcenty, hałas tła, fluktuacje jakości połączenia lub nawet degradacja dostawcy mogą powodować nagłe spadki dokładności i jakości użytkowania.
Niektóre systemy Voice AI polegają dzisiaj na wielu dostawcach dla LLM, rozpoznawania mowy, syntezowania mowy i routingu. Dlaczego ten podział jest nieunikniony, a dlaczego zamiana dostawców AI lub mowy powinna być szybką zmianą kodu, a nie dużym projektem inżynierskim?
Na początku Voice AI nie było prawdziwej opcji mowy do mowy, więc trzeba było połączyć rozpoznawanie mowy, LLM i syntezowanie mowy. Dziś kilku dostawców LLM integruje mowę bezpośrednio (często z pewnym poziomem obsługi barge-in), eliminując potrzebę budowania pełnego potoku. Te systemy są szybsze i bardziej interaktywne, ale nadal mają ograniczenia w zakresie takich aspektów, jak funkcjonalne połączenia i oferują mniej opcji poprawy transkrypcji i głosów. Oczekujemy, że modele mowy LLM będą porównywalne do modeli tekstowych wkrótce. Nawet wtedy klienci mogą nadal chcieć używać różnych dostawców mowy do swoich konkretnych wymagań. Częściowa separacja potoku dodaje również wybór redundancji.
Zamiana dostawców AI i mowy na naszej platformie nie jest dużym wysiłkiem inżynierskim, ale jest to coś więcej niż jedna linia kodu. Dostawcy mowy ciągle walczą z komodyzacja, wprowadzając unikalne funkcje. Trzymamy nasze konektory tak spójne, jak to możliwe, jednocześnie eksponując możliwości każdego dostawcy. Korzystanie z tych unikalnych funkcji, zamiana dostawców często oznacza zmianę kilku linii kodu.
Jak agenci głosowi AI zaczynają zmieniać ekonomię wsparcia klienta, sprzedaży i innych operacji B2C w porównaniu z tradycyjnymi modelami call center?
Może być za wcześnie, aby mówić o znaczącej zmianie w ekonomice wsparcia klienta, ale na pewno nadchodzi. Dziś w niektórych regionach przedstawiciele wsparcia klienta kosztują mniej niż usługi LLM, ale ten model wiąże się z dobrze znanymi wyzwaniami wokół skalowalności, wypalenia, zarządzania i operacji. Zakładam, że ekonomia zmieni się znacząco, gdy optymalizacja LLM będzie się poprawiać, chociaż zajmie to jeszcze trochę czasu.
Jakie sygnały wskazują, że Voice AI przechodzi z eksperymentowania do infrastruktury krytycznej dla przedsiębiorstw?
Najsilniejszym sygnałem jest inwestycja w infrastrukturę Voice AI, która rośnie szybko. Są sposoby na śledzenie połączeń lub minut Voice AI w skali globalnej, jeśli nie dokładnie, to przez szacunki. Chociaż mogę śledzić to tylko bezpośrednio dla Voximplant, wyraźnie widzimy silny wzrost.
Jak myślisz, że oczekiwania deweloperów wokół elastyczności i kontroli zmieniły się, gdy modele AI i technologie głosowe iterują szybciej?
To jest ciekawe pytanie. Kiedy chodzi o szybkość zmian, AI jest niezrównany przez cokolwiek, co widzieliśmy w historii. Kontrola i elastyczność są mniej jednoznaczne, w zależności od tego, co rozumiemy przez te terminy. Kiedy chodzi o kontrolę, istnieje wiele znanych wyzwań, i pokonywanie ich nie jest łatwe. Większość firm AI poświęca znaczne wysiłki na zapory modelu, ale robienie tego dobrze wymaga głębokiej ekspertyzy, a różne firmy mają wyraźnie różne cele.
Jakie błędy popełniają firmy najczęściej, gdy próbują wdrożyć agenty głosowe AI bezpośrednio na tradycyjne systemy telefoniczne?
Tradycyjne systemy telefoniczne nie są bezpośrednio kompatybilne z usługami Voice AI, więc zwykle wymagają dodatkowej integracji, zwykle za pośrednictwem protokołu SIP lub WebSockets. Typowe błędy obejmują niewystarczające zarządzanie awaryjnością, problemy z opóźnieniami (które mogą być spowodowane różnymi czynnikami) i wyzwania skalowalności.
Sam telefony scales quite well, especially with VoIP. Voice AI services są trudniejsze do skalowania ze względu na wymagania sprzętowe niezbędne do uruchomienia LLM, i nawet dość duzi gracze infrastrukturalni, tacy jak Amazon (AMZN ), mogą napotkać ograniczenia pojemności, gdy chodzi o sprzęt inferencyjny.
Spójrzając w przyszłość, jakie możliwości powinny obsługiwać platformy głosowe AI, aby pozostać istotne, gdy AI w czasie rzeczywistym staje się bardziej autonomiczne?
Myślę, że platformy Voice AI muszą skoncentrować się na SLA, ponieważ może to nadal być problemem. Powinny one również oferować dodatkowe narzędzia do testowania i obserwacji.
Ostatecznie najbardziej zaawansowane platformy będą oferować wszystko, co jest wymagane, ale dziś nadal uczymy się nowych lekcji każdego dnia, z których wiele powinno stać się częścią podstawowego stosu. Jeśli pracujesz z dużymi przedsiębiorstwami lub w środowiskach regulowanych, posiadanie wersji on-prem produktu może być krytyczne.
Gdy odtwarzasz swoją podróż od wczesnej infrastruktury VoIP do prowadzenia platformy głosowej AI dzisiaj, co najbardziej zaskakuje cię, jak branża ewoluowała?
Wiele rzeczy zaskakuje mnie, ale jedną z nich jest to, że zmiany w infrastrukturze VoIP zajmują lata. Dobrym przykładem jest to, że telefonia nadal opiera się na wąskopasmowych kodach audio (G.711, G.729), podczas gdy ludzie są już przyzwyczajeni do szerokopasmowego audio w usługach online, takich jak Zoom, Google Meet, WhatsApp itd.
Większość modeli AI jest szkolona na szerokopasmowych danych audio. Wszystkie nowoczesne telefony komórkowe mają wbudowane szerokopasmowe kodeki audio, ale nadal istnieją znaczące wyzwania interoperacyjności na poziomie operatora, które uniemożliwiają korzystanie z szerokopasmowego audio w tradycyjnych połączeniach telefonicznych. Nie jest tak, że nie ma żadnego postępu, ale moim zdaniem postęp był bardzo skromny.












