Interviews
Alexey Aylarov, mede-oprichter en CEO van Voximplant – Interviewreeks

Alexey Aylarov was mede-oprichter van Voximplant na een decennium waarin hij communicatiehulpmiddelen van de grond af aan had opgebouwd. Zijn vroege werk omvatte de ontwikkeling van IP PBX en het runnen van zijn eigen telecomsoftwarebedrijf lang voordat clouddraadloze telefoonij mainstream werd. Zingaya kwam daarna, waarmee click-to-call binnen de browser mogelijk werd. Voximplant volgde, dat uitgroeide tot een serverloze platform waarop ontwikkelaars vertrouwen voor real-time spraak en video. Alexey schrijft over de praktische kant van Voice AI, vooral waar grote taalmodellen botsen met de rommelige realiteit van mondiale telefoonij.
U bent uw carrière begonnen als VoIP-engineer in het midden van de jaren 2000, lang voordat AI real-time communicatie binnenkwam. Wat waren de grootste lacunes die u toen zag en die u uiteindelijk naar de oprichting van Voximplant hebben geleid?
Ik ben al sinds 2005 betrokken bij VoIP-systemen. Toen was het opbouwen van betrouwbare communicatie langzaam en complex. Ik merkte dat veel ontwikkelaars mijn frustratie deelden – teams probeerden telecomcomponenten te verbinden in plaats van zich te concentreren op de productervaring die ze eigenlijk wilden leveren. Dit zette me ertoe aan om naar het idee van programmeerbare communicatie voor ontwikkelaars te gaan. We wilden een product creëren dat het iedereen mogelijk zou maken om producten te bouwen zonder dat ze telecomexperts hoefden te zijn.
Voordat Voximplant ontstond, was ik mede-oprichter van SIP-gebaseerde belservices Flashphone en Zingaya, die vroege click-to-call-producten aanboden. De vraag bewees opnieuw dat teams programmeerbare communicatie wilden, maar de tooling was er nog niet. Alles leidde tot de creatie van Voximplant in 2013.
Vandaag zien we een soortgelijke lacune, maar op een grotere schaal. Voice AI komt de productiestroom binnen, LLM’s blijven elke maand evolueren, maar het mondiale telefoonnetwerk blijft gefragmenteerd. Geen enkele leverancier kan alles eind-tot-eind oplossen. Daarom fungeert Voximplant als een orkestratielaag, waardoor ontwikkelaars op een snelle en kostenefficiënte manier kunnen experimenteren met de nieuwste en meest geavanceerde tools en Voice Agents kunnen implementeren op echte gesprekken, zonder zich zorgen te maken over telefoonij-infrastructuur of streamingcomplexiteit.
Voximplant positioneert zich als een orkestratielaag in plaats van een enkele AI- of telefoonij-leverancier. Waarom dacht u dat orkestratie de juiste abstractielaag was om te bouwen voor de toekomst van voice AI?
Het was voor ons vanaf het begin belangrijk om wereldwijd te zijn, en je kunt geen mondiale telefoonij-platform bieden zonder enige vorm van telefoonij-orkestratie. Technische vereisten en infrastructuur verschillen per land, en we bieden telefoonnummers aan in meer dan 190 landen, dus dat betekent dat we veel technische bemiddeling doen.
Bovendien zijn telefoonij-standaarden zoals SIP geëvolueerd naar veel smaken over leveranciers heen. Het verbinden van verschillende telecombedrijven en diverse klantcommunicatie-infrastructuur vereist flexibele systemen die snel kunnen aanpassen. Nieuwere telefoonnetwerken, zoals WhatsApp, drijven hier behoeften aan – en dit is allemaal voordat we de communicatiecontrolelogica op het niveau van de uitvoering van de unieke toepassingslogica van onze klanten toevoegen.
Aan de AI-kant is de markt heel intens en evolueert snel. De ‘beste’ leverancier van vandaag is waarschijnlijk de tweede of derde plaats volgende week. Onze aanpak is om zoveel mogelijk van de toonaangevende leveranciers te ondersteunen. We willen dat onze klanten altijd een volledig assortiment state-of-the-art-opties hebben om uit te kiezen. Ze kunnen de juiste AI-leveranciers voor hun specifieke toepassing kiezen – of zelfs mengen en matchen. Ons orkestratieplatform streeft ernaar om het wisselen tussen leveranciers eenvoudiger te maken – terwijl we nog steeds hun volledige mogelijkheden blootleggen, zodat ontwikkelaars niet vast komen te zitten met een laagste gemeenschappelijke deler-functieset.
Veel teams onderschatten hoe moeilijk het is voor een voice AI-agent om echte telefoongesprekken te plaatsen en te beheren. Wat maakt volgens u real-world telefoonij zo uitdagend in vergelijking met puur digitale AI-interacties?
Het telefoonnetwerk is nog steeds sterk gefragmenteerd en inconsistent over regio’s heen, waardoor het nog onvoorspelbaarder wordt. In sommige landen kunnen bepaalde protocollen beperkt of geblokkeerd zijn, carriers ervaren uitval als onderdeel van normale operaties, en belroutingpatronen kunnen gedurende de dag veranderen. Er zijn ook regio’s waar clouddraadloze telefoonij juridisch ingewikkeld kan zijn.
We hebben ook gevallen gezien waarin de infrastructuur zelf de bottleneck wordt. Bijvoorbeeld, een Australische healthcare-startup die een AI-beller bouwt om in te checken bij oudere Kantonees-sprekende patiënten, worstelde met hoge latentie naar VS-gebaseerde Voice AI-leveranciers (zoals OpenAI of ElevenLabs), en de beperkte beschikbaarheid van hoge kwaliteit Kantonees TTS maakte de conversaties traag en onnatuurlijk aanvoelen.
Naast betrouwbaarheid is er ook een compliance-laag. Vereisten verschillen sterk van land tot land en overlappen vaak met kaders zoals HIPAA, PCI DSS en GDPR.
Spraakprestaties zijn ook niet universeel. Geen enkele STT- of TTS-engine werkt het beste in elke omgeving. Accenten, achtergrondruis, fluctuaties in gesprekskwaliteit of zelfs leveranciersdegradatie kunnen plotselinge dalingen in nauwkeurigheid en gebruikerservaring veroorzaken.
Sommige Voice AI-systemen vertrouwen vandaag op meerdere leveranciers voor LLM’s, spraak-naar-tekst, tekst-naar-spraak en routing. Waarom is deze fragmentatie onvermijdelijk, en waarom zou het wisselen van AI- of spraakleveranciers een snelle codeverandering moeten zijn in plaats van een groot ingenieursproject?
In het begin van Voice AI was er geen echte spraak-naar-spraak-optie, dus moest je een combinatie van spraak-naar-tekst, LLM en tekst-naar-spraak maken. Tegenwoordig integreren verschillende LLM-leveranciers spraak rechtstreeks (vaak met enige vorm van barge-in-ondersteuning), waardoor de noodzaak om een volledige pijplijn op te bouwen verdwijnt. Deze systemen zijn sneller en hooginteractief, maar hebben nog steeds beperkingen met aspecten zoals functionele oproepen en bieden minder opties voor het verbeteren van transcriptie en stemmen. We verwachten dat spraakgebaseerde LLM’s binnenkort vergelijkbaar zullen zijn met tekstmodellen. Zelfs dan kunnen klanten nog steeds andere spraakleveranciers voor hun specifieke vereisten willen gebruiken. Enige afzondering van de pijplijn voegt ook keuzes toe voor redundantie.
Het wisselen van AI- en spraakleveranciers op ons platform is geen groot ingenieursinspanning, maar het is meer dan één regel code. Spraakleveranciers vechten constant tegen commodificatie door unieke functies in te voeren. We houden onze connectors zo consistent mogelijk en leggen de mogelijkheden van elke leverancier bloot, zodat klanten van deze unieke functies gebruik kunnen maken. Het wisselen van leveranciers kan enkele regels code betekenen.
Hoe beginnen voice AI-agents de economie van klantenservice, verkoop en andere B2C-operaties te veranderen in vergelijking met traditionele callcentermodellen?
Het is misschien te vroeg om te praten over een significante verschuiving in de economie van klantenservice, maar het komt zeker. Vandaag zijn er regio’s waar klantenservicemedewerkers minder kosten dan LLM-gebaseerde diensten, maar dit model komt met bekende uitdagingen rond schaalbaarheid, burn-out, beheer en operaties. Ik neem aan dat de economie zal veranderen naarmate de optimalisatie van LLM’s verbetert, hoewel het nog even zal duren.
Wat zijn de signalen die aangeven dat Voice AI van experimenteel naar missiekritieke infrastructuur voor bedrijven gaat?
Het sterkste signaal hier is de investering in Voice AI-infrastructuur, die snel groeit. Er zijn manieren om Voice AI-geactiveerde oproepen of minuten op mondiaal niveau te volgen, als het niet exact is, via schattingen. Terwijl ik dit alleen direct kan volgen voor Voximplant, zien we duidelijke groei.
Hoe denkt u dat de verwachtingen van ontwikkelaars rond flexibiliteit en controle zijn veranderd naarmate AI-modellen en spraaktechnologieën sneller evolueren?
Dat is een interessante vraag. Wanneer het gaat om de snelheid van verandering, is AI ongeëvenaard door alles wat we in de geschiedenis hebben gezien. Controle en flexibiliteit zijn minder rechttoe rechtaan, afhankelijk van wat we met die termen bedoelen. Wanneer het gaat om controle, zijn er veel bekende uitdagingen, en het overwinnen ervan is niet gemakkelijk. De meeste AI-bedrijven besteden veel moeite aan modelguardrails, maar dit goed doen vereist diepe expertise, en verschillende bedrijven hebben duidelijk verschillende doelen.
Wat zijn de meest voorkomende fouten die bedrijven maken wanneer ze proberen voice AI-agents rechtstreeks op traditionele telefoonij-systemen te implementeren?
Traditionele telefoonij-systemen zijn niet rechtstreeks compatibel met Voice AI-diensten, dus ze vereisen meestal extra integratie, meestal via SIP-protocol of WebSockets. Veel voorkomende fouten zijn onvoldoende failoverbeheer, latentieproblemen (die door verschillende factoren kunnen worden veroorzaakt) en schaalbaarheidsuitdagingen.
Telefoonij zelf schaalt redelijk goed, vooral met VoIP. Voice AI-diensten zijn moeilijker om te schalen vanwege de hardwarevereisten die nodig zijn om LLM’s uit te voeren, en zelfs grote infrastructuurspelers zoals Amazon (AMZN ) kunnen capaciteitsbeperkingen ondervinden als het gaat om inferentiehardware.
Als we vooruitkijken, welke mogelijkheden moeten voice AI-platforms ondersteunen om relevant te blijven nu real-time AI meer autonoom wordt?
Ik denk dat Voice AI-platforms zich moeten concentreren op SLA, aangezien dit soms nog steeds een probleem kan zijn, en op extra tools voor testen en observatie.
Uiteindelijk zullen de meest geavanceerde platforms alles bieden wat nodig is, maar vandaag leren we nog steeds elke dag nieuwe lessen, waarvan veel deel moeten uitmaken van de core-stack. Als u met grote ondernemingen werkt of in gereguleerde omgevingen, kan het hebben van een on-prem-versie van uw product kritiek zijn.
Wanneer u terugkijkt op uw reis van vroege VoIP-infrastructuur tot het leiden van een voice AI-platform vandaag, wat heeft u het meest verrast over hoe de industrie is geëvolueerd?
Veel dingen hebben me verrast, maar een van hen is dat veranderingen in VoIP-infrastructuur jaren duren om te gebeuren. Een goed voorbeeld is dat telefoonij nog steeds afhankelijk is van smalbandaudio-codecs (G.711, G.729), terwijl mensen al gewend zijn aan breedbandaudio in online communicatiediensten zoals Zoom, Google Meet, WhatsApp, enz.
De meeste AI-modellen zijn getraind op breedbandaudio-gegevens. Alle moderne mobiele telefoons hebben breedbandaudio-codecs ingebouwd, maar er zijn nog steeds significante interoperabiliteitsuitdagingen op het niveau van de carrier die het gebruik van breedbandaudio in traditionele telefoongesprekken verhinderen. Het is niet alsof er helemaal geen vooruitgang is, maar naar mijn mening is het heel bescheiden.












