Intervjuer

Alexey Aylarov, medgrundare och VD för Voximplant – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Alexey Aylarov co-founded Voximplant efter att ha tillbringat ett decennium med att bygga kommunikationsverktyg från grunden. Hans tidiga arbete inkluderade IP PBX-utveckling och att driva sitt eget telekomsystemföretag långt innan molnbaserad telefoni blev mainstream. Zingaya kom sedan, och medförde möjligheten att ringa direkt från webbläsaren. Voximplant följde, och växte till en serverlös plattform som utvecklare litar på för realtidsröst och video. Alexey skriver om den praktiska sidan av Voice AI, särskilt där stora språkmodeller kolliderar med de verkliga utmaningarna inom global telefoni.

Du började din karriär som VoIP-ingenjör i mitten av 2000-talet, långt innan AI kom in i realtidskommunikation. Vad var de största luckorna du såg då som till slut ledde till att du grundade Voximplant?

Jag har varit involverad i VoIP-system sedan 2005. Då var det svårt och komplext att bygga tillförlitliga kommunikationer. Jag märkte att många utvecklare delade min frustration – team försökte koppla ihop telekomponenter istället för att fokusera på den produktupplevelse de faktiskt ville leverera. Detta ledde mig till idén om programmerbara kommunikationer för utvecklare. Vi ville skapa en produkt som skulle låta alla bygga produkter utan att behöva vara telekomexperter.

Innan Voximplant co-founded jag SIP-baserade tjänster som Flashphone och Zingaya, som erbjöd tidiga click-to-call-produkter. Efterfrågan visade återigen att team ville ha programmerbara kommunikationer, men verktygen fanns inte där än. Allt detta ledde till skapandet av Voximplant 2013.

Idag ser vi en liknande lucka, men på en större skala. Voice AI kommer in i produktionsflöden, LLMs utvecklas varje månad, men det globala telefonnätet förblir fragmenterat. Inga enskilda leverantörer kan lösa allt från slut till slut. Därför fungerar Voximplant som en orkestreringslager, som erbjuder utvecklare en snabb och kostnadseffektiv väg att experimentera med de senaste och mest avancerade verktygen och att distribuera Voice-agenter på riktiga samtal, utan att behöva oroa sig för telefoni-infrastruktur eller strömningens komplexitet.

Voximplant positionerar sig som en orkestreringslager snarare än en enskild AI- eller telekom-leverantör. Varför trodde du att orkestrering var rätt abstraktionslager att bygga för framtiden för Voice AI?

Det var viktigt för oss från början att vara globala, och man kan inte tillhandahålla en global telefoni-plattform utan att göra någon form av telekom-orkestrering. Tekniska krav och infrastruktur varierar mellan länder, och vi erbjuder telefonnummer i över 190 länder, så det innebär att vi gör mycket teknisk medling.

Dessutom har telekomstandarder som SIP utvecklats till många smaker över leverantörer. Att ansluta olika telekomoperatörer och kundkommunikationsinfrastrukturer kräver flexibla system som kan anpassa sig snabbt. Nyare telefonnät, som WhatsApp, fortsätter att driva behov här – och detta är allt innan man lägger till kommunikationskontrolllogiken som faktiskt utför kundernas unika applikationslogik.

På AI-sidan är marknaden mycket intensiv och utvecklas snabbt. Den “bästa” leverantören idag kommer troligen att vara tvåa eller trea nästa vecka. Vår strategi är att stödja så många ledande leverantörer som möjligt. Vi vill att våra kunder alltid ska ha ett fullständigt urval av state-of-the-art-alternativ att välja mellan. De kan välja rätt AI-leverantörer för sina specifika tillämpningar – eller till och med blanda och matcha. Vår orkestreringsplattform syftar också till att göra det enklare att byta mellan leverantörer – samtidigt som den exponerar deras fulla kapacitet så att utvecklare inte fastnar i en lägsta gemensamma nämnare-funktionssats.

Många team underskattar hur svårt det är för en Voice AI-agent att ringa och hantera riktiga telefonsamtal. Vad gör det verkliga telefoni-samtalet så utmanande jämfört med renodlade digitala AI-interaktioner?

Telefonnätet är fortfarande högt fragmenterat och inkonsekvent över regioner, vilket gör det ännu mer oförutsägbart. I vissa länder kan vissa protokoll vara begränsade eller blockeras, operatörer upplever avbrott som en del av normala drift, och ringscheman kan skifta under dagen. Det finns också regioner där molnbaserad telefoni kan vara juridiskt komplicerad.

Vi har också sett fall där själva infrastrukturen blir flaskhalsen. Till exempel hade en australisk hälsovårdsstartup som byggde en AI-anropare för att kontakta äldre kantonesisktalande patienter problem med hög latens till USA-baserade Voice AI-leverantörer (som OpenAI eller ElevenLabs), och den begränsade tillgången på högkvalitativ kantonesisk TTS gjorde samtal känna sig långsamma och onaturliga.

Utöver tillförlitlighet finns det en efterlevnadsaspekt. Kraven varierar brett från land till land och överlappar ofta med ramverk som HIPAA, PCI DSS och GDPR.

Talprestanda i sig är inte heller universell. Inga enskilda STT- eller TTS-motorer fungerar bäst i alla miljöer. Accenter, bakgrundsbuller, samtalskvalitetsfluktuationer eller till och med leverantörsdegradering kan orsaka plötsliga nedgångar i noggrannhet och användarupplevelse.

Vissa Voice AI-system idag förlitar sig på flera leverantörer för LLM, tal-till-text, text-till-tal och routning. Varför är denna fragmentering oundviklig, och varför bör byte av AI- eller talmotor vara en snabb kodändring snarare än ett stort ingenjörsprojekt?

Tidigt i Voice AI-fasen fanns det ingen riktig tal-till-tal-alternativ, så man var tvungen att kombinera tal-till-text, LLM och text-till-tal. Idag integrerar flera LLM-leverantörer tal direkt (ofta med någon form av barge-in-stöd), vilket tar bort behovet av att bygga en fullständig pipeline. Dessa system är snabbare och högt interaktiva, men har fortfarande begränsningar när det gäller aspekter som funktionell samtal och färre alternativ för att förbättra transkription och röster. Vi förväntar oss att talbaserade LLM ska vara jämförbara med textmodeller snart. Även då kan kunder fortfarande vilja använda olika talmotorer för sina specifika krav. Viss pipeline-separation lägger också till val för redundans.

Att byta AI- och talmotorer på vår plattform är inte ett stort ingenjörsarbete, men det är mer än en enkel kodändring. Talmotorer kämpar konstant mot kommodisering genom att införa unika funktioner. Vi håller våra kopplingar så konsekventa som möjligt samtidigt som vi exponerar varje leverantörs kapacitet, så att dra nytta av dessa unika funktioner – eller byta leverantörer – ofta innebär att ändra några rader med kod.

Hur börjar röstbaserade AI-agenter förändra ekonomin för kundsupport, försäljning och andra B2C-verksamheter jämfört med traditionella callcenter-modeller?

Det kan vara för tidigt att tala om en betydande förändring i ekonomin för kundsupport, men det kommer definitivt. Idag finns det regioner där kundsupportrepresentanter kostar mindre än LLM-baserade tjänster, men detta modell kommer med välkända utmaningar runt skalbarhet, utbrändhet, ledning och drift. Jag antar att ekonomin kommer att förändras betydligt allteftersom LLM-optimering fortsätter att förbättras, även om det kommer att ta lite tid.

Vilka signaler visar att Voice AI flyttar från experiment till mission-kritisk infrastruktur för företag?

Den starkaste signalen här är investeringen i Voice AI-infrastruktur, som växer snabbt. Det finns sätt att spåra Voice AI-aktiverade samtal eller minuter på en global skala, om inte exakt, genom uppskattningar. Medan jag bara kan spåra detta direkt för Voximplant, ser vi tydlig tillväxt.

Hur tror du att utvecklarnas förväntningar kring flexibilitet och kontroll har förändrats allteftersom AI-modeller och röstteknologier itererar snabbare?

Det är en intressant fråga. När det gäller förändringens hastighet är AI obesegrat av allt vi sett i historien. Kontroll och flexibilitet är mindre raka, beroende på vad vi menar med dessa termer. När det gäller kontroll finns det många välkända utmaningar, och att övervinna dem är inte lätt. De flesta AI-företag lägger ner betydande ansträngningar på modellguardrails, men att göra detta väl kräver djupgående expertis, och olika företag har tydligt olika mål.

Vilka misstag gör företag vanligtvis när de försöker distribuera röstbaserade AI-agenter direkt på traditionella telefoni-system?

Traditionella telefoni-system är inte direkt kompatibla med Voice AI-tjänster, så de kräver vanligtvis extra integration, vanligtvis via SIP-protokoll eller WebSockets. Vanliga misstag inkluderar otillräcklig felhantering, latensproblem (som kan orsakas av olika faktorer) och skalbarhetsutmaningar.

Telefoni i sig skalar ganska bra, särskilt med VoIP. Voice AI-tjänster är svårare att skala på grund av de hårdvarukrav som krävs för att köra LLM, och till och med ganska stora infrastrukturaktörer som Amazon (AMZN ) kan möta kapacitetsbegränsningar när det gäller inferenshårdvara.

Om man tittar framåt, vilka funktioner tror du att röstbaserade AI-plattformar måste stödja för att förbli relevanta när realtids-AI blir mer autonom?

Jag tror att röstbaserade AI-plattformar behöver fokusera på SLA, eftersom det fortfarande kan vara ett problem ibland, och på ytterligare verktyg för testning och observerbarhet.

Till slut kommer de mest avancerade plattformarna att erbjuda allt som krävs, men idag lär vi oss fortfarande nya lärdomar varje dag, många av vilka bör bli en del av kärnstacken. Om du arbetar med stora företag eller i reglerade miljöer kan det vara kritiskt att ha en lokal version av din produkt.

När du ser tillbaka på din resa från tidig VoIP-infrastruktur till att leda en röstbaserad AI-plattform idag, vad har överraskat dig mest om hur branschen har utvecklats?

Många saker har överraskat mig, men en av dem är att förändringar i VoIP-infrastruktur tar år att hända. Ett bra exempel är att telefoni fortfarande förlitar sig på smalbandiga ljudkodare (G.711, G.729), medan människor redan är vana vid bredbandig ljud i onlinekommunikationstjänster som Zoom, Google Meet, WhatsApp osv.

De flesta AI-modeller är tränade på bredbandig ljuddata också. Alla moderna mobiltelefoner har bredbandiga ljudkodare inbyggda, men det finns fortfarande betydande samverkansutmaningar på operatörsnivå som förhindrar att bredbandig ljud används i traditionella telefonsamtal. Det är inte som att det inte finns någon framsteg alls, men i min mening har det varit ganska blygsamt.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.