Intervjuer

Alexey Aylarov, medgrunnlegger og CEO av Voximplant – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Alexey Aylarov var med å grunnlegge Voximplant etter å ha brukt et tiår på å bygge kommunikasjonsverktøy fra bunnen av. Hans tidlige arbeid inkluderte utvikling av IP PBX og å drive sitt eget telecom-programvarefirma lenge før cloud-telefoni ble mainstream. Zingaya kom neste, og tok med click-to-call inn i nettleseren. Voximplant fulgte, og vokste til å bli en serverløs plattform utviklere avhenger av for sanntids-lyd og video. Alexey skriver om den praktiske siden av Voice AI, spesielt der store språkmodeller kolliderer med de vanskelige realitetene i global telefoni.

Du startet din karriere som en VoIP-ingeniør i midten av 2000-årene, lenge før AI kom inn i sanntidskommunikasjon. Hva var de største hullene du så da som til slutt førte deg til å grunnlegge Voximplant?

Jeg har vært involvert med VoIP-systemer siden 2005. Da var det å bygge pålitelige kommunikasjoner langsomt og komplekst. Jeg merket at mange utviklere delte min frustrasjon – team prøvde å wire telecom-komponenter istedenfor å fokusere på produktopplevelsen de faktisk ønsket å levere. Dette førte meg mot ideen om programmable kommunikasjon for utviklere. Vi ønsket å skape et produkt som ville la alle bygge produkter uten å måtte være telecom-eksperter.

Før Voximplant, var jeg med å grunnlegge SIP-baserte oppringningstjenester Flashphone og Zingaya, som tilbød tidlige click-to-call-produkter. Etterspørselen viste igjen at team ønsket programmable kommunikasjon, men verktøyene var ikke der enda. Alt dette ledet til skapingen av Voximplant i 2013.

I dag ser vi en lignende hull, men på en større skala. Voice AI går inn i produksjonsflyter, LLM-er fortsetter å utvikle seg hver måned, men det globale telefonnettet forblir fragmentert. Ingen enkelt leverandør kan løse alt fra ende til ende. Derfor fungerer Voximplant som en orkestreringslag, og tilbyr utviklere en rask og kostnadseffektiv måte å eksperimentere med de siste og mest avanserte verktøyene, og å deployere Voice-agenter på sanntidsoppringninger, uten å måtte bekymre seg om telefoni-infrastruktur eller strømningsskomplikasjoner.

Voximplant stiller seg som en orkestreringslag istedenfor en enkelt AI- eller telefoni-leverandør. Hvorfor trodde du at orkestrering var riktig abstraksjonslag å bygge for fremtiden av voice AI?

Det var viktig for oss fra begynnelsen å være globalt, og du kan ikke tilby et globalt telefoni-plattform uten å gjøre noen telefoni-orkestrering. Tekniske krav og infrastruktur varierer etter land, og vi tilbyr telefonnumre i over 190 land, så dette betyr at vi gjør mye teknisk megling.

I tillegg har telefoni-standarder som SIP utviklet seg til mange varianter over leverandører. Å koble forskjellige telcos og kundekommunikasjons-infrastrukturer krever fleksible systemer som kan tilpasse seg raskt. Nyere telefonnett, som WhatsApp, fortsetter å drive behov her – og dette er før vi legger til kommunikasjonskontroll-logikken på toppen som faktisk utfører kundenes unike applikasjonslogikk.

På AI-siden er markedet svært intensivt og utvikler seg raskt. “Den beste” leverandør i dag er sannsynligvis nummer to eller tre neste uke. Vår tilnærming er å støtte så mange av de ledende leverandørene som mulig. Vi ønsker at våre kunder alltid skal ha et fullstendig sett av state-of-the-art-valg til å velge fra. De kan velge riktig AI-leverandør for sine gitt applikasjoner – eller til og med blande og kombinere. Vår orkestreringsplattform har også som mål å gjøre det enklere å bytte mellom leverandører – samtidig som vi eksponerer deres fullstendige funksjoner, så utviklere ikke blir fanget i en lavest fellesnevner-funksjonssett.

Mange team undervurderer hvor vanskelig det er for en voice AI-agent å plassere og håndtere sanntidsoppringninger. Hva gjør sanntids-telefoni så utfordrende sammenlignet med ren digitale AI-interaksjoner?

Telefonnettet er fremdeles høyt fragmentert og inkonsistent over regioner, noe som gjør det enda mer uforutsigbart. I noen land kan visse protokoller være begrenset eller blokkert, operatører opplever avbrytelser som en del av normal drift, og oppringningsmønster kan skifte gjennom dagen. Det er også regioner hvor cloud-telefoni kan være juridisk komplisert.

Vi har også sett tilfeller hvor infrastrukturen selv blir flaskenhalen. For eksempel, en australsk helse-startup som bygget en AI-oppringer for å sjekke inn på eldre kantonesisk-talende pasienter, hadde problemer med høy forsinkelse til US-baserte Voice AI-leverandører (som OpenAI eller ElevenLabs), og begrenset tilgjengelighet av høykvalitets Cantonese TTS gjorde samtalen føles langsom og unaturlig.

I tillegg til pålitelighet, er det et kompatibilitetslag. Krav varierer vidt fra land til land og overlapper ofte med rammer som HIPAA, PCI DSS og GDPR.

Taleprestasjon selv er ikke universell heller. Ingen enkelt STT- eller TTS-motor fungerer best i hver miljø. Akcenter, bakgrunnsstøy, oppringningskvalitetsfluktuasjoner eller til og med leverandørforverring kan forårsake plutselige nedgang i nøyaktighet og brukeropplevelse.

Noen Voice AI-systemer i dag avhenger av flere leverandører for LLM-er, tale-til-tekst, tekst-til-tale og oppringning. Hvorfor er denne fragmenteringen uunngåelig, og hvorfor bør bytte av AI- eller tale-leverandør være en rask kodeendring istedenfor et stort ingeniørprosjekt?

Tidlig i Voice AI, var det ingen sanntids tale-til-tale-opsjoner, så du måtte sette sammen tale-til-tekst, LLM og tekst-til-tale. I dag integrerer flere LLM-leverandører tale direkte (ofte med noen grad av barge-in-støtte), og fjerner behovet for å bygge en full pipeline. Disse systemene er raskere og høyt interaktive, men har fortsatt begrensninger med aspekter som funksjonell oppringning og tilbyr færre valg for å forbedre transkripsjon og stemmer. Vi forventer at tale-baserte LLM-er snart vil være sammenlignbare med tekst-modeller. Selv da kan kunder fortsatt ønske å bruke forskjellige tale-leverandører for sine spesifikke krav. Noen pipeline-separasjon tilføyer også valg for redundans.

Bytte av AI- og tale-leverandører på vår plattform er ikke et stort ingeniørarbeid, men det er mer enn en enkelt kodeendring også. Tale-leverandører kjemper konstant mot kommodifisering ved å introdusere unike funksjoner. Vi holder våre koblinger så konsistente som mulig samtidig som vi eksponerer hver leverandørs funksjoner, så å ta i bruk disse unike funksjonene, eller bytte leverandører, ofte betyr å endre noen linjer med kode.

Hvordan begynner voice AI-agenter å endre økonomien i kundeservice, salg og andre B2C-operasjoner sammenlignet med tradisjonelle call-senter-modeller?

Det kan være for tidlig å snakke om en betydelig endring i økonomien i kundeservice, men det kommer definitivt. I dag er det regioner hvor kundeservice-representanter koster mindre enn LLM-drevne tjenester, men denne modellen kommer med velkjente utfordringer rundt skalerbarhet, utbrenthet, ledelse og drift. Jeg antar at økonomien vil endre seg betydelig når LLM-optimiering fortsetter å forbedre seg, selv om det vil ta noen tid.

Hva er signalene som forteller deg at Voice AI flytter fra eksperimentering til kritisk infrastruktur for bedrifter?

Det sterkeste signalet her er investeringen i Voice AI-infrastruktur, som vokser raskt. Det er måter å spore Voice AI-aktiverede oppringninger eller minutter på en global skala, hvis ikke eksakt, gjennom estimater. Mens jeg kan spore dette direkte bare for Voximplant, ser vi tydelig sterkt vekst.

Hvordan tror du at utvikler-forventninger rundt fleksibilitet og kontroll har endret seg når AI-modeller og tale-teknologier itererer raskere?

Det er et interessant spørsmål. Når det gjelder hastighet på endring, er AI uten sammenligning med noe vi har sett i historien. Kontroll og fleksibilitet er mindre rett frem, avhengig av hva vi mener med disse begrepene. Når det gjelder kontroll, er det mange velkjente utfordringer, og å overvinne dem er ikke enkelt. De fleste AI-selskapene bruker betydelige anstrengelser på modell-gjerder, men å gjøre dette godt krever dypt ekspertise, og forskjellige selskaper har tydeligvis forskjellige mål.

Hva er feilene selskaper vanligvis gjør når de prøver å deployere voice AI-agenter direkte på toppen av tradisjonelle telefoni-systemer?

Tradisjonelle telefoni-systemer er ikke direkte kompatible med Voice AI-tjenester, så de vanligvis krever ekstra integrasjon, vanligvis via SIP-protokollen eller WebSockets. Vanlige feil inkluderer utilstrekkelig feilhåndtering, forsinkelsesproblemer (som kan være forårsaket av forskjellige faktorer) og skalerbarhetsutfordringer.

Telefoni selv skalerer ganske bra, spesielt med VoIP. Voice AI-tjenester er hardest å skale på grunn av maskinvarekravene som er nødvendige for å kjøre LLM-er, og selv ganske store infrastruktur-spillere som Amazon (AMZN ) kan møte kapasitetsbegrensninger når det gjelder inferens-hardware.

Ser fremover, hva tror du voice AI-plattformer må støtte for å forbli relevante når sanntids-AI blir mer autonom?

Jeg tror Voice AI-plattformer må fokusere på SLA, siden det kan fortsatt være et problem noen ganger, og på ekstra verktøy for testing og overvåkning.

Til slutt vil de mest avanserte plattformene tilby alt som er nødvendig, men i dag lærer vi fortsatt nye lekser hver dag, mange av disse bør bli en del av kjerne-stakken. Hvis du arbeider med store bedrifter eller i regulerte miljøer, kan det å ha en on-prem-versjon av produktet ditt være kritisk.

Når du reflekterer over din reise fra tidlig VoIP-infrastruktur til å lede en voice AI-plattform i dag, hva har overrasket deg mest om hvordan industrien har utviklet seg?

Mange ting har overrasket meg, men en av dem er at endringer i VoIP-infrastruktur tar år å skje. Et godt eksempel er at telefoni fortsatt avhenger av smalbåndslyd-kodeker (G.711, G.729), mens folk allerede er vant til bredbåndslyd i online-kommunikasjonstjenester som Zoom, Google Meet, WhatsApp osv.

De fleste AI-modeller er trent på bredbåndslyd-data også. Alle moderne mobiltelefoner har bredbåndslyd-kodeker bygget inn, men det er fortsatt betydelige interoperabilitets-utfordringer på operatørnivå som forhindrer bredbåndslyd fra å bli brukt i tradisjonelle telefonoppringninger. Det er ikke som om det ikke er noen fremgang i det hele tatt, men i min mening, har det vært ganske beskjedent.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.