Interviuri
Alexey Aylarov, Co-Fondator și CEO al Voximplant – Seria de Interviuri

Alexey Aylarov a co-fondat Voximplant după un deceniu petrecut construind instrumente de comunicare de la zero. Lucrările sale timpurii au inclus dezvoltarea de IP PBX și conducerea propriei companii de software de telecomunicații, cu mult înainte ca telefonia în cloud să devină mainstream. Zingaya a urmat, aducând apelurile click-to-call în browser. Voximplant a urmat, crescând într-o platformă fără server pe care dezvoltatorii se bazează pentru voce și video în timp real. Alexey scrie despre partea practică a Voice AI, în special acolo unde modelele de limbaj mari se ciocnesc cu realitățile haotice ale telefiei globale.
Ați început cariera dvs. ca inginer VoIP în mijlocul anilor 2000, cu mult înainte ca AI să intre în comunicațiile în timp real. Care au fost cele mai mari lacune pe care le-ați văzut atunci, care v-au împins în cele din urmă să fondați Voximplant?
Am fost implicat în sisteme VoIP din 2005. Atunci, construirea unor comunicații fiabile era lentă și complexă. Am observat că mulți dezvoltatori împărtășeau frustrarea mea – echipele încercau să conecteze componente de telecomunicații în loc să se concentreze asupra experienței de produs pe care o doreau cu adevărat să o livreze. Acest lucru m-a împins să merg spre ideea de comunicații programabile pentru dezvoltatori. Am vrut să creăm un produs care să permită tuturor să construiască produse fără a fi nevoie să fie experți în telecomunicații.
Înainte de Voximplant, am co-fondat servicii de apelare bazate pe SIP, Flashphone și Zingaya, care au oferit produse de apelare click-to-call. Cererea a demonstrat din nou că echipele doreau comunicații programabile, dar instrumentele nu erau încă acolo. Toate acestea au condus la crearea Voximplant în 2013.
Astăzi, vedem o lacună similară, dar la o scară mai mare. Voice AI intră în fluxurile de producție, modelele de limbaj mari continuă să evolueze în fiecare lună, dar rețeaua telefonică globală rămâne fragmentată. Niciun furnizor nu poate rezolva totul de la capăt la capăt. De aceea, Voximplant acționează ca un strat de orchestrare, oferind dezvoltatorilor o modalitate rapidă și rentabilă de a experimenta cu instrumentele și cele mai avansate și de a implementa agenți de voce pe apeluri reale, fără a se preocupa de infrastructura de telecomunicații sau complexitatea streaming-ului.
Voximplant se poziționează ca un strat de orchestrare, mai degrabă decât un singur furnizor de AI sau telecomunicații. De ce ați crezut că orchestrarea este stratul de abstractizare corect pentru a construi pentru viitorul Voice AI?
A fost important pentru noi de la început să fim globali, și nu puteți oferi o platformă de telecomunicații globală fără a face o anumită orchestrare de telecomunicații. Cerințele tehnice și infrastructura variază de la țară la țară, și oferim numere de telefon în peste 190 de țări, ceea ce înseamnă că facem o mulțime de mediere tehnică.
În plus, standardele de telecomunicații, cum ar fi SIP, au evoluat în multe variante de-a lungul furnizorilor. Conectarea diferiților furnizori de telecomunicații și a infrastructurilor de comunicare ale clienților necesită sisteme flexibile care pot adapta rapid. Noile rețele de telefonie, cum ar fi WhatsApp, continuă să conducă nevoi aici – și acest lucru se întâmplă înainte de a adăuga logica de control a comunicațiilor pe care o execută logica de aplicație unică a clienților noștri.
Pe partea de AI, piața este foarte intensă și evoluează rapid. Furnizorul “cel mai bun” de astăzi este probabil să fie pe locul doi sau trei săptămâna viitoare. Abordarea noastră este să sprijinim cât mai mulți furnizori de top posibili. Vrem ca clienții noștri să aibă întotdeauna o gamă completă de opțiuni de ultimă generație pentru a alege. Ei pot alege furnizorii de AI potriviți pentru aplicația lor dată – sau chiar să îi combine. Platforma noastră de orchestrare are, de asemenea, ca scop să facă mai ușoară schimbarea între furnizori – în timp ce expune în același timp toate capacitățile lor, astfel încât dezvoltatorii să nu rămână blocați cu un set de caracteristici de nivel minim.
Mulți angajați subestimează cât de dificil este pentru un agent de voce AI să efectueze și să gestioneze apeluri telefonice reale. Din perspectiva dvs., ce face ca telefonia din lumea reală să fie atât de provocatoare în comparație cu interacțiunile digitale pur AI?
Rețeaua de telefonie este încă foarte fragmentată și inconsistentă în regiuni, făcând-o și mai imprevizibilă. În unele țări, anumite protocoale pot fi restricționate sau blocate, furnizorii experimentează întreruperi ca parte a operațiunilor normale, iar modelele de rutare a apelurilor pot varia pe parcursul zilei. Există, de asemenea, regiuni în care telefonia în cloud poate fi complicată din punct de vedere legal.
Am văzut, de asemenea, cazuri în care infrastructura însăși devine un blocaj. De exemplu, un startup de sănătate australian care construia un apelant AI pentru a verifica starea pacienților în vârstă care vorbesc cantoneză a întâmpinat probleme de întârziere ridicată la furnizorii de Voice AI cu sediul în SUA (cum ar fi OpenAI sau ElevenLabs), iar disponibilitatea limitată a sintezei vocale de înaltă calitate în cantoneză a făcut ca conversațiile să pară lente și ne naturale.
Pe lângă fiabilitate, există și un strat de conformitate. Cerințele variază foarte mult de la țară la țară și adesea se suprapun cu cadre precum HIPAA, PCI DSS și GDPR.
Performanța vorbirii însăși nu este universală. Niciun singur motor de recunoaștere a vorbirii sau de sinteză vocală nu funcționează cel mai bine în toate mediile. Accente, zgomot de fundal, fluctuații ale calității apelului sau chiar degradarea furnizorului pot cauza scăderi bruște ale preciziei și experienței utilizatorului.
Unele sisteme de Voice AI se bazează astăzi pe mai mulți furnizori pentru modele de limbaj mari, speech-to-text, text-to-speech și routing. De ce este această fragmentare inevitabilă, și de ce ar trebui să fie o schimbare rapidă de cod, mai degrabă decât un proiect de inginerie major?
La începutul Voice AI, nu a existat o adevărată opțiune de speech-to-speech, așa că a trebuit să combinați speech-to-text, LLM și text-to-speech. Astăzi, mai mulți furnizori de LLM integrează direct vorbirea (adesea cu un anumit nivel de suport de barge-in), eliminând nevoia de a construi o conductă completă. Aceste sisteme sunt mai rapide și foarte interactive, dar au încă limitări cu aspecte precum apelarea funcțională și oferă mai puține opțiuni pentru îmbunătățirea transcrierii și a vocilor. Ne așteptăm ca modelele de limbaj bazate pe vorbire să fie comparabile cu modelele de text în curând. Chiar și atunci, clienții ar putea să dorească să utilizeze furnizori de vorbire diferiți pentru cerințele lor specifice. Separarea conductei are, de asemenea, avantaje pentru redundanță.
Schimbarea furnizorilor de AI și de vorbire pe platforma noastră nu este o operațiune majoră de inginerie, dar este mai mult decât o singură linie de cod. Furnizorii de vorbire se luptă constant împotriva comercializării, introducând funcții unice. Păstrăm conectoarele noastre cât mai consistente posibil, expunând în același timp capacitățile fiecărui furnizor. Așa că, pentru a profita de aceste funcții unice, schimbarea furnizorilor adesea înseamnă modificarea câtorva linii de cod.
Cum încep agenții de voce AI să schimbe economia suportului clienților, vânzărilor și altor operațiuni B2C în comparație cu modelele tradiționale de call-center?
Poate că este prea devreme pentru a vorbi despre o schimbare semnificativă în economia suportului clienților, dar cu siguranță vine. Astăzi, există regiuni în care reprezentanții de suport clienți costă mai puțin decât serviciile bazate pe LLM, însă acest model vine cu provocări cunoscute legate de scalabilitate, epuizare, management și operațiuni. Presupun că economia se va schimba semnificativ pe măsură ce optimizarea LLM continuă să se îmbunătățească, deși va dura ceva timp.
Ce semnale vă spun că Voice AI trece de la experimentare la infrastructură critică pentru întreprinderi?
Semnalul cel mai puternic aici este investiția în infrastructura Voice AI, care crește rapid. Există modalități de a urmări apelurile sau minutele activate de Voice AI la scară globală, dacă nu exact, prin estimări. Deși pot urmări direct doar pentru Voximplant, vedem clar o creștere puternică.
Cum credeți că așteptările dezvoltatorilor în legătură cu flexibilitatea și controlul s-au schimbat pe măsură ce modelele de AI și tehnologiile vocale se iteratează mai rapid?
Asta e o întrebare interesantă. Când vine vorba de viteza de schimbare, AI este nemăsurat de orice am văzut în istorie. Controlul și flexibilitatea sunt mai puțin clare, în funcție de ceea ce înțelegem prin aceste termene. Când vine vorba de control, există multe provocări cunoscute, și depășirea lor nu este ușoară. Majoritatea companiilor de AI cheltuie eforturi semnificative pe gardurile de model, dar a face acest lucru bine necesită expertiză profundă, și diferite companii au, în mod evident, obiective diferite.
Care sunt greșelile pe care le fac companiile cel mai frecvent atunci când încearcă să implementeze agenți de voce AI direct pe sistemele de telecomunicații tradiționale?
Sistemele de telecomunicații tradiționale nu sunt compatibile direct cu serviciile de Voice AI, deci de obicei necesită integrare suplimentară, de obicei prin protocolul SIP sau WebSockets. Greșelile comune includ gestionarea inadecvată a failover-ului, probleme de întârziere (care pot fi cauzate de diverse factori) și provocări de scalabilitate.
Telefonia însăși se escaladează destul de bine, în special cu VoIP. Serviciile de Voice AI sunt mai greu de escaladat din cauza cerințelor de hardware necesare pentru a rula LLM, și chiar jucători de infrastructură mari, cum ar fi Amazon (AMZN ), pot întâmpina constrângeri de capacitate atunci când vine vorba de hardware de inferență.
Privind înainte, ce capacități trebuie să susțină platformele de voce AI pentru a rămâne relevante pe măsură ce AI-ul în timp real devine mai autonom?
Cred că platformele de Voice AI trebuie să se concentreze pe SLA, deoarece poate fi încă o problemă uneori, și pe unelte suplimentare pentru testare și observabilitate.
În cele din urmă, platformele cele mai avansate vor oferi tot ceea ce este necesar, dar astăzi, încă învățăm lecții noi în fiecare zi, multe dintre care ar trebui să devină parte a stivei de bază. Dacă lucrați cu întreprinderi mari sau în medii reglementate, aveți o versiune locală a produsului dvs. poate fi critică.
Când reflectați asupra călătoriei dvs. de la infrastructura VoIP timpurie la conducerea unei platforme de voce AI astăzi, ce v-a surprins cel mai mult despre modul în care industria a evoluat?
Multe lucruri m-au surprins, dar unul dintre ele este că schimbările în infrastructura VoIP durează ani pentru a se întâmpla. Un exemplu bun este că telefonia încă se bazează pe codificatori audio cu bandă îngustă (G.711, G.729), în timp ce oamenii sunt deja obișnuiți cu audio cu bandă largă în servicii de comunicare online, cum ar fi Zoom, Google Meet, WhatsApp etc.
Majoritatea modelelor de AI sunt antrenate pe date audio cu bandă largă. Toate telefoanele mobile moderne au codificatori audio cu bandă largă încorporați, dar există încă provocări semnificative de interoperabilitate la nivelul furnizorilor care împiedică utilizarea audio-ului cu bandă largă în apelurile telefonice tradiționale. Nu este ca și cum nu ar fi niciun progres, dar, în opinia mea, a fost foarte modest.












