Συνεντεύξεις
Алексέι Αϊλаров, Συνιδρυτής και Διευθύνων Σύμβουλος της Voximplant – Σειρά Συνεντεύξεων

Ο Алексέι Αϊλаров συνίδρυσε την Voximplant μετά από μια δεκαετία αφιερωμένη στην ανάπτυξη εργαλείων επικοινωνίας από το μηδέν. Η πρώιμη δουλειά του περιελάμβανε την ανάπτυξη IP PBX και τη διεύθυνση της δικής του εταιρείας λογισμικού τηλεπικοινωνιών πολύ πριν η τηλεφωνία cloud γίνει mainstream. Ακολούθησε η Zingaya, η οποία έφερε το click-to-call μέσα στο πρόγραμμα περιήγησης. Η Voximplant ακολούθησε, εξελισσόμενη σε μια ατελείωτη πλατφόρμα που οι développers εξαρτώνται για πραγματικό χρόνο φωνής και βίντεο. Ο Алексέι γράφει για την πρακτική πλευρά της Voice AI, ιδιαίτερα там όπου τα μεγάλα μοντέλα γλωσσών συναντούν τις ακατάστατες πραγματικότητες της παγκόσμιας τηλεφωνίας.
Ξεκινήσατε την καριέρα σας ως μηχανικός VoIP στη μέση της δεκαετίας του 2000, πολύ πριν η AI εισέλθει στις πραγματικές επικοινωνίες. Ποια ήταν τα μεγαλύτερα κενά που είδετε τότε που τελικά σας οδήγησαν στην ίδρυση της Voximplant;
Έχω εμπλακεί με συστήματα VoIP από το 2005. Τότε, η κατασκευή αξιόπιστων επικοινωνιών ήταν αργή και σύνθετη. Παρατήρησα ότι πολλοί développers μοιράζονταν την απογοήτευσή μου – οι ομάδες προσπαθούσαν να συνδέσουν компоненты τηλεφωνίας αντί να επικεντρωθούν στην εμπειρία προϊόντος που eigentlich ήθελαν να παραδώσουν. Αυτό με ώθησε να κινηθώ προς την ιδέα των προγραμματιζόμενων επικοινωνιών για développers. Θέλαμε να δημιουργήσουμε ένα προϊόν που θα επέτρεπε σε όλους να κατασκευάζουν προϊόντα χωρίς να χρειάζονται να είναι εμπειρογνώμονες τηλεφωνίας.
Πριν από τη Voximplant, συνίδρυσα τις υπηρεσίες κλήσεων SIP-based Flashphone και Zingaya, οι οποίες προσέφεραν πρώιμα προϊόντα click-to-call. Η ζήτηση αποδείχθηκε ξανά ότι οι ομάδες ήθελαν προγραμματιζόμενη επικοινωνία, αλλά το εργαλείο δεν ήταν ακόμη εκεί. Όλα αυτά οδήγησαν στη δημιουργία της Voximplant το 2013.
Σήμερα, βλέπουμε ένα παρόμοιο κενό, αλλά σε μεγαλύτερο βαθμό. Η Voice AI εισέρχεται στις ροές παραγωγής, τα LLMs συνεχίζουν να εξελίσσονται κάθε μήνα, αλλά το παγκόσμιο τηλεφωνικό δίκτυο παραμένει αποσυνδεδεμένο. Κανένας單ός προμηθευτής δεν μπορεί να λύσει όλα τα προβλήματα από το τέλος στο τέλος. Για αυτό, η Voximplant λειτουργεί ως ένα επίπεδο ορχήστρας, προσφέροντας στους développers einen γρήγορο και οικονομικά αποδοτικό τρόπο να πειραματιστούν με τα πιο πρόσφατα και προηγμένα εργαλεία και να αναπτύξουν Voice Agents σε πραγματικές κλήσεις, χωρίς να ανησυχούν για τη τηλεφωνική υποδομή ή τη σύνθετη ροή.
Η Voximplant θέτει τον εαυτό της ως ένα επίπεδο ορχήστρας και όχι ως einen đơnικό AI ή τηλεφωνικό προμηθευτή. Γιατί πιστεύετε ότι η ορχήστρα ήταν το σωστό επίπεδο αφαίρεσης για να κατασκευαστεί για το μέλλον της φωνητικής AI;
Ήταν σημαντικό για μας από την αρχή να είμαστε παγκόσμιοι, και δεν μπορείτε να προσφέρετε ένα παγκόσμιο τηλεφωνικό δίκτυο χωρίς να κάνετε κάποια τηλεφωνική ορχήστρα. Οι τεχνικές απαιτήσεις και η υποδομή ποικίλλουν ανά χώρα, και προσφέρουμε τηλεφωνικούς αριθμούς σε περισσότερες από 190 χώρες, οπότε αυτό σημαίνει ότι κάνουμε πολλή τεχνική διαμεσολάβηση.
Επιπλέον, τα τηλεφωνικά πρότυπα όπως το SIP έχουν εξελιχθεί σε πολλές γεύσεις μεταξύ προμηθευτών. Η σύνδεση διαφορετικών τηλεπικοινωνιακών εταιρειών και των verschiedenen υποδομών επικοινωνιών των πελατών απαιτεί ευέλικτα συστήματα που μπορούν να προσαρμοστούν γρήγορα. Νέα τηλεφωνικά δίκτυα, όπως το WhatsApp, για παράδειγμα, συνεχίζουν να οδηγούν τις ανάγκες εδώ – και αυτό είναι πριν από την προσθήκη της λογικής του επιπέδου ελέγχου επικοινωνιών που στην πραγματικότητα εκτελεί την 唯一τική λογική της εφαρμογής των πελατών μας.
Στην πλευρά της AI, η αγορά είναι πολύ έντονη και εξελίσσεται γρήγορα. Ο “καλύτερος” προμηθευτής σήμερα είναι πιθανό να είναι δεύτερος ή τρίτος την επόμενη εβδομάδα. Η προσέγγισή μας είναι να υποστηρίξουμε όσο το δυνατόν περισσότερους από τους ηγετικούς προμηθευτές. Θέλουμε οι πελάτες μας να έχουν πάντα μια πλήρη σειρά από state-of-the-art επιλογές για να επιλέξουν – ή ακόμη και να αναμιχθούν. Η πλατφόρμα ορχήστρας μας επίσης στοχεύει να κάνει την αλλαγή μεταξύ προμηθευτών πιο απλή – ενώ εξακολουθούμε να εκθέτουμε τις πλήρεις ικανότητες τους, ώστε οι développers δεν θα μείνουν κολλημένοι με ένα lowest common denominator σύνολο χαρακτηριστικών.
Πόσα ομάδες υποτιμούν πόσο δύσκολο είναι για einen φωνητικό AI agent να τοποθετήσει και να διαχειριστεί πραγματικές τηλεφωνικές κλήσεις. Από την πλευρά σας, τι κάνει την τηλεφωνία τόσο δύσκολη σε σύγκριση με τις ψηφιακές αλληλεπιδράσεις AI;
Το τηλεφωνικό δίκτυο είναι ακόμη高度 αποσυνδεδεμένο και ανομοιόμορφο σε διάφορες περιοχές, καθιστώντας το ακόμη πιο απρόβλεπτο. Σε ορισμένες χώρες, ορισμένα πρωτόκολλα μπορεί να είναι περιορισμένα ή μπλοκαρισμένα, οι φορείς τηλεπικοινωνιών αντιμετωπίζουν διακοπές ως μέρος της κανονικής λειτουργίας, και τα μοτίβα διαδρομής κλήσεων μπορούν να αλλάξουν καθ’ όλη τη διάρκεια της ημέρας. Υπάρχουν επίσης περιοχές όπου η τηλεφωνία cloud μπορεί να είναι νομικά σύνθετη.
Έχουμε επίσης δει περιπτώσεις όπου η υποδομή herself γίνεται το μπουκέτο. Για παράδειγμα, ένα αυστραλιανό startup υγείας που κατασκευάζει einen φωνητικό caller για να ελέγξει τους ηλικιωμένους Καντονέζους ασθενείς αγωνίστηκε με υψηλή καθυστέρηση προς τους προμηθευτές Voice AI των ΗΠΑ (όπως OpenAI ή ElevenLabs), και η περιορισμένη διαθεσιμότητα υψηλής ποιότητας Καντονέζικης TTS έκανε τις συνομιλίες να感觉 slow και μη φυσικές.
Επάνω από την αξιοπιστία, υπάρχει το επίπεδο συμμόρφωσης. Οι απαιτήσεις ποικίλλουν ευρέως από χώρα σε χώρα και συχνά перекrýονται με πλαισια όπως το HIPAA, το PCI DSS και το GDPR.
Η απόδοση ομιλίας herself δεν είναι καθολική. Κανένας STT ή TTS μηχανισμός δεν λειτουργεί καλύτερα σε κάθε περιβάλλον. Προφορικοί τόνοι, θόρυβος στο υπόβαθρο, διακυμάνσεις ποιότητας κλήσεων ή ακόμη και προμηθευτής υποβάθμιση possono να προκαλέσουν απότομες πτώσεις στην ακρίβεια και την εμπειρία χρήστη.
Ορισμένα συστήματα Voice AI σήμερα βασίζονται σε πολλούς προμηθευτές για LLMs, speech-to-text, text-to-speech και διαδρομή. Γιατί είναι αυτό το αποσύνδεσμο αναπόφευκτο, και γιατί πρέπει η αλλαγή AI ή προμηθευτή ομιλίας να είναι μια γρήγορη αλλαγή κώδικα και όχι ένα σημαντικό έργο μηχανικής;
Στις πρώτες μέρες της Voice AI, δεν υπήρχε αληθινή επιλογή ομιλίας-προς-ομιλία, οπότε έπρεπε να συναρμολογήσετε speech-to-text, LLM και text-to-speech. Σήμερα, πολλοί προμηθευτές LLMs ενσωματώνουν ομιλία直接 (συχνά με κάποιο επίπεδο υποστήριξης barge-in), αφαιρώντας την ανάγκη να κατασκευάσετε μια πλήρη πipeline. Αυτά τα συστήματα είναι ταχύτερα και高度 interactive, αλλά εξακολουθούσαν να έχουν περιορισμούς σε аспектς όπως η λειτουργική κλήση και προσφέρουν λιγότερες επιλογές για βελτίωση μεταγραφής και φωνών. Περιμένουμε τα speech-основанные LLMs να είναι συγκρίσιμα με τα μοντέλα κειμένου σύντομα. Ακόμη και τότε, οι πελάτες μπορεί να θέλουν να χρησιμοποιήσουν διαφορετικούς προμηθευτές ομιλίας για τις συγκεκριμένες απαιτήσεις τους. Η αποσύνδεση της πipeline επίσης προσφέρει επιλογές για αναduplication.
Η αλλαγή AI και προμηθευτών ομιλίας στην πλατφόρμα μας δεν είναι ένα σημαντικό έργο μηχανικής, αλλά είναι πιο чем μια αλλαγή κώδικα μιας γραμμής, επίσης. Οι προμηθευτές ομιλίας αγωνίζονται συνεχώς ενάντια στην εμπορευματοποίηση, εισάγοντας μοναδικά χαρακτηριστικά. Κρατάμε τους συνδετήρες μας όσο το δυνατόν πιο συνεπείς, ενώ εκθέτουμε τις ικανότητες κάθε προμηθευτή, οπότε η αξιοποίηση αυτών των μοναδικών χαρακτηριστικών, η αλλαγή προμηθευτών συχνά σημαίνει την αλλαγή quelques γραμμών κώδικα.
Πώς αρχίζουν οι φωνητικοί AI agents να αλλάζουν την οικονομική των υπηρεσιών υποστήριξης πελατών, πωλήσεων και άλλων B2C λειτουργιών σε σύγκριση με τα παραδοσιακά μοντέλα κέντρων κλήσεων;
Μожет być ακόμη νωρίς για να μιλήσουμε για μια σημαντική αλλαγή στην οικονομική των υπηρεσιών υποστήριξης πελατών, αλλά είναι σίγουρα έρχεται. Σήμερα, υπάρχουν περιοχές όπου οι αντιπρόσωποι υποστήριξης πελατών κοστίζουν λιγότερο από τις υπηρεσίες LLM-ενεργοποιημένες, ωστόσο αυτό το μοντέλο έρχεται με γνωστά προβλήματα γύρω από την κλιμάκωση, την εξουθένωση, τη διαχείριση και τις λειτουργίες. Υποθέτω ότι η οικονομική θα αλλάξει σημαντικά καθώς η βελτίωση των LLMs συνεχίζει να βελτιώνεται, αν και θα χρειαστεί κάποιο χρόνο.
Τι σήματα σας λένε ότι η Voice AI μετακινείται από την πειραματική στη mission-critical υποδομή για τις επιχειρήσεις;
Το ισχυρότερο σήμα εδώ είναι η επένδυση στην υποδομή Voice AI, η οποία αυξάνεται γρήγορα. Υπάρχουν τρόποι να παρακολουθήσετε τις κλήσεις Voice AI-ενεργοποιημένες ή τα λεπτά σε παγκόσμιο επίπεδο, αν όχι ακριβώς, μέσω εκτιμήσεων. Ενώ μπορώ να παρακολουθήσω μόνο αυτό直接 για τη Voximplant, βλέπουμε σαφώς ισχυρή αύξηση.
Πώς νομίζετε ότι οι προσδοκίες των développers γύρω από την ευελιξία και τον έλεγχο έχουν αλλάξει καθώς τα μοντέλα AI και οι τεχνολογίες φωνής εξελίσσονται πιο γρήγορα;
Αυτό είναι ένα ενδιαφέρον ερώτημα. Όταν πρόκειται για ταχύτητα αλλαγής, η AI είναι ακατάλληλη από οτιδήποτε έχουμε δει στην ιστορία. Ο έλεγχος και η ευελιξία είναι λιγότερο σαφείς, ανάλογα με το τι εννοούμε με αυτά τα όροι. Όταν πρόκειται για έλεγχο, υπάρχουν πολλά γνωστά προβλήματα, και η υπέρβαση τους δεν είναι εύκολη. Οι περισσότερες εταιρείες AI δαπανώνουν σημαντικές προσπάθειες στα model guardrails, αλλά το να το κάνουν καλά απαιτεί βαθιά εμπειρογνωσία, και διαφορετικές εταιρείες έχουν σαφώς διαφορετικά στόχους.
Ποια είναι τα λάθη που οι εταιρείες κάνουν πιο συχνά όταν προσπαθούν να αναπτύξουν φωνητικούς AI agents直接 πάνω σε παραδοσιακά τηλεφωνικά συστήματα;
Τα παραδοσιακά τηλεφωνικά συστήματα δεν είναι直接 συμβατά με τις υπηρεσίες Voice AI, οπότε συνήθως απαιτούν πρόσθετη ενοποίηση, συνήθως μέσω του πρωτοκόλλου SIP ή WebSockets. Κοινά λάθη περιλαμβάνουν ανεπαρκή διαχείριση failover, προβλήματα καθυστέρησης (τα οποία μπορούν να προκληθούν από διάφορους παράγοντες) και προκλήματα κλιμάκωσης.
Η τηλεφωνία herself κλιμακώνεται khá καλά, ιδιαίτερα με VoIP. Οι υπηρεσίες Voice AI είναι πιο δύσκολο να κλιμακωθούν λόγω των απαιτήσεων υλικού που απαιτούνται για να τρέξουν LLMs, και ακόμη και khá μεγάλοι παίκτες υποδομής όπως η Amazon (AMZN ) μπορούν να αντιμετωπίσουν περιορισμούς ικανότητας όταν πρόκειται για inference hardware.
Κοιτάζοντας μπροστά, ποιες ικανότητες πρέπει να υποστηρίξει η φωνητική AI πλατφόρμα για να παραμείνει σχετική καθώς η πραγματική AI γίνεται πιο αυτόνομη;
Νομίζω ότι η Voice AI πλατφόρμα πρέπει να επικεντρωθεί στην SLA,既然 μπορεί ακόμη να είναι ένα ζήτημα σε ορισμένες περιπτώσεις, και σε πρόσθετα εργαλεία για δοκιμή και παρατηρησιμότητα.
Τελικά, οι πιο προηγμένες πλατφόρμες θα προσφέρουν όλα τα απαραίτητα, αλλά σήμερα, μαθαίνουμε ακόμη νέες μαθήματα κάθε μέρα, πολλά από τα οποία θα πρέπει να γίνουν μέρος του πυρήνα στοίβας. Αν εργάζεστε με μεγάλες επιχειρήσεις ή σε ρυθμιζόμενους περιβάλλοντα, η διαθεσιμότητα μιας εκδοχής on-prem του προϊόντος σας μπορεί να είναι κρίσιμη.
Όταν αναλογιστείτε το ταξίδι σας από την πρώιμη υποδομή VoIP μέχρι την ηγεσία μιας φωνητικής AI πλατφόρμας σήμερα, τι σας έχει εκπλήξει περισσότερο σχετικά με το πώς η βιομηχανία έχει εξελιχθεί;
Πολλά πράγματα με έχουν εκπλήξει, αλλά ένα από αυτά είναι ότι οι αλλαγές στην υποδομή VoIP λαμβάνουν χρόνια για να συμβούν. Ένα καλό παράδειγμα είναι ότι η τηλεφωνία ακόμη βασίζεται σε στενό-πρόσωπο audio codecs (G.711, G.729), ενώ οι άνθρωποι είναι ήδη συνηθισμένοι σε wideband audio σε online υπηρεσίες επικοινωνίας όπως το Zoom, το Google Meet, το WhatsApp, κ.λπ.
Τα περισσότερα μοντέλα AI εκπαιδεύονται σε wideband audio δεδομένα επίσης. Όλα τα σύγχρονα κινητά τηλέφωνα έχουν wideband audio codecs ενσωματωμένα, αλλά υπάρχουν ακόμη σημαντικά προβλήματα συμβατότητας στο επίπεδο του φορέα που εμποδίζουν την wideband audio από το να χρησιμοποιηθεί σε παραδοσιακές τηλεφωνικές κλήσεις. Δεν είναι σαν να μην υπάρχει πρόοδος καθόλου, αλλά κατά την άποψή μου, έχει sido πολύ μετριοπαθής.












