Μοντέλα και πλατφόρμες AI
Η Decagon παρουσιάζει τον πράκτορα Voice 3 με το μοντέλο ομιλίας Chord

Η Decagon παρουσίασε το Voice 3, τον πράκτορα φωνητικής AI για κλήσεις πελατών, και το Chord, το πρώτο μοντέλο ομιλίας από το Decagon Labs, στην εκδήλωση Decagon Dialogues 2026 της εταιρείας στις 1 Οκτωβρίου 2026, αναφέροντας ότι ο πράκτορας υποστηρίζει περισσότερες από 70 γλώσσες και λειτουργεί σε μια νέα διπλή αρχιτεκτονική.
Στην Ανακοίνωση Voice 3, που συντάχθηκε από τον Διευθυντή Προϊόντος Quique Lores και την Ανώτερη Διευθύντρια Μάρκετινγκ Προϊόντος Ariana Xiang, η Decagon περιέγραψε το Voice 3 ως τον πιο προχωρημένο φωνητικό AI πράκτορα μέχρι σήμερα. Ο πράκτορας μιλάει μέσω του Chord και λανσαρίστηκε μαζί με τρία άλλα προϊόντα στο Decagon Dialogues 2026.
Στη Δημοσίευση Decagon Dialogues 2026, οι συνιδρυτές Jesse Zhang, διευθύνων σύμβουλος της Decagon, και Ashwin Sreenivas, πρόεδρος της, ονόμασαν τις άλλες τρεις κυκλοφορίες: Personal Agent Gateway, που αναγνωρίζει τους προσωπικούς AI πράκτορες των πελατών και τους παρέχει ένα αφιερωμένο κανάλι για αλληλεπίδραση με μια επιχείρηση· Agent Modules, που επεκτείνουν έναν πράκτορα σε διαδρομές πέρα από την υποστήριξη· και Duet Apprentice, που επιτρέπει στο σύστημα Duet της εταιρείας να μάθει μια επιχείρηση από εσωτερικούς πόρους και κλιμακωτές συνομιλίες πελατών.
Οι επιχειρήσεις αρχικά χρησιμοποίησαν πράκτορες Decagon για την επίλυση αιτημάτων υποστήριξης, έγραψαν οι συνιδρυτές, και αυτοί οι πράκτορες τώρα προαξιολογούν υποψήφιους πελάτες, ενσωματώνουν πελάτες, συλλέγουν πληρωμές και ενδυναμώνουν σχέσεις. Οι τέσσερις κυκλοφορίες διευρύνουν τον τρόπο με τον οποίο οι πελάτες φθάνουν σε αυτό που η Decagon αποκαλεί AI κονσιέρζ και τι μπορεί να κάνει για αυτούς.
Voice 3 και το μοντέλο ομιλίας Chord
Το Chord είναι το πρώτο μοντέλο φωνής που εκπαιδεύτηκε από το Decagon Labs, και η εταιρεία δηλώνει ότι υποβλήθηκε σε μετα-εκπαίδευση με πραγματικές συνομιλίες εμπειρίας πελατών, αντί για το ευρύ φάσμα χρήσεων που εξυπηρετούν τα περισσότερα μοντέλα φωνής, από αφήγηση ηχητικών βιβλίων μέχρι φωνητικά εφέ βιντεοπαιχνιδιών. Η Decagon λέει ότι το μοντέλο διαμορφώνει την ομιλία φράση προς φράση, επιβραδύνοντας για έναν κωδικό επιβεβαίωσης ή αριθμό τηλεφώνου και στη συνέχεια επιστρέφει σε έναν συνομιλιακό ρυθμό, αντί να βασίζεται σε μία καθολική ρύθμιση ταχύτητας. Οι υπάρχουσες ρυθμίσεις προσαρμογής φωνής μεταφέρονται: επιλογή φωνής, προφορά όρων ειδικών για την επιχείρηση και παράδοση προσαρμοσμένη στην επιχείρηση.
Το Voice 3 υποστηρίζει περισσότερες από 70 γλώσσες χωρίς να απαιτείται από τις ομάδες να δημιουργήσουν ξεχωριστό πράκτορα για κάθε μία, σύμφωνα με την ανακοίνωση. Ανιχνεύει τη γλώσσα του καλούντος και αλλάζει αυτόματα, ακόμη και όταν ο καλών μεταβαίνει μεταξύ γλωσσών κατά τη διάρκεια μιας πρότασης, και η Decagon λέει ότι οι φωνές προσαρμοσμένες σε τοπικές αγορές αντανακλούν τον τρόπο που μιλούν οι άνθρωποι σε κάθε αγορά και επικυρώνονται από φυσικούς ομιλητές πριν την κυκλοφορία.
Η Decagon δηλώνει ότι το Chord εκπαιδεύεται με αδειοδοτημένα δεδομένα και συγκατάθεση φωνητικού ταλέντου, ποτέ με δεδομένα που ανήκουν στους πελάτες. Ο Christian Niedworok, Υπεύθυνος Ψηφιακής Επικοινωνίας Υπηρεσιών στη Deutsche Telekom, ανέφερε στην ανακοίνωση ότι τα χρόνια των συστημάτων IVR έχουν εκπαιδεύσει τους πελάτες να μιλούν σε σύντομες φράσεις μόνο για να φτάσουν σε έναν άνθρωπο, και ότι η φωνή της Decagon ακούγεται σαν να ακούει πραγματικά και διατηρεί τη συζήτηση σε κίνηση αντί να σιωπά ενώ λειτουργεί. Η Διευθύνουσα Λειτουργιών της Chime, Janelle Sallenave, δήλωσε ότι το Decagon Voice επιτρέπει στη Chime να συνδυάσει υψηλή απόδοση και απρόσκοπτη προσαρμογή μάρκας με μνήμη διακαναλιού, διατηρώντας κάθε αλληλεπίδραση συνδεδεμένη και πιστή στις αξίες με προτεραιότητα τα μέλη.
Διαδικασία Εκπαίδευσης και Βασικό Μοντέλο
Μια συνοδευτική ανάρτηση από τον Samuel Zhang, μέλος του τεχνικού προσωπικού της Decagon που εστιάζει στην ορχήστρωση των πρακτόρων, περιγράφει πώς δημιουργήθηκε το Chord. Η διαδικασία εκπαίδευσής του σχεδιάστηκε ώστε να διατηρεί την υφή της πραγματικής συνομιλίας, συμπεριλαμβανομένης της μεταβολής του ρυθμού, της φυσικής έμφασης, των παύσεων και των γεμιστικών λέξεων, αντί να επεξεργάζεται τις ηχογραφήσεις σε καθαρό, ομοιόμορφο ανάγνωση, κάτι που, σύμφωνα με την ανάρτηση, κάνει τις φωνές να φαίνονται συνθετικές. Δύο μέθοδοι υποστηρίζουν αυτήν την προσέγγιση: μια διαδικασία ακριβούς μεταγραφής που διατηρεί τον ρυθμό, την έμφαση και τις ατέλειες, και μια μέθοδος ηχογράφησης που συνδυάζει το περιεχόμενο ενός σεναρίου με τη φυσικότητα μιας ελεύθερης ροής συνομιλίας αντί για μια θεατρική ανάγνωση από ηθοποιούς φωνής.
Για το βασικό μοντέλο, η Decagon μετέπειτα εκπαίδεψε ένα μοντέλο διάχυσης χωρίς διακριτοποίηση. Η ανάρτηση υποστηρίζει ότι η διακριτοποίηση του ήχου σε διακριτικά στοιχεία απορρίπτει πληροφορίες σε κάθε βήμα διακριτοποίησης, ενώ μια αναπαράσταση χωρίς διακριτικά παραμένει κοντά στην απώλεια δεδομένων και διατηρεί τις λεπτές λεπτομέρειες που διακρίνουν μια φωνή που είναι απλώς κατανοητή από μια που ακούγεται παρούσα. Επίσης, καθιστά το μοντέλο πολύ πιο ευέλικτο, σύμφωνα με την ανάρτηση, επιτρέποντας στη Decagon να διαμορφώνει το συναίσθημα, τον ρυθμό και την έμφαση με ακρίβεια. Σε παραγωγή, το Chord παρέχεται μέσω του Modal.
Διπλή Αρχιτεκτονική
Η Decagon λέει ότι οι περισσότεροι φωνητικοί πράκτορες λειτουργούν με μια αλυσιδωτή διαδικασία κατά την οποία η μετατροπή ομιλίας-σε-κείμενο μεταγράφει τον καλούντα, ένα μεγάλο μοντέλο γλώσσας αποφασίζει πώς να απαντήσει, και η μετατροπή κειμένου-σε-ομιλία εκφωνεί την απάντηση, με κάθε στάδιο να προσθέτει καθυστέρηση και η συντονισμός μεταξύ των σταδίων να δυσκολεύει τη φυσική εναλλαγή. Το Voice 3 αντικαθιστά αυτή τη διάταξη με μια διπλή αρχιτεκτονική που εκτελεί δύο επίπεδα παράλληλα: ένα μοντέλο συνομιλίας χαμηλής καθυστέρησης διαχειρίζεται την ακρόαση και την ομιλία, από απαντήσεις μέχρι ενημερώσεις προόδου, ενώ ένα πιο ισχυρό μοντέλο διαχειρίζεται τη λογική, την κλήση εργαλείων και την επιβολή περιορισμών πίσω από τη συνομιλία.
Σύμφωνα με την εταιρεία, ο πράκτορας επεξεργάζεται το εισερχόμενο ήχο ακόμη και ενώ μιλάει, έτσι μιλάει με έναν καλούντα που λέει \”mhm\” αλλά παραχωρεί σε μια πραγματική διακοπή. Περιγράφει την πρόοδό του κατά τη διάρκεια μακρών αναζητήσεων, απαντά σε επακόλουθες ερωτήσεις ενώ μια εργασία εξακολουθεί να εκτελείται, και βοηθά με μικρότερα αιτήματα ενδιάμεσα, αντί να αφήνει τον καλούντα σε σιωπή ή σε αναμονή.
Αποτελέσματα Αξιολόγησης που Αναφέρει η Εταιρεία
Η ανάρτηση του Zhang αναφέρει πελάτες στον τομέα των τηλεπικοινωνιών, των χρηματοοικονομικών υπηρεσιών και του ταξιδιού και της φιλοξενίας που μεταπήδησαν από μια έτοιμη φωνή σε μια φωνή στο Chord, συγκρίνοντας τα ίδια προγράμματα πριν και μετά με μόνο τη φωνή να έχει αλλάξει. Ο ρυθμός επίλυσης αυξήθηκε σε κάθε περίπτωση, σύμφωνα με τη Decagon: κατά 6,1 μονάδες για τον πελάτη τηλεπικοινωνιών, 7,1 μονάδες για τον πάροχο χρηματοοικονομικών υπηρεσιών και 2,6 μονάδες για τη μάρκα ταξιδιού. Οι δείκτες «Barge», που ορίζει η Decagon ως το ποσοστό κλήσεων όπου ο μόνος στόχος του καλούντος είναι η επαφή με άνθρωπο, μειώθηκαν κατά 14,5, 6,1 και 5,3 μονάδες στους τρεις πελάτες.
Σε μια τυφλή δοκιμή ακρόασης με τρεις φωνές, οι ακροατές άκουσαν τα ίδια ηχητικά δείγματα που προφέρθηκαν μία φορά από το Chord και μία φορά από το ταλέντο φωνής στο οποίο βασίζεται, και κλήθηκαν να επιλέξουν ποιο ήταν το AI. Η Decagon αναφέρει ότι το 45.7% των ακροατών πίστευε ότι η πραγματική ανθρώπινη φωνή ήταν το AI, ένα αποτέλεσμα που η εταιρεία περιγράφει ως αρκετά κοντά σε μια 50-50 ρίψη νόμισμα, ώστε τα δύο να είναι ουσιαστικά αδιάφορα. Η ανακοίνωση του Voice 3 συνοψίζει το αποτέλεσμα ως περίπου 90% των χρηστών που δεν μπορούν να το διακρίνουν.
Η Decagon αναφέρει επίσης μια δοκιμή προτίμησης που τοποθέτησε το Chord αντίθετα με τρία άλλα μοντέλα ομιλίας που περιγράφει ως κορυφαία, με τις ίδιες λέξεις να προφέρονται από καθένα και οι ακροατές να κλήνονται να επιλέξουν τη φωνή με την οποία θα ήθελαν περισσότερο να μιλήσουν ως πελάτης με πρόβλημα. Σε 185 ακροατές, η εταιρεία δηλώνει ότι το Chord κατέκτησε την πρώτη θέση συνολικά με 36.2% και έφτασε έως και 48.4% σε μεμονωμένους γύρους.
Κοιτάζοντας μπροστά, η Decagon λέει ότι το πιο δύσκολο και πολύτιμο ζήτημα είναι πώς συμπεριφέρεται μια φωνή μέσα σε μια πραγματική συνομιλία, συμπεριλαμβανομένου του αν κερδίζει εμπιστοσύνη σε πέντε λεπτά και αν αντέχει όταν η κλήση γίνεται χαοτική. Η εταιρεία περιγράφει το Chord ως την πιο πρόσφατη έκφραση του κεντρικού στοιχείου στο Decagon Labs: ότι για τις αλληλεπιδράσεις με πελάτες, ένα μοντέλο που έχει βελτιστοποιηθεί για μια συγκεκριμένη εργασία υπερέχει έναν γενικού σκοπού μοντέλο σύνορων που έχει δημιουργηθεί για τα πάντα.












