Μοντέλα και πλατφόρμες AI
Η ElevenLabs παρουσιάζει το Eleven V4 με παραλλαγή Turbo χαμηλής καθυστέρησης

Η ElevenLabs στις 28 Σεπτεμβρίου 2026 παρουσίασε Eleven v4, ένα μοντέλο κειμένου-σε-ομιλία που η εταιρεία περιγράφει ως το πιο εκφραστικό μέχρι τώρα, καθώς και το Eleven v4 Turbo, μια παραλλαγή χαμηλής καθυστέρησης σχεδιασμένη για φωνητικούς πράκτορες και χρήση σε πραγματικό χρόνο. Και τα δύο μοντέλα είναι διαθέσιμα αμέσως στο ElevenAgents, ElevenCreative και μέσω ElevenAPI, με πρόσβαση συμπεριλαμβανόμενη στο δωρεάν επίπεδο λογαριασμού.
Η ανακοίνωση κυκλοφορίας γράφτηκε από τους Mati Staniszewski και Piotr Dabkowski και καταχωρήθηκε στην κατηγορία Έρευνα της εταιρείας.
Νέα αρχιτεκτονική με έμφαση στην εκφραστικότητα
Η ElevenLabs δηλώνει ότι το Eleven v4 είναι χτισμένο πάνω σε μια εντελώς νέα αρχιτεκτονική σχεδιασμένη να ερμηνεύει τον τόνο, το ρυθμό, το συναίσθημα, τον χαρακτήρα και το πλαίσιο από το κείμενο, παράγοντας ομιλία που μπορεί να ακούγεται δραματική, τρυφερή, επείγουσα, κωμική ή συνομιλιακή, διατηρώντας ταυτόχρονα την ταυτότητα του ομιλητή. Η εταιρεία αναφέρει ότι η υποκείμενη πιστότητα ήχου είναι υψηλότερη συνολικά σε σχέση με τα προηγούμενα μοντέλα της.
Σύμφωνα με την εταιρεία, μια νέα μέθοδος καταγραφής ταυτοτήτων ομιλητών έχει σχεδιαστεί ώστε να διατηρεί κάθε φωνή συνεπή σε συνομιλίες πρακτόρων, ηχητικά βιβλία και διαφημίσεις, ενώ το πλαίσιο επιπέδου σκηνής επιτρέπει στους ομιλητές να ανταποκρίνονται σε ό,τι μόλις ειπώθηκε σε μια συζήτηση, παράγοντας διάλογο που η εταιρεία περιγράφει ως πιο φυσικό από τη συναρμολόγηση απομονωμένων φράσεων.
Οι ετικέτες ήχου ενσωματωμένες στο κείμενο αντικαθιστούν τους ελέγχους SSML
Οι χρήστες μπορούν να καθοδηγούν την παράδοση σε φυσική γλώσσα και να ενσωματώνουν ετικέτες ήχου εντός κειμένου· παραδείγματα της εταιρείας περιλαμβάνουν γέλια, «είπε θυμωμένα με γαλλική προφορά», ελαφρύ βροχόπτωση και ήχο τριζόνιου τηλεφώνου. Η ElevenLabs δηλώνει ότι το μοντέλο ακολουθεί αυτές τις ετικέτες ήχου και τις προτροπές κατεύθυνσης με μεγαλύτερη ακρίβεια από τα προηγούμενα μοντέλα της. Η υποστήριξη για φωνήματα του Διεθνούς Φωνητικού Αλφαβήτου βελτιώθηκε σημαντικά, ώστε οι προσαρμοσμένες προφορές να λειτουργούν πιο αξιόπιστα, και η τεκμηρίωση προγραμματιστών της ElevenLabs καλύπτει τη σύνταξη όλων των ετικετών για χρήση μέσω API. Σύμφωνα με τις Συχνές Ερωτήσεις της σελίδας προϊόντος, ετικέτες SSML όπως <break> είναι απενεργοποιημένες στο Eleven v4, με ετικέτες φυσικής γλώσσας να λειτουργούν ως μηχανισμός ελέγχου αντί αυτού.
Παραλλαγή Turbo και Μετρήσεις Καθυστέρησης
Για χρήση σε πραγματικό χρόνο, η ElevenLabs δηλώνει ότι οι ερευνητικές και μηχανικές της ομάδες βελτιστοποίησαν το Eleven v4 Turbo μαζί με την πλατφόρμα συνομιλίας ElevenAgents ως ένα ενιαίο σύστημα. Το Turbo υποστηρίζει αμφίδρομη ροή, ώστε ο ήχος να αρχίζει να επιστρέφει πριν ολοκληρωθεί μια πρόταση.
Η μεθοδολογία με υποσημειώσεις της ανακοίνωσης αναφέρει ότι το Eleven v4 Turbo κατέγραψε μέση ώρα μέχρι την πρώτη ομιλία περίπου 150 χιλιοστά του δευτερολέπτου σε δοκιμές του Σεπτεμβρίου 2026 που εκτελέστηκαν μέσω ροής WebSocket με ταυτόσες δέσμες ενεργειών και προεπιλεγμένες ρυθμίσεις, σε σύγκριση με τα Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS και OpenAI GPT‑4o mini TTS, με τη δικτυακή καθυστέρηση να μετριέται και να αφαιρείται για όλα τα συστήματα. Το διάγραμμα σύγκρισης στη σελίδα προϊόντος της εταιρείας εμφανίζει 150 ms ως το αναφοράς νούμερο, έναντι των δηλωμένων 262 ms για το Cartesia Sonic 3.6 και 814 ms για το OpenAI GPT‑4o mini TTS. Η ανακοίνωση αναφέρει επίσης μέση καθυστέρηση επαγωγής περίπου 100 ms για το Turbo, αριθμό που η εταιρεία δηλώνει ότι είναι ταχύτερος από το μέσο διάλειμμα μεταξύ δύο ατόμων που μιλούν.
Γλώσσες, Κλωνοποίηση Φωνής και Ήχος Μακράς Διάρκειας
Και τα δύο μοντέλα υποστηρίζουν περισσότερες από 90 γλώσσες. Η εταιρεία δηλώνει ότι μια φωνή που καταγράφηκε σε μία γλώσσα μπορεί πλέον να μιλάει άλλες άπταιστα, υιοθετώντας την προφορά ενός ντόπιου ομιλητή, και ότι η τήρηση της προφοράς δεν επιστρέφει πλέον στην αρχική προφορά κατά τη διάρκεια μιας παραγωγής.
Τα Άμεσα Κλώνα Φωνής μπορούν πλέον να καταγράψουν μια φωνή με υψηλή πιστότητα από 10 δευτερόλεπτα ήχου, σύμφωνα με την εταιρεία, η οποία επίσης δηλώνει ότι υπερτερούν των Επαγγελματικών Κλώνων Φωνής του μοντέλου Multilingual v2. Οι Επαγγελματικοί Κλώνοι Φωνής, που δεν ήταν διαθέσιμοι στο Eleven v3, υποστηρίζονται ξανά και λειτουργούν με το πλήρες συναισθηματικό εύρος του μοντέλου. Κάθε κλώνος, άμεσος ή επαγγελματικός, απαιτεί επαληθευμένη συγκατάθεση του ιδιοκτήτη της φωνής, και ο παραγόμενος ήχος καλύπτεται από την τεχνολογία AI Speech Classifier της ElevenLabs, την οποία η εταιρεία λέει ότι μπορεί να εντοπίσει ως παραγόμενο από AI.
Η συγχώνευση αιτημάτων, η αλυσίδα γεννήσεων για περιεχόμενο μεγαλύτερης διάρκειας, είναι σημαντικά πιο αξιόπιστη στο Eleven v4, σύμφωνα με την εταιρεία, βελτιώνοντας την εμπειρία εργασίας στο ElevenLabs Studio και στην εφαρμογή ElevenLabs Reader. Μια μεμονωμένη γεννήση υποστηρίζει έως 10,000 χαρακτήρες, με τη συγχώνευση περιεχομένου να διατηρεί το ρυθμό και την παράδοση συνεπή σε μεγαλύτερα σενάρια.
Αποτελέσματα Benchmark που Αναφέρει η Εταιρεία
Η ElevenLabs αναφέρει ότι το Eleven v4 κατέλαβε την πρώτη θέση στο leaderboard Voice Arena του Artificial Analysis Provider για τον Σεπτέμβριο 2026 και προτιμήθηκε από περίπου το 75 % των ακροατών σε τυφλές συγκρίσεις ένας‑προς‑έναν. Η μεθοδολογία με υποσημειώσεις δηλώνει ότι αυτές οι δοκιμές του Σεπτεμβρίου 2026 έθεσαν το μοντέλο απέναντι στα Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS και Google Gemini 3.8 Flash TTS, με τους κριτές να ακούνε την ίδια γραμμή από το Eleven v4 και έναν ανταγωνιστή παρουσίαση τυφλή, αξιολογώντας ποιο ήταν πιο εκφραστικό και ποιο πιο φυσικό, ενώ οι ισοπαλίες μετρήθηκαν ως μισό. Ένα διάγραμμα στην ανακοίνωση αναφέρει ότι το Eleven v4 κέρδισε το 65 %–81 % αυτών των αντιστοιχίσεων.
Πρόσβαση API, Τιμολόγηση και Συμμόρφωση
Και τα δύο μοντέλα είναι προσβάσιμα μέσω σημείων πρόσβασης REST και streaming με SDK για TypeScript και Python, και οι προγραμματιστές μπορούν να εναλλάσσουν τα μοντέλα με ένα μόνο model_id. Οι μορφές εξόδου ταιριάζουν με όλες τις άλλες μοντέλα της ElevenLabs: MP3, μη συμπιεσμένο WAV/PCM για στούντιο και μεταπαραγωγική εργασία, και µ-law για τηλεφωνικές και κέντρα κλήσεων ενσωματώσεις, με το ρυθμό δειγματοληψίας και το bitrate να ορίζονται μέσω του API.
Η τιμολόγηση ακολουθεί την ίδια δομή πίστωσης με τα άλλα μοντέλα κειμένου-σε-ομιλία της εταιρείας: ένα δωρεάν επίπεδο με 10,000 πόντους ανά μήνα, που η εταιρεία ισοδυναμεί περίπου με 10 λεπτά ήχου· επί πληρωμή σχέδια που ξεκινούν από $6 ανά μήνα και περιλαμβάνουν επαγγελματική κλωνοποίηση φωνής· και προσαρμοσμένη τιμολόγηση για επιχειρήσεις. Κάθε φωνή στη βιβλιοθήκη της εταιρείας, που περιλαμβάνει πάνω από 17,500 φωνές, λειτουργεί με το Eleven v4, αν και οι άμεσες και επαγγελματικές κλώνες που δημιουργήθηκαν πριν από την κυκλοφορία πρέπει να επανεκπαιδευτούν για να λειτουργούν αποτελεσματικά με το νέο μοντέλο.
Η ElevenLabs δηλώνει ότι το Eleven v4 λειτουργεί σε υποδομή πιστοποιημένη με SOC 2 Type II, ISO 27001 και PCI DSS Level 1, είναι σύμφωνο με το GDPR με ροές εργασίας που πληρούν τις προϋποθέσεις HIPAA για την υγειονομική περίθαλψη, δεν εκπαιδεύεται σε σενάρια ή ετικέτες ήχου χωρίς συγκατάθεση, και προσφέρει τη λειτουργία Zero Retention Mode για επιλέξιμες επιχειρηματικές υπηρεσίες.
Η Σελίδα προϊόντος Eleven v4 περιέχει δηλώσεις από ονομαστικούς πελάτες, συμπεριλαμβανομένου του Ryan Peterson, SVP προϊόντος για το Agentforce Voice στη Salesforce, ο οποίος είπε: «Ακριβώς εδώ βλέπουμε το Eleven v4 Turbo να θέτει νέο επίπεδο, με ταχύτερες, πιο φυσικές απαντήσεις που ανταποκρίνονται στο πρότυπο που αναμένουν οι πελάτες μας». Ο συνιδρυτής της BeyondWords, Patrick O’Flaherty, ο επικεφαλής προϊόντων δημιουργίας πίστωσης της Spring Financial, Oscar Daniels, και ο υπεύθυνος μουσικής και ήχου του Accenture Accelerate, Kyle Gudmundson, επίσης έδωσαν δηλώσεις για τα νέα μοντέλα.
Η ElevenLabs κατευθύνει τους προγραμματιστές στην τεκμηρίωσή της για τη σύνταξη του πλήρους audio-tag και τις λεπτομέρειες ενσωμάτωσης του API.












