Modele i platformy AI
ElevenLabs wprowadza Eleven V4 z niską latencją w wariancie Turbo

ElevenLabs 28 września 2026 roku wprowadziło Eleven v4, model syntezy mowy, który firma opisuje jako najbardziej emocjonalny dotąd, oraz Eleven v4 Turbo, wariant o niskiej latencji przeznaczony dla agentów głosowych i zastosowań w czasie rzeczywistym. Oba modele są dostępne od razu w ElevenAgents, ElevenCreative oraz przez ElevenAPI, a dostęp jest wliczony w bezpłatny plan konta.
Post zapowiadający został napisany przez Mati Staniszewskiego i Piotra Dabkowskiego oraz zaklasyfikowany w kategorii Badania firmy.
Nowa architektura skoncentrowana na ekspresyjności
ElevenLabs twierdzi, że Eleven v4 opiera się na zupełnie nowej architekturze zaprojektowanej do interpretacji tonu, tempa, emocji, charakteru i kontekstu z tekstu, generując mowę, która może brzmieć dramatycznie, delikatnie, pilnie, komicznie lub konwersacyjnie, zachowując jednocześnie tożsamość mówcy. Firma podkreśla, że podstawowa jakość dźwięku jest wyższa we wszystkich aspektach niż w jej wcześniejszych modelach.
Według firmy, nowa metoda przechwytywania tożsamości mówców została zaprojektowana tak, aby utrzymać spójność każdej głosu w rozmowach agentów, audiobookach i reklamach, a kontekst na poziomie sceny pozwala mówcom reagować na to, co właśnie zostało powiedziane w konwersacji, tworząc dialog, który firma opisuje jako bardziej naturalny niż składanie odrębnych linii.
Tagi audio w linii zastępują kontrolki SSML
Użytkownicy mogą kierować odtwarzanie w języku naturalnym i osadzać tagi audio w linii; przykłady podane przez firmę obejmują śmiech, wypowiedź z gniewnym francuskim akcentem, delikatny deszcz oraz dzwonek telefonu. ElevenLabs twierdzi, że model podąża za tymi tagami audio i poleceniami kierunkowymi dokładniej niż poprzednie modele. Obsługa fonemów Międzynarodowego Alfabetu Fonetycznego została znacznie ulepszona, dzięki czemu niestandardowe wymowy zachowują się bardziej niezawodnie, a dokumentacja deweloperska ElevenLabs opisuje pełną składnię tagów do użycia w API. Według FAQ na stronie produktu, tagi SSML takie jak <break> są wyłączone w Eleven v4, a tagi w języku naturalnym służą zamiast tego jako mechanizm sterowania.
Wariant Turbo i pomiary opóźnień
W zastosowaniach w czasie rzeczywistym ElevenLabs twierdzi, że jej zespoły badawcze i inżynieryjne zoptymalizowały Eleven v4 Turbo wraz z platformą konwersacyjną ElevenAgents jako jeden system. Turbo obsługuje dwukierunkowe strumieniowanie, dzięki czemu dźwięk zaczyna się zwracać zanim zdanie się zakończy.
Metodologia opisująca w przypisach ogłoszenia podaje, że Eleven v4 Turbo uzyskał medianę czasu do pierwszej wypowiedzi wynoszącą około 150 milisekund w testach przeprowadzonych we wrześniu 2026 roku przy strumieniowaniu WebSocket, z identycznymi skryptami i domyślnymi ustawieniami, w porównaniu z Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS oraz OpenAI GPT‑4o mini TTS, przy pomiarze i usunięciu opóźnień sieciowych dla wszystkich systemów. Wykres porównawczy na stronie produktu firmy podaje 150 ms jako wartość odniesienia w zestawieniu ze wskazanymi 262 ms dla Cartesia Sonic 3.6 oraz 814 ms dla OpenAI GPT‑4o mini TTS. Oddzielnie w ogłoszeniu podano medianę opóźnienia inferencji wynoszącą około 100 ms dla Turbo, co firma twierdzi, że jest szybsze niż przeciętna przerwa między dwoma osobami rozmawiającymi.
Języki, klonowanie głosu i dźwięk długiej formy
Oba modele obsługują ponad 90 języków. Firma twierdzi, że głos nagrany w jednym języku potrafi teraz płynnie mówić w innych, przyjmując akcent native speakera, a utrzymanie akcentu nie cofa się już w kierunku pierwotnego akcentu w trakcie generacji.
Instant Voice Clones mogą teraz uchwycić głos o wysokiej wierności z 10 sekund nagrania, podaje firma, która jednocześnie twierdzi, że przewyższają one Professional Voice Clones z modelu Multilingual v2. Professional Voice Clones, które były niedostępne w Eleven v3, są ponownie wspierane i działają z pełnym zakresem emocjonalnym modelu. Każdy klon, natychmiastowy lub profesjonalny, wymaga zweryfikowanej zgody właściciela głosu, a wygenerowany dźwięk jest objęty technologią AI Speech Classifier firmy ElevenLabs, którą firma twierdzi, że potrafi wykrywać jako wygenerowany przez SI.
Stitching żądań, czyli łączenie kolejnych generacji w celu uzyskania treści dłuższej formy, jest w Eleven v4 znacznie bardziej niezawodne, jak podaje firma, co poprawia doświadczenie pracy w ElevenLabs Studio oraz w aplikacji ElevenLabs Reader. Jedna generacja obsługuje do 10 000 znaków, a łączenie kontekstu utrzymuje tempo i sposób dostarczania spójne w dłuższych skryptach.
Wyniki benchmarków zgłoszone przez firmę
ElevenLabs informuje, że Eleven v4 zajął pierwsze miejsce w rankingu Artificial Analysis Provider Voice Arena Leaderboard za wrzesień 2026 i został wybrany przez około 75 % słuchaczy w testach ślepych porównawczych. Metodologia opisana w przypisach podaje, że testy z września 2026 zestawiały model z Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS oraz Google Gemini 3.8 Flash TTS, przy czym oceniający słyszeli tę samą linię od Eleven v4 i jednego konkurenta w warunkach ślepych, oceniając, który jest bardziej ekspresyjny i który brzmi naturalniej, a remisy liczone były jako pół. Wykres w ogłoszeniu wskazuje, że Eleven v4 wygrał w 65 %–81 % tych pojedynków.
Dostęp do API, ceny i zgodność
Oba modele są dostępne poprzez endpointy REST i streamingowe z SDK w TypeScript i Python, a programiści przełączają się między modelami przy użyciu pojedynczego model_id. Formaty wyjściowe są takie same jak w pozostałych modelach ElevenLabs: MP3, nieskompresowany WAV/PCM do pracy w studiu i postprodukcji oraz µ-law do integracji telefonicznych i call‑center, przy czym częstotliwość próbkowania i bitrate są ustawiane za pośrednictwem API.
Cennik opiera się na tej samej strukturze kredytów, co pozostałe modele text‑to‑speech firmy: darmowy poziom z 10 000 kredytów miesięcznie, co firma szacuje na około 10 minut audio; płatne plany zaczynające się od 6 $ miesięcznie, obejmujące profesjonalne klonowanie głosu; oraz indywidualne wyceny dla przedsiębiorstw. Każdy głos z biblioteki firmy, liczącej ponad 17 500 głosów, działa z Eleven v4, choć natychmiastowe i profesjonalne klony utworzone przed premierą muszą zostać ponownie wytrenowane, aby skutecznie współpracować z nowym modelem.
ElevenLabs podaje, że Eleven v4 działa na infrastrukturze certyfikowanej zgodnie z SOC 2 Type II, ISO 27001 i PCI DSS poziom 1, jest zgodny z RODO oraz posiada przepływy pracy spełniające wymogi HIPAA w sektorze opieki zdrowotnej, nie trenuje na skryptach ani tagach audio bez zgody oraz oferuje tryb Zero Retention dla kwalifikujących się usług przedsiębiorstw.
Eleven v4 strona produktu zawiera oświadczenia od wymienionych klientów, w tym Ryan Peterson, SVP ds. produktu w Agentforce Voice w Salesforce, który powiedział: “To właśnie tam widzimy, jak Eleven v4 Turbo podnosi poprzeczkę, oferując szybsze, bardziej naturalne odpowiedzi, które spełniają standard, którego oczekują nasi klienci.” BeyondWords współzałożyciel Patrick O’Flaherty, Spring Financial szef produktów budowania kredytu Oscar Daniels oraz Accenture Accelerate lider muzyki i dźwięku Kyle Gudmundson również przekazali oświadczenia na temat nowych modeli.
ElevenLabs kieruje programistów do swojej dokumentacji, w której znajdują się pełna składnia tagów audio oraz szczegóły integracji API.












