Mô hình và nền tảng AI

ElevenLabs ra mắt Eleven V4 với phiên bản Turbo độ trễ thấp

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

ElevenLabs vào ngày 28 tháng 9 năm 2026 đã ra mắt Eleven v4, một mô hình chuyển văn bản thành giọng nói mà công ty mô tả là cảm xúc nhất cho đến nay, và Eleven v4 Turbo, một phiên bản độ trễ thấp được thiết kế cho các đại lý giọng nói và sử dụng thời gian thực. Cả hai mô hình đều có sẵn ngay lập tức trong ElevenAgents, ElevenCreative và qua ElevenAPI, với quyền truy cập được bao gồm trong gói tài khoản miễn phí.

Bài đăng ra mắt được viết bởi Mati Staniszewski và Piotr Dabkowski và được đăng trong danh mục Nghiên cứu của công ty.

Kiến trúc mới tập trung vào khả năng biểu đạt

ElevenLabs cho biết Eleven v4 được xây dựng trên một kiến trúc hoàn toàn mới, được thiết kế để diễn giải tông giọng, nhịp độ, cảm xúc, tính cách và ngữ cảnh từ văn bản, tạo ra giọng nói có thể nghe như kịch tính, nhẹ nhàng, gấp gáp, hài hước hoặc hội thoại đồng thời giữ nguyên danh tính của người nói. Công ty nói rằng độ trung thực âm thanh nền được nâng cao trên toàn bộ so với các mô hình trước đây.

Theo công ty, một phương pháp mới để ghi nhận danh tính người nói được thiết kế nhằm giữ cho mỗi giọng nói nhất quán trong các cuộc trò chuyện của đại lý, sách nói và quảng cáo, và ngữ cảnh cấp cảnh cho phép người nói phản hồi những gì vừa được nói trong một cuộc hội thoại, tạo ra đoạn đối thoại mà công ty mô tả là tự nhiên hơn so với việc ghép các câu riêng lẻ.

Thẻ âm thanh nội tuyến thay thế điều khiển SSML

Người dùng có thể chỉ đạo việc phát âm bằng ngôn ngữ tự nhiên và nhúng các thẻ âm thanh nội tuyến; các ví dụ của công ty bao gồm tiếng cười, nói giận dữ với giọng Pháp, tiếng mưa nhẹ và tiếng điện thoại rung. ElevenLabs cho biết mô hình tuân theo các thẻ âm thanh và các lời nhắc chỉ đạo này chính xác hơn so với các mô hình trước. Hỗ trợ các phoneme của Bảng chữ cái Ngữ âm Quốc tế đã được cải thiện đáng kể, giúp cách phát âm tùy chỉnh hoạt động đáng tin cậy hơn, và tài liệu dành cho nhà phát triển của ElevenLabs bao gồm toàn bộ cú pháp thẻ cho việc sử dụng API. Theo phần Câu hỏi thường gặp trên trang sản phẩm, các thẻ SSML như <break> được vô hiệu hoá trong Eleven v4, với các thẻ ngôn ngữ tự nhiên đóng vai trò là cơ chế điều khiển thay thế.

Phiên bản Turbo và Đo lường Độ trễ

Đối với việc sử dụng thời gian thực, ElevenLabs cho biết các đội nghiên cứu và kỹ thuật của họ đã tối ưu hoá Eleven v4 Turbo cùng với nền tảng hội thoại ElevenAgents như một hệ thống duy nhất. Turbo hỗ trợ truyền phát hai chiều, vì vậy âm thanh bắt đầu trả về trước khi một câu hoàn thành.

Phương pháp có chú thích trong thông báo cho biết Eleven v4 Turbo đạt thời gian trung vị để phát giọng đầu tiên khoảng 150 miligiây trong các thử nghiệm tháng 9 năm 2026 được thực hiện qua truyền phát WebSocket với kịch bản và cài đặt mặc định giống nhau, so sánh với Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS và OpenAI GPT‑4o mini TTS, với độ trễ mạng được đo và loại bỏ cho tất cả các hệ thống. Bảng so sánh trên trang sản phẩm của công ty liệt kê 150 ms làm con số tham chiếu so với 262 ms được ghi cho Cartesia Sonic 3.6 và 814 ms cho OpenAI GPT‑4o mini TTS. Thông báo cũng nêu ra độ trễ suy luận trung vị khoảng 100 ms cho Turbo, một con số mà công ty cho là nhanh hơn khoảng thời gian dừng trung bình giữa hai người nói chuyện.

Ngôn ngữ, Nhân bản Giọng nói và Âm thanh Dài

Cả hai mô hình hỗ trợ hơn 90 ngôn ngữ. Công ty cho biết một giọng nói được ghi âm bằng một ngôn ngữ hiện có thể nói các ngôn ngữ khác một cách lưu loát đồng thời nhận giọng địa phương của người bản ngữ, và việc duy trì giọng địa phương không còn trượt lại về giọng nguồn trong quá trình sinh ra.

Theo công ty, Instant Voice Clones hiện có thể ghi lại một giọng nói với độ trung thực cao chỉ từ 10 giây âm thanh, và công ty cũng cho biết chúng vượt trội hơn so với Professional Voice Clones của mô hình Multilingual v2. Professional Voice Clones, vốn không có sẵn trong Eleven v3, đã được hỗ trợ trở lại và hoạt động với toàn bộ dải cảm xúc của mô hình. Mỗi bản sao, dù là instant hay professional, đều yêu cầu sự đồng ý đã được xác minh từ chủ sở hữu giọng nói, và âm thanh được tạo ra được bảo vệ bởi công nghệ AI Speech Classifier của ElevenLabs, mà công ty nói là có thể phát hiện chúng là do AI tạo ra.

Theo công ty, việc nối yêu cầu, tức là chuỗi các lần sinh liên tiếp cho nội dung dài hơn, đáng kể hơn đáng tin cậy trong Eleven v4, cải thiện trải nghiệm làm việc trong ElevenLabs Studio và ứng dụng ElevenLabs Reader. Một lần sinh duy nhất hỗ trợ lên tới 10.000 ký tự, với việc nối ngữ cảnh giữ cho nhịp độ và cách truyền đạt nhất quán trong các kịch bản dài hơn.

Kết quả Đánh giá Tiêu chuẩn Báo cáo bởi Công ty

ElevenLabs báo cáo rằng Eleven v4 đạt vị trí thứ nhất trên bảng xếp hạng Voice Arena của Artificial Analysis Provider trong tháng 9 năm 2026 và được khoảng 75 % người nghe ưu tiên trong các bài kiểm tra so sánh mù. Phương pháp có chú thích cho biết các bài kiểm tra tháng 9 năm 2026 đã đưa mô hình đối đầu với Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS và Google Gemini 3.8 Flash TTS, với các giám khảo nghe cùng một câu từ Eleven v4 và một đối thủ được trình bày mù, đánh giá câu nào biểu cảm hơn và câu nào nghe tự nhiên hơn, và các kết quả hòa được tính là một nửa. Một biểu đồ trong thông báo cho biết Eleven v4 thắng từ 65 % đến 81 % các cuộc đối đầu đó.

Truy cập API, Giá cả và Tuân thủ

Cả hai mô hình đều có thể truy cập qua các endpoint REST và streaming với SDK TypeScript và Python, và các nhà phát triển có thể chuyển đổi giữa các mô hình bằng một model_id duy nhất. Định dạng đầu ra giống mọi mô hình khác của ElevenLabs: MP3, WAV/PCM không nén cho công việc studio và hậu kỳ, và µ-law cho tích hợp điện thoại và trung tâm cuộc gọi, với tần số mẫu và bitrate được đặt qua API.

Giá cả tuân theo cùng cấu trúc tín dụng như các mô hình chuyển văn bản thành giọng nói khác của công ty: một mức miễn phí với 10.000 tín dụng mỗi tháng, mà công ty ước tính tương đương khoảng 10 phút âm thanh; các gói trả phí bắt đầu từ 6 USD mỗi tháng, bao gồm khả năng sao chép giọng nói chuyên nghiệp; và giá doanh nghiệp tùy chỉnh. Mọi giọng nói trong thư viện hơn 17.500 giọng của công ty đều hoạt động với Eleven v4, mặc dù các bản sao nhanh và chuyên nghiệp được tạo trước khi ra mắt cần được đào tạo lại để hoạt động hiệu quả với mô hình mới.

ElevenLabs cho biết Eleven v4 chạy trên hạ tầng được chứng nhận SOC 2 Type II, ISO 27001 và PCI DSS Level 1, tuân thủ GDPR với quy trình làm việc đủ tiêu chuẩn HIPAA cho lĩnh vực y tế, không đào tạo trên kịch bản hoặc thẻ âm thanh mà không có sự đồng ý, và cung cấp Chế độ Không Lưu Trữ cho các dịch vụ doanh nghiệp đủ điều kiện.

The Eleven v4 trang sản phẩm carries statements from named customers, including Ryan Peterson, Phó Chủ tịch điều hành sản phẩm cho Agentforce Voice tại Salesforce, who said: “Đó chính là nơi chúng tôi thấy Eleven v4 Turbo nâng tầm, với phản hồi nhanh hơn, tự nhiên hơn đáp ứng tiêu chuẩn mà khách hàng của chúng tôi mong đợi.” Đồng sáng lập BeyondWords Patrick O’Flaherty, Trưởng phòng sản phẩm xây dựng tín dụng Oscar Daniels của Spring Financial, và Trưởng phòng âm nhạc và âm thanh Kyle Gudmundson của Accenture Accelerate cũng đã cung cấp nhận xét về các mô hình mới.

ElevenLabs hướng các nhà phát triển tới tài liệu của mình để biết cú pháp thẻ âm thanh đầy đủ và chi tiết tích hợp API.

Jonas Reeve là một nhà phân tích được tạo ra bằng AI tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.