Model dan platform AI

ElevenLabs Meluncurkan Eleven V4 dengan Varian Turbo Latensi Rendah

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

ElevenLabs pada 28 September 2026 meluncurkan Eleven v4, sebuah model teks-ke-suara yang perusahaan gambarkan sebagai yang paling emosional hingga saat ini, serta Eleven v4 Turbo, sebuah varian latensi rendah yang dirancang untuk agen suara dan penggunaan waktu nyata. Kedua model tersedia segera di ElevenAgents, ElevenCreative, dan melalui ElevenAPI, dengan akses termasuk dalam tingkatan akun gratis.

Posting peluncuran ditulis oleh Mati Staniszewski dan Piotr Dabkowski serta dimasukkan ke dalam kategori Penelitian perusahaan.

Arsitektur Baru yang Berfokus pada Ekspresivitas

ElevenLabs menyatakan bahwa Eleven v4 dibangun di atas arsitektur baru sepenuhnya yang dirancang untuk menafsirkan nada, kecepatan, emosi, karakter, dan konteks dari teks, menghasilkan suara yang dapat terdengar dramatis, lembut, mendesak, komedik, atau percakapan sambil mempertahankan identitas pembicara. Perusahaan mengatakan bahwa fidelitas audio dasar lebih tinggi secara keseluruhan dibandingkan model-model sebelumnya.

Menurut perusahaan, metode baru untuk menangkap identitas pembicara dirancang agar setiap suara tetap konsisten di seluruh percakapan agen, buku audio, dan iklan, dan konteks tingkat adegan memungkinkan pembicara merespons apa yang baru saja dikatakan dalam sebuah percakapan, menghasilkan dialog yang perusahaan gambarkan lebih alami dibandingkan menyusun baris terpisah.

Tag Audio Inline Menggantikan Kontrol SSML

Pengguna dapat mengarahkan penyampaian dengan bahasa alami dan menyematkan tag audio inline; contoh perusahaan meliputi tawa, dikatakan dengan marah dalam aksen Prancis, hujan ringan, dan dering telepon. ElevenLabs menyatakan bahwa model mengikuti tag audio dan perintah arah ini lebih akurat daripada model sebelumnya. Dukungan untuk fonem Alfabet Fonetik Internasional (IPA) ditingkatkan secara signifikan sehingga pengucapan khusus berperilaku lebih dapat diandalkan, dan dokumentasi pengembang ElevenLabs mencakup sintaks lengkap tag untuk penggunaan API. Menurut FAQ halaman produk, tag SSML seperti <break> dinonaktifkan dalam Eleven v4, dengan tag bahasa alami berfungsi sebagai mekanisme kontrol sebagai gantinya.

Varian Turbo dan Pengukuran Latensi

Untuk penggunaan waktu nyata, ElevenLabs mengatakan bahwa tim riset dan rekayasa mereka mengoptimalkan Eleven v4 Turbo bersama dengan platform percakapan ElevenAgents sebagai satu sistem. Turbo mendukung streaming dua arah, sehingga audio mulai kembali sebelum sebuah kalimat selesai.

Metodologi bercatatan kaki pada pengumuman menyatakan bahwa Eleven v4 Turbo mencatat waktu median hingga suara pertama sekitar 150 milidetik dalam pengujian September 2026 yang dijalankan melalui streaming WebSocket dengan skrip identik dan pengaturan default melawan Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS, dan OpenAI GPT‑4o mini TTS, dengan latensi jaringan diukur dan dihilangkan untuk semua sistem. Diagram perbandingan di halaman produk perusahaan mencantumkan 150 ms sebagai angka referensi dibandingkan 262 ms yang dinyatakan untuk Cartesia Sonic 3.6 dan 814 ms untuk OpenAI GPT‑4o mini TTS. Pengumuman tersebut juga menyebutkan latensi inferensi median sekitar 100 ms untuk Turbo, angka yang perusahaan katakan lebih cepat daripada jeda rata‑rata antara dua orang yang berbicara.

Bahasa, Kloning Suara, dan Audio Panjang

Kedua model mendukung lebih dari 90 bahasa. Perusahaan mengatakan bahwa suara yang direkam dalam satu bahasa kini dapat berbicara bahasa lain dengan lancar sambil mengadopsi aksen penutur asli, dan kepatuhan aksen tersebut tidak lagi kembali ke aksen sumber seiring berjalannya generasi.

Klon Suara Instan kini dapat menangkap suara dengan fidelitas tinggi dari 10 detik audio, menurut perusahaan, yang juga menyatakan bahwa mereka mengungguli Klon Suara Profesional dari model Multilingual v2. Klon Suara Profesional, yang tidak tersedia di Eleven v3, kembali didukung dan beroperasi dengan rentang emosional penuh model. Setiap klon, baik instan maupun profesional, memerlukan persetujuan terverifikasi dari pemilik suara, dan audio yang dihasilkan dilindungi oleh teknologi AI Speech Classifier milik ElevenLabs, yang perusahaan katakan dapat mendeteksi bahwa audio tersebut dihasilkan oleh AI.

Penyambungan permintaan, yaitu penggabungan generasi secara berurutan untuk konten bentuk panjang, jauh lebih dapat diandalkan dalam Eleven v4, kata perusahaan, meningkatkan pengalaman bekerja di ElevenLabs Studio dan ElevenLabs Reader App. Satu generasi mendukung hingga 10.000 karakter, dengan penyambungan konteks menjaga kecepatan dan penyampaian tetap konsisten pada skrip yang lebih panjang.

Hasil Benchmark yang Dilaporkan Perusahaan

ElevenLabs melaporkan bahwa Eleven v4 menempati peringkat pertama pada Papan Peringkat Voice Arena Penyedia Analisis Buatan untuk September 2026 dan dipilih oleh sekitar 75 persen pendengar dalam uji coba blind head‑to‑head. Metodologi bercatatan kaki menyatakan bahwa uji coba September 2026 tersebut mengadu model melawan Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS, dan Google Gemini 3.8 Flash TTS, dengan penilai mendengar baris yang sama dari Eleven v4 dan satu pesaing yang disajikan secara blind, menilai mana yang lebih ekspresif dan mana yang terdengar lebih alami, serta seri dianggap setengah. Diagram dalam pengumuman menyatakan bahwa Eleven v4 memenangkan 65 %–81 % dari pertandingan tersebut.

Akses API, Harga, dan Kepatuhan

Kedua model dapat diakses melalui endpoint REST dan streaming dengan SDK TypeScript dan Python, dan pengembang dapat beralih antara model dengan satu model_id. Format output cocok dengan semua model ElevenLabs lainnya: MP3, WAV/PCM tidak terkompresi untuk pekerjaan studio dan pasca‑produksi, serta µ-law untuk integrasi telepon dan pusat panggilan, dengan laju sampel dan bitrate diatur melalui API.

Harga mengikuti struktur kredit yang sama seperti model teks‑to‑speech lain milik perusahaan: tingkatan gratis dengan 10.000 kredit per bulan, yang perusahaan setara dengan kira‑kira 10 menit audio; paket berbayar mulai $6 per bulan yang mencakup kloning suara profesional; dan harga khusus untuk perusahaan. Setiap suara dalam perpustakaan perusahaan yang berisi lebih dari 17.500 suara dapat bekerja dengan Eleven v4, meskipun klon instan dan profesional yang dibuat sebelum peluncuran perlu dilatih ulang agar berfungsi secara efektif dengan model baru.

ElevenLabs menyatakan bahwa Eleven v4 berjalan pada infrastruktur bersertifikat SOC 2 Type II, ISO 27001, dan PCI DSS Level 1, mematuhi GDPR dengan alur kerja yang memenuhi syarat HIPAA untuk layanan kesehatan, tidak melatih pada skrip atau tag audio tanpa persetujuan, dan menawarkan Zero Retention Mode untuk layanan perusahaan yang memenuhi syarat.

Halaman produk Eleven v4 memuat pernyataan dari pelanggan yang disebutkan namanya, termasuk Ryan Peterson, SVP produk untuk Agentforce Voice di Salesforce, yang berkata: “Itulah tepatnya di mana kami melihat Eleven v4 Turbo meningkatkan standar, dengan respons yang lebih cepat dan lebih alami yang memenuhi standar yang diharapkan pelanggan kami.” Co‑founder BeyondWords Patrick O’Flaherty, kepala produk pembangunan kredit Spring Financial Oscar Daniels, dan pemimpin musik serta audio Accenture Accelerate Kyle Gudmundson juga memberikan pernyataan tentang model baru tersebut.

ElevenLabs mengarahkan pengembang ke dokumentasinya untuk sintaks audio-tag lengkap dan detail integrasi API.

Jonas Reeve adalah analis yang dihasilkan AI di Unite.AI, yang berfokus pada AI kognitif, kecerdasan umum buatan (AGI), dan dasar teoretis kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul baik dalam sistem biologis maupun buatan, serta menghubungkan arsitektur AI modern dengan pertanyaan-pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.

Dengan pendekatan konseptual dan reflektif, Jonas meneliti kerangka kerja seperti model penalaran, sistem agen, kognisi emergen, dan teori penyelarasan, dengan tujuan memperjelas apa arti sebenarnya kemajuan menuju AGI—dan apa yang tidak. Alih-alih mengejar jadwal atau hype, ia menekankan prinsip pertama, ketelitian konseptual, dan batasan model saat ini.

Artikel yang ditulis oleh Jonas Reeve dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI tingkat lanjut.