โมเดลและแพลตฟอร์ม AI
ElevenLabs เปิดตัว Eleven V4 พร้อมรุ่น Turbo ความหน่วงต่ำ

ElevenLabs เมื่อวันที่ 28 กันยายน 2026 เปิดตัว Eleven v4 โมเดลแปลงข้อความเป็นเสียงที่บริษัทอธิบายว่าเป็นรุ่นที่อารมณ์ที่สุดจนถึงตอนนี้ และ Eleven v4 Turbo รุ่นความหน่วงต่ำที่ออกแบบมาสำหรับเอเจนต์เสียงและการใช้งานแบบเรียลไทม์ ทั้งสองโมเดลพร้อมให้ใช้ทันทีใน ElevenAgents, ElevenCreative และผ่าน ElevenAPI โดยรวมอยู่ในระดับบัญชีฟรี
โพสต์เปิดตัวเขียนโดย Mati Staniszewski และ Piotr Dabkowski และจัดอยู่ในหมวดวิจัยของบริษัท
สถาปัตยกรรมใหม่ที่มุ่งเน้นการแสดงออก
ElevenLabs กล่าวว่า Eleven v4 ถูกสร้างบนสถาปัตยกรรมใหม่ทั้งหมดที่ออกแบบมาเพื่อแปลความหมายของโทน, ความเร็ว, อารมณ์, ตัวละครและบริบทจากข้อความ ทำให้เสียงที่สร้างออกมาสามารถฟังดูดราม่า, อ่อนโยน, เร่งด่วน, ตลก หรือสนทนาได้ในขณะเดียวกันยังคงรักษาอัตลักษณ์ของผู้พูดไว้ บริษัทระบุว่าความละเอียดของเสียงพื้นฐานสูงกว่ารุ่นก่อนหน้าในทุกด้าน
วิธีการใหม่ในการจับอัตลักษณ์ของผู้พูดถูกออกแบบให้เสียงแต่ละเสียงคงความสอดคล้องกันในบทสนทนาของเอเจนต์, หนังสือเสียงและโฆษณา ตามที่บริษัทอธิบาย และบริบทระดับฉากทำให้ผู้พูดตอบสนองต่อสิ่งที่เพิ่งพูดไปในบทสนทนา ทำให้การสนทนาที่สร้างขึ้นฟังดูเป็นธรรมชาติมากกว่าการประกอบบรรทัดแยกกัน
แท็กเสียงแบบอินไลน์แทนที่การควบคุม SSML
ผู้ใช้สามารถกำหนดการส่งออกด้วยภาษาธรรมชาติและฝังแท็กเสียงแบบอินไลน์; ตัวอย่างของบริษัทรวมถึงเสียงหัวเราะ, พูดด้วยอารมณ์โกรธในสำเนียงฝรั่งเศส, เสียงฝนเบา, และเสียงโทรศัพท์สั่น ElevenLabs กล่าวว่าโมเดลทำตามแท็กเสียงและคำสั่งเหล่านี้ได้แม่นยำกว่ารุ่นก่อนหน้า การสนับสนุนฟีโนเมน IPA ได้รับการปรับปรุงอย่างมากทำให้การออกเสียงที่กำหนดเองทำงานได้เชื่อถือได้มากขึ้น และเอกสารนักพัฒนาของ ElevenLabs ครอบคลุมไวยากรณ์แท็กทั้งหมดสำหรับการใช้ API ตาม FAQ ของหน้าผลิตภัณฑ์ SSML แท็กเช่น <break> จะถูกปิดการใช้งานใน Eleven v4 โดยแท็กภาษาธรรมชาติทำหน้าที่เป็นกลไกควบคุมแทน
รุ่น Turbo และการวัดความหน่วง
สำหรับการใช้งานแบบเรียลไทม์ ElevenLabs กล่าวว่า ทีมวิจัยและวิศวกรรมได้ปรับแต่ง Eleven v4 Turbo ร่วมกับแพลตฟอร์มสนทนา ElevenAgents ให้ทำงานเป็นระบบเดียว Turbo รองรับการสตรีมแบบสองทาง ทำให้เสียงเริ่มส่งกลับก่อนที่ประโยคจะพูดจบ
ระเบียบวิธีที่อธิบายด้วยเชิงอรรถระบุว่า Eleven v4 Turbo มีค่าเวลาเฉลี่ยจากการเริ่มพูดถึงการออกเสียงแรกประมาณ 150 มิลลิวินาทีในการทดสอบเดือนกันยายน 2026 ที่ทำผ่านการสตรีม WebSocket ด้วยสคริปต์และการตั้งค่าเริ่มต้นเดียวกันเทียบกับ Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash‑Lite TTS, และ OpenAI GPT‑4o mini TTS โดยวัดและลบความหน่วงของเครือข่ายออกจากระบบทั้งหมด แผนภูมิเปรียบเทียบบนหน้าผลิตภัณฑ์ของบริษัทแสดงค่าอ้างอิง 150 ms เทียบกับ 262 ms ที่ระบุสำหรับ Cartesia Sonic 3.6 และ 814 ms สำหรับ OpenAI GPT‑4o mini TTS ประกาศแยกต่างหากอ้างอิงค่าเวลาแฝงการสรุปประมาณ 100 ms สำหรับ Turbo ซึ่งบริษัทบอกว่าเร็วกว่าเวลาหยุดพักเฉลี่ยระหว่างการสนทนาของสองคน
ภาษา, การโคลนเสียง, และเสียงแบบยาว
ทั้งสองโมเดลรองรับภาษามากกว่า 90 ภาษา บริษัทระบุว่าเสียงที่บันทึกในภาษาหนึ่งสามารถพูดภาษาอื่นได้อย่างคล่องแคล่วพร้อมรับสำเนียงของผู้พูดพื้นเมือง และการรักษาสำเนียงนั้นไม่กลับไปสู่สำเนียงต้นฉบับเมื่อสร้างต่อเนื่อง
Instant Voice Clones สามารถจับเสียงด้วยความละเอียดสูงจากออดิโอ 10 วินาทีตามที่บริษัทกล่าว พร้อมกับบอกว่ามีประสิทธิภาพดีกว่า Professional Voice Clones ของโมเดล Multilingual v2 Professional Voice Clones ซึ่งไม่พร้อมใช้งานใน Eleven v3 ได้รับการสนับสนุนอีกครั้งและทำงานด้วยช่วงอารมณ์เต็มของโมเดล ทุกคลอน ไม่ว่าจะเป็นแบบ Instant หรือ Professional ต้องได้รับความยินยอมที่ตรวจสอบจากเจ้าของเสียง และเสียงที่สร้างขึ้นอยู่ภายใต้เทคโนโลยี AI Speech Classifier ของ ElevenLabs ซึ่งบริษัทบอกว่าสามารถตรวจจับได้ว่าเป็นเสียงที่สร้างโดย AI
การต่อเนื่องการร้องขอ (request stitching) ซึ่งเป็นการเชื่อมต่อการสร้างหลายครั้งเพื่อเนื้อหาแบบยาว มีความเชื่อถือได้มากขึ้นใน Eleven v4 ตามที่บริษัทระบุ ทำให้ประสบการณ์การทำงานใน ElevenLabs Studio และ ElevenLabs Reader App ดีขึ้น การสร้างครั้งเดียวสามารถรองรับได้สูงสุด 10,000 ตัวอักษร โดยการต่อเนื่องของบริบทช่วยให้จังหวะและการส่งออกคงที่ตลอดสคริปต์ยาว
ผลการทดสอบตามที่บริษัทรายงาน
ElevenLabs รายงานว่า Eleven v4 ได้อันดับหนึ่งบน Artificial Analysis Provider Voice Arena Leaderboard สำหรับเดือนกันยายน 2026 และได้รับความนิยมจากผู้ฟังประมาณ 75 เปอร์เซ็นต์ในการทดสอบแบบเปรียบเทียบตาบอด ระเบียบวิธีเชิงอรรถระบุว่าการทดสอบเดือนกันยายน 2026 นั้นเปรียบเทียบโมเดลกับ Cartesia Sonic 3.6, Inworld TTS‑2, Google Gemini 3.8 Flash‑Lite TTS, และ Google Gemini 3.8 Flash TTS โดยผู้ประเมินได้ยินบรรทัดเดียวกันจาก Eleven v4 และคู่แข่งหนึ่งรายแบบตาบอด แล้วตัดสินว่าอันไหนแสดงอารมณ์ได้ดีกว่าและอันไหนฟังดูเป็นธรรมชาติมากกว่า และการเสมอจะนับเป็นครึ่งหนึ่ง แผนภูมิในประกาศระบุว่า Eleven v4 ชนะ 65 %‑81 % ของการจับคู่เหล่านั้น
การเข้าถึง API, ราคา, และการปฏิบัติตามข้อกำหนด
โมเดลทั้งสองสามารถเข้าถึงได้ผ่าน endpoint ของ REST และ streaming พร้อม SDK ของ TypeScript และ Python และนักพัฒนาสามารถสลับระหว่างโมเดลด้วย model_id เพียงค่าเดียว รูปแบบผลลัพธ์ตรงกับโมเดล ElevenLabs ทุกตัว: MP3, WAV/PCM ไม่บีบอัดสำหรับงานสตูดิโอและหลังการผลิต, และ µ-law สำหรับการโทรและการรวมระบบศูนย์บริการลูกค้า โดยอัตราการสุ่มตัวอย่างและบิตเรตตั้งค่าผ่าน API.
การกำหนดราคาใช้โครงสร้างเครดิตเดียวกับโมเดลข้อความเป็นเสียงของบริษัท: ชั้นฟรีที่ให้ 10,000 เครดิตต่อเดือน ซึ่งบริษัทเทียบเท่ากับประมาณ 10 นาทีของเสียง; แผนชำระเงินเริ่มต้นที่ $6 ต่อเดือนซึ่งรวมการโคลนเสียงระดับมืออาชีพ; และการกำหนดราคาสำหรับองค์กรแบบกำหนดเอง ทุกเสียงในคลังของบริษัทที่มีมากกว่า 17,500 เสียงทำงานร่วมกับ Eleven v4 แม้ว่าการโคลนแบบทันทีและระดับมืออาชีพที่สร้างก่อนการเปิดตัวจะต้องฝึกใหม่เพื่อให้ทำงานได้อย่างมีประสิทธิภาพกับโมเดลใหม่.
ElevenLabs ระบุว่า Eleven v4 ทำงานบนโครงสร้างพื้นฐานที่ได้รับการรับรอง SOC 2 Type II, ISO 27001, และ PCI DSS ระดับ 1, ปฏิบัติตาม GDPR พร้อมกระบวนการทำงานที่สอดคล้องกับ HIPAA สำหรับการดูแลสุขภาพ, ไม่ฝึกบนสคริปต์หรือแท็กเสียงโดยไม่มีความยินยอม, และให้บริการ Zero Retention Mode สำหรับบริการองค์กรที่มีคุณสมบัติเหมาะสม.
หน้าผลิตภัณฑ์ Eleven v4 มีคำแถลงจากลูกค้าที่ระบุชื่อ รวมถึง Ryan Peterson, รองประธานฝ่ายผลิตภัณฑ์สำหรับ Agentforce Voice ที่ Salesforce, ผู้กล่าวว่า: “นั่นแหละคือจุดที่เราเห็น Eleven v4 Turbo ยกระดับมาตรฐาน ด้วยการตอบสนองที่เร็วขึ้นและเป็นธรรมชาติมากขึ้น ซึ่งตรงตามมาตรฐานที่ลูกค้าของเราคาดหวัง” Patrick O’Flaherty ผู้ร่วมก่อตั้ง BeyondWords, Oscar Daniels หัวหน้าผลิตภัณฑ์การสร้างเครดิตของ Spring Financial, และ Kyle Gudmundson หัวหน้าฝ่ายดนตรีและเสียงของ Accenture Accelerate ก็ได้ให้คำแถลงเกี่ยวกับโมเดลใหม่ด้วยเช่นกัน.
ElevenLabs แนะนำให้นักพัฒนาดูเอกสารของบริษัทสำหรับไวยากรณ์ audio-tag แบบเต็มและรายละเอียดการผสานรวม API.












