نماذج ومنصات الذكاء الاصطناعي

إيلفن لابز تطلق Eleven V4 مع نسخة توربو منخفضة الكمون

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

إيلفن لابز في 28 سبتمبر 2026 أطلقت Eleven v4، نموذج تحويل النص إلى كلام تصفه الشركة بأنه الأكثر تعبيرًا حتى الآن، وEleven v4 Turbo، نسخة منخفضة الكمون مصممة لوكلاء الصوت والاستخدام في الوقت الحقيقي. كلا النموذجين متاحان فورًا في ElevenAgents وElevenCreative، ومن خلال ElevenAPI، مع تضمين الوصول في طبقة الحساب المجانية.

تم كتابة منشور الإطلاق بواسطة ماتي ستانيسzewski وبيوتر دابكوفسكي وتم تصنيفه في فئة البحث الخاصة بالشركة.

معمارية جديدة تركز على التعبيرية

تقول ElevenLabs إن Eleven v4 مبنية على معمارية جديدة كليًا صُممت لتفسير النبرة والإيقاع والعاطفة والشخصية والسياق من النص، مولدةً كلامًا يمكن أن يبدو دراميًا أو رقيقًا أو عاجلًا أو كوميديًا أو حواريًا مع الحفاظ على هوية المتحدث. وتضيف الشركة أن جودة الصوت الأساسية أعلى عبر جميع النماذج مقارنةً بالنماذج السابقة.

طريقة جديدة لالتقاط هويات المتحدث صُممت للحفاظ على ثبات كل صوت عبر محادثات الوكلاء والكتب الصوتية والإعلانات، وفقًا للشركة، ويسمح السياق على مستوى المشهد للمتحدثين بالرد على ما قيل للتو في المحادثة، منتجًا حوارًا تصفه الشركة بأنه أكثر طبيعية من تجميع خطوط منفصلة.

علامات الصوت المضمنة تحل محل عناصر التحكم SSML

يمكن للمستخدمين توجيه التسليم بلغة طبيعية وإدراج علامات صوت مدمجة؛ تشمل أمثلة الشركة الضحكات، قيل بغضب بلكنة فرنسية، مطر خفيف، ورنين هاتف. تقول ElevenLabs إن النموذج يتبع هذه العلامات الصوتية وتوجيهات اللغة الطبيعية بدقة أكبر من نماذجه السابقة. تم تحسين دعم الفونيمات وفقًا للأبجدية الصوتية الدولية بشكل كبير بحيث تتصرف النطق المخصص بصورة أكثر موثوقية، وتغطي وثائق مطوري ElevenLabs صياغة العلامات بالكامل للاستخدام عبر API. وفقًا لأسئلة المنتج المتكررة، فإن علامات SSML مثل <break> معطلة في Eleven v4، حيث تُستخدم العلامات ذات اللغة الطبيعية كآلية تحكم بدلاً من ذلك.

نسخة توربو وقياسات الكمون

للاستخدام في الوقت الحقيقي، تقول ElevenLabs إن فرق البحث والهندسة قامت بتحسين Eleven v4 Turbo بالتعاون مع منصة ElevenAgents الحوارية كنظام واحد. تدعم نسخة توربو البث الثنائي الاتجاه، بحيث يبدأ الصوت في الظهور قبل انتهاء الجملة.

تشير منهجية الملاحظة المرفقة بالإعلان إلى أن Eleven v4 Turbo سجل زمنًا متوسطًا للوصول إلى الكلام الأول يبلغ نحو 150 مللي ثانية في اختبارات سبتمبر 2026 التي أُجريت عبر بث WebSocket باستخدام نصوص متطابقة وإعدادات افتراضية مقابل Cartesia Sonic 3.6 وxAI TTS وGoogle Gemini Flash‑Lite TTS وOpenAI GPT‑4o mini TTS، مع قياس وإزالة زمن الشبكة لجميع الأنظمة. تُظهر المخططات المقارنة على صفحة المنتج الخاصة بالشركة أن 150 مللي ثانية هي القيمة المرجعية مقابل 262 مللي ثانية المعلنة لـ Cartesia Sonic 3.6 و814 مللي ثانية لـ OpenAI GPT‑4o mini TTS. كما يذكر الإعلان بشكل منفصل أن زمن الاستدلال المتوسط لنسخة توربو يبلغ حوالي 100 مللي ثانية، وهو ما تقول الشركة إنه أسرع من متوسط التوقف بين كلمتين يتبادلها شخصان.

اللغات، استنساخ الصوت، والصوت طويل الشكل

يدعم كلا النموذجين أكثر من 90 لغة. تقول الشركة إن صوتًا مسجلاً بلغة واحدة يمكنه الآن التحدث بلغات أخرى بطلاقة مع اعتماد لهجة المتحدث الأصلي، وأن الالتزام بهذه اللهجة لم يعد يتراجع إلى اللهجة الأصلية مع تقدم عملية التوليد.

يمكن الآن لاستنساخات الصوت الفورية التقاط صوت بدقة عالية من 10 ثوانٍ من الصوت، وفقًا للشركة، التي تقول أيضًا إن هذه الاستنساخات تتفوق على استنساخات الصوت الاحترافية لنموذج Multilingual v2. تُدعم استنساخات الصوت الاحترافية، التي كانت غير متوفرة في Eleven v3، مرة أخرى وتعمل بنطاق عاطفي كامل للنموذج. كل استنساخ، سواء كان فوريًا أو احترافيًا، يتطلب موافقة موثقة من مالك الصوت، ويغطي الصوت المُولد تقنية مصنف الكلام AI من ElevenLabs، التي تقول الشركة إن بإمكانها اكتشاف أنه مُولد بالذكاء الاصطناعي.

تقول الشركة إن ربط الطلبات، أي ربط الأجيال معًا لإنشاء محتوى أطول، أصبح أكثر موثوقية بشكل كبير في Eleven v4، مما يحسن تجربة العمل في ElevenLabs Studio وتطبيق ElevenLabs Reader. تدعم جيل واحد ما يصل إلى 10,000 حرف، مع الحفاظ على التوقيت والتسليم المتسق عبر النصوص الأطول بفضل ربط السياق.

نتائج المعايير التي أبلغت عنها الشركة

تقرير ElevenLabs أن Eleven v4 احتل المرتبة الأولى في لوحة صدارة Voice Arena لمزود التحليل الاصطناعي لشهر سبتمبر 2026 وكان مفضلاً لدى حوالي 75 بالمئة من المستمعين في اختبارات عمياء مباشرة. تقول منهجية الملاحظة المرفقة إن تلك الاختبارات في سبتمبر 2026 وضعت النموذج ضد Cartesia Sonic 3.6 وInworld TTS‑2 وGoogle Gemini 3.8 Flash‑Lite TTS وGoogle Gemini 3.8 Flash TTS، حيث سمع المقيمون نفس السطر من Eleven v4 ومنافس واحد بصورة عمياء، ثم قيموا أيهما أكثر تعبيرًا وأيها أكثر طبيعية، مع احتساب التعادل كنصف. يوضح مخطط في الإعلان أن Eleven v4 فاز بنسبة تتراوح بين 65% و81% من تلك المواجهات.

الوصول إلى API، التسعير، والامتثال

يمكن الوصول إلى كلا النموذجين عبر نقاط النهاية REST والبث باستخدام مجموعات تطوير البرمجيات TypeScript وPython، ويمكن للمطورين التبديل بين النماذج باستخدام معرف النموذج model_id واحد. تتطابق صيغ الإخراج مع جميع نماذج ElevenLabs الأخرى: MP3، WAV/PCM غير مضغوط للاستوديو والعمل ما بعد الإنتاج، وµ-law للاتصالات الهاتفية وتكاملات مراكز الاتصال، مع ضبط معدل العينة ومعدل البت عبر واجهة برمجة التطبيقات API.

يتبع التسعير نفس هيكل الائتمانات كما هو الحال في نماذج تحويل النص إلى كلام الأخرى للشركة: طبقة مجانية تحتوي على 10,000 ائتمان شهريًا، والتي تعادل تقريبًا 10 دقائق من الصوت؛ وخطط مدفوعة تبدأ من $6 شهريًا وتشمل استنساخ الصوت الاحترافي؛ وأسعار مخصصة للمؤسسات. جميع الأصوات في مكتبة الشركة التي تضم أكثر من 17,500 صوتًا تعمل مع Eleven v4، رغم أن النسخ الفورية والاحترافية التي تم إنشاؤها قبل الإطلاق تحتاج إلى إعادة تدريب لتعمل بفعالية مع النموذج الجديد.

تعلن ElevenLabs أن Eleven v4 يعمل على بنية تحتية معتمدة وفقًا لـ SOC 2 Type II وISO 27001 وPCI DSS Level 1، وهو متوافق مع GDPR مع سير عمل مؤهل لـ HIPAA في مجال الرعاية الصحية، ولا يتم تدريب النموذج على النصوص أو وسوم الصوت دون موافقة، ويقدم وضع عدم الاحتفاظ (Zero Retention Mode) للخدمات المؤسسية المؤهلة.

تحتوي صفحة منتج Eleven v4 على تصريحات من عملاء مسمىين، بما في ذلك رايان بيترسون، نائب رئيس المنتجات في Agentforce Voice بشركة Salesforce، الذي قال: “هذا بالضبط ما نراه في Eleven v4 Turbo يرفع المستوى، مع استجابات أسرع وأكثر طبيعية تلبي المعايير التي يتوقعها عملاؤنا.” كما قدم المؤسس المشارك لشركة BeyondWords باتريك O’Flaherty، ورئيس منتجات بناء الائتمان في Spring Financial أوسكار دانيلز، وقائد الموسيقى والصوت في Accenture Accelerate كايل جودمانسون تصريحات حول النماذج الجديدة.

توجه ElevenLabs المطورين إلى وثائقها للحصول على الصيغة الكاملة لوسم الصوت وتفاصيل تكامل API.

يُعد Jonas Reeve محللاً مولَّدًا بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي، والذكاء العام الاصطناعي (AGI)، والأسس النظرية للذكاء الآلي. يستكشف عمله كيفية ظهور التعلم، والتفكير، والذاكرة، والتجريد في كل من الأنظمة البيولوجية والاصطناعية، ربطًا بين بنى الذكاء الاصطناعي الحديثة والأسئلة القديمة في علم النفس الإدراكي وفلسفة العقل.

من خلال نهجٍ مفاهيميٍ وتأملي، يفحص Jonas أطرًا مثل نماذج التفكير، والأنظمة الوكيلة، والإدراك الناشئ، ونظرية التوافق، سعيًا لتوضيح ما يعنيه التقدم نحو الـAGI فعليًا—وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الضجيج، يركز على المبادئ الأولى، والصرامة المفاهيمية، وحدود النماذج الحالية.

المقالات التي كتبها Jonas Reeve مُولَّدة بالذكاء الاصطناعي وتُراجع من قبل فريق التحرير في Unite.AI لضمان الدقة والوضوح والنقاش المسؤول حول مفاهيم الذكاء الاصطناعي المتقدمة.