نماذج ومنصات الذكاء الاصطناعي

مايكروسوفت تُطلق MAI-Transcribe-2-Streaming ونموذجين من MAI-Voice

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

مايكروسوفت AI في 1 أكتوبر 2026 أطلقت MAI-Transcribe-2-Streaming، نموذجها الأول للتفريغ الصوتي المتدفّق، إلى جانب نموذجين جديدين لتحويل النص إلى كلام، MAI-Voice-2.1 و MAI-Voice-2.1-Flash، وجميع الثلاثة متاحين عبر Microsoft Foundry.

MAI-Transcribe-2-Streaming ومعيار Artificial Analysis

تصف مايكروسوفت MAI-Transcribe-2-Streaming بأنه يقدم نصوصًا فورية منخفضة الكمون في 60 لغة مع كشف تلقائي ومستمر للغة. وقالت الشركة إن النموذج يحتل المرتبة الأولى من حيث الدقة لكل من النصوص النهائية والجزئية على Artificial Analysis، وأنه يقع على حدّ باريتو لتقييم الدقة مقابل الكمون في المعيار، مما يعني أن تحسين الدقة لا يتطلب تضحية كبيرة بالكمون. تُظهر مخطط لوحة المتصدرين في المنشور، مستشهدًا بلوحة المتصدرين المتدفقة لـ Artificial Analysis بتاريخ 28 سبتمبر 2026، أن النموذج يحقق معدل خطأ كلمة نهائي بنسبة 2.5٪، ومعدل جزئي أول بنسبة 2.8٪، و0.13 ثانية للوصول إلى النص النهائي.

بدلاً من انتظار انتهاء المتحدث قبل إرجاع النص، ينتج النموذج فرضياته الأولى، المعروفة بالجزئيات، خلال ما يزيد قليلاً عن 100 مللي ثانية من استقبال الصوت، ثم يُعيد تعديلها مع وصول مزيد من السياق قبل تثبيت النص النهائي. وقالت مايكروسوفت إن ذلك يتيح للتطبيقات المدعومة بالصوت أن تتعامل مع الكلام قبل انتهاء المتحدث: يمكن لوكلاء الصوت بدء التفكير أو استدعاء الأدوات في منتصف الجملة، ويمكن أن تظهر النصوص الحية بينما يتحدث الأشخاص. بالنسبة للإملاء والترجمة الفورية في الوقت الحقيقي، أفادت الشركة أن تقييماتها الداخلية تُظهر ظهور الكلمات في النص بسرعة مضاعفة مقارنةً بأقرب منافس لها.

Artificial Analysis يذكر أن مؤشر AA-WER Streaming الخاص به يقيس دقة التفريغ للنماذج التي يُبث فيها الصوت في الوقت الفعلي، مقطعًا بعد مقطع، عبر نحو ثماني ساعات من الصوت من ثلاث مجموعات بيانات: AA-AgentTalk بنسبة 50٪، VoxPopuli بنسبة 25٪، و Earnings22 بنسبة 25٪. تغطي مجموعات البيانات الكلام الواقعي بلهجات متنوعة، ولغة متخصصة بالمجال، وظروف صوتية صعبة، وتبدأ قياسات الوقت إلى النص النهائي والوقت إلى أول جزئية في المعيار عند نهاية الكلام التي يكتشفها كاشف النشاط الصوتي SileroVAD.

يتوفر MAI-Transcribe-2-Streaming بسعر تمهيدي قدره 0.54 دولار لكل ساعة من الصوت حتى نهاية العام. يوسّع النموذج خط منتجات الصوت MAI من مايكروسوفت، الذي يشمل بالفعل MAI-Transcribe-2، نموذج التعرف على الكلام غير المتدفّق السابق الذي صوّرت الشركة أنه الأسرع، الأكثر دقة، والأرخص في العالم.

MAI-Voice-2.1 و MAI-Voice-2.1-Flash

يدعم MAI-Voice-2.1 23 لغة و26 موقعًا، وقالت مايكروسوفت إن صوتًا واحدًا يمكنه استخدام جميعها بلهجة أصلية، مع الحفاظ على هوية المتحدث نفسها عند تبديل اللغات. في مثال الشركة، يمكن لتطبيق تعليم يمكنه تبديل اللغات أثناء الدرس دون تغيير المعلمين، ويمكن للمساعد متعدد اللغات الرد بأي لغة يُخاطَب بها مع الاستمرار في الظهور كصوت واحد. يُسعر النموذج بـ 22 دولارًا لكل مليون حرف.

يدعم MAI-Voice-2.1-Flash نفس اللغات والمتحدثين عبر اللغات لكنه مُصمم لأعباء عمل عالية الحجم وحسّاسة للكمون. يمكنه توليد ما يصل إلى 45 ثانية من الصوت بكمون نهائي قدره 150 مللي ثانية، وقالت مايكروسوفت إنه يوفر استنتاج النموذج أسرع بنسبة 55٪ ويكلف تقريبًا أقل بنسبة 60٪ مقارنةً بالنماذج المماثلة. يُسعر بـ 15 دولارًا لكل مليون حرف.

يدعم كلا نموذجَي الصوت استنساخ الصوت عبر جميع اللغات المدعومة باستخدام بضع ثوانٍ من الصوت المرجعي، مع ضوابط موافقة مدمجة تقول مايكروسوفت إنها تمنع سوء الاستخدام. في اختبار تورينغ شمل 4,000 مستمع دمج النموذجين الصوتيين الجديدين، قيم 50.3٪ من المستمعين MAI-Voice على أنه مماثل أو أكثر شبهاً بالبشر مقارنةً بالتسجيلات البشرية، وفقًا لمايكروسوفت.

صوّرت مايكروسوفت الجمع بين MAI-Transcribe-2-Streaming و MAI-Voice-2.1-Flash على أنه استعادة للوقت في طرفي حلقة وكيل الصوت، وهي سلسلة الاستماع والفهم والقرار والتحدث ضمن الإطار الزمني الذي لا يزال فيه الإنسان ي perceives التفاعل كحوار. تشمل حالات الاستخدام المطورة المذكورة وكلاء خدمة العملاء الذين يفصلون الطلبات أثناء نطقها ويستجيبون بصوت طبيعي، ومساعدين متعددين اللغات يكتشفون اللغة المنطوقة ويردون بأي من اللغات الـ23 المدعومة من MAI-Voice، وتطبيقات التعلم التفاعلية والإعلامية التي تستخدم متحدثين مميزين للتدريس، والتمثيل، والمحاكاة، والسرد، والمحتوى الحواري.

التوفر وعرض Chatter التجريبي

يتوفر MAI-Voice-2.1 و MAI-Voice-2.1-Flash عبر OpenRouter. جميع النماذج الثلاثة متاحة عبر Microsoft Foundry، وMAI Playground، وVercel، وAzure Voice Live، مع الإشارة إلى أن LiveKit سيأتي قريبًا.

لإظهار عمل النماذج معًا في وكيل حي، أنشأت مايكروسوفت Chatter، عرضًا تجريبيًا جديدًا في MAI Playground يتيح للمستخدمين التحدث إلى مساعد صوتي مدعوم بنماذج التفريغ الصوتي والصوت.

يُعد Jonas Reeve محللاً مولَّدًا بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي، والذكاء العام الاصطناعي (AGI)، والأسس النظرية للذكاء الآلي. يستكشف عمله كيفية ظهور التعلم، والتفكير، والذاكرة، والتجريد في كل من الأنظمة البيولوجية والاصطناعية، ربطًا بين بنى الذكاء الاصطناعي الحديثة والأسئلة القديمة في علم النفس الإدراكي وفلسفة العقل.

من خلال نهجٍ مفاهيميٍ وتأملي، يفحص Jonas أطرًا مثل نماذج التفكير، والأنظمة الوكيلة، والإدراك الناشئ، ونظرية التوافق، سعيًا لتوضيح ما يعنيه التقدم نحو الـAGI فعليًا—وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الضجيج، يركز على المبادئ الأولى، والصرامة المفاهيمية، وحدود النماذج الحالية.

المقالات التي كتبها Jonas Reeve مُولَّدة بالذكاء الاصطناعي وتُراجع من قبل فريق التحرير في Unite.AI لضمان الدقة والوضوح والنقاش المسؤول حول مفاهيم الذكاء الاصطناعي المتقدمة.