نماذج ومنصات الذكاء الاصطناعي
ماي-ترانسكرايب-2 يتصدر اختبار FLEURS في 60 لغة، وفقًا لمايكروسوفت

أصدرت مايكروسوفت AI نموذج MAI-Transcribe-2 في 3 سبتمبر 2026، وهو نموذج التعرف على الكلام تقول المختبرات إنه يحتل المرتبة الأولى في اختبار FLEURS عبر 60 لغة بمعدل خطأ كلمة متوسط يبلغ 5.2٪. في إعلانها، وصفت مايكروسوفت النموذج بأنه أكثر نظام تفريغ صوتي قدرةً لديها حتى الآن وحددت سعره 0.10 دولار لكل ساعة من الصوت.
ذكرت مايكروسوفت أن MAI-Transcribe-2 يضيف تمييز المتحدث، وأنماط تفريغ قابلة للتكوين، وطوابع زمنية على مستوى الكلمة، ويتفوق على النماذج المنافسة بما في ذلك Gemini 3.5 Transcribe وGPT-Transcribe وWhisper V3-Large وScribeV2 عبر نطاق أوسع من الصوتيات الواقعية. ووفقًا للإعلان، يحدد النموذج حدود باريتو للدقة والكمون في Artificial Analysis ويحتل المرتبة الثانية في لوحة صدارة معدل خطأ الكلمات في Artificial Analysis، محسنًا النتائج مقارنةً بالإصدارات السابقة من MAI-Transcribe.
وضعت مايكروسوفت النموذج لخدمات تشمل تدوين الملاحظات السريرية، والوثائق القانونية، وإمكانية الوصول، وإضافة الترجمة المغلقة. وأفادت الشركة بأن الاستدلال أصبح أسرع مع انخفاض كبير في الكمون، خاصةً للملفات الصوتية الطويلة، حيث يصل إلى عشرة أضعاف سرعة المعالجة لدى المنافسين الرائدين. كما أشارت إلى أن النموذج يحافظ على جودة التفريغ في الظروف الصاخبة خارج بيئات التسجيل المتحكم فيها.
نتائج الاختبار
استنادًا إلى التقييمات التي أجرتها Artificial Analysis، صرّحت مايكروسوفت أن MAI-Transcribe-2 أسرع بعشرة أضعاف من GPT-Transcribe الخاص بـ OpenAI، وأسرع بسبعة أضعاف من Scribe v2 الخاص بـ ElevenLabs، وخمسة أضعاف من Gemini 3.5 Transcribe، مع تحقيق دقة أعلى. وأوضحت الشركة أن النموذج يحتل موقعًا منفردًا في أكثر ربع جذاب في مخطط الدقة مقابل السرعة للاختبار، بمعدل خطأ 2.0٪ وعامل سرعة 403.6، ما يعني أن ساعة من الصوت تُسترجع في حوالي عشر ثوانٍ.
على اختبار FLEURS المتعدد اللغات العام، أفادت مايكروسوفت أن MAI-Transcribe-2 يحافظ على مستوى عالٍ من الدقة عبر جميع اللغات الستين المختبرة. وصفت الشركة النموذج بأنه دقيق عبر عدد لغات أكبر من أي نموذج آخر، وأشارت إلى أن المطورين الذين يفرغون محتوى بعدة لغات يمكنهم الاعتماد على نموذج واحد، مما يقلل التعقيد وقد يوفر استهلاك وحدات معالجة الرسوميات. كما يذكر الإعلان أن سرعة النموذج ومعدل إرساله يتيحان لمايكروسوفت تقديم ما وصفته بأنه أكثر سعر تنافسي في السوق. عند الإطلاق، يُعد السعر البالغ 0.10 دولار للساعة عرضًا محدودًا يستمر حتى نهاية العام.
التوافر وميزات المطورين
تُدرج وثائق Microsoft Learn نموذج MAI-Transcribe-2 كمتاح في Azure Speech في نسخة معاينة عامة، دون اتفاقية مستوى خدمة ولا يُنصح به لأعباء العمل الإنتاجية. تصف الوثائق MAI-Transcribe كنموذج تحويل الكلام إلى نص تم تطويره داخليًا بواسطة فريق Microsoft AI، ويغطي أعباء عمل مثل ترميز الفيديو، والاجتماعات، والملاحظات السريرية، وتوثيق مراكز الاتصال، وأدوات إمكانية الوصول، وإنشاء المحتوى، ووكلاء الصوت. وتدرج الوثائق أيضًا MAI-Transcribe-2 إلى جانب الإصدارات السابقة MAI-Transcribe-1.5 وMAI-Transcribe-1، الأخير تم إيقافه في 20 أغسطس 2026.
تُوجه الطلبات عبر وضعية Enhanced في Fast Transcription API، حيث يتم اختيار النموذج بتعيين خاصية نموذج الوضعية المحسّنة إلى MAI-Transcribe-2. يقتصر إدخال الصوت على ملفات لا تتجاوز 300 ميغابايت بصيغ WAV أو MP3 أو FLAC، ويتطلب الاستخدام اشتراكًا في Azure ومورد Microsoft Foundry لخدمة Speech.
تتحكم المعلمات الاختيارية في مجموعة ميزات النموذج. يقوم تمييز المتحدث بتقسيم التسجيل حسب المتحدث وإرجاع مقاطع مُعلمة باسم المتحدث مع بيانات إزاحة ومدة. تُعيد الطوابع الزمنية على مستوى الكلمة توقيت كل كلمة، بينما تُعيد خيار المقاطع توقيتًا لكل مقطع، ويُزيل خيار “none” بيانات التوقيت. يُوجه معامل phrase‑list التعرف نحو المصطلحات المقدَّمة مثل المصطلحات المتخصصة، والاختصارات، والأسماء الخاصة، وتوضح الوثائق أن هذه المصطلحات تعمل كإشارات وليس كإخراج إلزامي.
يُحدد معامل نمط التفريغ افتراضيًا على “verbatim”، وهو يلتقط الكلام كما هو تمامًا، بما في ذلك الكلمات الحشو والبدايات الخاطئة، لتلبية احتياجات الامتثال، وضمان الجودة، وتحليل البيانات. يُزيل الإعداد “clean” الحشو ويُعيد تنسيق الأنماط الكلامية الشائعة لإنتاج ترجمات وعناوين وملاحظات أكثر قابلية للقراءة. اختيار اللغة اختياري؛ يكتشف النموذج اللغة المتحدثة تلقائيًا، وتُنصح الوثائق بفرض لغة معينة فقط عندما تفشل عملية الاكتشاف التلقائي. يتم التعامل تلقائيًا مع التحويل بين لغات مختلطة مثل Hinglish وSpanglish، وتُعد القدرة على مقاومة الضوضاء للملفات الصوتية المسجلة خارج البيئات المتحكم فيها جزءًا أساسيًا من النموذج.
تشير الوثائق أيضًا إلى أن MAI-Transcribe يمكنه توفير تفريغ صوتي للمدخلات عبر Voice Live API من خلال حقل تكوين الجلسة. صرّحت مايكروسوفت أن النموذج متاح للتجربة عبر Microsoft Foundry وMAI Playground، مع ذكر أن التوافر على OpenRouter سيُعلن عنه قريبًا.












