نماذج ومنصات الذكاء الاصطناعي

آي بي إم تقول إن Granite Speech 5.0 ينسخ 3.5 ساعة من الكلام في ثانية واحدة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أصدرت شركة IBM نموذجين مدمجين للتعرف على الكلام الإنجليزي في 25 أغسطس 2026، مدعيةً أن معدل النسخ يتجاوز أي نموذج مفتوح سُجل من قبل: أكثر من 3.5 ساعة من الكلام تُعالج في ثانية واحدة. النموذجان، Granite Speech 5.0 TurboCTC والنظير غير التجاري، يحتوي كل منهما على 470 مليون معلمة فقط، وتُبلغ الشركة أن معدل الإنتاجية الإجمالي يتجاوز 12,600 RTFx على وحدة معالجة رسومات NVIDIA H200 واحدة، مما يعني أن الصوت يمر عبر النماذج أسرع بأكثر من إثني عشر ألف مرة من الوقت الحقيقي.

تأتي السرعة مع دقة تنافسية، على الأقل وفقًا لأرقام IBM. على مجموعات الاختبار القصيرة للإنجليزية العامة في OpenASR Leaderboard، يحصل النسخة غير التجارية على معدل خطأ كلمة إجمالي يبلغ 4.85٪، بينما تحصل النسخة المرخصة مفتوحًا على 5.00٪، وفقًا لإعلان IBM. كلا الرقمين تم الإبلاغ عنهما من قبل البائع: تصنفهما IBM كغير رسميين، رغم أن الاستنتاج تم عبر بنية وظائف Hugging Face الخاصة وتم تقييمه بأدوات لوحة الصدارة، لذا تتوقع الشركة أن تتطابق مع الجدول الرسمي بمجرد تحديثه.

النموذجان متطابقان في الحجم والهيكلية ويختلفان في بيانات التدريب والترخيص. النموذج المرخص تحت Apache 2.0 تم تدريبه على نحو 60,000 ساعة من الصوت الإنجليزي ومُصرح باستخدامه تجاريًا. النسخة غير التجارية تضيف GigaSpeech وSPGI Speech، ما يقرب من 15,000 ساعة إضافية، لتصل مجموعة بياناتها إلى نحو 75,000 ساعة تحت ترخيص CC-BY-NC-SA-4.0. تقول IBM إن البيانات الإضافية تمنح ميزة دقة معتدلة في معظم مجموعات الاختبار، مع تفوق ملحوظ على SPGI Speech نفسه وعيب واضح في اختبار Earnings22 المجزأ الجديد على لوحة الصدارة.

مُشفر بدون نموذج لغة

تستند ادعاءات السرعة إلى ما تركته IBM. إصدارات Granite Speech السابقة (الإصدارات 3.3 و4.x الموثقة في ورقة Granite Speech الخاصة بـ IBM) ربطت مشفرًا صوتيًا من نوع Conformer بنموذج لغة Granite عبر مشروع ومحوّلات LoRA، لتوليد النص بشكل تلقائي كما يفعل نموذج الدردشة. نماذج 5.0 تتخلى تمامًا عن نموذج اللغة. ما يبقى هو مشفر Conformer مكوّن من 16 طبقة تم تدريبه باستخدام التصنيف الزمني الاتصالي، وهو مخطط فك تشفير يربط إطارات الصوت مباشرةً بالرموز الناتجة في تمريرة واحدة غير تلقائية باستخدام فك تشفير جشع.

تغييران إضافيان ينجزان معظم العمل. حيث كانت المشفرات السابقة لـ Granite تُنتج 50 حرفًا في الثانية، تُنتج النماذج الجديدة 12.5 رمزًا في الثانية، وذلك عبر ثلاث مراحل من تقليل العينة الزمني بمقدار 2× من الواجهة الأمامية log-Mel التي تعمل بمعدل 100 إطار في الثانية. كما انتقل مفردات الإخراج من الأحرف إلى 16,384 وحدة فرعية مدربة، حيث يستخدم SentencePiece في النموذج غير التجاري وBPE في نموذج Apache. الرموز الأقل عددًا والأطول عند ربع معدل الإطارات هو ما يدفع معدل الإنتاجية لتجاوز 20 مرة ما كانت عليه نماذج Granite Speech السابقة، حسب حسابات IBM.

المقايضة هي بين اتساع القدرة وتركيز النسخ. بدون نموذج اللغة، تفقد هذه النماذج القدرة على ترجمة الكلام وتوجيه الكلمات المفتاحية التي كان يدعمها الإصدار السابق. ما تكسبه هو بصمة مناسبة لأجهزة الكمبيوتر المحمولة والعتاد الطرفي: تضع IBM هذين النموذجين في مجال تحويل الكلام إلى نص للمؤسسات حيث تكون زمن الاستجابة والإنتاجية أهم من نموذج يمكنه أيضًا استنتاج ما سمعه.

ما تُظهره وتُخفيه التقييمات

أقوى إشارة مستقلة حتى الآن تأتي من الصوت بعيد المجال. على FFASR Leaderboard، الذي يقيس التعرف على الكلام الضوضائي والصاخب، تُبلغ IBM عن النتائج الرسمية حتى 25 أغسطس 2026 حيث تحتل النموذج غير التجاري المركز الخامس من حيث الدقة والنموذج Apache المركز التاسع — بينما يحتلان كلاهما المرتبتين الأسرع على اللوحة، مع قياس الإنتاجية على وحدة NVIDIA L4 واحدة. تُقيم FFASR النماذج على صوت ضوضائي وصاخب ومتحرك المصدر عند مستويات إشارة إلى ضوضاء متعددة، وهي ظروف يتدهور فيها التعرف بعيد المجال، وفقًا لوصف اللوحة نفسه.

مع ذلك، يحتاج رقم 12,600 RTFx البارز إلى سياقه. إنه رقم استنتاج مجمع على أحد أسرع وحدات معالجة الرسومات في مراكز البيانات المتاحة، وليس ما سيراه حاسوب محمول يُشغِّل عرض البث WebGPU التجريبي. تغطي أرقام WER الإجمالية الإنجليزية القصيرة فقط، ولم تكن التصنيفات الرسمية لـ OpenASR Leaderboard، التي تشمل مجموعات اختبار خاصة، قد استوعبت النماذج الجديدة عند النشر. الإطار الذي تقدمه IBM هو الصادق هنا: هذه نتائج قوية أبلغ عنها البائع وتنتظر تأكيد لوحة الصدارة.

تستحق طريقة التدريب أيضًا الإشارة لما تقوله عن شفافية البيانات. كل مجموعة بيانات في مجموعة نصوص النموذجين متاحة للجمهور، وتضم الإضافات الاصطناعية 2,740 ساعة تتكون من 2,500 ساعة من صوت متعدد المتحدثين مُجمَّعة من مقاطع متكلم واحد بالإضافة إلى 240 ساعة من العبارات التي أنشأتها نماذج gpt‑oss المفتوحة الوزن من OpenAI وتم تركيبها باستخدام StyleTTS2، مستهدفة الأرقام والعملات والعناوين التي تُربك المُعَرِّفين. استغرق التدريب 10 أيام على 8 وحدات NVIDIA H100 GPU في عنقود IBM Blue Vela، وفقًا لبطاقة النموذج.

كلا النموذجين متاحان الآن على Hugging Face بدعم أصلي في مكتبة transformers — يتم تثبيته من المصدر حتى الإصدار التالي — ضمن مجموعة Granite Speech، ويعمل عرض تجريبي للبث عبر المتصفح في Chrome وEdge. للحصول على فكرة عن موقع نماذج النسخ المتخصصة مقارنةً بالخدمات التجارية، راجع ملخصنا لـ برمجيات النسخ الذكي.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.