شراكات

وكلاء الصوت المحليون يحصلون على مسار أجهزة جديد مع انضمام Smallest.ai إلى Tenstorrent

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

Tenstorrent و Smallest.ai أعلنت شراكة في 1 أكتوبر 2026 لتوفير مجموعة صوتية للذكاء الاصطناعي من المستوى الإنتاجي تُنَفَّذ محليًا، وتشغل نموذج التحويل النصي إلى كلام الفوري Lightning V2 من Smallest.ai أصلاً على Tenstorrent Galaxy Blackhole servers.

أوضحت Tenstorrent، شركة حوسبة الذكاء الاصطناعي، و Smallest.ai، مختبر أبحاث الذكاء الاصطناعي يبني بنية تحتية للذكاء الاصطناعي الصوتي الفوري، أن المجموعة المشتركة صُممت لتقليل تكاليف النشر مع تقديم الأداء المطلوب لتطبيقات الصوت الفوري. وأشارت الشركتان إلى أن تشغيل Lightning V2 على بنية Blackhole يتيح للمؤسسات تشغيل وكلاء الصوت الفوري بالكامل محليًا مع سيادة كاملة للبيانات، مستهدفًا أحمال عمل عالية الحجم وحساسة للبيانات عبر الخدمات المالية والاتصالات والرعاية الصحية وبيئات المؤسسات. يتوفر Lightning V2 على أجهزة Tenstorrent فورًا، مع تسعير يعتمد على الاستخدام دون أي التزامات مسبقة.

قال أمرو العشماوي، نائب رئيس الاستراتيجية وتطوير الأعمال في Tenstorrent: “لا ينبغي أن يكون هناك خيار بين الأداء والتكلفة – فقد بنت Tenstorrent حوسبة فعّالة وقابلة للتوسع تقلل تكلفة سير العمل الحالي وتجعل الأحمال الجديدة بالكامل عملية”.

أجهزة Galaxy Blackhole

تم بناء منصة الخادم المذكورة في الإعلان حول 32 رقاقة Blackhole ASIC توفر 23 بيتافلوبس من حساب Block FP8، مع 6.2 جيجابايت من ذاكرة SRAM على الشريحة بسرعة 2.9 بيتابايت/ثانية و1 تيرابايت من ذاكرة GDDR6 بسرعة 16 تيرابايت/ثانية، وفقًا مواصفات Galaxy الخاصة بـ Tenstorrent. تتصل كل رقاقة عبر عشرة روابط 400 جيجابت إيثرنت لتشكيل نسيج مسرّع بسرعة 32 تيرابايت/ثانية، ويمكن توسيع الأنظمة حتى 56 منفذ 800 جيجابت QSFP‑DD. يجمع الهيكل المبرد هوائيًا بحجم 6U مع معالج مضيف AMD EPYC 9004 وذاكرة DDR5 تصل إلى 576 جيجابايت، يعمل بنظام Ubuntu 22.04، يستهلك ما بين 8 إلى 10 كيلواط في المتوسط، ويأتي بسعر قائمة قدره 160,000 دولار.

تصميم منخفض الدقة والنتائج المقاسة

تم توثيق الهندسة وراء الشراكة في ورقة بحثية، “إعادة كتابة اقتصاديات استدلال TTS: Lightning V2 على Tenstorrent يحقق تكلفة أقل بأربع مرات مقارنةً بـ NVIDIA L40S” كتبها رنجيث م س من Smallest.ai، مهندس أداء استدلال الذكاء الاصطناعي الأول؛ والمدير التقني أكشات ماندلوي؛ والرئيس التنفيذي سدارشان كاماث. قُدمت الورقة لأول مرة في 24 مارس 2026، وتم تعديلها في 7 أبريل 2026.

قال رنجيث، المؤلف الأول للورقة، في الإعلان: “معمارية Tenstorrent مختلفة جوهريًا عن النماذج الحالية. من خلال العمل مع NoC و SRAM الأكبر، حققنا تحسينًا بأربع مرات مقابل جزء صغير من تكلفة بنية GPU المقارنة، مما أدى إلى تحول هيكلي في اقتصاديات الاستدلال.”

أفاد المؤلفون أن نماذج التحويل النصي إلى كلام أكثر هشاشة عدديةً بشكل كبير مقارنةً بنماذج اللغة الكبيرة لأنها تُولِّد موجات مستمرة عبر تحسين تكراري، مما يجعل الأخطاء العددية الصغيرة تتراكم عبر خطوات إزالة الضوضاء وتظهر كعيوب سمعية. في مواجهة هذا القيد، تشير الورقة إلى أن أكثر من 95٪ من طبقات Lightning V2 تعمل بدقة حسابية LoFi، وأن أكثر من 80٪ من النموذج يُنشر بتقنية BlockFloat8 دون تدهور ملحوظ في جودة الصوت. كما أفاد المؤلفون بتقليل حسابي بمقدار 4 أضعاف في نموذج الصوت الانتشاري، و8 أضعاف في المشفر العصبي، وتقريبًا تقليل بمقدار 2 أضعاف في حجم النموذج، وتخفيض بمقدار 1.8 أضعاف في حجم نقل الذاكرة.

فيما يتعلق بجودة المخرجات، تشير الورقة إلى أن درجة الإدراك DNSMOS بلغت 3.872 للخط الأساسي NVIDIA L40S مقابل 3.801 على P150 من Tenstorrent، وهو فرق قدره 0.071 يصفه المؤلفون بأنه يقع ضمن نطاق التفاوت الإدراكي الطفيف، بالإضافة إلى معدل خطأ كلمة مُعَدَّل قدره 0.009 بين مخرجات النظامين.

في اختبار الجهاز الواحد، تشير الورقة إلى أن L40S حافظ على تزامن قدره 3 مع زمن استجابة 300 مللي ثانية مقابل تكلفة جهاز مدرجة تبلغ 9,000 دولار، بينما حقق كل من P150 و P100 تزامنًا قدره 1 مع زمن استجابة 250 مللي ثانية بتكلفة مدرجة تبلغ 1,400 دولار و1,000 دولار على التوالي، مما أدى إلى تحقيق مكاسب تكلفة قدرها 2.6× و3.6×. وبما أن Lightning V2 يعمل على شريحة واحدة دون التوازي متعدد الشرائح أو اتصال QSFP، فإن قيمة زمن استجابة P100 مأخوذة من نتائج P150 المقاسة، حسبما تشير الورقة.

على مستوى الأسطول، نمذج المؤلفون عبء عمل يتألف من 550 طلب تحويل نص إلى كلام مدته خمس ثوانٍ يُنفَّذ بالتزامن الكامل. وقد حسبوا أن الحفاظ على هذا العبء سيتطلب 11 وحدة معالجة رسومية L40S بتكلفة تقريبية تبلغ 100,000 دولار لتسريع الأجهزة، مقابل 27 وحدة تسريع P100 بتكلفة تقريبية تبلغ 27,000 دولار أو 27 وحدة تسريع P150 بتكلفة تقريبية تبلغ 37,000 دولار، أي تخفيض في التكلفة الأولية بمقدار 3‑4 مرات في مقارنتهم النموذجية.

تشير الورقة أيضًا إلى أن طبقة واحدة مُحسَّنة بشكل كبير، تتضمن تقريبًا 6 مليارات عملية ضرب وتجميع، تُنفَّذ في حوالي 60 ميكروثانية على L40S مقابل حوالي 31 ميكروثانية على P150. ويتوقع المؤلفون أن توسيع مثل هذا التحسين على مستوى النواة عبر طبقات إضافية قد يحقق تحسينًا يتراوح بين 8 إلى 12 مرة من حيث التكلفة مقارنةً بالخط الأساسي L40S، مرتفعًا عن المكسب الحالي على مستوى النظام البالغ 3.6 مرة.

يُصوِّر المؤلفون دعم BlockFloat8 الأصلي كخط فاصل بين تكلفة الأجهزة: حيث تُصنَّف وحدات معالجة الرسومات الحديثة التي تمتلك هذه القدرة في فئة سعرية تقريبًا 40,000 دولار لكل جهاز، وفقًا لتقاريرهم، بينما تمكّن Tenstorrent تنفيذ BlockFloat8 على أجهزة في فئة سعرية تقريبًا 1,000 دولار، أي فرق بمقدار مرتبة من حيث تكلفة الشراء في وصفهم.

الهشاشة العددية وحالة معامل الارتباط بيرسون

يوثق الورق دراسة حالة تصحيح الأخطاء حول معامل الارتباط بيرسون، وهو مقياس تشابه عددي قياسي. يذكر المؤلفون أن المخرجات من L40S ومعالج AMD EPYC 7352 أظهرت معاملًا نهائيًا لا يتجاوز 0.72 رغم تساوي المدخلات، ومع ذلك أنتجت صوتًا لا يمكن تمييزه إدراكيًا. في حالة منفصلة، تسببت طبقة كان معاملها يقترب من 1.0 في حدوث عطل صوتي استغرق أكثر من شهر لتحديده. يستنتج المؤلفون أن مقاييس التشابه على مستوى الموتر التقليدية ليست مؤشرات موثوقة لجودة الصوت الإدراكية في أنظمة تحويل النص إلى كلام، وأن التحقق الإدراكي الشامل ضروري لتطبيقات الدقة المخفضة.

القيود والخطوات التالية

يذكر المؤلفون أن بعض الطبقات لا تزال حساسة عددياً للغاية للتنفيذ بدقة منخفضة أو بتقنية النقطة العائمة الكتلية دون تدهور إدراكي، مما يحد من تغطية النموذج الكامل بدقة منخفضة، وأن إعدادات المترجم والبرامج لم تُحسّن بالكامل بعد.

في 28 سبتمبر 2026 منشور تقني، وصفت Smallest.ai نموذج Lightning V2 بأنه أول نموذج تحويل نص إلى كلام في العالم يقدّم توليف صوت عالي الجودة تحت تقنين BlockFloat8 المشترك وحسابات الدقة المخفضة. وقالت الشركة إن نموذج Lightning V3 الأحدث يتفوق بالفعل على V2 من حيث الجودة والكفاءة المعمارية، وأنها تخطط لنشر Lightning V3 على أجهزة Tenstorrent وفق نفس مبادئ التصميم المشترك، مستهدفةً اختراقات تكلفة مماثلة أو أكبر.

Theo Nash هو متخصص مولَّد بالذكاء الاصطناعي في Unite.AI، يغطي بنية تحتية للذكاء الاصطناعي، الحوسبة، والأنظمة المادية التي تشغّل الذكاء الاصطناعي الحديث. يتركّز عمله على الأسس التقنية وراء أحمال العمل الضخمة للذكاء الاصطناعي، بما في ذلك مراكز البيانات، المعجّلات، الشبكات، ومجموعات البرمجيات التي تربط بينها.

مع منظور تحليلي ومُستند إلى الهندسة، يفحص Theo كيف تُتيح التقدّمات في وحدات معالجة الرسوميات (GPUs)، السيليكون المخصَّص، بنى الذاكرة، والأنظمة الموزَّعة أجيالًا جديدةً من نماذج الذكاء الاصطناعي. يولي اهتمامًا خاصًا للمقايضات في الأداء، كفاءة الطاقة، القابلية للتوسع، والقيود العملية التي تُشكّل نشر البنية التحتية للذكاء الاصطناعي في الواقع.

المقالات التي يكتبها Theo Nash مُولَّدة بالذكاء الاصطناعي وتُراجَع من قِبل فريق التحرير في Unite.AI لضمان الدقة التقنية، الوضوح، وتغطية مسؤولة للمشهد المتطور سريعًا في حوسبة الذكاء الاصطناعي.