نماذج ومنصات الذكاء الاصطناعي

إطلاق برنامج Speechmatics لتعرف الكلام التلقائي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أطلقت شركة Speechmatics الرائدة في تقنية تعرف الكلام على برنامجها الجديد “التعرف على الكلام التلقائي” الذي يستخدم أحدث تقنيات التعلم العميق والنمذجة الذاتية. وقد أظهر النظام قدرة على تجاوز منافسيه من أمازون وغوغل ومايكروسوفت.

بيانات ستانفورد

تستند تقنية Speechmatics على بيانات من دراسة ستانفورد حول “الاختلافات العرقية في تعرف الكلام”، وقد حقق نظامها دقة تصل إلى 82.8% لصوت الأمريكيين من أصل أفريقي. وللمقارنة، حقق نظام غوغل دقة تصل إلى 68.7% فقط، في حين حقق نظام أمازون دقة تصل إلى 68.6%. (AMZN ) (GOOGL )

مستوى الدقة ي相当 إلى 45% من تقليل أخطاء تعرف الكلام، وهو ما يعادل ثلاث كلمات في الجملة العادية. ليس نظام Speechmatics دقيقاً فقط في هذا الصدد، بل أظهر أيضاً تحسينات في الدقة عبر اللهجات والعمر واللهجات والمميزات الاجتماعية والديموغرافية الأخرى.

غالبًا ما يحدث سوء فهم في تعرف الكلام بسبب قلة البيانات المُصنفة التي يمكن أن يستخدمها الخوارزميات لتدريب نفسها. يتطلب البيانات المُصنفة تصنيفاً يدويًا من قبل البشر، مما يؤدي إلى قلة البيانات المتاحة لهذه الأنظمة. كما أن هذا يحد من تمثيل جميع الأصوات، مما يخلق مشكلة جديدة.

التدريب على البيانات غير المُصنفة

تجعل تقنية Speechmatics تقدمًا كبيرًا في هذا الصدد، حيث يتم تدريب تقنيتها على كميات هائلة من البيانات غير المُصنفة التي يتم الحصول عليها مباشرة من الإنترنت. تأتي البيانات من مصادر مثل المحتوى على وسائل التواصل الاجتماعي والبودكاست.

أ启ن التعلم الذاتي نظام Speechmatics لتدريبه على 1.1 مليون ساعة من الصوت، وهو ما يزيد عن الساعات 30,000 السابقة. هذا يسمح له بتمثيل أوسع للأصوات، مما يساعد على تقليل التحيز والخطأ في تعرف الكلام.

عندما يتعلق الأمر بأصوات الأطفال، أظهر نظام Speechmatics أيضاً قدرة على تجاوز المنافسين. تعتبر أصوات الأطفال صعبة للتعرف عليها من خلال تقنيات تعرف الكلام التقليدية، لكن نظام Speechmatics سجل دقة تصل إلى 91.8%. في حين أن نظام غوغل سجل دقة تصل إلى 83.4% فقط، ونظام Deepgram سجل دقة تصل إلى 82.3%.

كيتي ويداهال هي الرئيس التنفيذي لشركة Speechmatics.

“نحن على مهمة لتقديم الجيل التالي من قدرات التعلم الآلي، ومن خلال ذلك تقديم تقنيات كلام أكثر شمولاً وسهولة الوصول إليها. هذا الإعلان هو خطوة كبيرة نحو تحقيق هذه المهمة.”

“تركيزنا على معالجة التحيز الاصطناعي أدى إلى هذا القفزة الهائلة في صناعة تعرف الكلام، وستؤدي إلى تغييرات في العديد من السيناريوهات المختلفة. فكر في التعليقات الخاطئة التي نراها على وسائل التواصل الاجتماعي، والاجتماعات القضائية حيث يتم تسجيل الكلمات بشكل خاطئ، والمنصات التعليمية التي عانت من أصوات الأطفال خلال الجائحة. يمكن أن يكون للأخطاء التي كان الناس يضطرون إلى قبولها تأثير ملموس على حياتهم اليومية.”

أليسون زو كوينيكي هي المؤلفة الرئيسية لدراسة ستانفورد حول تعرف الكلام.

“من المهم دراسة وتحسين العدالة في أنظمة الكلام إلى النص نظراً للpotential لتسبب ضرر غير متساوٍ للأفراد من خلال القطاعات المختلفة من الرعاية الصحية إلى العدالة الجنائية.”

أليكس يقود عمليات الأخبار المدعومة بالذكاء الاصطناعي في Unite.AI، حيث يجمع بين الصحافة والبحث والأتمتة لدعم تغطية الذكاء الاصطناعي في الوقت المناسب وبشكل قابل للتوسع. يساعد عمله في ضمان ظهور التطورات الناشئة في مجال الذكاء الاصطناعي بكفاءة، مع الحفاظ على معايير التحرير الخاصة بالموقع.