نماذج ومنصات الذكاء الاصطناعي

باحثون يطورون نموذجًا لتحليل الكلام البشري باستخدام الشبكات العصبية العميقة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

团队 من الباحثين من ألمانيا يبحثون في نموذج جديد لتحليل الكلام البشري يستند إلى التعلم الآلي والشبكات العصبية العميقة. يمكن أن يساعد هذا النموذج بشكل كبير في تحسين تحليل الكلام البشري.

خوارزميات سماعات الأذن عادة ما تستخدم لتحسين تحليل الكلام البشري، وتُقيم من خلال تجارب مختلفة تحدد نسبة الإشارة إلى الضوضاء التي يمكن من خلالها التعرف على عدد معين من الكلمات. ومع ذلك، فإن هذه التجارب غالبًا ما تكون استهلاكًا للوقت والمال.

تم توضيح النموذج الجديد في بحث نُشر في مجلة جمعية الصوت الأمريكية.

تنبؤات للمستمعين الذين يعانون من ضعف السمع

جانا روسباخ هي واحدة من المؤلفين من جامعة كارل فون أوسيتزكي.

“الجديد في نموذجنا هو أنه يوفر تنبؤات جيدة للمستمعين الذين يعانون من ضعف السمع لنوعيات الضوضاء ذات التعقيد المختلف ويظهر أخطاء منخفضة وارتباطات عالية مع البيانات المقاسة”، قال روسباخ.

حسّب فريق الباحثين كم عدد الكلمات في الجملة التي يمكن للمستمع فهمها من خلال التعرف الآلي على الكلام (ASR). أدوات التعرف على الكلام مثل أليكسا وسيري تعتمد على هذا ASR، وهو متاح على نطاق واسع.

الدراسة والنتائج

أجريت الدراسة التي قام بها الفريق على ثمانية أشخاص ذوي سمع طبيعي و20 شخصًا يعانون من ضعف السمع. تم تعرض المستمعين لضوضاء معقدة مختلفة خففت الكلام، وتم تصنيف المستمعين الذين يعانون من ضعف السمع إلى ثلاثة مجموعات حسب مستوى فقدان السمع المرتبط بالعمر.

من خلال النموذج الجديد، يمكن للباحثين التنبؤ بأداء تحليل الكلام البشري للمستمعين الذين يعانون من ضعف السمع بدرجات مختلفة من فقدان السمع. كانوا قادرين على إجراء هذه التنبؤات لعدة أنواع من الضوضاء Masksers ذات التعقيدات المختلفة في الت调 والتشابه مع الكلام الحقيقي. كل هذا مكن كل شخص من أن يتم ملاحظته وتحليله بشكل فردي فيما يتعلق بفقدان السمع المحتمل.

“كنا أكثر ما ن驚 أن التنبؤات عملت جيدًا لجميع أنواع الضوضاء. كنا ننتظر أن نموذجنا سيواجه مشاكل عند استخدام متكلم منافس واحد. ومع ذلك، لم يكن ذلك هو الحال”، قال روسباخ.

由于 النموذج ركز على سمع الأذن الواحدة، سيبحث الفريق الآن في إنشاء نموذج ثنائي الأذن لسمع الأذنين. كما يقولون أن النموذج الجديد يمكن استخدامه للتنبؤ بالجهد الاستماعي أو جودة الكلام أيضًا.

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.