โมเดลและแพลตฟอร์ม AI
นักวิจัยพัฒนาโมเดลการรับรู้พูดของมนุษย์ด้วยเครือข่ายประสาทลึก
นักวิจัยจากเยอรมนีได้สำรวจโมเดลการรับรู้พูดของมนุษย์ใหม่โดยใช้การเรียนรู้ของเครื่องและเครือข่ายประสาทลึก โมเดลใหม่นี้สามารถช่วยปรับปรุงการรับรู้พูดของมนุษย์ได้อย่างมาก
อัลกอริทึมการฟังเสียงทั่วไปจะใช้เพื่อปรับปรุงการรับรู้พูดของมนุษย์ และจะถูกประเมินผ่านการทดลองต่างๆ ที่กำหนดอัตราส่วนสัญญาณต่อเสียงรบกวนเมื่อมีการรับรู้คำจำนวนหนึ่ง อย่างไรก็ตาม การทดลองเหล่านี้มักจะใช้เวลานานและแพง
โมเดลใหม่ได้รับการอธิบายไว้ในงานวิจัยที่ตีพิมพ์ใน The Journal of the Acoustical Society of America
การคาดการณ์สำหรับผู้ฟังที่มีปัญหาการได้ยิน
Jana Roßbach เป็นหนึ่งในผู้เขียนจาก Carl Von Ossietzky University
“ความใหม่ของโมเดลของเราคือสามารถให้การคาดการณ์ที่ดีสำหรับผู้ฟังที่มีปัญหาการได้ยินสำหรับประเภทเสียงรบกวนที่มีความซับซ้อนมากและแสดงข้อผิดพลาดต่ำและความสัมพันธ์ที่สูงกับข้อมูลที่วัดได้” Roßbach กล่าว
ทีมนักวิจัยคำนวณว่าผู้ฟังสามารถเข้าใจคำพูดได้กี่คำต่อประโยคผ่านการรับรู้พูดอัตโนมัติ (ASR) เครื่องมือการรับรู้พูดเช่น Alexa และ Siri พึ่งพา ASR ซึ่งมีอยู่ทั่วไป
การศึกษาและผลลัพธ์
การศึกษาที่ดำเนินการโดยทีมนักวิจัยมีผู้ฟังปกติ 8 คนและผู้ฟังที่มีปัญหาการได้ยิน 20 คน ผู้ฟังถูกสัมผัสกับเสียงรบกวนที่ซับซ้อนมากมายที่ซ่อนเสียงพูด และผู้ฟังที่มีปัญหาการได้ยินถูกแบ่งออกเป็นสามกลุ่มตามระดับการสูญเสียการได้ยินเนื่องจากอายุ
ผ่านโมเดลใหม่ นักวิจัยสามารถคาดการณ์การทำงานของการรับรู้พูดของมนุษย์สำหรับผู้ฟังที่มีปัญหาการได้ยินในระดับต่างๆ ได้ พวกเขาสามารถทำการคาดการณ์เหล่านี้สำหรับเสียงรบกวนต่างๆ ที่มีความซับซ้อนในด้านการเปลี่ยนแปลงชั่วคราวและความคล้ายคลึงกับเสียงพูดจริง ซึ่งทุกอย่างช่วยให้สามารถสังเกตและวิเคราะห์แต่ละคนได้ตามความสูญเสียการได้ยินที่เป็นไปได้
“เราตกใจมากที่สุดว่าการคาดการณ์ทำงานได้ดีสำหรับทุกประเภทเสียงรบกวน เราคาดว่าโมเดลจะมีปัญหาเมื่อใช้เสียงพูดที่แข่งขันกันเพียงเสียงเดียว แต่นั่นไม่ใช่กรณีนั้น” Roßbach กล่าว
เนื่องจากโมเดลมุ่งเน้นไปที่การได้ยินแบบซิงเกิลเอียร์ ทีมงานจะหันไปสร้างโมเดลไบนอรัลสำหรับการได้ยินสองหู พวกเขายังบอกอีกว่าโมเดลใหม่นี้สามารถใช้เพื่อคาดการณ์ความพยายามในการฟังหรือคุณภาพเสียงพูดได้เช่นกัน












