โมเดลและแพลตฟอร์ม AI

นักวิจัยพัฒนาโมเดลการรับรู้พูดของมนุษย์ด้วยเครือข่ายประสาทลึก

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากเยอรมนีได้สำรวจโมเดลการรับรู้พูดของมนุษย์ใหม่โดยใช้การเรียนรู้ของเครื่องและเครือข่ายประสาทลึก โมเดลใหม่นี้สามารถช่วยปรับปรุงการรับรู้พูดของมนุษย์ได้อย่างมาก

อัลกอริทึมการฟังเสียงทั่วไปจะใช้เพื่อปรับปรุงการรับรู้พูดของมนุษย์ และจะถูกประเมินผ่านการทดลองต่างๆ ที่กำหนดอัตราส่วนสัญญาณต่อเสียงรบกวนเมื่อมีการรับรู้คำจำนวนหนึ่ง อย่างไรก็ตาม การทดลองเหล่านี้มักจะใช้เวลานานและแพง

โมเดลใหม่ได้รับการอธิบายไว้ในงานวิจัยที่ตีพิมพ์ใน The Journal of the Acoustical Society of America

การคาดการณ์สำหรับผู้ฟังที่มีปัญหาการได้ยิน

Jana Roßbach เป็นหนึ่งในผู้เขียนจาก Carl Von Ossietzky University

“ความใหม่ของโมเดลของเราคือสามารถให้การคาดการณ์ที่ดีสำหรับผู้ฟังที่มีปัญหาการได้ยินสำหรับประเภทเสียงรบกวนที่มีความซับซ้อนมากและแสดงข้อผิดพลาดต่ำและความสัมพันธ์ที่สูงกับข้อมูลที่วัดได้” Roßbach กล่าว

ทีมนักวิจัยคำนวณว่าผู้ฟังสามารถเข้าใจคำพูดได้กี่คำต่อประโยคผ่านการรับรู้พูดอัตโนมัติ (ASR) เครื่องมือการรับรู้พูดเช่น Alexa และ Siri พึ่งพา ASR ซึ่งมีอยู่ทั่วไป

การศึกษาและผลลัพธ์

การศึกษาที่ดำเนินการโดยทีมนักวิจัยมีผู้ฟังปกติ 8 คนและผู้ฟังที่มีปัญหาการได้ยิน 20 คน ผู้ฟังถูกสัมผัสกับเสียงรบกวนที่ซับซ้อนมากมายที่ซ่อนเสียงพูด และผู้ฟังที่มีปัญหาการได้ยินถูกแบ่งออกเป็นสามกลุ่มตามระดับการสูญเสียการได้ยินเนื่องจากอายุ

ผ่านโมเดลใหม่ นักวิจัยสามารถคาดการณ์การทำงานของการรับรู้พูดของมนุษย์สำหรับผู้ฟังที่มีปัญหาการได้ยินในระดับต่างๆ ได้ พวกเขาสามารถทำการคาดการณ์เหล่านี้สำหรับเสียงรบกวนต่างๆ ที่มีความซับซ้อนในด้านการเปลี่ยนแปลงชั่วคราวและความคล้ายคลึงกับเสียงพูดจริง ซึ่งทุกอย่างช่วยให้สามารถสังเกตและวิเคราะห์แต่ละคนได้ตามความสูญเสียการได้ยินที่เป็นไปได้

“เราตกใจมากที่สุดว่าการคาดการณ์ทำงานได้ดีสำหรับทุกประเภทเสียงรบกวน เราคาดว่าโมเดลจะมีปัญหาเมื่อใช้เสียงพูดที่แข่งขันกันเพียงเสียงเดียว แต่นั่นไม่ใช่กรณีนั้น” Roßbach กล่าว

เนื่องจากโมเดลมุ่งเน้นไปที่การได้ยินแบบซิงเกิลเอียร์ ทีมงานจะหันไปสร้างโมเดลไบนอรัลสำหรับการได้ยินสองหู พวกเขายังบอกอีกว่าโมเดลใหม่นี้สามารถใช้เพื่อคาดการณ์ความพยายามในการฟังหรือคุณภาพเสียงพูดได้เช่นกัน

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก