โมเดลและแพลตฟอร์ม AI

EchoSpeech: การปฏิวัติการสื่อสารด้วยเทคโนโลยีการรู้จำคำพูดเงียบ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากมหาวิทยาลัยคอร์เนลได้พัฒนา EchoSpeech ซึ่งเป็นอินเทอร์เฟซการรู้จำคำพูดเงียบที่ใช้การรับรู้ทางเสียงและปัญญาประดิษฐ์เพื่อรู้จำคำสั่งเงียบได้ถึง 31 คำสั่งโดยอาศัยการเคลื่อนไหวของปากและริมฝีปาก อินเทอร์เฟซที่มีพลังงานต่ำและสามารถสวมใส่ได้นี้สามารถทำงานบนสมาร์ทโฟนและต้องการเวลาเพียงไม่กี่นาทีในการฝึกอบรมผู้ใช้เพื่อรู้จำคำสั่ง

รุยดอง จาง นักศึกษาระดับ博士จากสาขาวิชาวิทยาศาสตร์ข้อมูลเป็นผู้เขียนนำของ “EchoSpeech: การรู้จำคำพูดเงียบแบบต่อเนื่องบนอุปกรณ์สวมใส่ที่มีการรับรู้ทางเสียง” ซึ่งจะถูกนำเสนอที่การประชุมสมาคมคอมพิวเตอร์แห่งการคำนวณเกี่ยวกับปัจจัยของมนุษย์ในระบบคอมพิวเตอร์ (CHI) ในเดือนนี้ที่ฮัมบูร์ก ประเทศเยอรมนี

“สำหรับผู้ที่ไม่สามารถพูดได้ เทคโนโลยีการรู้จำคำพูดเงียบอาจเป็นวิธีการเข้าสู่ระบบสังเคราะห์เสียงที่ดีเยี่ยม มันสามารถให้เสียงกลับมาแก่ผู้ป่วย” จางกล่าว โดยเน้นถึงความเป็นไปได้ของเทคโนโลยีนี้ในการใช้งานในอนาคต

การประยุกต์ใช้ในโลกแห่งความเป็นจริงและข้อดีในด้านความเป็นส่วนตัว

ในรูปแบบปัจจุบัน EchoSpeech สามารถใช้สำหรับการสื่อสารกับผู้อื่นผ่านสมาร์ทโฟนในสถานที่ที่การสื่อสารด้วยเสียงไม่เหมาะสมหรือไม่สะดวก เช่น ร้านอาหารที่มีเสียงดังหรือห้องสมุดที่ต้องการความเงียบ อินเทอร์เฟซการรู้จำคำพูดเงียบสามารถจับคู่กับปากกาและใช้งานร่วมกับซอฟต์แวร์ออกแบบ เช่น CAD ซึ่งลดความจำเป็นในการใช้แป้นพิมพ์และเมาส์อย่างมาก

อุปกรณ์ EchoSpeech มีไมโครโฟนและลำโพงที่เล็กกว่าดินสอ สามารถทำงานเป็นระบบโซนาร์ที่มีพลังงานจากปัญญาประดิษฐ์ โดยส่งและรับคลื่นเสียงข้ามใบหน้าและตรวจจับการเคลื่อนไหวของปาก อัลกอริธึมการเรียนรู้ลึกจะวิเคราะห์โปรไฟล์คลื่นเสียงเหล่านี้ในเวลาจริงด้วยความแม่นยำประมาณ 95%

“เรากำลังพัฒนาโซนาร์บนร่างกาย” เฉิง จาง ผู้ช่วยศาสตราจารย์สาขาวิชาวิทยาศาสตร์ข้อมูลและผู้อำนวยการ实验室 Smart Computer Interfaces for Future Interactions (SciFi) ของมหาวิทยาลัยคอร์เนลกล่าว

เทคโนโลยีการรู้จำคำพูดเงียบแบบเดิมๆ มักจะพึ่งพาเซตคำสั่งที่กำหนดไว้ล่วงหน้าและต้องการให้ผู้ใช้เผชิญหรือสวมกล้อง ซึ่งเฉิง จางอธิบายว่าไม่เหมาะสมและไม่สมจริง และยังทำให้เกิดความกังวลเกี่ยวกับความเป็นส่วนตัวสำหรับทั้งผู้ใช้และผู้ที่มีปฏิสัมพันธ์ด้วย

เทคโนโลยีการรับรู้ทางเสียงของ EchoSpeech ขจัดความจำเป็นในการใช้กล้องวิดีโอสวมใส่ นอกจากนี้ เนื่องจากข้อมูลเสียงมีขนาดเล็กกว่าข้อมูลภาพหรือวิดีโอ จึงต้องการแบนด์วิธที่น้อยกว่าในการประมวลผลและสามารถส่งไปยังสมาร์ทโฟนผ่านบลูทูธในเวลาจริง ตามที่ฟร็องซัวส์ กิมเบรตีแยร์ ผู้ช่วยศาสตราจารย์สาขาวิชาวิทยาศาสตร์ข้อมูลกล่าว

“และเนื่องจากข้อมูลถูกประมวลผลที่สมาร์ทโฟนของคุณแทนการอัปโหลดไปยังคลาวด์” เขากล่าว “ข้อมูลที่มีความเป็นส่วนตัวจึงไม่เคยออกจากความควบคุมของคุณ”

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก