โมเดลและแพลตฟอร์ม AI
นักวิจัยพยายามขยายการรู้จับการพูดอัตโนมัติไปถึง 2,000 ภาษา
ทีมนักวิจัยจากมหาวิทยาลัยคาร์เนกีเมลลอนกำลังพยายามขยายการรู้จับการพูดอัตโนมัติไปถึง 2,000 ภาษา ในปัจจุบัน มีเพียงบางส่วนของภาษาที่มีการพูดประมาณ 7,000 ถึง 8,000 ภาษาทั่วโลกที่สามารถใช้เทคโนโลยีภาษาแบบสมัยใหม่ เช่น การถอดเสียงพูดเป็นข้อความหรือการสร้างคำบรรยายอัตโนมัติ
ซินเจียน ลี เป็นนักศึกษาระดับ博士ในโรงเรียนคอมพิวเตอร์แห่งสถาบันเทคโนโลยีภาษา (LTI)
“มีคนมากมายในโลกที่พูดภาษาที่หลากหลาย แต่เครื่องมือเทคโนโลยีภาษาไม่ได้ถูกพัฒนาเพื่อภาษาทั้งหมด” เขากล่าว “การพัฒนาเทคโนโลยีและแบบจำลองภาษาที่ดีสำหรับทุกคนเป็นหนึ่งในเป้าหมายของการวิจัยนี้”
ลีเป็นส่วนหนึ่งของทีมผู้เชี่ยวชาญที่พยายามทำให้ข้อกำหนดข้อมูลสำหรับการพัฒนารูปแบบการรู้จับการพูดเป็นภาษาที่ง่ายขึ้น
ทีมนี้ยังรวมถึงสมาชิกคณะของ LTI เช่น ชินจิ วาตานาเบะ, ฟลอเรียน เมตเซ, เดวิด มอร์เทนเซน และอัลัน แบล็ก
การวิจัยที่มีชื่อว่า “ASR2K: Speech Recognition for Around 2,000 Languages Without Audio” ถูกนำเสนอที่ Interspeech 2022 ในประเทศเกาหลีใต้
ส่วนใหญ่ของแบบจำลองการรู้จับการพูดที่มีอยู่ต้องการชุดข้อมูลข้อความและเสียง ในขณะที่ข้อมูลข้อความมีอยู่สำหรับภาษาหลายพันภาษา แต่ไม่ใช่สำหรับเสียง ทีมนี้ต้องการขจัดความจำเป็นในการใช้ข้อมูลเสียงโดยเน้นไปที่องค์ประกอบทางภาษาที่เหมือนกันในหลายภาษา
เทคโนโลยีการรู้จับการพูดปกติจะเน้นไปที่สียงที่แตกต่างของภาษา ซึ่งเป็นเสียงที่แตกต่างจากภาษาอื่น ๆ ในขณะเดียวกัน ภาษาหลายภาษามีเสียงที่อธิบายว่าคำพูดเสียงอย่างไร และเสียงหลายเสียงสามารถสอดคล้องกับเสียงที่แตกต่างได้
ทีมนี้กำลังทำงานในการพัฒนารูปแบบการรู้จับการพูดที่พึ่งพาเสียงน้อยลงและพึ่งพาข้อมูลเกี่ยวกับวิธีการที่เสียงถูกแบ่งปันระหว่างภาษา ซึ่งช่วยลดความพยายามที่จำเป็นในการสร้างแบบจำลองที่แยกจากกันสำหรับภาษาแต่ละภาษา โดยการผสมผสานแบบจำลองกับต้นไม้พันธุกรรม ซึ่งเป็นแผนภาพที่แสดงความสัมพันธ์ระหว่างภาษา จะช่วยในการสร้างกฎการออกเสียง ทีมนี้สามารถประมาณการแบบจำลองการรู้จับการพูดสำหรับภาษาหลายพันภาษาได้แม้ไม่มีข้อมูลเสียง
“เรากำลังพยายามขจัดความจำเป็นในการใช้ข้อมูลเสียง ซึ่งช่วยให้เราเคลื่อนจาก 100 ถึง 200 ภาษาเป็น 2,000 ภาษา” ลีกล่าว “这是การวิจัยครั้งแรกที่มุ่งเป้าไปที่ภาษาหลายพันภาษา และเราคือทีมแรกที่พยายามขยายเครื่องมือภาษาไปถึงขอบเขตนี้”
การวิจัยในขณะที่ยังอยู่ในขั้นตอนแรกได้ปรับปรุงเครื่องมือการประมาณภาษาโดยอัตโนมัติ 5%
“ภาษาแต่ละภาษาเป็นปัจจัยที่สำคัญมากใน文化ของมันเอง ภาษาแต่ละภาษามีเรื่องราวของมันเอง และหากคุณไม่พยายามรักษาภาษาเหล่านั้น เรื่องราวเหล่านั้นอาจสูญหายไป” ลีกล่าว “การพัฒนาระบบการรู้จับการพูดและเครื่องมือนี้เป็นขั้นตอนในการพยายามรักษาภาษาเหล่านั้น”












