โมเดลและแพลตฟอร์ม AI

นักวิจัยพยายามขยายการรู้จับการพูดอัตโนมัติไปถึง 2,000 ภาษา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ทีมนักวิจัยจากมหาวิทยาลัยคาร์เนกีเมลลอนกำลังพยายามขยายการรู้จับการพูดอัตโนมัติไปถึง 2,000 ภาษา ในปัจจุบัน มีเพียงบางส่วนของภาษาที่มีการพูดประมาณ 7,000 ถึง 8,000 ภาษาทั่วโลกที่สามารถใช้เทคโนโลยีภาษาแบบสมัยใหม่ เช่น การถอดเสียงพูดเป็นข้อความหรือการสร้างคำบรรยายอัตโนมัติ

ซินเจียน ลี เป็นนักศึกษาระดับ博士ในโรงเรียนคอมพิวเตอร์แห่งสถาบันเทคโนโลยีภาษา (LTI)

“มีคนมากมายในโลกที่พูดภาษาที่หลากหลาย แต่เครื่องมือเทคโนโลยีภาษาไม่ได้ถูกพัฒนาเพื่อภาษาทั้งหมด” เขากล่าว “การพัฒนาเทคโนโลยีและแบบจำลองภาษาที่ดีสำหรับทุกคนเป็นหนึ่งในเป้าหมายของการวิจัยนี้”

ลีเป็นส่วนหนึ่งของทีมผู้เชี่ยวชาญที่พยายามทำให้ข้อกำหนดข้อมูลสำหรับการพัฒนารูปแบบการรู้จับการพูดเป็นภาษาที่ง่ายขึ้น

ทีมนี้ยังรวมถึงสมาชิกคณะของ LTI เช่น ชินจิ วาตานาเบะ, ฟลอเรียน เมตเซ, เดวิด มอร์เทนเซน และอัลัน แบล็ก

การวิจัยที่มีชื่อว่า “ASR2K: Speech Recognition for Around 2,000 Languages Without Audio” ถูกนำเสนอที่ Interspeech 2022 ในประเทศเกาหลีใต้

ส่วนใหญ่ของแบบจำลองการรู้จับการพูดที่มีอยู่ต้องการชุดข้อมูลข้อความและเสียง ในขณะที่ข้อมูลข้อความมีอยู่สำหรับภาษาหลายพันภาษา แต่ไม่ใช่สำหรับเสียง ทีมนี้ต้องการขจัดความจำเป็นในการใช้ข้อมูลเสียงโดยเน้นไปที่องค์ประกอบทางภาษาที่เหมือนกันในหลายภาษา

เทคโนโลยีการรู้จับการพูดปกติจะเน้นไปที่สียงที่แตกต่างของภาษา ซึ่งเป็นเสียงที่แตกต่างจากภาษาอื่น ๆ ในขณะเดียวกัน ภาษาหลายภาษามีเสียงที่อธิบายว่าคำพูดเสียงอย่างไร และเสียงหลายเสียงสามารถสอดคล้องกับเสียงที่แตกต่างได้

ทีมนี้กำลังทำงานในการพัฒนารูปแบบการรู้จับการพูดที่พึ่งพาเสียงน้อยลงและพึ่งพาข้อมูลเกี่ยวกับวิธีการที่เสียงถูกแบ่งปันระหว่างภาษา ซึ่งช่วยลดความพยายามที่จำเป็นในการสร้างแบบจำลองที่แยกจากกันสำหรับภาษาแต่ละภาษา โดยการผสมผสานแบบจำลองกับต้นไม้พันธุกรรม ซึ่งเป็นแผนภาพที่แสดงความสัมพันธ์ระหว่างภาษา จะช่วยในการสร้างกฎการออกเสียง ทีมนี้สามารถประมาณการแบบจำลองการรู้จับการพูดสำหรับภาษาหลายพันภาษาได้แม้ไม่มีข้อมูลเสียง

“เรากำลังพยายามขจัดความจำเป็นในการใช้ข้อมูลเสียง ซึ่งช่วยให้เราเคลื่อนจาก 100 ถึง 200 ภาษาเป็น 2,000 ภาษา” ลีกล่าว “这是การวิจัยครั้งแรกที่มุ่งเป้าไปที่ภาษาหลายพันภาษา และเราคือทีมแรกที่พยายามขยายเครื่องมือภาษาไปถึงขอบเขตนี้”

การวิจัยในขณะที่ยังอยู่ในขั้นตอนแรกได้ปรับปรุงเครื่องมือการประมาณภาษาโดยอัตโนมัติ 5%

“ภาษาแต่ละภาษาเป็นปัจจัยที่สำคัญมากใน文化ของมันเอง ภาษาแต่ละภาษามีเรื่องราวของมันเอง และหากคุณไม่พยายามรักษาภาษาเหล่านั้น เรื่องราวเหล่านั้นอาจสูญหายไป” ลีกล่าว “การพัฒนาระบบการรู้จับการพูดและเครื่องมือนี้เป็นขั้นตอนในการพยายามรักษาภาษาเหล่านั้น”

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก