โมเดลและแพลตฟอร์ม AI

CNTXT AI เปิดตัว Munsit: ระบบการรับรู้พูดภาษาอาหรับที่แม่นยำที่สุดเท่าที่เคยสร้างมา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ในขณะสำคัญสำหรับอินเทลลิเจนต์อาร์ติฟิเชียลภาษาอาหรับ CNTXT AI ได้เปิดตัว Munsit ซึ่งเป็นรุ่นใหม่ของโมเดลการรับรู้พูดภาษาอาหรับที่ไม่เพียงแต่เป็นโมเดลที่แม่นยำที่สุดเท่าที่เคยสร้างมาสำหรับภาษาอาหรับ แต่ยังเป็นโมเดลที่มีประสิทธิภาพเหนือกว่าผู้นำระดับโลกอย่าง OpenAI, Meta, Microsoft (MSFT ) และ ElevenLabs ในมาตรฐานการประเมินผลที่กำหนดไว้ โมเดลนี้ถูกพัฒนาขึ้นที่สหรัฐอาหรับเอมิเรตส์และออกแบบมาเพื่อภาษาอาหรับจากต้นจนจบ Munsit จึงเป็นก้าวสำคัญสำหรับเทคโนโลยี “อินเทลลิเจนต์อาร์ติฟิเชียลอธิปไตย” ของ CNTXT — เทคโนโลยีที่ถูกสร้างขึ้นในภูมิภาคสำหรับภูมิภาค แต่ยังมีความสามารถในการแข่งขันในระดับโลก

รากฐานทางวิทยาศาสตร์ของความสำเร็จนี้ถูกอธิบายไว้ในเอกสารวิจัยใหม่ของทีม การปรับปรุงการรับรู้พูดภาษาอาหรับโดยใช้การเรียนรู้แบบอ่อน ซึ่งแนะนำวิธีการฝึกอบรมที่มีประสิทธิภาพและประหยัดข้อมูล ซึ่งสามารถแก้ไขปัญหาการขาดแคลนข้อมูลการรับรู้พูดภาษาอาหรับที่มีการทำเครื่องหมายไว้แล้ว วิธีการนี้ — การเรียนรู้แบบอ่อน — ทำให้ทีมสามารถสร้างระบบที่ตั้งค่ามาตรฐานใหม่สำหรับคุณภาพการถอดเสียงทั้งในภาษาอาหรับมาตรฐาน (MSA) และกว่า 25 ภาษาถิ่น

การเอาชนะการขาดแคลนข้อมูลใน ASR ภาษาอาหรับ

ภาษาอาหรับ ถึงแม้ว่าจะเป็นภาษาที่มีผู้พูดมากที่สุดในโลกและเป็นภาษาที่ได้รับการยอมรับจากสหประชาชาติ แต่ก็ยังถือเป็นภาษาที่มีทรัพยากรน้อยในด้านการรับรู้พูด นี่เป็นผลมาจากความซับซ้อนของภาษาและขาดข้อมูลการรับรู้พูดที่มีการทำเครื่องหมายไว้แล้ว ไม่เหมือนกับภาษาอังกฤษที่มีข้อมูลการรับรู้พูดที่มีการทำเครื่องหมายไว้แล้วมากมาย ภาษาอาหรับจึงต้องเผชิญกับความท้าทายที่สำคัญในการสร้างระบบการรับรู้พูดอัตโนมัติที่มีประสิทธิภาพ

แทนที่จะรอการทำเครื่องหมายข้อมูลการรับรู้พูดที่มีคุณภาพสูง CNTXT AI ได้เลือกเส้นทางที่มีประสิทธิภาพมากกว่า — การเรียนรู้แบบอ่อน การเข้าใกล้นี้เริ่มต้นด้วยการรวบรวมข้อมูลการรับรู้พูดภาษาอาหรับมากกว่า 30,000 ชั่วโมงจากแหล่งต่างๆ ผ่านการประมวลผลข้อมูลแบบกำหนดเอง ข้อมูลเสียงดังกล่าวถูกทำความสะอาด แบ่งออกเป็นช่วง และทำเครื่องหมายอัตโนมัติเพื่อให้ได้เซตข้อมูลฝึกอบรมที่มีคุณภาพสูง 15,000 ชั่วโมง — หนึ่งในเซตข้อมูลการรับรู้พูดภาษาอาหรับที่ใหญ่ที่สุดและเป็นตัวแทนมากที่สุดเท่าที่เคยรวบรวมมา

กระบวนการนี้ไม่ได้พึ่งพาการทำเครื่องหมายโดยมนุษย์ แต่ CNTXT ได้พัฒนาระบบหลายขั้นตอนสำหรับการสร้าง การประเมิน และการกรองสมมติฐานจากโมเดลการรับรู้พูดหลายรุ่น การถอดเสียงเหล่านี้ถูกเปรียบเทียบโดยใช้ระยะทาง Levenshtein เพื่อเลือกสมมติฐานที่สอดคล้องกันมากที่สุด จากนั้นจึงผ่านโมเดลภาษาเพื่อประเมินความเป็นไปได้ทางไวยากรณ์ ส่วนใดที่ไม่ผ่านเกณฑ์คุณภาพที่กำหนดจะถูกทิ้งไป ดังนั้น แม้ไม่มีการยืนยันโดยมนุษย์ ข้อมูลฝึกอบรมก็ยังคงเชื่อถือได้ ทีมได้ปรับปรุงกระบวนการนี้ผ่านหลายรอบการวนซ้ำ โดยที่แต่ละครั้งจะปรับปรุงความแม่นยำของเครื่องหมายโดยการฝึกอบรมระบบการรับรู้พูดใหม่และป้อนกลับเข้าไปในกระบวนการทำเครื่องหมาย

การขับเคลื่อน Munsit: สถาปัตยกรรม Conformer

ในใจกลางของ Munsit คือโมเดล Conformer ซึ่งเป็นสถาปัตยกรรมเครือข่ายประสาทที่ผสมผสานความไวต่อท้องถิ่นของชั้นเชิงการคำนวณกับความสามารถในการสร้างแบบจำลองลำดับโลกของทรานส์ฟอร์เมอร์ การออกแบบนี้ทำให้ Conformer มีความสามารถพิเศษในการจัดการกับลักษณะเฉพาะของภาษาพูด ซึ่งทั้งความสัมพันธ์ระยะไกล (เช่น โครงสร้างประโยค) และรายละเอียดทางสัทศาสตร์ที่ละเอียดอ่อนมีความสำคัญ

CNTXT AI ได้ใช้ Conformer รุ่นใหญ่ โดยฝึกอบรมจากต้นโดยใช้ mel-spectrograms 80 ช่องทางเป็นข้อมูลเข้า โมเดลประกอบด้วย 18 ชั้นและมีประมาณ 121 ล้านพารามิเตอร์ การฝึกอบรมดำเนินการบนคลัสเตอร์ที่มีประสิทธิภาพสูงโดยใช้ GPU NVIDIA A100 สองตัวพร้อมความแม่นยำ bfloat16 ทำให้สามารถจัดการขนาดแบตช์ขนาดใหญ่และพื้นที่คุณลักษณะมิติสูงได้อย่างมีประสิทธิภาพ สำหรับการทำเครื่องหมายโทเค็นของโครงสร้างทางภาษาที่ซับซ้อนของภาษาอาหรับ ทีมงานใช้ SentencePiece tokenizer ที่ฝึกอบรมเฉพาะบนคอร์ปัสของตนเอง ซึ่งผลิตคำศัพท์ย่อย 1,024 หน่วย

ไม่เหมือนกับการฝึกอบรมแบบกำกับแบบดั้งเดิมที่ต้องมีการจับคู่ข้อมูลเสียงแต่ละคลิปกับเครื่องหมายที่ถูกทำเครื่องหมายอย่างระมัดระวัง CNTXT ใช้วิธีการที่ทำงานกับเครื่องหมายที่อ่อนกว่า เครื่องหมายเหล่านี้ แม้ว่าจะมีเสียงรบกวนมากกว่าเครื่องหมายที่ได้รับการยืนยันโดยมนุษย์ แต่ได้รับการปรับให้เหมาะสมผ่านวงจรป้อนกลับที่ให้ความสำคัญกับการตกลงร่วมกัน ความสอดคล้องทางไวยากรณ์ และความเป็นไปได้ทางเล็กซิกอล โมเดลนี้ถูกฝึกอบรมโดยใช้ฟังก์ชันการเสียหาย Connectionist Temporal Classification (CTC) ซึ่งเหมาะสำหรับการสร้างแบบจำลองลำดับที่ไม่สอดคล้องกัน — สิ่งสำคัญสำหรับงานการรับรู้พูดที่เวลาในการพูดคำไม่แน่นอนและไม่คาดเดาได้

การครอบงำมาตรฐาน

ผลลัพธ์พูดถึงตัวเอง Munsit ถูกทดสอบกับโมเดลการรับรู้พูดที่เปิดให้ใช้งานและเชิงพาณิชย์นำหน้าบนชุดข้อมูลมาตรฐานภาษาอาหรับ 6 ชุด: SADA, Common Voice 18.0, MASC (สะอาดและเสียงรบกวน), MGB-2 และ Casablanca ชุดข้อมูลเหล่านี้ครอบคลุมหลายสำเนียงและเสียงพูดทั่วโลกอาหรับ ตั้งแต่ซาอุดีอาระเบียจนถึงโมร็อกโก

ใน tất cảมาตรฐาน Munsit-1 ได้รับอัตราความผิดพลาดคำ (WER) เฉลี่ย 26.68 และอัตราความผิดพลาดตัวอักษร (CER) 10.05 เมื่อเปรียบเทียบกับ Whisper ของ OpenAI ที่มีประสิทธิภาพสูงสุดซึ่งบันทึก WER เฉลี่ย 36.86 และ CER 17.21 Meta’s SeamlessM4T ซึ่งเป็นโมเดลหลายภาษาที่มีประสิทธิภาพสูงสุดอีกตัวหนึ่ง มีผลลัพธ์ที่สูงกว่า Munsit เหนือกว่าระบบอื่นๆ ทั้งบนข้อมูลสะอาดและเสียงรบกวน และแสดงให้เห็นถึงความแข็งแกร่งที่โดดเด่นในสถานการณ์ที่มีเสียงรบกวน ซึ่งเป็นปัจจัยสำคัญสำหรับการใช้งานจริงเช่นศูนย์บริการลูกค้าและบริการสาธารณะ

ช่องว่างยังคงกว้างเมื่อเปรียบเทียบกับระบบที่เป็นเจ้าของโดยบริษัทต่างๆ Munsit เหนือกว่าโมเดลการรับรู้พูดภาษาอาหรับของ Microsoft Azure, ElevenLabs Scribe และแม้แต่ฟีเจอร์การถอดเสียง GPT-4o ของ OpenAI ผลลัพธ์เหล่านี้ไม่ใช่การปรับปรุงที่เล็กน้อย — แต่เป็นการปรับปรุงที่มีความหมายโดยเฉลี่ย 23.19% ใน WER และ 24.78% ใน CER เมื่อเปรียบเทียบกับเส้นฐานที่เปิดให้ใช้งานที่แข็งแกร่งที่สุด ซึ่งทำให้ Munsit เป็นผู้นำที่ชัดเจนในด้านการรับรู้พูดภาษาอาหรับ

แพลตฟอร์มสำหรับอนาคตของ AI เสียงภาษาอาหรับ

ในขณะที่ Munsit-1 กำลังเปลี่ยนแปลงความเป็นไปได้สำหรับการถอดเสียง การเขียนคำบรรยาย และการสนับสนุนลูกค้าในตลาดที่พูดภาษาอาหรับ CNTXT AI มองว่าการเปิดตัวครั้งนี้เป็นเพียงจุดเริ่มต้น บริษัทมองเห็นแพลตฟอร์มเต็มรูปแบบของเทคโนโลยีเสียงภาษาอาหรับ รวมถึงการแปลงข้อความเป็นเสียง ผู้ช่วยเสียง และระบบแปลแบบเรียลไทม์ — ทั้งหมดนี้มีพื้นฐานมาจากโครงสร้างพื้นฐานอธิปไตยและ AI ที่เกี่ยวข้องกับภูมิภาค

“Munsit มากกว่าการเป็นความสำเร็จในการรับรู้พูด” Mohammad Abu Sheikh ซีอีโอของ CNTXT AI กล่าว “มันเป็นคำประกาศที่ภาษาอาหรับควรอยู่ในแนวหน้าของ AI ทั่วโลก เราได้พิสูจน์แล้วว่า AI ระดับโลกไม่จำเป็นต้องนำเข้ามา — มันสามารถสร้างขึ้นได้ที่นี่ ในภาษาอาหรับ สำหรับภาษาอาหรับ”

ด้วยการเกิดขึ้นของโมเดลเฉพาะภูมิภาคเช่น Munsit อุตสาหกรรม AI กำลังเข้าสู่ยุคใหม่ — ยุคที่ความเกี่ยวข้องทางภาษาและวัฒนธรรมไม่ถูกเสียสละเพื่อความเป็นเลิศทางเทคนิค ในความเป็นจริง ด้วย Munsit CNTXT AI ได้แสดงให้เห็นว่าสิ่งเหล่านี้เป็นเรื่องเดียวกัน

อองตวนเป็นผู้นำที่มีวิสัยทัศน์และเป็นหุ้นส่วนผู้ก่อตั้งของ Unite.AI โดยมีความหลงใหลที่ไม่สั่นคลอนในการ塑造และ推廣อนาคตของ AI และหุ่นยนต์ เขาเป็นผู้ประกอบการซีรีย์ที่เชื่อว่า AI จะมีผลกระทบต่อสังคมมากเท่ากับไฟฟ้า และมักจะพูดถึงศักยภาพของเทคโนโลยีที่เป็นนวัตกรรมและ AGI

ในฐานะ นักอนาคต เขาได้ทำการสำรวจว่านวัตกรรมเหล่านี้จะเปลี่ยนแปลงโลกของเราอย่างไร นอกจากนี้เขายังเป็นผู้ก่อตั้ง Securities.io ซึ่งเป็นแพลตฟอร์มที่มุ่งเน้นในการลงทุนในเทคโนโลยีที่ทันสมัยที่สุดซึ่งกำลังเปลี่ยนแปลงอนาคตและเปลี่ยนแปลงอุตสาหกรรมทั้งหมด