โมเดลและแพลตฟอร์ม AI

MAI-Transcribe-2 ครองอันดับหนึ่งในเกณฑ์ FLEURS ครอบคลุม 60 ภาษา, Microsoft กล่าว

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Microsoft AI เปิดตัว MAI-Transcribe-2 เมื่อวันที่ 3 กันยายน 2026 ซึ่งเป็นโมเดลการจดจำเสียงที่ห้องทดลองระบุว่าได้อันดับหนึ่งในเกณฑ์ FLEURS ครอบคลุม 60 ภาษาโดยมีอัตราความผิดพลาดของคำเฉลี่ยที่ 5.2% ใน การประกาศของ Microsoft Microsoft อธิบายว่าโมเดลนี้เป็นระบบการถอดข้อความที่มีความสามารถที่สุดจนถึงปัจจุบันและตั้งราคาไว้ที่ $0.10 ต่อชั่วโมงของเสียง

Microsoft กล่าวว่า MAI-Transcribe-2 เพิ่มฟีเจอร์การแยกผู้พูด (speaker diarization), สไตล์การถอดข้อความที่กำหนดค่าได้, และการทำเครื่องหมายเวลาในระดับคำ, และทำผลงานเหนือโมเดลคู่แข่งรวมถึง Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large, และ ScribeV2 ในช่วงเสียงจริงที่หลากหลายมากขึ้น ตามการประกาศ โมเดลนี้กำหนดเส้นขอบ Pareto สำหรับความแม่นยำและความหน่วงเวลาบน Artificial Analysis และได้อันดับสองในอันดับความผิดพลาดของคำบนบอร์ดลำดับของ Artificial Analysis, ปรับปรุงผลลัพธ์จากเวอร์ชัน MAI-Transcribe ก่อนหน้า

Microsoft วางตำแหน่งโมเดลนี้สำหรับงานที่รวมถึงการจดบันทึกทางคลินิก, เอกสารทางกฎหมาย, การเข้าถึงสำหรับผู้พิการ, และการสร้างคำบรรยายปิด. บริษัทรายงานว่าการสรุปผลเร็วขึ้นด้วยความหน่วงเวลาที่ต่ำกว่ามาก โดยเฉพาะสำหรับเสียงแบบยาวถึง 10 เท่าของความเร็วการประมวลผลของคู่แข่งชั้นนำ. นอกจากนี้ยังระบุว่าโมเดลยังคงรักษาคุณภาพการถอดข้อความได้ในสภาพเสียงรบกวนที่อยู่นอกสภาพแวดล้อมการบันทึกที่ควบคุม

ผลการทดสอบเบนช์มาร์ค

อ้างอิงการประเมินที่ดำเนินการโดย Artificial Analysis, Microsoft กล่าวว่า MAI-Transcribe-2 มีความเร็วสูงกว่า GPT-Transcribe ของ OpenAI ถึง 10 เท่า, สูงกว่า Scribe v2 ของ ElevenLabs ถึง 7 เท่า, และสูงกว่า Gemini 3.5 Transcribe ถึง 5 เท่า พร้อมให้ความแม่นยำที่ดีกว่า บริษัทระบุว่าโมเดลนี้อยู่คนเดียวในควอดรันท์ที่น่าสนใจที่สุดของแผนภูมิความแม่นยำต่อความเร็วของเกณฑ์, ด้วยอัตราความผิดพลาด 2.0% และปัจจัยความเร็ว 403.6, หมายความว่าเสียงหนึ่งชั่วโมงจะได้รับผลลัพธ์ภายในประมาณสิบวินาที

บนเกณฑ์ FLEURS สาธารณะหลายภาษา, Microsoft รายงานว่า MAI-Transcribe-2 รักษาระดับความแม่นยำสูงอย่างต่อเนื่องในทุก 60 ภาษาที่ทดสอบ บริษัทอธิบายว่าโมเดลนี้มีความแม่นยำในจำนวนภาษามากกว่าทุกรุ่นอื่นและกล่าวว่าผู้พัฒนาที่ต้องถอดข้อความหลายภาษา สามารถพึ่งพาโมเดลเดียวได้ ลดความซับซ้อนและอาจประหยัดการใช้ GPU การประกาศยังระบุว่าความเร็วและอัตราการประมวลผลของโมเดลทำให้ Microsoft สามารถนำเสนอราคาที่เรียกว่าเป็นราคาที่แข่งขันที่สุดในตลาด ในช่วงเปิดตัว ราคา $0.10 ต่อชั่วโมงเป็นข้อเสนอจำกัดเวลาที่ดำเนินจนถึงสิ้นปี

การพร้อมใช้งานและคุณลักษณะสำหรับนักพัฒนา

เอกสาร Microsoft Learn ระบุว่า MAI-Transcribe-2 มีให้ใช้ใน Azure Speech ในรูปแบบพรีวิวสาธารณะ, ไม่มีข้อตกลงระดับบริการและไม่แนะนำให้ใช้ในงานผลิตจริง เอกสารอธิบายว่า MAI-Transcribe เป็นโมเดลการแปลงเสียงเป็นข้อความที่พัฒนาโดยทีม Microsoft AI ภายในบริษัท, ครอบคลุมงานเช่นการใส่คำบรรยายวิดีโอ, การประชุม, บันทึกทางคลินิก, เอกสารศูนย์บริการลูกค้า, เครื่องมือการเข้าถึง, การสร้างเนื้อหา, และเอเจนต์เสียง นอกจากนี้ยังระบุ MAI-Transcribe-2 ควบคู่กับ MAI-Transcribe-1.5 และ MAI-Transcribe-1 ซึ่งรุ่นหลังถูกยกเลิกการสนับสนุนเมื่อ 20 สิงหาคม 2026

คำขอจะถูกส่งผ่านโหมดปรับปรุงของ Fast Transcription API, โดยเลือกโมเดลโดยตั้งค่าคุณสมบัติโมเดลโหมดปรับปรุงเป็น MAI-Transcribe-2. อินพุตเสียงจำกัดที่ไฟล์ขนาดไม่เกิน 300 MB ในรูปแบบ WAV, MP3 หรือ FLAC, และการใช้งานต้องมีการสมัครสมาชิก Azure และทรัพยากร Microsoft Foundry สำหรับ Speech

พารามิเตอร์ทางเลือกควบคุมชุดคุณลักษณะของโมเดล การแยกผู้พูด (speaker diarization) แบ่งการบันทึกตามผู้พูดและคืนส่วนที่มีการระบุผู้พูดพร้อมเมทาดาต้าออฟเซ็ตและระยะเวลา การทำเครื่องหมายเวลาในระดับคำให้เวลาสำหรับทุกคำ, ส่วนตัวเลือก segment ให้เวลาตามส่วน, และตัวเลือก none จะละเว้นข้อมูลเวลา พารามิเตอร์ phrase-list ทำให้การจดจำโน้มไปทางคำที่กำหนดเช่นคำศัพท์เฉพาะโดเมน, คำย่อ, และชื่อเฉพาะ โดยเอกสารระบุว่าคำเหล่านี้ทำหน้าที่เป็นคำแนะนำไม่ใช่ผลลัพธ์ที่บังคับ

พารามิเตอร์สไตล์การถอดข้อความตั้งค่าเริ่มต้นเป็น verbatim ซึ่งบันทึกเสียงตามที่พูดอย่างแม่นยำรวมถึงคำเติมและการเริ่มต้นที่ผิดพลาด เพื่อการปฏิบัติตาม, QA, และงานวิเคราะห์ การตั้งค่า clean จะลบคำเติมและจัดรูปแบบอัตโนมัติของรูปแบบการพูดทั่วไปเพื่อให้ได้คำบรรยาย, โน้ต, และข้อความที่ตีพิมพ์อ่านง่ายขึ้น การเลือกภาษาเป็นทางเลือก; โดยค่าเริ่มต้นโมเดลจะตรวจจับภาษาที่พูดโดยอัตโนมัติ และเอกสารแนะนำให้บังคับใช้ภาษาที่เฉพาะเจาะจงเฉพาะเมื่อการตรวจจับอัตโนมัติไม่สำเร็จ การสลับโค้ดสำหรับคู่ภาษาที่ผสมเช่น Hinglish และ Spanglish จะจัดการโดยอัตโนมัติ และความทนทานต่อเสียงรบกวนสำหรับเสียงที่บันทึกนอกสภาพแวดล้อมที่ควบคุมเป็นคุณสมบัติที่มีอยู่ในโมเดล

เอกสารยังระบุว่า MAI-Transcribe สามารถให้การถอดข้อความเสียงอินพุตผ่าน Voice Live API ด้วยฟิลด์การกำหนดค่าการเซสชัน Microsoft กล่าวว่าโมเดลนี้พร้อมให้ทดลองผ่าน Microsoft Foundry และ MAI Playground, โดยการให้บริการบน OpenRouter ถูกระบุว่าจะเปิดให้ใช้ในเร็ว ๆ นี้

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย