โมเดลและแพลตฟอร์ม AI

Microsoft เปิดตัว MAI-Transcribe-2-Streaming และสองโมเดล MAI-Voice

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Microsoft AI เมื่อวันที่ 1 ตุลาคม 2026 เปิดตัว MAI-Transcribe-2-Streaming ซึ่งเป็นโมเดลการถอดข้อความแบบสตรีมมิ่งรุ่นแรกของบริษัท พร้อมด้วยโมเดลแปลงข้อความเป็นเสียงสองรุ่นใหม่ คือ MAI-Voice-2.1 และ MAI-Voice-2.1-Flash ทั้งสามรุ่นพร้อมให้ใช้ผ่าน Microsoft Foundry.

MAI-Transcribe-2-Streaming และเกณฑ์วัด Artificial Analysis

Microsoft อธิบายว่า MAI-Transcribe-2-Streaming ให้บริการการถอดข้อความแบบเรียลไทม์และความหน่วงต่ำใน 60 ภาษา พร้อมการตรวจจับภาษาอัตโนมัติและต่อเนื่อง บริษัทระบุว่าโมเดลนี้ได้อันดับที่ 1 ด้านความแม่นยำสำหรับการถอดข้อความขั้นสุดท้ายและแบบบางส่วนบน Artificial Analysis และอยู่บนแนวหน้า Pareto ของการประเมินความแม่นยำเทียบกับความหน่วงของเกณฑ์วัด ซึ่งหมายความว่าการเพิ่มความแม่นยำไม่จำเป็นต้องแลกกับความหน่วงที่สูง แผนภูมิลีดเดอร์บอร์ดในโพสต์ที่อ้างอิงลีดเดอร์บอร์ดสตรีมมิ่งของ Artificial Analysis วันที่ 28 กันยายน 2026 แสดงว่าโมเดลนี้มีอัตราข้อผิดพลาดคำขั้นสุดท้ายที่ 2.5 เปอร์เซ็นต์, อัตราข้อผิดพลาดของส่วนแรกที่ 2.8 เปอร์เซ็นต์, และใช้เวลา 0.13 วินาทีในการถอดข้อความขั้นสุดท้าย

แทนที่จะรอให้ผู้พูดพูดจบก่อนจึงคืนข้อความ โมเดลนี้จะสร้างสมมติฐานแรกซึ่งเรียกว่า partials ภายในเวลาประมาณ 100 มิลลิวินาทีหลังจากรับเสียง แล้วจึงปรับปรุงเมื่อได้รับบริบทเพิ่มเติมก่อนที่จะสรุปเป็นการถอดข้อความที่เสถียร Microsoft ระบุว่าการทำเช่นนี้ทำให้แอปพลิเคชันที่รองรับเสียงสามารถตอบสนองต่อคำพูดก่อนที่ผู้พูดจะพูดจบ: ตัวแทนเสียงสามารถเริ่มให้เหตุผลหรือเรียกใช้เครื่องมือระหว่างประโยค และการถอดข้อความแบบสดสามารถปรากฏขณะผู้คนกำลังพูด สำหรับการพิมพ์บันทึกและการใส่คำบรรยายแบบเรียลไทม์ บริษัทกล่าวว่าการประเมินภายในของตนแสดงว่าคำต่าง ๆ ปรากฏในการถอดข้อความเร็วสองเท่าเมื่อเทียบกับคู่แข่งที่ใกล้เคียงที่สุด

Artificial Analysis ระบุว่า ดัชนี AA-WER Streaming ของมันวัดความแม่นยำของการถอดข้อความสำหรับโมเดลที่สตรีมเสียงแบบเรียลไทม์เป็นชิ้น ๆ ตลอดประมาณแปดชั่วโมงจากสามชุดข้อมูล: AA-AgentTalk 50 เปอร์เซ็นต์, VoxPopuli 25 เปอร์เซ็นต์, และ Earnings22 25 เปอร์เซ็นต์ ชุดข้อมูลเหล่านี้ครอบคลุมการพูดในโลกจริงที่มีสำเนียงหลากหลาย, ภาษาเฉพาะโดเมน, และสภาพเสียงที่ท้าทาย, และการวัด Time to Final และ Time to First Partial ของเกณฑ์วัดเริ่มต้นที่จุดสิ้นสุดของเสียงที่ตรวจจับโดยตัวตรวจจับกิจกรรมเสียง SileroVAD

MAI-Transcribe-2-Streaming มีให้บริการในราคาแนะนำ $0.54 ต่อชั่วโมงของเสียงจนถึงสิ้นปี โมเดลนี้ขยายสายผลิตภัณฑ์เสียง MAI ของ Microsoft ซึ่งรวมถึง MAI-Transcribe-2 รุ่นก่อนหน้าที่ไม่ใช่สตรีมมิ่ง ซึ่งบริษัทอ้างว่าเป็นโมเดลการรู้จำเสียงที่เร็วที่สุด, แม่นยำที่สุดและราคาถูกที่สุดในโลก

MAI-Voice-2.1 and MAI-Voice-2.1-Flash

MAI-Voice-2.1 รองรับ 23 ภาษาและ 26 โลคัล และ Microsoft ระบุว่าเสียงเดียวสามารถใช้ทั้งหมดนี้ด้วยสำเนียงท้องถิ่น โดยคงอัตลักษณ์ของผู้พูดเดียวกันเมื่อสลับภาษา แอปสอนพิเศษในตัวอย่างของบริษัทสามารถสลับภาษาในระหว่างบทเรียนโดยไม่ต้องเปลี่ยนครู, และผู้ช่วยหลายภาษา สามารถตอบในภาษาที่ผู้ใช้พูดถึงได้โดยยังคงฟังเหมือนเสียงเดียวกัน โมเดลนี้มีราคา $22 ต่อ 1 ล้านอักขระ

MAI-Voice-2.1-Flash รองรับภาษาและผู้พูดข้ามภาษาตามเดียวกัน แต่ถูกออกแบบมาสำหรับงานที่มีปริมาณสูงและต้องการความหน่วงต่ำ สามารถสร้างเสียงได้สูงสุด 45 วินาทีด้วยความหน่วงเวลาต้นถึงปลาย 150 มิลลิวินาที และ Microsoft ระบุว่ามันให้การสรุปผลโมเดลเร็วขึ้น 55 เปอร์เซ็นต์และมีต้นทุนถูกกว่าประมาณ 60 เปอร์เซ็นต์เมื่อเทียบกับโมเดลที่คล้ายกัน โมเดลนี้มีราคา $15 ต่อ 1 ล้านอักขระ

โมเดลเสียงทั้งสองรองรับการโคลนเสียงในทุกภาษาที่สนับสนุนโดยใช้เสียงอ้างอิงเพียงไม่กี่วินาที พร้อมกับระบบการป้องกันความยินยอมในตัวที่ Microsoft ระบุว่า ป้องกันการใช้งานในทางที่ผิด ในการทดสอบทัวริงกับผู้ฟัง 4,000 คนที่รวมโมเดลเสียงใหม่สองรุ่นนี้, 50.3 เปอร์เซ็นต์ของผู้ฟังให้คะแนน MAI-Voice ว่าเทียบหรือเหมือนมนุษย์มากกว่าการบันทึกเสียงของมนุษย์, Microsoft กล่าว

Microsoft นำเสนอการจับคู่ MAI-Transcribe-2-Streaming กับ MAI-Voice-2.1-Flash ว่าเป็นการซื้อคืนเวลาในทั้งสองด้านของลูปเอเจนต์เสียง ซึ่งเป็นกระบวนการของการฟัง, เข้าใจ, ตัดสินใจ, และพูดภายในช่วงเวลาที่มนุษย์ยังคงรับรู้การโต้ตอบเป็นการสนทนา กรณีการใช้งานที่ระบุสำหรับนักพัฒนารวมถึงเอเจนต์บริการลูกค้าที่ถอดข้อความคำขอขณะพูดและตอบด้วยเสียงธรรมชาติ, ผู้ช่วยหลายภาษาที่ตรวจจับภาษาที่พูดและตอบในภาษาที่รองรับ 23 ภาษา ของ MAI-Voice, และแอปพลิเคชันการเรียนรู้และสื่อแบบโต้ตอบที่ใช้ผู้พูดแยกต่างหากสำหรับการสอน, การเล่นบทบาท, การจำลอง, การบรรยาย, และเนื้อหาการสนทนา

การวางจำหน่ายและสาธิต Chatter

MAI-Voice-2.1 และ MAI-Voice-2.1-Flash มีให้บริการผ่าน OpenRouter ทั้งสามโมเดลพร้อมให้ใช้ผ่าน Microsoft Foundry, MAI Playground, Vercel, และ Azure Voice Live โดย LiveKit จะเปิดให้ใช้ในเร็ว ๆ นี้

เพื่อแสดงให้เห็นว่าโมเดลทำงานร่วมกันในเอเจนต์แบบสด, Microsoft สร้าง Chatter ซึ่งเป็นสาธิตใหม่ใน MAI Playground ที่ให้ผู้ใช้พูดคุยกับผู้ช่วยเสียงที่ขับเคลื่อนด้วยโมเดลการถอดข้อความและโมเดลเสียง

Jonas Reeve เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI, มุ่งเน้นที่ AI เชิงสังเคราะห์, ปัญญาประดิษฐ์ทั่วไป (AGI), และพื้นฐานเชิงทฤษฎีของปัญญาเครื่องจักร งานของเขาศึกษาว่าการเรียนรู้, การให้เหตุผล, ความจำ, และการสรุปเชิงนามธรรมเกิดขึ้นอย่างไรในระบบชีวภาพและระบบเทียม, เชื่อมโยงสถาปัตยกรรม AI สมัยใหม่กับคำถามที่ยาวนานในวิทยาศาสตร์การรับรู้และปรัชญาจิตใจ.

ด้วยแนวทางเชิงแนวคิดและการสะท้อน, Jonas ตรวจสอบกรอบแนวคิดต่าง ๆ เช่น โมเดลการให้เหตุผล, ระบบตัวแทน, การรับรู้ที่เกิดขึ้น, และทฤษฎีการปรับแนว, โดยมุ่งหมายชี้แจงว่าความก้าวหน้าไปสู่ AGI มีความหมายอย่างไร—และไม่หมายความว่าอย่างไร. แทนที่จะไล่ตามไทม์ไลน์หรือการโฆษณาเกินจริง, เขาให้ความสำคัญกับหลักการพื้นฐาน, ความเข้มงวดเชิงแนวคิด, และขีดจำกัดของโมเดลปัจจุบัน.

บทความที่เขียนโดย Jonas Reeve ถูกสร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อรับประกันความแม่นยำ, ความชัดเจน, และการอภิปรายอย่างรับผิดชอบเกี่ยวกับแนวคิด AI ขั้นสูง.