โมเดลและแพลตฟอร์ม AI
IBM กล่าวว่า Granite Speech 5.0 สามารถถอดข้อความเสียง 3.5 ชั่วโมงในหนึ่งวินาที

IBM เปิดตัวโมเดลการรู้จำเสียงภาษาอังกฤษขนาดกะทัดรัดสองรุ่นเมื่อวันที่ 25 สิงหาคม 2026 โดยอ้างว่าความเร็วการถอดข้อความที่ไม่มีโมเดลเปิดใดเคยทำได้มาก่อน: มากกว่า 3.5 ชั่วโมงของเสียงที่ประมวลผลในหนึ่งวินาทีเดียว คู่โมเดลนี้คือ Granite Speech 5.0 TurboCTC และรุ่นที่ไม่ใช้เพื่อการค้า ทั้งสองมีพารามิเตอร์เพียง 470 ล้านตัว และบริษัทรายงานอัตราการผ่านรวมเหนือ 12,600 RTFx บน GPU NVIDIA H200 ตัวเดียว หมายความว่าเสียงไหลผ่านโมเดลได้เร็วกว่าเวลาจริงมากกว่าสิบสองพันเท่า
ความเร็วนี้มาพร้อมกับความแม่นยำที่แข่งขันได้ อย่างน้อยตามตัวเลขของ IBM บนชุดทดสอบรูปแบบสั้นภาษาอังกฤษสาธารณะของ OpenASR Leaderboard รุ่นที่ไม่ใช้เพื่อการค้าบันทึกอัตราความผิดพลาดของคำรวม 4.85% และรุ่นที่มีใบอนุญาตเปิด 5.00% ตามประกาศของ IBM ตัวเลขทั้งสองเป็นข้อมูลจากผู้จำหน่าย: IBM ระบุว่าเป็นข้อมูลไม่เป็นทางการ แม้ว่าการสรุปผลจะทำผ่านโครงสร้างงานของ Hugging Face เองและประเมินด้วยเครื่องมือของ leaderboard ดังนั้นบริษัทคาดว่าตัวเลขเหล่านี้จะตรงกับตารางอย่างเป็นทางการเมื่อมีการอัปเดต
โมเดลทั้งสองมีขนาดและสถาปัตยกรรมเหมือนกัน แต่แตกต่างกันที่ข้อมูลการฝึกและใบอนุญาต โมเดล Apache 2.0 ได้รับการฝึกด้วยเสียงภาษาอังกฤษประมาณ 60,000 ชั่วโมงและได้รับการอนุมัติให้ใช้เพื่อการค้า ส่วนรุ่นที่ไม่ใช้เพื่อการค้าเพิ่มข้อมูลจาก GigaSpeech และ SPGI Speech อีกประมาณ 15,000 ชั่วโมง ทำให้คอร์ปัสรวมใกล้ 75,000 ชั่วโมงภายใต้ใบอนุญาต CC-BY-NC-SA-4.0 IBM กล่าวว่าข้อมูลเพิ่มเติมนี้ให้ความได้เปรียบด้านความแม่นยำเล็กน้อยในชุดทดสอบส่วนใหญ่ โดยมีข้อได้เปรียบที่ชัดเจนมากขึ้นบน SPGI Speech เองและมีข้อเสียที่ชัดเจนบนการทดสอบ Earnings22 แบบแบ่งส่วนใหม่ของ leaderboard
ตัวเข้ารหัสโดยไม่มีโมเดลภาษา
การอ้างอิงความเร็วนี้อาศัยสิ่งที่ IBM ไม่ได้รวมไว้ รุ่น Granite Speech ก่อนหน้า (รุ่น 3.3 และ 4.x ที่อธิบายในเอกสาร Granite Speech ของ IBM) ได้ต่อเข้าตัวเข้ารหัสเสียง Conformer เข้ากับโมเดลภาษา Granite ผ่านโปรเจกเตอร์และ LoRA adapters เพื่อสร้างข้อความแบบอัตโนมัติเช่นเดียวกับโมเดลแชท รุ่น 5.0 จึงตัดโมเดลภาษาออกทั้งหมด สิ่งที่เหลือคือตัวเข้ารหัส Conformer 16 ชั้นที่ฝึกด้วยการจำแนกชั่วคราวแบบเชื่อมต่อ (CTC) ซึ่งเป็นโครงร่างการถอดรหัสที่แมปเฟรมเสียงโดยตรงไปยังโทเค็นผลลัพธ์ในหนึ่งขั้นตอนที่ไม่อัตโนมัติด้วยการถอดรหัสแบบกรีดดี้
การเปลี่ยนแปลงอีกสองประการทำหน้าที่ส่วนใหญ่ เมื่อเข้ารหัส Granite รุ่นก่อนส่งออก 50 ตัวอักษรต่อวินาที รุ่นใหม่ส่งออก 12.5 โทเค็นต่อวินาที ซึ่งได้มาจากการลดความถี่เชิงเวลา 2 เท่าในสามขั้นตอนจากส่วนหน้าที่ทำงานที่ 100 เฟรมต่อวินาทีของ log-Mel นอกจากนี้พจนานุกรมผลลัพธ์ก็เปลี่ยนจากตัวอักษรเป็นหน่วยย่อย 16,384 ตัวที่ฝึกด้วย SentencePiece ในรุ่นที่ไม่ใช้เพื่อการค้าและ BPE ในรุ่น Apache การใช้โทเค็นที่น้อยกว่าแต่ยาวกว่าในอัตราเฟรมที่เหลือเพียงหนึ่งในสี่เป็นสิ่งที่ทำให้อัตราการผ่านเกิน 20 เท่าของโมเดล Granite Speech ก่อนหน้า ตามที่ IBM รายงาน
การแลกเปลี่ยนนี้คือการลดความกว้างของความสามารถเพื่อเน้นการถอดข้อความโดยเฉพาะ เมื่อไม่มีโมเดลภาษา โมเดลเหล่านี้จะสูญเสียความสามารถในการแปลเสียงและการให้ความสำคัญกับคีย์เวิร์ดที่รุ่นก่อนรองรับ สิ่งที่ได้เพิ่มขึ้นคือขนาดที่เหมาะกับแล็ปท็อปและอุปกรณ์ขอบเครือข่าย IBM จัดตำแหน่งคู่โมเดลนี้สำหรับการแปลงเสียงเป็นข้อความในระดับองค์กร ที่ความหน่วงและอัตราการผ่านมีความสำคัญมากกว่าการที่โมเดลสามารถให้เหตุผลเกี่ยวกับสิ่งที่ได้ยิน
สิ่งที่การประเมินทำได้และไม่สามารถแสดงได้
สัญญาณอิสระที่แข็งแกร่งที่สุดจนถึงตอนนี้มาจากเสียงระยะไกล บน FFASR Leaderboard ซึ่งวัดการรับรู้เสียงที่มีเสียงรบกวนและเสียงสะท้อน IBM รายงานผลอย่างเป็นทางการ ณ วันที่ 25 สิงหาคม 2026 โดยให้รุ่นที่ไม่ใช้เพื่อการค้าได้อันดับที่ห้าด้านความแม่นยำและรุ่น Apache ได้อันดับที่เก้า — ทั้งสองรุ่นยังเป็นสองรายการที่เร็วที่สุดบนบอร์ด โดยวัดอัตราการผ่านบน NVIDIA L4 ตัวเดียว FFASR ประเมินโมเดลบนเสียงที่มีเสียงรบกวน, เสียงสะท้อน, และแหล่งเสียงเคลื่อนที่หลายระดับ SNR ซึ่งเป็นสภาวะที่การรับรู้ระยะไกลลดลงตามคำอธิบายของ leaderboard
แม้ตัวเลข 12,600 RTFx ที่โดดเด่นนี้ต้องอธิบายบริบทด้วย มันเป็นค่าการสรุปผลแบบแบตช์บนหนึ่งใน GPU ศูนย์ข้อมูลที่เร็วที่สุดที่ขายอยู่ ไม่ใช่สิ่งที่แล็ปท็อปที่รันสตรีมมิ่งเดโม WebGPU จะเห็น ตัวเลข WER รวมครอบคลุมเฉพาะภาษาอังกฤษรูปแบบสั้นเท่านั้น และการจัดอันดับอย่างเป็นทางการของ OpenASR Leaderboard ซึ่งรวมชุดทดสอบส่วนตัว ยังไม่ได้รับโมเดลใหม่ในช่วงที่เผยแพร่ IBM เองให้กรอบการอธิบายที่ตรงไปตรงมาที่สุด: นี่เป็นผลลัพธ์ที่ผู้จำหน่ายรายงานอย่างแข็งแรงและกำลังรอการยืนยันจาก leaderboard
สูตรการฝึกยังควรได้รับการกล่าวถึงในแง่ของความเปิดเผยของข้อมูล ทุกชุดข้อมูลในคอร์ปัสของทั้งสองโมเดลสามารถเข้าถึงได้สาธารณะ และการเพิ่มข้อมูลสังเคราะห์ 2,740 ชั่วโมงประกอบด้วยเสียงหลายผู้พูด 2,500 ชั่วโมงที่ต่อเนื่องจากส่วนของผู้พูดเดี่ยว บวกกับ 240 ชั่วโมงของคำพูดที่สร้างโดยโมเดล gpt-oss ของ OpenAI ที่เปิดน้ำหนักและสังเคราะห์ด้วย StyleTTS2 เพื่อมุ่งเป้าไปที่ตัวเลข สกุลเงิน และที่อยู่ที่ทำให้เครื่องรับรู้สับสน การฝึกใช้เวลา 10 วันบน 8 GPU NVIDIA H100 ในคลัสเตอร์ Blue Vela ของ IBM ตามข้อมูลในโมเดลการ์ด
โมเดลทั้งสองตอนนี้พร้อมใช้งานบน Hugging Face พร้อมการสนับสนุนโดยเนทีฟในไลบรารี transformers — ติดตั้งจากซอร์สจนถึงการปล่อยรุ่นถัดไป — ภายใต้คอลเลกชัน Granite Speech และมีเดโมสตรีมมิ่งบนเบราว์เซอร์ที่ทำงานใน Chrome และ Edge สำหรับการเปรียบเทียบว่ารุ่นการถอดข้อความเฉพาะเจาะจงอยู่ในระดับใดเมื่อเทียบกับบริการเชิงพาณิชย์ ดูสรุปของเราเกี่ยวกับ AI transcription software












