โมเดลและแพลตฟอร์ม AI

IBM กล่าวว่า Granite Speech 5.0 สามารถถอดข้อความเสียง 3.5 ชั่วโมงในหนึ่งวินาที

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

IBM เปิดตัวโมเดลการรู้จำเสียงภาษาอังกฤษขนาดกะทัดรัดสองรุ่นเมื่อวันที่ 25 สิงหาคม 2026 โดยอ้างว่าความเร็วการถอดข้อความที่ไม่มีโมเดลเปิดใดเคยทำได้มาก่อน: มากกว่า 3.5 ชั่วโมงของเสียงที่ประมวลผลในหนึ่งวินาทีเดียว คู่โมเดลนี้คือ Granite Speech 5.0 TurboCTC และรุ่นที่ไม่ใช้เพื่อการค้า ทั้งสองมีพารามิเตอร์เพียง 470 ล้านตัว และบริษัทรายงานอัตราการผ่านรวมเหนือ 12,600 RTFx บน GPU NVIDIA H200 ตัวเดียว หมายความว่าเสียงไหลผ่านโมเดลได้เร็วกว่าเวลาจริงมากกว่าสิบสองพันเท่า

ความเร็วนี้มาพร้อมกับความแม่นยำที่แข่งขันได้ อย่างน้อยตามตัวเลขของ IBM บนชุดทดสอบรูปแบบสั้นภาษาอังกฤษสาธารณะของ OpenASR Leaderboard รุ่นที่ไม่ใช้เพื่อการค้าบันทึกอัตราความผิดพลาดของคำรวม 4.85% และรุ่นที่มีใบอนุญาตเปิด 5.00% ตามประกาศของ IBM ตัวเลขทั้งสองเป็นข้อมูลจากผู้จำหน่าย: IBM ระบุว่าเป็นข้อมูลไม่เป็นทางการ แม้ว่าการสรุปผลจะทำผ่านโครงสร้างงานของ Hugging Face เองและประเมินด้วยเครื่องมือของ leaderboard ดังนั้นบริษัทคาดว่าตัวเลขเหล่านี้จะตรงกับตารางอย่างเป็นทางการเมื่อมีการอัปเดต

โมเดลทั้งสองมีขนาดและสถาปัตยกรรมเหมือนกัน แต่แตกต่างกันที่ข้อมูลการฝึกและใบอนุญาต โมเดล Apache 2.0 ได้รับการฝึกด้วยเสียงภาษาอังกฤษประมาณ 60,000 ชั่วโมงและได้รับการอนุมัติให้ใช้เพื่อการค้า ส่วนรุ่นที่ไม่ใช้เพื่อการค้าเพิ่มข้อมูลจาก GigaSpeech และ SPGI Speech อีกประมาณ 15,000 ชั่วโมง ทำให้คอร์ปัสรวมใกล้ 75,000 ชั่วโมงภายใต้ใบอนุญาต CC-BY-NC-SA-4.0 IBM กล่าวว่าข้อมูลเพิ่มเติมนี้ให้ความได้เปรียบด้านความแม่นยำเล็กน้อยในชุดทดสอบส่วนใหญ่ โดยมีข้อได้เปรียบที่ชัดเจนมากขึ้นบน SPGI Speech เองและมีข้อเสียที่ชัดเจนบนการทดสอบ Earnings22 แบบแบ่งส่วนใหม่ของ leaderboard

ตัวเข้ารหัสโดยไม่มีโมเดลภาษา

การอ้างอิงความเร็วนี้อาศัยสิ่งที่ IBM ไม่ได้รวมไว้ รุ่น Granite Speech ก่อนหน้า (รุ่น 3.3 และ 4.x ที่อธิบายในเอกสาร Granite Speech ของ IBM) ได้ต่อเข้าตัวเข้ารหัสเสียง Conformer เข้ากับโมเดลภาษา Granite ผ่านโปรเจกเตอร์และ LoRA adapters เพื่อสร้างข้อความแบบอัตโนมัติเช่นเดียวกับโมเดลแชท รุ่น 5.0 จึงตัดโมเดลภาษาออกทั้งหมด สิ่งที่เหลือคือตัวเข้ารหัส Conformer 16 ชั้นที่ฝึกด้วยการจำแนกชั่วคราวแบบเชื่อมต่อ (CTC) ซึ่งเป็นโครงร่างการถอดรหัสที่แมปเฟรมเสียงโดยตรงไปยังโทเค็นผลลัพธ์ในหนึ่งขั้นตอนที่ไม่อัตโนมัติด้วยการถอดรหัสแบบกรีดดี้

การเปลี่ยนแปลงอีกสองประการทำหน้าที่ส่วนใหญ่ เมื่อเข้ารหัส Granite รุ่นก่อนส่งออก 50 ตัวอักษรต่อวินาที รุ่นใหม่ส่งออก 12.5 โทเค็นต่อวินาที ซึ่งได้มาจากการลดความถี่เชิงเวลา 2 เท่าในสามขั้นตอนจากส่วนหน้าที่ทำงานที่ 100 เฟรมต่อวินาทีของ log-Mel นอกจากนี้พจนานุกรมผลลัพธ์ก็เปลี่ยนจากตัวอักษรเป็นหน่วยย่อย 16,384 ตัวที่ฝึกด้วย SentencePiece ในรุ่นที่ไม่ใช้เพื่อการค้าและ BPE ในรุ่น Apache การใช้โทเค็นที่น้อยกว่าแต่ยาวกว่าในอัตราเฟรมที่เหลือเพียงหนึ่งในสี่เป็นสิ่งที่ทำให้อัตราการผ่านเกิน 20 เท่าของโมเดล Granite Speech ก่อนหน้า ตามที่ IBM รายงาน

การแลกเปลี่ยนนี้คือการลดความกว้างของความสามารถเพื่อเน้นการถอดข้อความโดยเฉพาะ เมื่อไม่มีโมเดลภาษา โมเดลเหล่านี้จะสูญเสียความสามารถในการแปลเสียงและการให้ความสำคัญกับคีย์เวิร์ดที่รุ่นก่อนรองรับ สิ่งที่ได้เพิ่มขึ้นคือขนาดที่เหมาะกับแล็ปท็อปและอุปกรณ์ขอบเครือข่าย IBM จัดตำแหน่งคู่โมเดลนี้สำหรับการแปลงเสียงเป็นข้อความในระดับองค์กร ที่ความหน่วงและอัตราการผ่านมีความสำคัญมากกว่าการที่โมเดลสามารถให้เหตุผลเกี่ยวกับสิ่งที่ได้ยิน

สิ่งที่การประเมินทำได้และไม่สามารถแสดงได้

สัญญาณอิสระที่แข็งแกร่งที่สุดจนถึงตอนนี้มาจากเสียงระยะไกล บน FFASR Leaderboard ซึ่งวัดการรับรู้เสียงที่มีเสียงรบกวนและเสียงสะท้อน IBM รายงานผลอย่างเป็นทางการ ณ วันที่ 25 สิงหาคม 2026 โดยให้รุ่นที่ไม่ใช้เพื่อการค้าได้อันดับที่ห้าด้านความแม่นยำและรุ่น Apache ได้อันดับที่เก้า — ทั้งสองรุ่นยังเป็นสองรายการที่เร็วที่สุดบนบอร์ด โดยวัดอัตราการผ่านบน NVIDIA L4 ตัวเดียว FFASR ประเมินโมเดลบนเสียงที่มีเสียงรบกวน, เสียงสะท้อน, และแหล่งเสียงเคลื่อนที่หลายระดับ SNR ซึ่งเป็นสภาวะที่การรับรู้ระยะไกลลดลงตามคำอธิบายของ leaderboard

แม้ตัวเลข 12,600 RTFx ที่โดดเด่นนี้ต้องอธิบายบริบทด้วย มันเป็นค่าการสรุปผลแบบแบตช์บนหนึ่งใน GPU ศูนย์ข้อมูลที่เร็วที่สุดที่ขายอยู่ ไม่ใช่สิ่งที่แล็ปท็อปที่รันสตรีมมิ่งเดโม WebGPU จะเห็น ตัวเลข WER รวมครอบคลุมเฉพาะภาษาอังกฤษรูปแบบสั้นเท่านั้น และการจัดอันดับอย่างเป็นทางการของ OpenASR Leaderboard ซึ่งรวมชุดทดสอบส่วนตัว ยังไม่ได้รับโมเดลใหม่ในช่วงที่เผยแพร่ IBM เองให้กรอบการอธิบายที่ตรงไปตรงมาที่สุด: นี่เป็นผลลัพธ์ที่ผู้จำหน่ายรายงานอย่างแข็งแรงและกำลังรอการยืนยันจาก leaderboard

สูตรการฝึกยังควรได้รับการกล่าวถึงในแง่ของความเปิดเผยของข้อมูล ทุกชุดข้อมูลในคอร์ปัสของทั้งสองโมเดลสามารถเข้าถึงได้สาธารณะ และการเพิ่มข้อมูลสังเคราะห์ 2,740 ชั่วโมงประกอบด้วยเสียงหลายผู้พูด 2,500 ชั่วโมงที่ต่อเนื่องจากส่วนของผู้พูดเดี่ยว บวกกับ 240 ชั่วโมงของคำพูดที่สร้างโดยโมเดล gpt-oss ของ OpenAI ที่เปิดน้ำหนักและสังเคราะห์ด้วย StyleTTS2 เพื่อมุ่งเป้าไปที่ตัวเลข สกุลเงิน และที่อยู่ที่ทำให้เครื่องรับรู้สับสน การฝึกใช้เวลา 10 วันบน 8 GPU NVIDIA H100 ในคลัสเตอร์ Blue Vela ของ IBM ตามข้อมูลในโมเดลการ์ด

โมเดลทั้งสองตอนนี้พร้อมใช้งานบน Hugging Face พร้อมการสนับสนุนโดยเนทีฟในไลบรารี transformers — ติดตั้งจากซอร์สจนถึงการปล่อยรุ่นถัดไป — ภายใต้คอลเลกชัน Granite Speech และมีเดโมสตรีมมิ่งบนเบราว์เซอร์ที่ทำงานใน Chrome และ Edge สำหรับการเปรียบเทียบว่ารุ่นการถอดข้อความเฉพาะเจาะจงอยู่ในระดับใดเมื่อเทียบกับบริการเชิงพาณิชย์ ดูสรุปของเราเกี่ยวกับ AI transcription software

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย