โมเดลและแพลตฟอร์ม AI

xAI เปิดตัวโมเดลการแปลงเสียงเป็นข้อความ Grok Voice Transcribe 2.0

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

xAI เปิดตัว Grok Voice Transcribe 2.0 ซึ่งเป็นโมเดลการแปลงเสียงเป็นข้อความรุ่นล่าสุดของบริษัทเมื่อวันที่ 18 กันยายน 2026 โดยกำหนดราคาการประมวลผลเป็นชุดที่ $0.10 ต่อชั่วโมงของเสียง และอธิบายว่าโมเดลนี้แม่นยำสองเท่ากว่า Grok Voice Transcribe 1.0

Grok Voice Transcribe 2.0 สร้างบนโมเดลพื้นฐานด้านเสียงที่อยู่เบื้องหลัง Grok Voice ตามข้อมูลของ xAI แล้ว Grok Voice รองรับการโทรช่วยเหลือลูกค้าหลายหมื่นครั้งต่อวัน, แปลงข้อความจากวิดีโอหลายล้านชั่วโมง, และทำงานเป็นเอเจนต์เสียงในผลิตภัณฑ์จริง รวมถึงผู้ช่วย Grok ในยานยนต์ของ Tesla บริษัทระบุว่าโมเดลใหม่ได้รับการฝึกด้วยเสียงหลายภาษาแบบสดที่มีเสียงรบกวนและบันทึกจากสภาพแวดล้อมที่หลากหลาย พร้อมการปรับแต่งหลังการฝึก และอธิบายผลลัพธ์ว่าเป็นหนึ่งในโมเดลการถอดข้อความที่แม่นยำที่สุดที่มีให้ใช้งานในสภาพแวดล้อมจริง

การประเมินความแม่นยำ

xAI ระบุว่า Grok Voice Transcribe 2.0 มีอันดับแรกด้านความแม่นยำในบรรดา 32 โมเดลสตรีมมิ่งบนลีดเดอร์บอร์ดสาธารณะ Artificial Analysis นอกจากนี้ บริษัทยังวัดอัตราความผิดพลาดของคำบนชุดการประเมินภายในสี่ชุดที่มาจากการจราจรการผลิต ได้แก่ เสียงโทรศัพท์จากการโทรช่วยเหลือลูกค้า, การสนทนากับ Grok, ข้อมูลประจำตัวที่พูดออกมารวมถึงรหัสบัญชีและที่อยู่อีเมล, และคำสั่งเสียงหลายภาษาสั้น ๆ บริษัทรายงานว่าโมเดลใหม่ให้ผลการปรับปรุงเหนือ Grok Voice Transcribe 1.0 ในทุกชุดและเป็นโมเดลที่ดีที่สุดในชุดโทรศัพท์ซึ่งเป็นการโทรช่วยเหลือลูกค้าเป็นภาษาอังกฤษที่ 8 kHz แผนภูมิที่ xAI เผยแพร่เปรียบเทียบโมเดลกับ Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3, และ Whisper Large v3 บนชุดภายในเหล่านั้น

ตามข้อมูลของ xAI การถอดข้อความหลายภาษานั้นให้การเพิ่มความแม่นยำที่มากที่สุดเมื่อเทียบกับเวอร์ชัน 1.0 บริษัทระบุว่าโมเดลสามารถถอดข้อความได้หลายสิบภาษา, ตรวจจับภาษานั้นโดยอัตโนมัติ, และติดตามการสลับภาษากลางการบันทึกในหนึ่งครั้ง วลีสั้น เช่น คำสั่งในรถ ทำให้โมเดลมีบริบทน้อยสำหรับระบุภาษา; ในชุดวลีสั้นของ xAI ที่ครอบคลุมการพูดของผู้ช่วยเสียงใน 19 ภาษา อัตราความผิดพลาดของคำลดลงจาก 20.6 เปอร์เซ็นต์ เป็น 6.8 เปอร์เซ็นต์ ตามที่บริษัทรายงาน

คุณลักษณะและการเข้าถึง API

ผ่าน Speech-to-Text API, Grok Voice Transcribe 2.0 รองรับการถอดข้อความแบบชุดจากไฟล์ที่บันทึกและ URL รวมถึงการสตรีมแบบเรียลไทม์ ชุดคุณลักษณะที่ระบุไว้รวมถึงการใส่เวลาที่ระดับคำพร้อมคะแนนความมั่นใจ, การแยกผู้พูดโดยไม่มีค่าใช้จ่ายเพิ่มเติม, การถอดข้อความหลายช่องสูงสุดถึงแปดช่อง, การปรับแนวคำสำคัญสูงสุด 100 คำในแต่ละคำขอ, การจัดรูปแบบข้อความที่คืนค่าตัวเลข, วันที่, สกุลเงิน, หมายเลขโทรศัพท์ และที่อยู่อีเมลในรูปแบบเขียน, การลบคำเติม, และการตรวจจับการเปลี่ยนบทสนทิอัจฉริยะที่ระบุจุดสิ้นสุดของการพูดของผู้พูดสำหรับเอเจนต์เสียง xAI ระบุว่าการรวม API Speech-to-Text ที่มีอยู่ได้รับการปรับปรุงความแม่นยำโดยไม่ต้องเปลี่ยนโค้ด

เอกสารการแปลงเสียงเป็นข้อความ ระบุว่ามีรูปแบบเสียงที่รองรับทั้งหมด 12 รูปแบบ, ขนาดไฟล์สูงสุด 500 MB, และอัตราการสุ่มตัวอย่างที่ 8000, 16000, 22050, 24000, 44100, และ 48000 Hz พารามิเตอร์ภาษาเปิดใช้งานการจัดรูปแบบแบบเขียนสำหรับ 25 ภาษา รวมถึงอังกฤษ, สเปน, ฝรั่งเศส, เยอรมัน, ฮินดี, ญี่ปุ่น, และเกาหลี

คำขอแบบชุดใช้ข้อมูลแบบ multipart form และต้องระบุไฟล์ที่อัปโหลดหรือ URL เพื่อให้เซิร์ฟเวอร์ดาวน์โหลดและถอดข้อความ; การตอบกลับจะส่งคืนข้อความเต็ม, ภาษาที่ตรวจพบเป็นรหัส BCP‑47, ระยะเวลาของเสียงเป็นวินาที, และส่วนคำระดับคำพร้อมเวลาเริ่มต้นและสิ้นสุด สำหรับการสตรีม, ลูกค้าจะส่งเสียงดิบเป็นเฟรมไบนารีไปยังปลายทาง WebSocket ที่ wss://api.x.ai/v1/stt และรับเหตุการณ์ถอดข้อความในรูปแบบ JSON ขณะเสียงกำลังประมวลผล, พร้อมผลลัพธ์ชั่วคราวที่ออกประมาณทุก 500 มิลลิวินาที

การใช้งาน Loom, การตั้งราคา, และการเลิกใช้

xAI ระบุว่า Atlassian ได้ประเมิน Grok Voice Transcribe 2.0 เทียบกับโซลูชันการถอดข้อความที่มีอยู่ของตน พบว่ามีความแม่นยำมากขึ้นและตอนนี้ใช้โมเดลนี้เพื่อถอดข้อความทุกวิดีโอบน Loom ซึ่งเป็นผลิตภัณฑ์บันทึกหน้าจอของบริษัท ประกาศของ xAI ได้อ้างอิงคำพูดของ Sanchan Saxena รองประธานอาวุโสของ Teamwork Collection ที่ Atlassian เกี่ยวกับกระบวนการทำงานที่ส่งต่อข้อความจาก Loom ไปยังเครื่องมือเขียนโค้ด Cursor: “ด้วย Grok ที่ขับเคลื่อนการแปลงเสียงเป็นข้อความของ Loom และ Cursor ที่แปลงเป็นโค้ด เรากำลังปิดวงจรจากบริบทสู่โค้ด: บันทึกสิ่งที่คุณหมายถึง แล้วงานก็สำเร็จ”

การตั้งราคาเท่ากับกับ Grok Voice Transcribe 1.0: $0.10 ต่อชั่วโมงของเสียงสำหรับการถอดข้อความแบบชุดและ $0.20 ต่อชั่วโมงสำหรับการสตรีม พร้อมรวมการแยกผู้พูด, เวลาตำแหน่ง, และคำสำคัญ xAI ระบุว่า Grok Voice Transcribe 2.0 จะเร็ว ๆ นี้เป็นโมเดลเริ่มต้นใน Speech-to-Text API และเวอร์ชัน 1.0 จะถูกเลิกใช้ในสัปดาห์ต่อไป ลูกค้าที่ต้องการคงใช้โมเดลเก่าในช่วงการเปลี่ยนแปลงสามารถระบุ grok-voice-transcribe-1.0 ในคำขอได้ ปัจจุบันเอกสารระบุว่า grok-voice-transcribe-1.0 เป็นค่าเริ่มต้นเมื่อไม่ได้ระบุพารามิเตอร์โมเดล, โดยสามารถเลือก grok-voice-transcribe-2.0 ได้ทั้งบน endpoint REST และ WebSocket

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย