نماذج ومنصات الذكاء الاصطناعي

xAI تُصدر نموذج Grok Voice Transcribe 2.0 للتعرف على الكلام

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أصدرت xAI نموذج Grok Voice Transcribe 2.0، أحدث نموذج للتعرف على الكلام، في 18 سبتمبر 2026، مع تحديد سعر الدفعات بـ 0.10 دولار لكل ساعة من الصوت، ووصفت النموذج بأنه أكثر دقة بمعدل الضعف مقارنةً بـ Grok Voice Transcribe 1.0.

تم بناء Grok Voice Transcribe 2.0 على نموذج الأساس الصوتي وراء Grok Voice. ووفقًا لـ xAI، فإن Grok Voice يُشغّل بالفعل عشرات الآلاف من مكالمات دعم العملاء يوميًا، ويُحوّل ملايين الساعات من سرد الفيديو إلى نص، ويُدير وكلاء صوتيين في منتجات مادية، بما في ذلك مساعد Grok في مركبات Tesla. صرحت الشركة أن النموذج الجديد تم تدريبه على صوت حي، صاخب ومتعدد اللغات تم تسجيله عبر مجموعة متنوعة من البيئات وتم تحسينه بعد التدريب، ووصفته بأنها واحدة من أكثر نماذج النسخ الدقيق المتاحة للكلام في البيئات الواقعية.

تقييمات الدقة

قالت xAI إن Grok Voice Transcribe 2.0 يحتل المرتبة الأولى من حيث الدقة بين 32 نموذجًا للبث على لوحة الصدارة العامة Artificial Analysis. بخلاف المعايير العامة، تقيس الشركة معدل خطأ الكلمات على أربع مجموعات تقييم داخلية مأخوذة من حركة الإنتاج: صوتيات هاتفية من مكالمات دعم العملاء، محادثات مع Grok، بيانات اعتماد منطوقة مثل رموز الحساب وعناوين البريد الإلكتروني، وأوامر صوتية قصيرة متعددة اللغات. وأفادت الشركة أن النموذج الجديد يحسن الأداء مقارنةً بـ Grok Voice Transcribe 1.0 عبر جميع المجموعات الأربعة ويتفوق على كل نموذج اختبرته على مجموعة الهاتف، التي تتألف من مكالمات دعم عملاء إنجليزية بتردد 8 كيلوهرتز. تقارن المخططات التي نشرتها xAI النموذج مع Gemini 3.5 Transcribe وMAI-Transcribe-2 وElevenLabs Scribe v2 وDeepgram Nova-3 وWhisper Large v3 على تلك المجموعات الداخلية.

وفقًا لـ xAI، فإن النسخ متعدد اللغات هو أكبر تحسين في الدقة مقارنةً بالإصدار 1.0. وأشارت الشركة إلى أن النموذج ينسخ عشرات اللغات، يكتشف اللغة تلقائيًا، ويتتبع تبديلات اللغة أثناء التسجيل في مرور واحد. العبارات القصيرة، مثل الأوامر داخل السيارة، تترك للنموذج سياقًا قليلًا لتحديد اللغة؛ وعلى مجموعة العبارات القصيرة لمساعد الصوت التي تغطي 19 لغة، انخفض معدل خطأ الكلمات من 20.6٪ إلى 6.8٪، حسب ما أفادت الشركة.

الميزات والوصول إلى واجهة برمجة التطبيقات

من خلال واجهة برمجة تطبيقات Speech-to-Text، يتعامل Grok Voice Transcribe 2.0 مع النسخ الدفعي للملفات المسجلة وعناوين URL وكذلك البث في الوقت الفعلي. تشمل مجموعة الميزات الموثقة طوابع زمنية على مستوى الكلمة مع درجات الثقة، وتحديد المتحدثين دون تكلفة إضافية، والنسخ متعدد القنوات حتى ثمانية قنوات، وتوجيه المصطلحات الرئيسية حتى 100 مصطلح مجال لكل طلب، وتنسيق النص الذي يُعيد الأرقام والتواريخ والعملات وأرقام الهواتف وعناوين البريد الإلكتروني بصيغة مكتوبة، وإزالة كلمات الحشو، واكتشاف ذكي لدورات المتحدث لتحديد نهاية دور المتحدث لوكلاء الصوت. وقالت xAI إن تكاملات واجهة برمجة التطبيقات الحالية للـ Speech-to-Text ستحصل على تحسين الدقة دون الحاجة لتغييرات في الشيفرة.

الوثائق الرسمية وثائق تحويل الكلام إلى نص تُدرج 12 صيغة صوتية مدعومة، وحجم ملف أقصى قدره 500 ميغابايت، ومعدلات عينة 8000، 16000، 22050، 24000، 44100، و48000 هرتز. يتيح معامل اللغة تنسيق النص المكتوب عبر 25 لغة، من بينها الإنجليزية والإسبانية والفرنسية والألمانية والهندية واليابانية والكورية.

تستخدم طلبات الدفعات بيانات نموذج متعددة الأجزاء ويجب توفير إما ملف مرفوع أو عنوان URL ليقوم الخادم بتنزيله وتحويله إلى نص؛ تُعيد الاستجابة النص الكامل، واللغة المكتشفة كرمز BCP-47، ومدة الصوت بالثواني، ومقاطع على مستوى الكلمة مع أوقات البدء والانتهاء. بالنسبة للبث، يرسل العملاء الصوت الخام كإطارات ثنائية إلى نقطة نهاية WebSocket على wss://api.x.ai/v1/stt ويتلقون أحداث نصية بصيغة JSON أثناء معالجة الصوت، مع نتائج مؤقتة اختيارية تُصدر تقريبًا كل 500 مللي ثانية.

نشر Loom، التسعير، وإيقاف الدعم

قالت xAI إن Atlassian قيّمت Grok Voice Transcribe 2.0 مقارنةً بحل النسخ الحالي لديها، ووجدته أكثر دقة، وتستخدم الآن النموذج لنسخ كل فيديو على Loom، منتجها لتسجيل الشاشة. إعلان xAI اقتبس من ساشان ساكسينا، نائب الرئيس الأول لمجموعة Teamwork Collection في Atlassian، حول سير العمل الذي يمرر نسخ Loom إلى أداة الترميز Cursor: “مع تشغيل Grok لتقنية تحويل الكلام إلى نص في Loom وCursor التي تحول ذلك إلى كود، نُغلق الحلقة من السياق إلى الكود: سجّل ما تعنيه، وسيتم إنجاز العمل.”

التسعير مماثل لـ Grok Voice Transcribe 1.0: 0.10 دولار لكل ساعة من الصوت للنسخ الدفعي و0.20 دولار لكل ساعة للبث، مع تضمين تحديد المتحدثين، والطوابع الزمنية، والمصطلحات الرئيسية. قالت xAI إن Grok Voice Transcribe 2.0 سيصبح قريبًا النموذج الافتراضي في واجهة برمجة تطبيقات Speech-to-Text وأن الإصدار 1.0 سيُوقف دعمه في الأسابيع القليلة المقبلة؛ يمكن للعملاء الذين يرغبون في البقاء على النموذج السابق خلال الانتقال تثبيت grok-voice-transcribe-1.0 في طلباتهم. تُدرج الوثائق حاليًا grok-voice-transcribe-1.0 كافتراضي عندما يُترك معامل النموذج غير محدد، مع إمكانية اختيار grok-voice-transcribe-2.0 على كل من نقاط النهاية REST وWebSocket.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.