نماذج ومنصات الذكاء الاصطناعي
وصول GPT‑Live‑1 من OpenAI إلى واجهة برمجة التطبيقات بسعر 0.05 دولار للدقيقة

أطلقت OpenAI نموذج GPT‑Live‑1 في واجهة برمجة التطبيقات في 10 سبتمبر 2026، مما جعل نموذج الصوت ذو الازدواجية الكاملة متاحًا للمطورين بسعر 0.05 دولار للدقيقة لطبقة الصوت الأمامية. يوسع هذا الإصدار نظام المحادثة وراء ChatGPT Voice ليشمل التطبيقات الخارجية وتدفقات العمل التجارية.
يمكن لـ GPT‑Live‑1 الاستماع والتحدث في آن واحد، وأعلنت OpenAI أنه يفوض عمليات الاستدلال الأعمق والإجراءات إلى النماذج والأدوات التي يُقترن بها، كما تم توضيحه مع Codex وChatGPT Work. بالنسبة لإصدار الواجهة البرمجية، صرّحت الشركة بأنها ركّزت على القدرات التي تسمح للمطورين بتوجيه وتخصيص تجارب الصوت وفقًا للمستخدمين وسير العمل والأهداف.
نموذج واحد للاستماع والتحدث
تسلسل الوكلاء الصوتيون التقليديون بين تحويل الكلام إلى نص، نموذج الاستدلال، وتحويل النص إلى كلام، وكل عملية تسليم تضيف تأخيرًا وتزيد فرص فقدان التوقيت أو السياق أو الإيقاع الطبيعي للمحادثة. يتعامل GPT‑Live‑1 مع الاستماع والتحدث في نموذج واحد يستدلال على الصوت الوارد والصادر معًا، مستجيبًا للمقاطعات والإشارات في لحظتها بينما يفوض الاستدلال الأعمق إلى الخلفية، بحيث يمكن للمحادثة الاستمرار بينما تُجرى الأعمال في الخلفية.
يختار المطورون النماذج والأدوات وإطار الوكيل وراء المحادثة. تقدم OpenAI مثالًا على ربط GPT‑Live‑1 بنموذج مثل Luna للمهام عالية الحجم مثل جدولة المواعيد أو تحديث الطلبات، ونموذج مثل Astra للقضايا المعقدة التي تتطلب استدلالًا؛ ويمكن أن يكون الخلفية نموذجًا من طرف ثالث. يمكن للمطورين تشكيل نبرة الوكيل وإيقاعه وأسلوب المحادثة عبر موجه النظام.
تُدرج OpenAI مزيدًا من المميزات لإصدار الواجهة البرمجية: إدارة صامتة للسياق ومعالجة الضوضاء الخلفية دون سرد كل خطوة بصوت عالٍ، احتفاظ بالسياق عبر جلسات ممتدة، ودعم الاتصالات الهاتفية للوكلاء ذوي الازدواجية الكاملة في المكالمات من حجوزات المطاعم إلى دعم العملاء. يوفر GPT‑Live‑1 بشكل أصلي نصوص تحويل الكلام إلى نص (ASR) ونص الرد، يدعم توجيه الكلمات المفتاحية وفهم الحروف والأرقام، وعلى الرغم من أنه ليس نموذجًا قائمًا على الأدوار، إلا أنه يدعم اكتشاف الأدوار أصلاً بحيث يمكن للمطورين الاستمرار في البناء حول حدود الأدوار الصريحة. يُظهر مقتطف شفرة نُشر مع الإعلان تطبيقًا يمرر سياق المحادثة إلى Codex ويعيد إجابة Codex إلى GPT‑Live‑1 خلال جلسة.
نتائج التقييم المبلغ عنها
تُفيد OpenAI أن GPT‑Live‑1 يحسن أداء اختبار Full Duplex Bench بمقدار 30 نقطة مئوية مقارنةً بـ GPT‑Realtime‑2.1، مع تحسينات كبيرة في زمن استجابة الأدوار والسلوك التفاعلي، وأنه يحتل المرتبة الأولى في اختبار Tau3، وهو معيار يقيس ذكاء وكلاء الصوت المتقدم في المهام الشاملة، عند ربطه بـ GPT‑6 Astra بجهد استدلال متوسط.
في اختبار Tau3 (الذكاء الصوتي)، الذي يقيّم مهام خدمة العملاء المنطوقة في مجالات الطيران والتجزئة والاتصالات، تُبلغ درجات Pass@1 التي أبلغت عنها OpenAI 86.2٪ لـ GPT‑Live‑1، مقابل 45.7٪ لـ GPT‑Realtime‑2.1 و42.4٪ لـ GPT‑Realtime‑2. أما في اختبار Tau Banking (المعرفة الصوتية)، الذي يُقاس كنسبة إكمال 97 مهمة معرفة مصرفية بنجاح، فالأرقام المبلغ عنها هي 32.0٪ مقابل 12.4٪ و10.3٪.
كما أفادت الشركة بأن متوسط درجة تحليل الديناميكيات الحوارية للذكاء الاصطناعي (Artificial Analysis Conversational Dynamics) وصل إلى 97.3٪ لـ GPT‑Live‑1، مقابل 95.7٪ لـ GPT‑Realtime‑2.1 و95.3٪ لـ GPT‑Realtime‑2، في تقييم يغطي معالجة الوقفات، وتناوب الأدوار في الحوار، والمقاطعات، والقنوات الخلفية. في اختبار Full Duplex Bench الإصدار 1.5 للتفاعلية، الذي يختبر ردود الفعل على الكلام الخلفي، والكلام إلى شخص آخر، والقنوات الخلفية للمستمع، والمقاطعات، كانت الدرجات المبلغ عنها 80.10٪ مقابل 45.4٪ و47.8٪. أما زمن استجابة الأدوار في اختبار Full Duplex Bench الإصدار 1، الذي يقيس سرعة بدء الوكيل رده بعد انتهاء المستخدم من دوره، فكان 0.798 ثانية مقابل 1.41 ثانية و1.63 ثانية. في اختبار Full Duplex Bench الإصدار 3، الذي تم تشغيله بخلفية Terra بجهد استدلال منخفض، أفادت OpenAI بأن نسبة Pass@1 لاستدعاء الأدوات بلغت 87.0٪ مقابل 60.0٪ و58.0٪، وجودة الردود بلغت 90.0٪ مقابل 88.0٪ و81.0٪.
من ChatGPT Voice إلى الواجهة البرمجية
قدمت OpenAI نموذج GPT‑Live في 8 يوليو 2026 كجيل جديد من نماذج الصوت ذات الازدواجية الكاملة التي تشغّل ChatGPT Voice، وأطلقت GPT‑Live‑1 وGPT‑Live‑1 mini لمستخدمي ChatGPT عالميًا في ذلك اليوم مع بيان نيتها لنقل النماذج إلى الواجهة البرمجية. صرّحت OpenAI أن GPT‑Live‑1 سيصبح النموذج الافتراضي الذي يشغّل ChatGPT Voice لمستخدمي Go وPlus وPro، بينما يكون GPT‑Live‑1 mini هو الافتراضي للمستخدمين المجانيين. أضاف تحديث 31 يوليو 2026 علامة مائية SynthID إلى الصوت المدعوم الذي يُولّد باستخدام GPT‑Live عبر ChatGPT Voice وواجهة برمجة تطبيقات OpenAI، إلى جانب إتاحة وصول عبر الواجهة البرمجية إلى أداة التحقق العامة من OpenAI.
تشير الإعلان أيضًا إلى OpenAI Presence، التي تقول OpenAI إنّها تستخدم GPT‑Live‑1 لتشغيل التفاعلات الصوتية الفورية للوكلاء الذين يجيبون على الأسئلة، يحلّون المشكلات، يستخدمون أنظمة الشركة، يتخذون إجراءات مُعتمدة، ويصعدون إلى الأشخاص عند الحاجة. قدمت OpenAI خدمة Presence في 22 يوليو 2026 كمنتج مؤسسي مُنفّذ لتدفقات العمل الصوتية والدردشة، متاح للعملاء المؤهلين عبر برنامج توافر عام محدود يقوده مهندسو OpenAI Forward Deployed ومجموعة مختارة من شركات التكامل العالمية، وليس كمنتج ذاتي الخدمة.
العملاء الأوائل والأصوات الجديدة
صرّح أليكس ليفي، كبير مسؤولي التقنية في Yelp، أن إضافة GPT‑Live‑1 إلى Yelp Host وHatch حسّنت من تناوب الأدوار والدقة مقارنةً بالبنية الصوتية التقليدية للشركة، وأن Yelp تشهد تحسينات ملحوظة في معدلات معالجة المكالمات عندما يجيب Yelp Host على مكالمات مثل الحجوزات وطلبات الطعام. وقال ليفي: “المتصلون يتحدثون أيضًا جملًا أكثر اكتمالًا وطبيعية، مما يدل على أن التجربة على الطرف الآخر من الهاتف تبدو مختلفة حقًا”. يُظهر عرض توضيحي نُشر مع الإعلان كيف يضمن Yelp Host حجزًا بينما يتعامل GPT‑Live‑1 مع الضوضاء الخلفية والمحادثات الجانبية والمقاطعات.
قال أندرو هو، المؤسس المشارك والرئيس التقني في Speak، إنّ التقييمات الأولية وجدت أن GPT‑Live‑1 يقلل المقاطعات أثناء فترات تفكير المتعلمين بنحو 80٪ مقارنةً بالأنظمة القائمة على الأدوار السابقة في دروس Live Tutor في Speak. صرّح جوردن نيل، الرئيس التنفيذي للعمليات في Fin، أن النموذج ينقل دعم الصوت الذكي من إيقاع التوقف والبدء إلى التدفق الطبيعي للمكالمة الهاتفية، مما يسمح للعملاء بالتوقف، والمقاطعة، وتغيير الاتجاه بينما يدمج Fin المحادثة مع نظام الدعم المملوك له لحل المشكلات. وصف والدم يان، المؤسس المشارك والرئيس المنتج في Cognition، استخدام GPT‑Live‑1 جنبًا إلى جنب مع ديفين، مهندس الذكاء الاصطناعي في Cognition، للتباحث حول فكرة، اختبار نهج تحت الضغط، أو تسليم عمل أثناء الابتعاد عن لوحة المفاتيح.
أعلنت OpenAI أنها توسّع من مجموعة صغيرة من الأصوات الفورية إلى مجموعة أوسع تشمل لهجات، ونطق، ولغات متعددة، مما يمنح المطورين مزيدًا من الخيارات في شكل أصوات مساعديهم. يجب على المطورين الذين يرغبون في الحصول على صوت مخصص التواصل مع فريق مبيعات OpenAI لمعرفة مؤهلاتهم وإجراءات الطلب. وأشارت الشركة إلى أنها ستستمر في توسيع خيارات الصوت وتوافر اللغات خلال الأشهر القادمة.












