एआई मॉडल और प्लेटफ़ॉर्म
OpenAI का GPT‑Live‑1 API में $0.05 प्रति मिनट पर उपलब्ध हुआ

OpenAI API में GPT‑Live‑1 लॉन्च किया 10 सितंबर, 2026 को, अपने फुल‑डुप्लेक्स वॉइस मॉडल को डेवलपर्स के लिए $0.05 प्रति मिनट की कीमत पर फ्रंट‑एंड वॉइस लेयर के लिए उपलब्ध कराया। यह रिलीज़ ChatGPT Voice के पीछे की वार्तालाप प्रणाली को तृतीय‑पक्ष ऐप्स और व्यवसायिक वर्कफ़्लो में विस्तारित करती है।
GPT‑Live‑1 एक साथ सुन और बोल सकता है, और OpenAI ने कहा कि यह गहरी तर्क और क्रियाओं को उन मॉडलों और टूल्स को सौंपता है जिनके साथ यह जुड़ा है, जैसा कि Codex और ChatGPT Work के साथ दर्शाया गया है। API रिलीज़ के लिए, कंपनी ने उन क्षमताओं पर ध्यान केंद्रित किया है जो डेवलपर्स को उनके उपयोगकर्ताओं, वर्कफ़्लो और लक्ष्यों के आसपास आवाज़ अनुभवों को निर्देशित और अनुकूलित करने की अनुमति देती हैं।
सुनने और बोलने के लिए एकल मॉडल
परम्परागत वॉइस एजेंट्स स्पीच‑टू‑टेक्स्ट, एक तर्क मॉडल, और टेक्स्ट‑टू‑स्पीच को क्रमशः जोड़ते हैं, और प्रत्येक हैंडऑफ़ में विलंबता बढ़ती है और बातचीत की समयसारिणी, संदर्भ या प्राकृतिक लय खोने के अवसर बढ़ते हैं। GPT‑Live‑1 एक ही मॉडल में सुनने और बोलने को संभालता है जो आने वाले और जाने वाले ऑडियो को साथ में तर्क करता है, व्यवधान और स्वीकृति को वास्तविक समय में संभालता है जबकि गहरी तर्क को बैक‑एंड को सौंपता है, ताकि बैकग्राउंड में काम चलते हुए बातचीत जारी रह सके।
डेवलपर्स बातचीत के पीछे के मॉडल, टूल और एजेंट हार्नेस चुनते हैं। OpenAI ने उदाहरण दिया है कि GPT‑Live‑1 को Luna जैसे मॉडल के साथ उच्च‑वॉल्यूम कार्यों जैसे शेड्यूलिंग या ऑर्डर अपडेट के लिए जोड़ा जा सकता है, और Astra जैसे मॉडल को जटिल ग्राहक समस्याओं के लिए जो तर्क की आवश्यकता रखते हैं; बैकएंड तृतीय‑पक्ष मॉडल भी हो सकता है। डेवलपर्स सिस्टम प्रॉम्प्ट के माध्यम से एजेंट की टोन, गति और वार्तालाप शैली को आकार दे सकते हैं।
OpenAI API रिलीज़ के लिए अतिरिक्त ताकतें सूचीबद्ध करता है: मौन संदर्भ प्रबंधन और पृष्ठभूमि शोर को संभालना बिना हर कदम को ज़ोर से वर्णित किए, विस्तारित सत्रों में संदर्भ बनाए रखना, और टेलीफ़ोनी समर्थन जो रेस्तरां आरक्षण से लेकर ग्राहक समर्थन तक की कॉल्स में फुल‑डुप्लेक्स फोन एजेंट्स को सक्षम करता है। GPT‑Live‑1 स्वाभाविक रूप से ASR ट्रांसक्रिप्ट और प्रतिक्रिया टेक्स्ट प्रदान करता है, कीवर्ड बायसिंग और अल्फ़ान्यूमेरिक समझ का समर्थन करता है, और यद्यपि यह टर्न‑बेस्ड मॉडल नहीं है, फिर भी टर्न डिटेक्शन को स्वाभाविक रूप से सपोर्ट करता है ताकि डेवलपर्स स्पष्ट टर्न सीमाओं के आसपास निर्माण जारी रख सकें। घोषणा के साथ प्रकाशित एक कोड अंश दिखाता है कि एक एप्लिकेशन बातचीत का संदर्भ Codex को पास कर रहा है और सत्र के दौरान Codex का उत्तर GPT‑Live‑1 को वापस दे रहा है।
रिपोर्टेड मूल्यांकन परिणाम
OpenAI ने रिपोर्ट किया कि GPT‑Live‑1 Full Duplex Bench प्रदर्शन को GPT‑Realtime‑2.1 की तुलना में 30 प्रतिशत अंक बेहतर बनाता है, टर्न‑टेकिन्ग लैटेंसी और इंटरैक्टिव व्यवहार में बड़े सुधार के साथ, और जब इसे GPT‑6 Astra के साथ मध्यम तर्क प्रयास पर जोड़ा जाता है, तो यह Tau3 बेंचमार्क पर प्रथम स्थान पर आता है, जो एंड‑टू‑एंड कार्यों पर फ्रंटियर वॉइस‑एजेंट इंटेलिजेंस को मापता है।
Tau3 (Voice) Intelligence पर, जो एयरलाइन, रिटेल और टेलीकॉम डोमेनों में बोले गए ग्राहक‑सेवा कार्यों का मूल्यांकन करता है, OpenAI ने रिपोर्ट किए गए Pass@1 टास्क‑सक्सेस स्कोर 86.2% GPT‑Live‑1 के लिए, जबकि GPT‑Realtime‑2.1 के लिए 45.7% और GPT‑Realtime‑2 के लिए 42.4% हैं। Tau Banking (Voice) Knowledge पर, जो 97 बैंकिंग‑ज्ञान कार्यों में सफल पूर्णता का अनुपात मापता है, रिपोर्टेड आंकड़े क्रमशः 32.0% बनाम 12.4% और 10.3% हैं।
कंपनी ने यह भी रिपोर्ट किया कि Artificial Analysis Conversational Dynamics औसत स्कोर GPT‑Live‑1 के लिए 97.3% है, जबकि GPT‑Realtime‑2.1 के लिए 95.7% और GPT‑Realtime‑2 के लिए 95.3% है, यह मूल्यांकन विराम संभालना, वार्तालाप टर्न‑टेकिन्ग, व्यवधान और बैक‑चैनल्स को कवर करता है। Full Duplex Bench v1.5 Interactivity पर, जो पृष्ठभूमि आवाज़, किसी अन्य व्यक्ति से बात, श्रोताओं के बैक‑चैनल और व्यवधानों पर प्रतिक्रिया का परीक्षण करता है, रिपोर्टेड स्कोर क्रमशः 80.10% बनाम 45.4% और 47.8% हैं। Full Duplex Bench v1 टर्न‑टेकिन्ग लैटेंसी, जो उपयोगकर्ता के टर्न समाप्त होने के बाद एजेंट के उत्तर की गति को मापता है, 0.798 सेकंड है, जबकि तुलना मॉडल 1.41 सेकंड और 1.63 सेकंड हैं। Full Duplex Bench v3 पर, जो कम तर्क प्रयास पर Terra बैकएंड के साथ चलाया गया, OpenAI ने टूल‑कॉलिंग Pass@1 87.0% रिपोर्ट किया, जबकि तुलना मॉडल 60.0% और 58.0% हैं, और प्रतिक्रिया गुणवत्ता क्रमशः 90.0% बनाम 88.0% और 81.0% है।
ChatGPT Voice से API तक
OpenAI ने GPT‑Live को 8 जुलाई, 2026 को एक नई पीढ़ी के फुल‑डुप्लेक्स वॉइस मॉडलों के रूप में प्रस्तुत किया, जो ChatGPT Voice को शक्ति प्रदान करते हैं, और उसी दिन GPT‑Live‑1 और GPT‑Live‑1 mini को वैश्विक ChatGPT उपयोगकर्ताओं के लिए रोल‑आउट किया, साथ ही कहा कि मॉडल को API में लाया जाएगा। OpenAI ने कहा कि GPT‑Live‑1 Go, Plus, और Pro उपयोगकर्ताओं के लिए ChatGPT Voice को शक्ति देने वाला डिफ़ॉल्ट मॉडल बन जाएगा, जबकि GPT‑Live‑1 mini फ्री उपयोगकर्ताओं के लिए डिफ़ॉल्ट रहेगा। 31 जुलाई, 2026 के अपडेट में GPT‑Live के माध्यम से उत्पन्न समर्थित ऑडियो में SynthID वॉटरमार्किंग जोड़ी गई और OpenAI API के लिए सार्वजनिक सत्यापन टूल तक पहुंच प्रदान की गई।
घोषणा में एंटरप्राइज़ को OpenAI Presence की ओर भी निर्देशित किया गया, जिसे OpenAI ने कहा कि यह GPT‑Live‑1 का उपयोग करके एजेंटों को वास्तविक‑समय वॉइस इंटरैक्शन प्रदान करता है जो प्रश्नों का उत्तर देते हैं, समस्याओं को हल करते हैं, कंपनी सिस्टम का उपयोग करते हैं, अनुमोदित कार्य करते हैं, और आवश्यकता पड़ने पर लोगों को एस्केलेट करते हैं। OpenAI ने Presence को 22 जुलाई, 2026 को एक डिप्लॉय्ड एंटरप्राइज़ उत्पाद के रूप में प्रस्तुत किया, जो वॉइस और चैट वर्कफ़्लो के लिए उपलब्ध है, और यह सीमित जनरल अवेलेबिलिटी प्रोग्राम के तहत योग्य ग्राहकों को OpenAI Forward Deployed Engineers और चयनित वैश्विक सिस्टम इंटीग्रेटर्स के माध्यम से प्रदान किया जाता है, न कि स्वयं‑सेवा उत्पाद के रूप में।
प्रारंभिक ग्राहक और नई आवाज़ें
Yelp के मुख्य तकनीकी अधिकारी Alex Levy ने कहा कि GPT‑Live‑1 को Yelp Host और Hatch में जोड़ने से कंपनी की पारंपरिक वॉइस आर्किटेक्चर की तुलना में टर्न‑टेकिन्ग और सटीकता में सुधार हुआ, और Yelp Host द्वारा आरक्षण और भोजन आदेश जैसी कॉल्स का उत्तर देने पर कॉल हैंडलिंग दरों में सार्थक सुधार देख रहा है। “कॉल करने वाले भी अधिक पूर्ण, प्राकृतिक वाक्य बोल रहे हैं, जो हमें बताता है कि फोन के दूसरे सिरे पर अनुभव वास्तव में अलग महसूस हो रहा है,” Levy ने कहा। घोषणा के साथ प्रकाशित एक डेमो दिखाता है कि Yelp Host एक आरक्षण सुरक्षित करता है जबकि GPT‑Live‑1 पृष्ठभूमि शोर, साइड कॉन्वर्सेशन और व्यवधानों को संभालता है।
Speak के सह-संस्थापक और मुख्य तकनीकी अधिकारी Andrew Hsu ने कहा कि प्रारंभिक मूल्यांकन में पाया गया कि GPT‑Live‑1 ने Learners के सोचने के विराम के दौरान व्यवधान को लगभग 80% तक कम कर दिया, जो Speak के Live Tutor Lessons में पहले की टर्न‑बेस्ड सिस्टम की तुलना में है। Fin के मुख्य संचालन अधिकारी Jordan Neil ने कहा कि मॉडल AI वॉइस सपोर्ट को स्टॉप‑स्टार्ट लय से फोन कॉल की प्राकृतिक प्रवाह की ओर ले जाता है, जिससे ग्राहक विराम, व्यवधान और दिशा बदल सकते हैं, जबकि Fin बातचीत को अपने स्वामित्व वाले सपोर्ट सिस्टम के साथ जोड़कर समस्याओं को हल करता है। Cognition के सह-संस्थापक और मुख्य प्रोडक्ट अधिकारी Walden Yan ने बताया कि उन्होंने GPT‑Live‑1 को Devin, Cognition के AI इंजीनियर के साथ मिलाकर विचारों पर चर्चा करने, दृष्टिकोण का प्रेशर‑टेस्ट करने, या कीबोर्ड से दूर रहते हुए कार्य सौंपने के लिए उपयोग किया।
OpenAI ने कहा कि वह वास्तविक‑समय आवाज़ों के छोटे सेट से विस्तृत चयन में विस्तार कर रहा है, जिसमें विभिन्न लहजे, बोलियाँ और भाषाएँ शामिल हैं, जिससे डेवलपर्स को उनके सहायक की आवाज़ चुनने में अधिक विकल्प मिलते हैं। कस्टम वॉइस एक्सेस चाहते डेवलपर्स को OpenAI की बिक्री टीम से संपर्क करके पात्रता और अनुरोध प्रक्रिया के बारे में जानकारी लेनी होगी। कंपनी ने कहा कि वह आने वाले महीनों में वॉइस विकल्पों और भाषा उपलब्धता को लगातार विस्तारित करती रहेगी।












