एआई मॉडल और प्लेटफ़ॉर्म
एंथ्रोपिक क्लॉड के वॉइस मोड में ओपस और सोनेट लाता है

एंथ्रोपिक ने क्लॉड के वॉइस मोड को अपने अधिक क्षमतावान मॉडलों के लिए खोल दिया है, जिससे बोली गई बातचीत ओपस और सोनेट टियर्स पर चल सकती है, न कि हल्के हाइकु मॉडल पर जिसने इस सुविधा को 2025 में लॉन्च किया था। कंपनी ने गुरुवार, 23 जुलाई, 2026 को इस परिवर्तन की पुष्टि की, इसे वास्तविक कार्य के लिए क्लॉड से बात करने के लिए उपयोगी बनाने के तरीके के रूप में प्रस्तुत किया।
एंथ्रोपिक के वॉइस मोड डॉक्यूमेंटेशन के अनुसार, सुविधा अब जिस मॉडल को उपयोगकर्ता ने आखिरी बार टेक्स्ट चैट में चुना था, उसके साथ शुरू होती है और डिफ़ॉल्ट रूप से इसका सबसे तेज़ संस्करण चलाती है, इसलिए एक सत्र मॉडल की बुद्धिमत्ता को विरासत में मिलती है। उपयोगकर्ता बातचीत के बीच में हाइकु, सोनेट और ओपस के बीच स्विच कर सकते हैं। व्यवहार में, यह उन कार्यों को खोलता है जिन्हें हाइकु-केवल सेटअप ने खराब तरीके से संभाला था: लंबे तर्क, एक ग्राहक पिच को कैसे व्यक्त किया जाए, इसकी प्रतिक्रिया या टूल-भारी अनुरोध जैसे एक ईमेल को ड्राफ्ट करना और कैलेंडर स्लॉट को आवाज से अपडेट करना।
वॉइस मोड जीमेल, गूगल कैलेंडर, गूगल डॉक्स और स्लैक जैसे जुड़े हुए ऐप्स में भी पहुंच सकता है, इसलिए एक बोली गई अनुरोध उपयोगकर्ता के अपने खातों से संदर्भ ले सकता है या एक कार्रवाई कर सकता है जैसे कि एक बैठक का पुन: निर्धारण। यह ऐप एकीकरण ओपनएआई से अलगाव का सबसे स्पष्ट बिंदु है, जिसका हाल ही में अपडेट किया गया वॉइस मोड चैटजीपीटी के बात करने के तरीके को बदल दिया लेकिन अभी भी बाहरी उपकरणों का उपयोग करके काम पूरा नहीं कर सकता है।
एक उत्पाद निर्णय, एक नया वॉइस मॉडल नहीं
किसी भी फ्रंटियर लैब्स के लिए जो वास्तव में क्या जहाज करता है, इस रिलीज़ का उल्लेखनीय हिस्सा यह है कि एंथ्रोपिक ने क्या नहीं बनाया। यहाँ कोई नया भाषण-मूल वॉइस मॉडल नहीं है। एंथ्रोपिक ने एंगेडगेट को बताया कि अपडेट “बुद्धिमत्ता और उपकरण पहुंच” पर केंद्रित है, और यह “आवाज में निवेश जारी रखने” के साथ “इस साल बाद में और अधिक साझा करने” के लिए है। अंतर्निहित पाइपलाइन अभी भी टर्न-आधारित रहती है: क्लॉड सुनता है, सोचता है, फिर बोलता है, और यह कथित तौर पर बोले गए आउटपुट के लिए एक बाहरी टेक्स्ट-टू-स्पीच प्रदाता जैसे इलेवनलैब्स पर निर्भर करता है।
एक तर्क मॉडल को वॉइस में मार्ग करना ऑडियो अपग्रेड की तुलना में एक क्षमता है। एक बोली गई अनुरोध अब एक मॉडल द्वारा संभाला जा सकता है जो एक समस्या की योजना बनाता है और काम करता है, जहां हाइकु एक तेज़ उत्तर पर एक विचारशील एक की तुलना में ट्यून किया गया था। वॉइस क्या कर सकता है यह परिवर्तन पूरी तरह से इसके पीछे के मॉडल से आता है।
यह ओपनएआई द्वारा की जा रही एक अलग दांव है। ओपनएआई ने एक द्विदिश, भाषण-मूल प्रणाली, जीपीटी-लाइव में संसाधनों को डाला है, जो एक ही समय में आपके द्वारा कही जाने वाली चीजों को संसाधित करता है और उत्तर उत्पन्न करता है, फोन कॉल की लय के करीब। एंथ्रोपिक इसके बजाय अपने सबसे मजबूत तर्क मॉडलों को एक पारंपरिक वॉइस स्टैक पर मार्ग करना है और इसके साथ आने वाली बातचीत सीमाओं को स्वीकार करना। चूंकि वॉइस मॉडल खुद अपरिवर्तित है, उपयोगकर्ता बाधा के साथ चिकनी व्यवधान या एक अधिक तरल पदार्थ के बीच और पीछे की ओर देखने की संभावना नहीं रखते हैं। जो बदलता है वह यह है कि क्लॉड कितनी अच्छी तरह से पूछे जाने वाले प्रश्नों के बारे में तर्क दे सकता है, न कि यह कितनी प्राकृतिक लगती है जब यह ऐसा करता है।
व्यापार-बंद एक प्रश्न पर मैप करता है जो क्लॉड उपयोगकर्ताओं को पहले से ही सामना करना पड़ता है: सबसे क्षमतावान मॉडल हमेशा कार्य के लिए सही नहीं होता है। सही एआई मॉडल चुनना गहराई को गति की लागत पर खरीदता है, और वॉइस बातचीत विशेष रूप से देरी से संवेदनशील होती हैं। उपयोगकर्ता के हाथों में विकल्प रखना, तेज़ विकल्प के लिए सभी को डिफ़ॉल्ट करने के बजाय, अपडेट का व्यावहारिक पदार्थ है।
क्या उपलब्ध है, और क्या गायब है
अपग्रेड किया गया वॉइस मोड बीटा में सभी उपयोगकर्ताओं के लिए एंथ्रोपिक के मोबाइल, डेस्कटॉप और वेब ऐप्स में रोल आउट हो रहा है। चूंकि यह मौजूदा मॉडलों को मार्ग करने की बात है, न कि नए बुनियादी ढांचे की, रोलआउट ताज़ा ऑडियो सिस्टम को जहाज करने के लिए एंथ्रोपिक की प्रतीक्षा नहीं करता है। मुफ्त खाते हाइकु मॉडल और एक जुड़े हुए ऐप तक सीमित हैं, सोनेट और ओपस टियर केवल भुगतान करने वाले ग्राहकों के लिए आरक्षित हैं। इस साल पहले जोड़े गए बहुस्तरीय इनपुट शामिल हैं, हालांकि क्लॉड अभी भी स्वचालित रूप से भाषा स्विच का पता नहीं लगा सकता; उपयोगकर्ताओं को या तो जोर से या वॉइस सेटिंग्स में बोलने वाली भाषा का नाम देना होगा।
पिकर ओपस, सोनेट और हाइकु को उजागर करता है, लेकिन क्लॉड फेबल 5 नहीं, एंथ्रोपिक का सबसे क्षमतावान व्यापक रूप से उपलब्ध मॉडल, जो अभी भी वॉइस से बाहर रहता है। यह छूट रिलीज़ के तर्क से मेल खाती है। यह दिन-प्रतिदिन उपयोग किए जाने वाले तर्क मॉडल के साथ वॉइस का मिलान करने के बारे में है, न कि एक बोली गई सहायक के लिए सीमा को आगे बढ़ाने के बारे में।
परिणाम एक वॉइस ब्रेकथ्रू की तुलना में एक रणनीति के बयान की तरह पढ़ता है। एंथ्रोपिक यह दांव लगा रहा है कि एक बोली गई सहायक का मूल्य मॉडल द्वारा सोच और उपकरणों तक पहुंच से आता है, न कि एक उद्देश्य-निर्मित ऑडियो आर्किटेक्चर से। इसके इस साल बाद में वादा किए गए अनुवर्ती कार्यक्रम ओपनएआई और गूगल के अपने भाषण-मूल प्रणालियों को आगे बढ़ाना जारी रखने के साथ यह स्थिति कितनी देर तक रहती है, यह दिखाएगा।












