एआई मॉडल और प्लेटफ़ॉर्म

एंथ्रोपिक क्लॉड के वॉइस मोड में ओपस और सोनेट लाता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एंथ्रोपिक ने क्लॉड के वॉइस मोड को अपने अधिक क्षमतावान मॉडलों के लिए खोल दिया है, जिससे बोली गई बातचीत ओपस और सोनेट टियर्स पर चल सकती है, न कि हल्के हाइकु मॉडल पर जिसने इस सुविधा को 2025 में लॉन्च किया था। कंपनी ने गुरुवार, 23 जुलाई, 2026 को इस परिवर्तन की पुष्टि की, इसे वास्तविक कार्य के लिए क्लॉड से बात करने के लिए उपयोगी बनाने के तरीके के रूप में प्रस्तुत किया।

एंथ्रोपिक के वॉइस मोड डॉक्यूमेंटेशन के अनुसार, सुविधा अब जिस मॉडल को उपयोगकर्ता ने आखिरी बार टेक्स्ट चैट में चुना था, उसके साथ शुरू होती है और डिफ़ॉल्ट रूप से इसका सबसे तेज़ संस्करण चलाती है, इसलिए एक सत्र मॉडल की बुद्धिमत्ता को विरासत में मिलती है। उपयोगकर्ता बातचीत के बीच में हाइकु, सोनेट और ओपस के बीच स्विच कर सकते हैं। व्यवहार में, यह उन कार्यों को खोलता है जिन्हें हाइकु-केवल सेटअप ने खराब तरीके से संभाला था: लंबे तर्क, एक ग्राहक पिच को कैसे व्यक्त किया जाए, इसकी प्रतिक्रिया या टूल-भारी अनुरोध जैसे एक ईमेल को ड्राफ्ट करना और कैलेंडर स्लॉट को आवाज से अपडेट करना।

वॉइस मोड जीमेल, गूगल कैलेंडर, गूगल डॉक्स और स्लैक जैसे जुड़े हुए ऐप्स में भी पहुंच सकता है, इसलिए एक बोली गई अनुरोध उपयोगकर्ता के अपने खातों से संदर्भ ले सकता है या एक कार्रवाई कर सकता है जैसे कि एक बैठक का पुन: निर्धारण। यह ऐप एकीकरण ओपनएआई से अलगाव का सबसे स्पष्ट बिंदु है, जिसका हाल ही में अपडेट किया गया वॉइस मोड चैटजीपीटी के बात करने के तरीके को बदल दिया लेकिन अभी भी बाहरी उपकरणों का उपयोग करके काम पूरा नहीं कर सकता है।

एक उत्पाद निर्णय, एक नया वॉइस मॉडल नहीं

किसी भी फ्रंटियर लैब्स के लिए जो वास्तव में क्या जहाज करता है, इस रिलीज़ का उल्लेखनीय हिस्सा यह है कि एंथ्रोपिक ने क्या नहीं बनाया। यहाँ कोई नया भाषण-मूल वॉइस मॉडल नहीं है। एंथ्रोपिक ने एंगेडगेट को बताया कि अपडेट “बुद्धिमत्ता और उपकरण पहुंच” पर केंद्रित है, और यह “आवाज में निवेश जारी रखने” के साथ “इस साल बाद में और अधिक साझा करने” के लिए है। अंतर्निहित पाइपलाइन अभी भी टर्न-आधारित रहती है: क्लॉड सुनता है, सोचता है, फिर बोलता है, और यह कथित तौर पर बोले गए आउटपुट के लिए एक बाहरी टेक्स्ट-टू-स्पीच प्रदाता जैसे इलेवनलैब्स पर निर्भर करता है।

एक तर्क मॉडल को वॉइस में मार्ग करना ऑडियो अपग्रेड की तुलना में एक क्षमता है। एक बोली गई अनुरोध अब एक मॉडल द्वारा संभाला जा सकता है जो एक समस्या की योजना बनाता है और काम करता है, जहां हाइकु एक तेज़ उत्तर पर एक विचारशील एक की तुलना में ट्यून किया गया था। वॉइस क्या कर सकता है यह परिवर्तन पूरी तरह से इसके पीछे के मॉडल से आता है।

यह ओपनएआई द्वारा की जा रही एक अलग दांव है। ओपनएआई ने एक द्विदिश, भाषण-मूल प्रणाली, जीपीटी-लाइव में संसाधनों को डाला है, जो एक ही समय में आपके द्वारा कही जाने वाली चीजों को संसाधित करता है और उत्तर उत्पन्न करता है, फोन कॉल की लय के करीब। एंथ्रोपिक इसके बजाय अपने सबसे मजबूत तर्क मॉडलों को एक पारंपरिक वॉइस स्टैक पर मार्ग करना है और इसके साथ आने वाली बातचीत सीमाओं को स्वीकार करना। चूंकि वॉइस मॉडल खुद अपरिवर्तित है, उपयोगकर्ता बाधा के साथ चिकनी व्यवधान या एक अधिक तरल पदार्थ के बीच और पीछे की ओर देखने की संभावना नहीं रखते हैं। जो बदलता है वह यह है कि क्लॉड कितनी अच्छी तरह से पूछे जाने वाले प्रश्नों के बारे में तर्क दे सकता है, न कि यह कितनी प्राकृतिक लगती है जब यह ऐसा करता है।

व्यापार-बंद एक प्रश्न पर मैप करता है जो क्लॉड उपयोगकर्ताओं को पहले से ही सामना करना पड़ता है: सबसे क्षमतावान मॉडल हमेशा कार्य के लिए सही नहीं होता है। सही एआई मॉडल चुनना गहराई को गति की लागत पर खरीदता है, और वॉइस बातचीत विशेष रूप से देरी से संवेदनशील होती हैं। उपयोगकर्ता के हाथों में विकल्प रखना, तेज़ विकल्प के लिए सभी को डिफ़ॉल्ट करने के बजाय, अपडेट का व्यावहारिक पदार्थ है।

क्या उपलब्ध है, और क्या गायब है

अपग्रेड किया गया वॉइस मोड बीटा में सभी उपयोगकर्ताओं के लिए एंथ्रोपिक के मोबाइल, डेस्कटॉप और वेब ऐप्स में रोल आउट हो रहा है। चूंकि यह मौजूदा मॉडलों को मार्ग करने की बात है, न कि नए बुनियादी ढांचे की, रोलआउट ताज़ा ऑडियो सिस्टम को जहाज करने के लिए एंथ्रोपिक की प्रतीक्षा नहीं करता है। मुफ्त खाते हाइकु मॉडल और एक जुड़े हुए ऐप तक सीमित हैं, सोनेट और ओपस टियर केवल भुगतान करने वाले ग्राहकों के लिए आरक्षित हैं। इस साल पहले जोड़े गए बहुस्तरीय इनपुट शामिल हैं, हालांकि क्लॉड अभी भी स्वचालित रूप से भाषा स्विच का पता नहीं लगा सकता; उपयोगकर्ताओं को या तो जोर से या वॉइस सेटिंग्स में बोलने वाली भाषा का नाम देना होगा।

पिकर ओपस, सोनेट और हाइकु को उजागर करता है, लेकिन क्लॉड फेबल 5 नहीं, एंथ्रोपिक का सबसे क्षमतावान व्यापक रूप से उपलब्ध मॉडल, जो अभी भी वॉइस से बाहर रहता है। यह छूट रिलीज़ के तर्क से मेल खाती है। यह दिन-प्रतिदिन उपयोग किए जाने वाले तर्क मॉडल के साथ वॉइस का मिलान करने के बारे में है, न कि एक बोली गई सहायक के लिए सीमा को आगे बढ़ाने के बारे में।

परिणाम एक वॉइस ब्रेकथ्रू की तुलना में एक रणनीति के बयान की तरह पढ़ता है। एंथ्रोपिक यह दांव लगा रहा है कि एक बोली गई सहायक का मूल्य मॉडल द्वारा सोच और उपकरणों तक पहुंच से आता है, न कि एक उद्देश्य-निर्मित ऑडियो आर्किटेक्चर से। इसके इस साल बाद में वादा किए गए अनुवर्ती कार्यक्रम ओपनएआई और गूगल के अपने भाषण-मूल प्रणालियों को आगे बढ़ाना जारी रखने के साथ यह स्थिति कितनी देर तक रहती है, यह दिखाएगा।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।