एआई मॉडल और प्लेटफ़ॉर्म
Anthropic ने Claude Sonnet 5.5 जारी किया, Sonnet 5 की कीमत अपरिवर्तित रखी

Anthropic ने 28 सितंबर, 2026 को Claude Sonnet 5.5 जारी किया, जो उसके Claude 5.5 परिवार का दूसरा मॉडल है। मॉडल Claude Sonnet 5 की कीमत को प्रति मिलियन इनपुट टोकन $2 और प्रति मिलियन आउटपुट टोकन $10 पर बनाए रखता है, और Anthropic का कहना है कि यह अपने परीक्षण में आउटपुट को 30% से अधिक तेज़ उत्पन्न करता है जबकि प्रति कार्य लागत में 30% तक कमी आती है।
अपने रिलीज़ घोषणा में, Anthropic ने Sonnet 5.5 को Claude Opus 5.5 का तेज़, कम‑लागत वाला पूरक बताया, जिसे कंपनी का कहना है कि जटिल कार्यों के लिए बनाया गया है जिनमें सावधानीपूर्वक निर्णय की आवश्यकता होती है। Sonnet 5.5 दैनिक कार्यों, बग सुधारने, और परिष्कृत दस्तावेज़, स्लाइड और स्प्रेडशीट बनाने में सबसे मजबूत है, Anthropic ने कहा, और जोड़ा कि इसमें डिजाइन के प्रति भी तेज़ नज़र है।
Claude Sonnet 5.5 सभी प्लेटफ़ॉर्म पर उपलब्ध है, जिसमें Amazon Web Services, Google Cloud, और Microsoft Azure शामिल हैं, मॉडल ID claude-sonnet-5-5 के तहत, और यह शून्य डेटा प्रतिधारण के साथ पेश किया जाता है, जैसा कि Opus 5.5 और Sonnet 5 के साथ है।
रिपोर्ट किए गए बेंचमार्क परिणाम
Anthropic रिपोर्ट करता है कि Sonnet 5.5 Terminal-Bench 4.0 पर 70.6% स्कोर प्राप्त करता है, जो एक एजेंटिक कोडिंग मूल्यांकन है, जबकि Sonnet 5 का स्कोर 10.3% है, और Opus 5.5 का सूचीबद्ध स्कोर 66.4% है जो उसके Xhigh‑effort परिणाम को दर्शाता है। FrontierCode 1.1 के मुख्य सेट पर, Sonnet 5.5 ने Max effort पर 46.2% और Xhigh पर 52.1% दर्ज किया, जबकि Sonnet 5 के लिए 42.4%, Opus 5.5 के लिए 54.4%, और OpenAI के GPT-6 Sol के लिए 49.3% है। रिपोर्ट किए गए CursorBench 4.0 स्कोर क्रमशः Sonnet 5.5 के लिए 55.5%, Sonnet 5 के लिए 34.1%, और Opus 5.5 के लिए 57.8% हैं।
ज्ञान‑कार्य मूल्यांकनों पर, कंपनी Sonnet 5.5 के लिए GDPval-AA v2.1 स्कोर 1844 रिपोर्ट करती है, जो Opus 5.5 के 1846 से दो अंक कम और Sonnet 5 के 1449 से लगभग 400 अंक अधिक है, तथा AA‑Briefcase v1.1 स्कोर 1811, जो Opus 5.5 के 1822 और Sonnet 5 के 1359 के मुकाबले है। घोषणा में यह भी बताया गया है कि Humanity’s Last Exam पर टूल्स के साथ 64.5%, OSWorld 2.1 पर 80.1% आंशिक क्रेडिट, और Chartography (एक दृश्य चार्ट पहचान परीक्षण) पर टूल्स के बिना 61.6% प्राप्त हुए। Anthropic का कहना है कि Sonnet 5.5 पहला Sonnet मॉडल है जो केवल स्क्रीनशॉट से Pokémon Red को मात देता है।
कंपनी चेतावनी देती है कि बेंचमार्क स्कोर मॉडल की क्षमताओं के केवल एक पहलू को दर्शाते हैं, और कहती है कि अपने परीक्षण और बाहरी परीक्षकों के परीक्षणों में, Opus 5.5 जटिल, खुले‑अंत वाले कार्यों में स्पष्ट रूप से अधिक मजबूत रहता है जिनमें निरंतर निर्णय की आवश्यकता होती है। एक फुटनोट में कहा गया है कि Artificial Analysis ने प्री‑रिलीज़ डिप्लॉयमेंट पर GDPval-AA और AA‑Briefcase चलाए थे, जिसमें एक structured‑outputs बग था जिसे ठीक कर दिया गया है और यह Sonnet 5.5 के प्रदर्शन को कम आंक सकता है। एक अन्य फुटनोट में उल्लेख है कि OpenAI ने हाल ही में GPT-6 Sol में इमेज‑अंडरस्टैंडिंग बग को ठीक किया है, जिससे तृतीय‑पक्ष स्कोर अभी तक प्रतिबिंबित नहीं हो सकते।
प्रारंभिक परीक्षक परिणाम
CodeRabbit के एआई उपाध्यक्ष, David Loker ने कहा कि Sonnet 5.5 जटिलता स्तरों में Sonnet 5 की तुलना में बेहतर निर्णय दिखाता है जबकि आउटपुट टोकन की संख्या में काफी कमी करता है, और CodeRabbit अब सरल और मध्यम समीक्षाओं को इस मॉडल पर ले जाने की योजना बना रहा है, आने वाले हफ्तों में और अधिक। Base44 AI इंजीनियरिंग लीड Gabriel Grinberg ने बताया कि 118 वास्तविक ऐप बिल्ड्स में, Sonnet 5.5 ने प्रति बिल्ड औसतन 3.6 पुनरावृत्ति की, जबकि Opus 5 ने 7.7, और Base44 द्वारा तुलना किए गए सभी मॉडलों में सबसे कम विफल टूल कॉल्स देखे।
Slack के प्रमुख इंजीनियर Curtis Allen ने रिपोर्ट किया कि ऑफ़लाइन Slackbot मूल्यांकनों में बिना प्रॉम्प्ट बदलाव के लगभग 14% कम आउटपुट टोकन उपयोग हुए। Zendesk के एआई निदेशक, Abhinay Kathuria ने कहा कि टिकटों को Claude मॉडल्स की तुलना में 20% तेज़ी से प्रोसेस किया गया, जो Zendesk उत्पादन में चलाता है। Balyasny Asset Management ने लगभग 121,000 टोकन प्रति उत्तर की रिपोर्ट की, जबकि Sonnet 5 ने 2,441 वित्तीय कार्यों के निजी सूट में 497,000 टोकन उपयोग किए। Box ने परिणाम 2.4 गुना तेज़ और कुल टोकन में 12% कमी के साथ रिपोर्ट किए, और Atlassian ने कहा कि ग्राहक Sonnet 5 की तुलना में Rovo Agents को 30% तक तेज़ चला सकते हैं।
मूल्य निर्धारण, गति, और माइग्रेशन
Sonnet 5.5 की सूचीबद्ध कीमतें Sonnet 5 के समान हैं: प्रति मिलियन इनपुट टोकन $2, प्रति मिलियन आउटपुट टोकन $10, प्रति मिलियन कैश‑रीड टोकन $0.20, और प्रति मिलियन कैश‑राइट टोकन $2.50। Opus 5.5 की कीमतें $4 इनपुट, $20 आउटपुट, और $5 कैश‑राइट हैं। Anthropic का कहना है कि Sonnet 5.5 समान कार्य के लिए सामान्यतः बहुत कम टोकन की आवश्यकता रखता है और अब तक का सबसे तेज़ Sonnet मॉडल है।
मॉडल पाँच पुनः-कैलिब्रेटेड प्रयास स्तर प्रदान करता है: लो, मीडियम, हाई, xhigh, और मैक्स। डिफ़ॉल्ट सेटिंग्स Claude Code और Claude ऐप्स में मीडियम हैं और Claude प्लेटफ़ॉर्म पर हाई, जो API का भी डिफ़ॉल्ट है।
Anthropic की माइग्रेशन गाइड Sonnet 5 से माइग्रेट करने वाले डेवलपर्स के लिए ब्रेकिंग बदलावों की सूची देती है। एडेप्टिव थिंकिंग अब डिफ़ॉल्ट रूप से चलती है, अक्षम थिंकिंग सेटिंग 400 त्रुटि देती है, और जो डेवलपर्स Sonnet को थिंकिंग बंद करके चलाते थे उन्हें माइग्रेट करने से पहले नया टूल्स सेटिंग, उपलब्ध सबसे निम्न, माइग्रेट करने से पहले। मजबूरन टूल चयन को स्वचालित टूल चयन के साथ कड़े टूल्स के जोड़े में बदल दिया गया है, और न्यूनतम कैशेबल प्रॉम्प्ट Sonnet 5 पर 1,024 टोकन से घटकर 512 टोकन हो गया है। दस्तावेज़ में पाँच अस्वीकार कारण श्रेणियाँ भी सूचीबद्ध हैं, जिनमें साइबर, बायो, फ्रंटियरनिकाल, और सामान्यहानियाँ, और यह नोट करता है कि सर्वर‑साइड फॉलबैक केवल साइबर और frontier_llm अस्वीकृति को Sonnet 5 पर पुनः प्रयास करता है।
सुरक्षा निष्कर्ष और सुरक्षा उपाय
क्योंकि Sonnet 5.5 की साइबर क्षमताएँ Opus 5 के समान हैं, Anthropic ने कहा कि यह पहला Sonnet मॉडल है जो कंपनी के सबसे सक्षम मॉडलों में उपयोग किए जाने वाले साइबर सुरक्षा उपायों और फॉलबैक्स के साथ लॉन्च हो रहा है। सिस्टम कार्ड रिपोर्ट करता है कि सुरक्षा उपाय बंद होने पर, Sonnet 5.5 ने औसतन 11.53 क्षमता फ़्लैग और ExploitBench पर 80% कैप्चर रेट प्राप्त किया और 178 पूर्ण मनमाने कोड निष्पादन एक्सप्लॉइट उत्पन्न किए, जबकि Sonnet 5 के लिए केवल एक था। इसने CyScenarioBench चुनौतियों का 46.1% पूरा किया, जबकि Sonnet 5 ने 0.7% पूरा किया, और Binary Exploitation Benchmark पर 50 नियंत्रण‑प्रवाह हाइजैक उत्पन्न किए, जबकि Sonnet 5 ने केवल 3 किए।
साइबर सुरक्षा उपाय तीन चरणों में चलते हैं: मॉडल की आंतरिक सक्रियताओं पर एक प्रोब, मॉडल के भीतर एक हल्का वर्गीकारक, और एक अलग प्रशिक्षित LLM वर्गीकारक। कार्ड रिपोर्ट करता है कि साइबर हानि कवरेज सेट पर 99.43% रिकॉल और rewind-attacker मजबूती मूल्यांकन पर 21.0% अटैक सफलता दर प्राप्त हुई, जो Sonnet 5 के लिए 57.2% से सुधरी है, जबकि उपयोगकर्ताओं को यह चेतावनी दी जाती है कि सामान्य साइबर सुरक्षा कार्यों पर भी अस्वीकृतियों में वृद्धि की उम्मीद रखें। उच्च‑जोखिम वाले अनुरोध स्पष्ट रूप से Sonnet 5 पर फॉलबैक होते हैं, और विस्तारित Cyber Verification Program जल्द ही सत्यापित रक्षकों को Sonnet 5.5, Opus 5.5, और Claude Mythos मॉडलों पर उन्नत क्षमताओं तक स्तरित पहुँच प्रदान करेगा।
बायोलॉजी सुरक्षा उपाय वही हानिकारक‑दुरुपयोग वर्गीकारक हैं जो Opus 5 के लिए लागू किए गए हैं, और कोई फॉलबैक मॉडल नहीं है, और Anthropic का लाइफ़ साइंसेज़ वेरिफिकेशन प्रोग्राम बायोलॉजी कार्य के पूरे स्पेक्ट्रम के लिए पहुँच को कवर करता है। Sonnet 5.5 भी पहला Sonnet मॉडल है जिसमें सुरक्षा वर्गीकारक हैं जो तर्क निष्कर्षण को रोकते हैं, और यह संरक्षित सोच को विस्तारित करता है ताकि मॉडल की सोच को उस खाते से अलग नहीं किया जा सके जिसने इसे बनाया है।
Anthropic के लगभग 1,850 परिदृश्यों पर स्वचालित व्यवहारिक ऑडिट में, कंपनी रिपोर्ट करती है कि Sonnet 5.5 अधिकांश संरेखण, दुरुपयोग प्रतिरोध, और ईमानदारी मापदंडों पर Sonnet 5 से बेहतर या समान प्रदर्शन करता है, परीक्षण किए गए मॉडलों में सबसे कम प्रयुक्त सैंडबॉक्स एस्केप दर दर्ज करता है, और कई पूर्व मॉडलों की तुलना में अधिक अपठनीय सोच प्रदर्शित करता है। सिस्टम कार्ड बताता है कि Sonnet 5.5 कोई नया Responsible Scaling Policy थ्रेशोल्ड नहीं पार करता, इसे नीति के CB-1 और Autonomy-1 थ्रेशोल्ड को पूरा करने वाला माना जाता है, और इसका आपदा‑समान विसंरेखण जोखिम कम आंका गया है। मॉडल का विश्वसनीय ज्ञान कटऑफ़ जून 2026 है।
Anthropic ने कहा कि Claude Haiku 5.5, जो उच्च‑वॉल्यूम और लागत‑संवेदनशील अनुप्रयोगों के लिए बनाया गया है, आने वाले हफ्तों में Claude 5.5 परिवार में शामिल हो जाएगा।












