एआई मॉडल और प्लेटफ़ॉर्म
जेमिनी 3.1 प्रो रिकॉर्ड रीजनिंग गेन्स हासिल करता है
गूगल ने 19 फरवरी को जेमिनी 3.1 प्रो जारी किया, जो अपने फ्लैगशिप एआई मॉडल का एक अपडेट है जो रीजनिंग प्रदर्शन को दोगुना से अधिक बढ़ाता है जबकि इसके पूर्ववर्ती के समान मूल्य निर्धारण रखता है।
सबसे आकर्षक संख्या: ARC-AGI-2 पर, एक बेंचमार्क जो यह परीक्षण करता है कि मॉडल पूरी तरह से नए तर्क पैटर्न को हल कर सकता है या प्रशिक्षण डेटा को याद करता है, जेमिनी 3.1 प्रो 77.1% स्कोर करता है। जेमिनी 3 प्रो ने 31.1% स्कोर किया। यह 46 प्रतिशत बिंदु की छलांग किसी भी फ्रंटियर मॉडल परिवार में एकल पीढ़ी के रीजनिंग लाभ में सबसे बड़ा है।
मॉडल तुरंत गूगल के उपभोक्ता और विकासकर्ता प्लेटफार्मों पर उपलब्ध है। जेमिनी ऐप उपयोगकर्ता एआई प्रो और एआई अल्ट्रा योजनाओं पर उच्च उपयोग सीमा के साथ पहुंच प्राप्त करते हैं, जबकि विकासकर्ता एआई स्टूडियो, वर्टेक्स एआई, जेमिनी सीएलआई, एंटीग्रेविटी और एंड्रॉइड स्टूडियो में जेमिनी एपीआई के माध्यम से 3.1 प्रो तक पहुंच प्राप्त कर सकते हैं। नोटबुकएलएम को भी प्रो और अल्ट्रा ग्राहकों के लिए अपग्रेड मिलता है।
मूल्य निर्धारण 200,000 टोकन से कम प्रोम्प्ट के लिए प्रति मिलियन इनपुट टोकन $2 पर बना रहता है, जो लंबे संदर्भों के लिए $4 तक बढ़ जाता है। आउटपुट की लागत प्रति मिलियन टोकन $12 है। जेमिनी 3 प्रो के माध्यम से एपीआई के माध्यम से पहले से ही उपयोग कर रहे किसी भी व्यक्ति के लिए, अपग्रेड मुफ्त है।
बेंचमार्क प्रदर्शन समग्र
मॉडल कार्ड दिखाता है कि जेमिनी 3.1 प्रो 18 ट्रैक किए गए बेंचमार्क में से 12 पर पहला स्थान हासिल करता है। आरसी-एजीआई-2 के अलावा, उत्कृष्टता में 94.3% जीपीक्यूए डायमंड, एक स्नातक स्तर का विज्ञान तर्क परीक्षण, और 2,887 एलो लाइवकोडबेंच प्रो शामिल हैं, जो प्रतिस्पर्धी प्रोग्रामिंग के लिए सभी फ्रंटियर मॉडल के लिए उच्चतम स्कोर है।
मानवता के आखिरी परीक्षा पर – एक बेंचमार्क जो विभिन्न अकादमिक अनुशासनों से विशेषज्ञ प्रश्नों से तैयार किया गया है – 3.1 प्रो 44.4% तक पहुंचता है, जो जेमिनी 3 प्रो के लिए 37.5% से अधिक है और जीपीटी-5.2 के 34.5% से आगे है। बहुस्तरीय एमएमएलयू बेंचमार्क 92.6% दिखाता है, और 128,000 टोकन पर लंबे संदर्भ सटीकता 84.9% पर बनी हुई है।
मॉडल 1 मिलियन टोकन इनपुट संदर्भ विंडो बनाए रखता है और 64,000 आउटपुट टोकन तक उत्पन्न कर सकता है, जो उन एआई कोडिंग टूल्स के विशिष्टताओं से मेल खाता है जिन्हें एक ही सत्र में पूरे कोडबेस को निगलना और महत्वपूर्ण कोड ब्लॉक उत्पन्न करना पड़ता है।
जहां 3.1 प्रो अग्रणी नहीं है, वह भी बताने वाला है। एसडब्ल्यूई-बेंच वरिफाइड पर, एक वास्तविक दुनिया के सॉफ्टवेयर इंजीनियरिंग कार्यों का परीक्षण, यह 80.6% स्कोर करता है – एंथ्रोपिक के क्लॉड ओपस 4.6 के 80.8% से थोड़ा कम। अंतर है कम, लेकिन यह दिखाता है कि एंथ्रोपिक व्यावहारिक कोडिंग कार्यों में एक संकीर्ण बढ़त बनाए रखता है।
डायनामिक थिंकिंग में क्या बदलाव आता है
जेमिनी 3.1 प्रो डिफ़ॉल्ट रूप से डायनामिक थिंकिंग का उपयोग करता है, जिसमें मॉडल प्रत्येक प्रॉम्प्ट की जटिलता के आधार पर आंतरिक तर्क को समायोजित करता है। सरल प्रश्न तेजी से उत्तर प्राप्त करते हैं। जटिल बहु-चरण समस्याएं गहरी प्रसंस्करण श्रृंखला को ट्रिगर करती हैं trước कि मॉडल अपना उत्तर उत्पन्न करे।
विकासकर्ता एपीआई में एक थिंकिंग_लेवल पैरामीटर के माध्यम से इस व्यवहार को नियंत्रित कर सकते हैं, आंतरिक तर्क की अधिकतम गहराई निर्धारित कर सकते हैं। यह तर्क मॉडल में एक तनाव को संबोधित करता है: विस्तारित सोच कठिन समस्याओं पर सटीकता में सुधार करती है लेकिन सीधे प्रश्नों के लिए देरी और लागत जोड़ती है। डायनामिक थिंकिंग इस व्यापार को स्वचालित करने का प्रयास करती है।
यह सुविधा एक व्यापक उद्योग परिवर्तन को दर्शाती है। ओपनएआई के ओ-श्रृंखला मॉडल ने चेन-ऑफ-थॉट रीजनिंग को एक चयन योग्य मोड के रूप में पेश किया। एंथ्रोपिक के क्लॉड में विस्तारित सोच एक ऑप्ट-इन सुविधा के रूप में है। गूगल का डिफ़ॉल्ट के रूप में इसका उपयोग करने का दृष्टिकोण – परिवर्तनशील तीव्रता के साथ – यह दांव लगाता है कि अधिकांश उपयोगकर्ता स्वयं इस निर्णय का प्रबंधन करने के बजाय मॉडल को यह तय करने देंगे कि कितनी मेहनत करनी है।
प्रतिस्पर्धी क्षेत्र संकुचित होता है
जेमिनी 3.1 प्रो एक बाजार में आता है जहां बेंचमार्क नेतृत्व मासिक रूप से हाथ बदलता है। गूगल के जेमिनी 3 ने ओपनएआई में एक “कोड रेड” को ट्रिगर किया जिसने एक महीने से कम समय में जीपीटी-5.2 का उत्पादन किया। एंथ्रोपिक क्लॉड अपडेट को तेजी से गति से शिप कर रहा है। प्रत्येक रिलीज मॉडल के बीच अंतर को कम करता है, जिससे प्लेटफार्मों के बीच चयन बढ़ती है जो कि कच्ची क्षमता के बजाय पारिस्थितिकी तंत्र और मूल्य निर्धारण पर निर्भर करता है।
गूगल का लाभ वितरण बना हुआ है। जेमिनी 3.1 प्रो सीधे उन उत्पादों में फिट होता है जिनका उपयोग सैकड़ों मिलियन लोगों द्वारा किया जाता है: जीमेल, डॉक्स, सर्च, और पर्सनल इंटेलिजेंस सुविधाएं जो मॉडल को उपयोगकर्ताओं के व्यक्तिगत डेटा से जोड़ती हैं। मॉडल जेमिनी एंटरप्राइज और जेमिनी सीएलआई को भी संचालित करता है, जिससे विकासकर्ताओं और व्यवसायों को उन उपकरणों के माध्यम से पहुंच मिलती है जिनका वे पहले से ही उपयोग करते हैं।
विकासकर्ताओं के लिए जो फ्रंटियर मॉडल के बीच चयन कर रहे हैं, मूल्य निर्धारण निर्णय आसान हो गया है। प्रति मिलियन इनपुट टोकन $2 पर, जेमिनी 3.1 प्रो ओपनएआई और एंथ्रोपिक के फ्लैगशिप मूल्य निर्धारण को समान क्षमता के लिए कम करता है। 3 प्रो से मुफ्त अपग्रेड मौजूदा उपयोगकर्ताओं के लिए किसी भी प्रवास फ्रिक्शन को दूर करता है।
रीजनिंग लाभ सबसे ज्यादा एजेंटिक अनुप्रयोगों के लिए महत्वपूर्ण हैं – एआई सिस्टम जो योजना बनाते हैं, बहु-चरण कार्यों को निष्पादित करते हैं और स्वायत्त रूप से उपकरणों का उपयोग करते हैं। आरसी-एजीआई-2 विशेष रूप से उस प्रकार की नए पैटर्न की पहचान का परीक्षण करता है जिसकी एजेंटों को अपने प्रशिक्षण डेटा से परे समस्याओं का सामना करने पर आवश्यकता होती है। 77.1% स्कोर करने वाला मॉडल 31.1% स्कोर करने वाले की तुलना में अज्ञात स्थितियों को बहुत अधिक विश्वसनीय रूप से संभालता है।
यह देखना महत्वपूर्ण है कि क्या ये बेंचमार्क लाभ वास्तविक दुनिया में सुधार के अनुपात में अनुवाद करते हैं। बेंचमार्क विशिष्ट क्षमताओं को नियंत्रित परिस्थितियों में पकड़ते हैं; वास्तविक उपयोगकर्ता अनुभव इस बात पर निर्भर करता है कि मॉडल लोगों द्वारा इसे फेंके जाने वाले कार्यों की अप्रत्याशित श्रृंखला में कैसा प्रदर्शन करता है। आरसी-एजीआई-2 की छलांग से पता चलता है कि 3.1 प्रो किसी भी मॉडल से बेहतर नवीनता को संभालता है। यह देखना दिलचस्प होगा कि उपयोगकर्ता इस क्षमता का उपयोग कैसे करते हैं।










