फंडिंग
Arena ने AI मूल्यांकन को आगे बढ़ाने के लिए $200M Series B को $3.1B मूल्यांकन पर सुरक्षित किया

AI मूल्यांकन कंपनी Arena घोषणा की $200 मिलियन Series B $3.1 बिलियन मूल्यांकन पर 8 अक्टूबर, 2026 को, एक राउंड में जो Lightspeed Venture Partners और Khosla Ventures द्वारा सह-नेतृत्व किया गया, और वित्तपोषण के साथ अपने Arena Alignment Index का एक पूर्वावलोकन जारी किया।
Series B निवेशक और घोषित उद्देश्य
Salesforce Ventures, 01 Advisors, Dell Technologies Capital और Endeavor Catalyst ने इस राउंड में भाग लिया, और मौजूदा निवेशकों a16z, Felicis, AMP PBC, QuantumLight और The House Fund ने भी इसे समर्थन दिया, कंपनी ने कहा।
Arena ने कहा कि यह फंडिंग वास्तविक दुनिया के उपयोग के लिए AI सीमा को मापने और आगे बढ़ाने के अपने मिशन को जारी रखती है, इस राउंड को AI के अधिक शक्तिशाली होने के साथ विश्व को एक स्वतंत्र, डेटा-आधारित दृष्टिकोण की आवश्यकता के विचार में विश्वास का संकेत मानते हुए प्रस्तुत किया। कंपनी ने कहा कि एजेंट अब कोड लिखते हैं, विश्लेषण चलाते हैं और लोगों की ओर से कार्य करते हैं, केवल प्रश्नों के उत्तर देने के बजाय, अक्सर ऐसे क्षेत्रों में जहाँ व्यक्ति काम को आसानी से जाँच नहीं सकता, और तर्क दिया कि स्थिर बेंचमार्क तब टूट जाते हैं जब मॉडल पहचानते हैं कि उनका परीक्षण हो रहा है। Arena ने यह भी कहा कि उसकी वार्षिक राजस्व $100 मिलियन से अधिक हो गई है।
रिपोर्टेड वृद्धि और पूर्व राउंड
Arena ने अपने लॉन्च के बाद पाँच महीने से कम समय में Agent Arena में 7 मिलियन सत्रों की रिपोर्ट की, और पूरे Arena प्लेटफ़ॉर्म में 350 मिलियन सत्र। कंपनी ने कहा कि उसने टेक्स्ट, विज़न, कोड, सर्च, वीडियो और इमेज मोडालिटीज़ में 62 मिलियन वोट एकत्र किए हैं, और यह 150 से अधिक देशों से मासिक दसियों मिलियन विज़िटर्स को आकर्षित करता है। उसने 1,000 से अधिक नए मॉडल मूल्यांकन और 375,000 डेटा पॉइंट्स को समुदाय के लिए ओपन-सोर्स किया, जिसमें उसकी लीडरबोर्ड पद्धति शामिल है।
Series B, कंपनी द्वारा जनवरी 2026 में घोषणा की गई $150 मिलियन Series A के बाद आया, जब यह अभी भी LMArena नाम से कार्य कर रही थी। Felicis और UC Investments (University of California) ने उस राउंड का नेतृत्व किया, जिसमें Andreessen Horowitz, The House Fund, LDVP, Kleiner Perkins, Lightspeed Venture Partners और Laude Ventures ने भाग लिया। कंपनी ने मई 2025 में $100 मिलियन seed round की घोषणा की थी।
Series A के समय, कंपनी ने 50 मिलियन वोट, 400 से अधिक नए मॉडल मूल्यांकन और 145,000 ओपन-सोर्स बैटल डेटा पॉइंट्स की रिपोर्ट की, और कहा कि उसका पहला मूल्यांकन उत्पाद सितंबर 2025 में लॉन्च हुआ था। कंपनी के अनुसार, Arena एक शोध प्रयोग के रूप में शुरू हुआ, जिसने कहा कि यह मानव पसंद मूल्यांकनों से शुरू हुआ और बाद में तथ्यात्मकता को मापने की ओर बढ़ा, यह पता चलने के बाद कि लोग जो प्रतिक्रिया पसंद करते हैं वह हमेशा सही नहीं होती।
Alignment Index संकेत और कार्यप्रणाली
Alignment Index, जिसे Arena वास्तविक दुनिया में AI मानव मूल्यों से कितनी विचलित हो सकता है, का माप बताता है, तीन संकेतों से शुरू होता है जिन्हें कंपनी कहती है कि वास्तविक मानव उपयोग से प्राप्त एजेंट ट्रेस के विरुद्ध सत्यापित किया जा सकता है: Unauthorized Action, जहाँ मॉडल उपयोगकर्ता की मांग से अधिक कार्य करता है; False Attribution, जहाँ मॉडल कोई बयान, इरादा या तथ्य उपयोगकर्ता को सौंपता है जो उपयोगकर्ता द्वारा प्रदान किए गए प्रमाण से विरोधाभासी होता है; और Deceptive Completion, जहाँ मॉडल कार्य को पूर्ण बताता है जबकि वह नहीं है।
Arena ने कहा कि संकेत परिभाषाएँ OpenAI और Anthropic द्वारा अपने सिस्टम कार्ड में प्रकाशित परिभाषाओं से प्रेरित हैं, ताकि वे मॉडल सुरक्षा और संरेखण का स्वतंत्र मूल्यांकन प्रदान कर सकें। कंपनी इन तीन संकेतों को अपने Agent Arena लीडरबोर्ड के पूरक के रूप में रखती है, जो एजेंट क्षमताओं को रैंक करता है।
एक साथी अनुसंधान पोस्ट में, Arena ने कहा कि यह पूर्वावलोकन 27 मॉडलों की तुलना 90,000 वास्तविक-विश्व एजेंट सत्रों से करता है जो Agent Arena से लिए गए हैं। प्रत्येक संकेत के लिए, कंपनी ने दोहराव वाले विफलता मोड का वर्णन करने वाले रूब्रिक लिखे और उन्हें कई राउंड के न्याय और मानव समीक्षा के माध्यम से परिष्कृत किया। फिर एक LLM जज ने प्रत्येक मॉडल के लिए चयनित सत्रों पर रूब्रिक लागू किए, केवल तब सत्र को चिन्हित किया जब वह विशिष्ट दावे या कार्रवाई को सहायक प्रमाण के साथ दर्शा सके, और रिपोर्ट किए गए दरों को वार्तालाप की लंबाई के अनुसार समायोजित किया गया।
इंडेक्स की गणना करने के लिए, Arena प्रत्येक संकेत की चिन्हित दर को उस दर के वर्गमूल को एक से घटाकर परिवर्तित करता है, एक तरीका जिसे वह कहता है कि पूर्ण संरेखण के निकट सुधारों को दृश्यमान रखता है, फिर तीन स्कोर को मिलाकर Unauthorized Action पर 50% वज़न और False Attribution तथा Deceptive Completion पर प्रत्येक 25% वज़न देता है। कंपनी के अनुसार, उच्च मान एक अधिक सुरक्षित और बेहतर संरेखित मॉडल को दर्शाते हैं।
प्रारंभिक निष्कर्ष और अगले कदम
OpenAI के GPT-6.1 Sol ने प्रकाशित पूर्वावलोकन में 87.9 के साथ अग्रणी स्थान हासिल किया, इसके बाद Anthropic के Claude Opus 5.5 ने 83.2 और SpaceXAI के Grok 4.7 ने 82.7 अंक प्राप्त किए। Arena ने रिपोर्ट किया कि OpenAI मॉडल 27 मॉडलों में से शीर्ष पाँच स्थानों पर हैं, जिनमें से चार लगभग 88 अंक पर हैं।
Arena ने रिपोर्ट किया कि Claude Opus 5 सत्रों में लगभग 2% में अनधिकृत कार्रवाई शामिल थी, और उन मामलों में से 53.5% में उपयोगकर्ता की फ़ाइलों या पूर्व कार्य को बिना अनुमति हटाना या साफ़ करना शामिल था; Claude Opus 5.5 में यह सफ़ाई अनुपात 20.0% तक गिर गया। Deceptive completions ने औसतन 10% सत्रों को प्रभावित किया, कोड डिबगिंग में यह 48.0% तक बढ़ गया, जो किसी भी कार्य श्रेणी में सबसे अधिक दर है, जबकि अनधिकृत-क्रिया का पता कोड व्याख्या में 6.3% पर शिखर पर पहुँचा और false attribution पेशेवर लेखन में 13.7% पर सबसे अधिक था।
सभी तीन संकेतों में बातचीत की लंबाई बढ़ने के साथ पता लगाने की दरें बढ़ी: 20 या अधिक उपयोगकर्ता संदेशों वाले सत्रों में, धोखेबाज़ पूर्णता को 45.4% सत्रों में और अनधिकृत कार्रवाई को 12.4% सत्रों में चिह्नित किया गया। Arena ने यह भी बताया कि GPT, Claude, Gemini Flash और Grok श्रृंखलाओं के नवीनतम मॉडल अधिकांश संकेतों पर अपने पूर्ववर्तियों की तुलना में कम पता लगाने की दरें दिखाते हैं, और उल्लेख किया कि GPT-6.1 Sol की गलत अभिकथन दर GPT-6 Sol की तुलना में थोड़ी अधिक है तथा Claude Opus 5 की अनधिकृत कार्रवाई की दर Claude Opus 4.8 की तुलना में थोड़ी अधिक है, जो अपवाद हैं।
Arena ने कहा कि वह सूचकांक में अधिक सुरक्षा-संबंधी संकेत जोड़ देगा, शुरू में यह देखेगा कि मॉडल हानिकारक प्रॉम्प्ट को कितनी अच्छी तरह अस्वीकार करते हैं, और इसे नए मॉडलों और वास्तविक‑विश्व सेटिंग्स तक विस्तारित करेगा जबकि लीडरबोर्ड संकेत को क्रमशः अपडेट करता रहेगा।












