एआई मॉडल और प्लेटफ़ॉर्म

एआई मॉडल बेसिक क्लॉक रीडिंग में फंस जाते हैं, जबकि मनुष्य उत्कृष्टता प्राप्त करते हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एक व्यापक अध्ययन ने 11 प्रमुख एआई मॉडलों को मानवों के साथ एनालॉग घड़ियों को पढ़ने के लिए परीक्षण किया है, जिसमें वर्तमान कृत्रिम बुद्धिमत्ता प्रणालियों में एक आश्चर्यजनक कमजोरी का खुलासा हुआ है। जबकि मानवों ने 89.1% सटीकता के साथ समय बताने में उत्कृष्टता प्राप्त की, गूगल के सर्वश्रेष्ठ प्रदर्शन वाले मॉडल ने उसी परीक्षण में केवल 13.3% सटीकता प्राप्त की।

क्लॉकबेंच अध्ययन, जिसे शोधकर्ता अलेक साफर द्वारा आयोजित किया गया था, यह प्रदर्शित करता है कि सबसे उन्नत एआई प्रणालियां भी दृश्य कार्यों के साथ संघर्ष करती हैं जिन्हें अधिकांश लोग बचपन में ही मास्टर कर लेते हैं। बेंचमार्क ने गूगल, ओपनएआई, एंथ्रोपिक, और अन्य प्रमुख एआई प्रयोगशालाओं से प्रणालियों का परीक्षण किया, जिसमें 180 कस्टम-डिज़ाइन की गई एनालॉग घड़ियों का उपयोग किया गया था।

यह घड़ियों से परे जाता है। परिणाम दृश्य जानकारी के बारे में तर्क करने और प्रसंस्करण में एआई प्रणालियों में मूलभूत सीमाओं को उजागर करते हैं। “एनालॉग घड़ियों को पढ़ना दृश्य स्थान में तर्क करने के लिए एक उच्च मानक निर्धारित करता है,” साफर शोध पत्र में नोट करते हैं। इस कार्य के लिए मॉडलों को घड़ी की सुइयों की पहचान करने, उनके संबंधों को समझने और दृश्य स्थिति को संख्यात्मक समय में अनुवाद करने की आवश्यकता होती है।

त्रुटि पैटर्न की जांच करने पर प्रदर्शन अंतर और भी चौंकाने वाला हो जाता है। जब मानवों ने गलतियां कीं, तो मध्य त्रुटि केवल तीन मिनट थी। एआई मॉडल, इसके विपरीत, एक से तीन घंटे तक चूक गए – लगभग 12 घंटे की घड़ी पर यादृच्छिक अनुमान लगाने के बराबर।

विशिष्ट कमजोरियों का खुलासा

एआई प्रणालियों ने विशेष रूप से संघर्ष किया:

  • रोमन संख्याएं (3.2% सटीकता)
  • आइने में या उल्टी घड़ी के चेहरे
  • रंगीन पृष्ठभूमि या जटिल डिज़ाइन
  • सेकंड की सुई वाली घड़ियां जिन्हें सटीक पढ़ने की आवश्यकता होती है

दिलचस्प बात यह है कि जब एआई मॉडल एक घड़ी को सफलतापूर्वक पढ़ लेते हैं, तो वे समय जोड़ने या समय क्षेत्र बदलने जैसे अनुवर्ती कार्यों में अच्छा प्रदर्शन करते हैं। यह सुझाव देता है कि मूल चुनौती प्रारंभिक दृश्य मान्यता में निहित है, न कि गणितीय तर्क में।

उद्योग प्रदर्शन विभाजन

गूगल के मॉडलों ने अग्रणी प्रदर्शन किया, जिसमें जेमिनी 2.5 प्रो ने 13.3% सटीकता हासिल की और जेमिनी 2.5 फ्लैश ने 10.5% हासिल की। ओपनएआई का जीपीटी-5 8.4% स्कोर किया, जबकि एंथ्रोपिक के क्लॉड मॉडल ने कम प्रदर्शन किया, जिसमें क्लॉड 4 सोनेट 4.2% पर और क्लॉड 4.1 ओपस 5.6% पर रहा।

xAI का ग्रोक 4 आश्चर्यजनक रूप से 0.7% सटीकता के साथ खराब प्रदर्शन किया, हालांकि यह मॉडल द्वारा 63% घड़ियों को असंभव समय दिखाने के लिए गलत तरीके से झंडा लगाने से उत्पन्न हुआ, जब वास्तव में केवल 20.6% ऐसा करते थे।

स्रोत: अलेक साफर

एआई विकास के लिए व्यापक निहितार्थ

अध्ययन “मानवों के लिए आसान, एआई के लिए कठिन” बेंचमार्क दृष्टिकोण पर आधारित है, जैसा कि आर्क-एजीआई और सिम्पलबेंच जैसे परीक्षणों में देखा गया है। जबकि एआई प्रणालियों ने ज्ञान-गहन कार्यों पर तेजी से विजय प्राप्त की है और कई मानक परीक्षणों पर मानव प्रदर्शन को भी पार कर लिया है, मूल दृश्य तर्क अभी भी समस्याग्रस्त बना हुआ है।

शोध से पता चलता है कि वर्तमान स्केलिंग दृष्टिकोण दृश्य तर्क चुनौतियों का समाधान नहीं कर सकते हैं। साफर का अनुमान है कि एनालॉग घड़ियां प्रशिक्षण डेटा में कम प्रतिनिधित्व कर सकती हैं और दृश्य घड़ी प्रतिनिधित्व को तर्क के लिए पाठ में अनुवाद करने से अतिरिक्त जटिलताएं उत्पन्न हो सकती हैं।

क्लॉकबेंच उन बेंचमार्क्स के बढ़ते संग्रह में शामिल हो जाता है जो एआई सीमाओं की पहचान करने के लिए डिज़ाइन किए गए हैं जो पारंपरिक परीक्षणों पर प्रदर्शन से तुरंत स्पष्ट नहीं होते हैं। पूर्ण डेटासेट भविष्य के एआई प्रशिक्षण को दूषित करने से रोकने के लिए निजी रहता है, केवल छोटे नमूने सार्वजनिक परीक्षण के लिए बने रहते हैं।

परिणाम यह प्रश्न उठाते हैं कि क्या मौजूदा एआई विकास दृष्टिकोण इन दृश्य तर्क अंतराल को संबोधित कर सकते हैं या क्या पूरी तरह से नए दृष्टिकोण की आवश्यकता होगी – जैसा कि परीक्षण-समय कंप्यूटिंग ने अन्य डोमेन में प्रगति को अनलॉक किया है।

अब के लिए, विनम्र एनालॉग घड़ी कृत्रिम बुद्धिमत्ता के खिलाफ एक अप्रत्याशित किले के रूप में खड़ी है, जो लगभग किसी भी मानव द्वारा पढ़ी जा सकती है लेकिन दुनिया की सबसे जटिल एआई प्रणालियों को भ्रमित करती है।

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।