Anderson का एंगल
‘रोगी’ डेटा जनरेटिव एआई प्रदर्शन को प्रदूषित कर रहा है

एक नए अध्ययन में पाया गया है कि एआई मॉडलों को प्रशिक्षित करने के लिए उपयोग किए जाने वाले कई लोकप्रिय छवि डेटासेट परीक्षण छवियों या लगभग-डुप्लिकेट्स से दूषित हैं, जिससे मॉडलों को सीखने के बजाय उत्तरों को याद रखने की अनुमति मिलती है। रिसाव व्यापक है लेकिन आमतौर पर पता नहीं लगाया जाता है, और स्कोर को शांत रूप से बढ़ाता है और वेब-स्केल डेटा पर प्रशिक्षित मॉडलों को अनुचित लाभ प्रदान करता है।
जब आप ड्राइविंग टेस्ट देते हैं, तो आपको आमतौर पर पहले से नहीं बताया जाता है कि टेस्ट के लिए कौन से रास्ते उपयोग किए जाएंगे। यदि आप ऐसा करते हैं (और आप थोड़े नैतिक रूप से कमजोर हैं), तो आप टेस्ट के लिए ‘अनुकूलन’ कर सकते हैं bằng बार-बार उस मार्ग पर अभ्यास करके, बजाय इसके कि आप व्यापक ड्राइविंग कौशल विकसित करें जो किसी भी मार्ग को उचित रूप से संभाल सके।
मशीन लर्निंग मॉडलों के प्रशिक्षण में, यह एक तर्कसंगत तुलना है – एक परीक्षण विभाजन – प्रशिक्षण डेटा को 70% विभाजन के बीच विभाजित करना जो मॉडल को प्रशिक्षित करने के लिए उपयोग किया जाएगा, और शेष 30% ‘जंगली’ डेटा के रूप में उपयोग किया जाएगा।
चूंकि जंगली डेटा मॉडल द्वारा पहले कभी नहीं देखा गया है, यदि मॉडल उस डेटा पर अच्छा प्रदर्शन करता है, तो यह माना जा सकता है कि यह प्रभावी और कार्यात्मक है; यदि नहीं, तो मॉडल ओवरफिट हो सकता है एक संतुलित सेट पर – या डेटा को अतिरिक्त क्यूरेशन और परिभाषा की आवश्यकता है।
इसके अलावा, नहीं मॉडलों का उनके प्रशिक्षण डेटा पर मूल्यांकन करना वर्तमान में एआई अनुसंधान और विकास में मुख्य बिंदु है।
फिर से, कृपया
जापान से एक नए शोध पत्र के अनुसार, कंप्यूटर विजन और जनरेटिव एआई अनुसंधान क्षेत्र ने एलएलएम शोधकर्ताओं के प्रयासों को मेल नहीं किया है ताकि यह सुनिश्चित किया जा सके कि परीक्षण डेटा प्रशिक्षण डेटा को प्रदूषित न करे; परीक्षणों में, शोधकर्ताओं ने पाया कि उन्होंने जिन सभी हाइपरस्केल विजन डेटासेट का अध्ययन किया, जिनमें कुछ सबसे बड़े वर्तमान जनरेटिव एआई सिस्टम शामिल हैं, ने अपने परीक्षण डेटा को अपने प्रशिक्षण डेटा में कुछ हद तक पारित किया है – जिसका अर्थ है कि इन विभाजनों पर प्रशिक्षित मॉडलों के लिए बेंचमार्क और प्रदर्शन रिपोर्ट उतनी ही सटीक नहीं होंगी जितनी कि परीक्षा परिणाम होंगी। किसी के पास परीक्षा हॉल में एक क्रिब है।

शोधकर्ताओं द्वारा पाए गए डेटा के पार-संदूषण के उदाहरण, जहां डुप्लिकेट या लगभग-डुप्लिकेट डेटा बिंदु प्रशिक्षण और परीक्षण डेटा दोनों में मौजूद हैं। स्रोत: https://arxiv.org/pdf/2508.17416
उपरोक्त छवि में, नए पत्र से, हम देखते हैं कि विभिन्न मॉडलों के प्रशिक्षण और परीक्षण डेटा में डुप्लिकेट या लगभग-डुप्लिकेट डेटा बिंदुओं के उदाहरण – जो मॉडल के उस डेटा पर प्रदर्शन को अमान्य बनाता है, और हल्के से इसके सामान्य स्कोर को पूरे बोर्ड में बढ़ाता है, जिससे ऐसा लगता है कि मॉडल ने सामान्यीकरण का स्तर हासिल किया है जो वास्तव में नहीं हो सकता है।
मामलों को और जटिल बनाने के लिए, प्रदूषण विभिन्न परिदृश्यों में हो सकता है, जिसमें ‘प्री-प्रशिक्षण‘ शामिल है, जहां वज़न का उपयोग किया जाता है पुराने मॉडलों को ‘किक-स्टार्ट’ करने के लिए एक नए मॉडल को ‘किक-स्टार्ट’ करने के लिए। यदि अपस्ट्रीम, पुराना मॉडल नई डेटासेट में कुछ समान डेटा है जो प्री-प्रशिक्षण के लिए उपयोग की जा रही है, तो पार-संदूषण तब भी हो सकता है जब 70/30 या 80/20 विभाजन साफ हो।
सहसंबंध प्रभाव
यह लगभग निश्चित है कि यह बहुत ही नवीनतम डेटासेट में भी होगा: पिछले पांच वर्षों में, दृष्टि/भाषा डेटासेट का दायरा बहुत बढ़ गया है, न केवल वेब पर नवीनतम छवि डेटा को शामिल किया गया है, बल्कि पुराने, ऐतिहासिक डेटासेट में मौजूद बहुत सारे डेटा को फिर से काटा गया है।
इसके अलावा, अरबों छवियों को डुप्लिकेट और लगभग-डुप्लिकेट के लिए खोजने और फिल्टर करने के लिए स्वचालित दिनचर्या अब इतनी कठिन कार्य का सामना कर रही है कि स्वयं क्यूरेशन – इसकी लागत समय और पैसे के संदर्भ में – अब बजटीय सीमाओं के संदर्भ में माना जाना चाहिए
इस बीच, छवि डुप्लिकेशन कॉमन क्रॉल जैसे बड़े संग्रह के पीछे वेब-खनन की तरह की अधिक प्रथा का एक अनिवार्य परिणाम है, जो छवियों को पुनः पोस्ट और पुनः संपीड़ित करने और संपादित करने की सामान्य प्रथा के कारण है, और फ्लिप (अनुमति के बिना उपयोग की जाने वाली छवि के मामले में पता लगाने से बचने के लिए, उदाहरण के लिए) को लागू करना।
लेखकों का remark है*:
‘डेटा रिसाव एक व्यापक समस्या है, जो अधिकांश दृश्य डेटासेट में व्याप्त है। रिसाव मॉडलों की सामान्यीकरण क्षमता को धुंधला कर सकता है, जो विशेष रूप से समस्याग्रस्त है जब अलग-अलग डेटासेट पर प्रशिक्षित मॉडलों की तुलना की जाती है, जिससे अनुचित तुलना होती है। ‘
‘हम डेटासेट डिजाइनरों से इन मूल्यांकन के परिणामों पर ध्यान से विचार करने का आग्रह करते हैं। एक न्यायसंगत मॉडल मूल्यांकन के लिए, हम डुप्लिकेट डिटेक्टर का उपयोग करने की सलाह देते हैं जो कठिन और नरम रिसाव दोनों पर विचार करता है। ‘
‘आदर्श रूप से, रिसाव वाली छवियों को प्रशिक्षण सेट से हटा दिया जाना चाहिए, और यदि संभव नहीं है, तो उन्हें कम से कम परीक्षण सेट से हटा दिया जाना चाहिए।’
पत्र एक संख्या पर जोर देता है कि शोधकर्ताओं ने विशाल और लोकप्रिय डेटासेट पर परीक्षण किया – प्रत्येक ने कुछ स्तर के प्रदूषण का प्रदर्शन किया।
नया पत्र दृश्य डेटासेट में डेटा रिसाव शीर्षक से है, और ओसाका विश्वविद्यालय के तीन शोधकर्ताओं से है।
विधि
पत्र के लेखक रिसाव को तीन आयामों में परिभाषित करते हैं: मोडलिटी, कवरेज, और डिग्री।
मोडलिटी यह बताता है कि क्या केवल छवियां रिसाव होती हैं या छवियों और लेबल दोनों को उजागर किया जाता है; कवरेज यह पहचानता है कि क्या ओवरलैप एक ही डेटासेट के भीतर होता है या विभिन्न डेटासेट के बीच होता है; और डिग्री यह परिभाषित करता है कि क्या दोहराई गई सामग्री बिल्कुल समान है या केवल आसन्न है।
रिसाव के संबंध में, काम में दो परिदृश्यों पर विचार किया जाता है: इन्ट्रा-डेटासेट रिसाव (जहां मूल्यांकन छवियां एक ही डेटासेट के प्रशिक्षण विभाजन में पुनः प्रकट होती हैं), और इंटर-डेटासेट रिसाव (जहां एक डेटासेट से मूल्यांकन छवियां एक विभिन्न डेटासेट में मौजूद होती हैं जिसका उपयोग प्रशिक्षण के लिए किया जाता है)।
डिग्री के संबंध में, दो स्तर परिभाषित किए गए हैं: नरम रिसाव (जहां छवियां समान नहीं हैं लेकिन मामूली भिन्नताएं प्रदर्शित करती हैं), और कठिन रिसाव (जहां छवियां प्रशिक्षण और मूल्यांकन दोनों में बिल्कुल समान हैं)।
शोधकर्ता छवि पुनर्प्राप्ति के संदर्भ में रिसाव का पता लगाने के लिए छवि एनकोडर का उपयोग करके प्रत्येक छवि को एक विशेषता वेक्टर के रूप में प्रस्तुत करते हैं। प्रश्न सेट मूल्यांकन डेटा है, जबकि संग्रह प्रशिक्षण सेट है।
छोटे डेटासेट के लिए, प्रत्येक प्रश्न वेक्टर की तुलना कोसाइन समानता का उपयोग करके सीधे सभी प्रशिक्षण वेक्टर से की जाती थी। बड़े डेटासेट के लिए, एक फास इंडेक्स बनाया गया था ताकि के-निकटतम पड़ोसी (के-एनएन) खोज तेजी से हो सके।
चूंकि एनकोडर को सूक्ष्म समानता का पता लगाने के लिए पर्याप्त दृश्य जानकारी को पकड़ने की आवश्यकता है, लेकिन फिर भी बहुत बड़े डेटा के सामने कुशल रहना चाहिए, लेखकों ने स्टेबल डिफ्यूजन के लिए लायोन संग्रह के निर्माताओं द्वारा प्रदान किए गए पूर्व-गणना किए गए क्लिप विशेषताओं पर भरोसा किया।
डेटा और परीक्षण
नए काम के लिए उपयोग किए जाने वाले परीक्षणों में सीएलआईपी छवि एनकोडर मूल सीएलआईपी वीआईटी-बी/32 था जो मूल रूप से एलएआईओएन को छानने के लिए उपयोग किया गया था। विविध छवियों के संबंधित होने की स्थापना के लिए, के-निकटतम पड़ोसी का उपयोग ऑटोफास के तहत किया गया था।
डेटासेट को तीन प्रकारों में वर्गीकृत किया गया था: प्री-प्रशिक्षण डेटासेट – वेब-स्क्रैप किए गए बड़े संग्रह, सामान्य मॉडलों को प्रशिक्षित करने के लिए उपयोग किए जाते हैं; प्रशिक्षण डेटासेट – छोटे, अक्सर एनोटेटेड संग्रह, सीधे मॉडल ट्यूनिंग के लिए उपयोग किए जाते हैं; और बेंचमार्क डेटासेट – मैन्युअल रूप से एनोटेटेड, और केवल मूल्यांकन के लिए उपयोग किए जाते हैं।
विश्लेषण में सात डेटासेट में बीस विभाजन शामिल थे: माइक्रोसॉफ्ट सीओसीओ का उपयोग प्रशिक्षण और मूल्यांकन दोनों सेट के रूप में किया गया था, जिसमें प्रशिक्षण, सत्यापन, परीक्षण और अनलेबल्ड विभाजन शामिल थे; फ्लिकर 30 के का उपयोग केवल एक बेंचमार्क के रूप में किया गया था; और गूगल कॉन्सेप्टुअल कैप्शन (जीसीसी) संग्रह का उपयोग प्री-प्रशिक्षण स्रोत के रूप में किया गया था, जिसमें इसका सत्यापन भाग मूल्यांकन के लिए भी उपयोग किया गया था।
इसके अलावा, इमेजनेट का उपयोग प्रशिक्षण और बेंचमार्किंग दोनों के लिए किया गया था, जबकि लायोन -400 एम डेटासेट का उपयोग केवल प्री-प्रशिक्षण के लिए किया गया था।
ओपनइमेजेस वी 4 ने प्रशिक्षण और बेंचमार्क डेटा दोनों का योगदान दिया, और टेक्स्टकैप्स ने मूल्यांकन के लिए प्रशिक्षण और परीक्षण विभाजन दोनों प्रदान किए।

गूगल के ओपन इमेजेस डेटासेट से छवि एनोटेशन के उदाहरण, नए काम में जांचे गए। स्रोत: https://arxiv.org/pdf/1811.00982
यह देखने के लिए कि विधि छवियों को सूक्ष्म रूप से बदलने पर रिसाव का पता लगाने में कितनी अच्छी तरह काम करती है, जैसे कि आकार बदलना, फसल, या समान गैर-semantic रूपांतरण, लेखकों ने फ्लिकर 30 के पर परीक्षण किया, 5,000 छवियों को यादृच्छिक रूप से प्रश्न के रूप में चुना, और पूरे डेटासेट का उपयोग संदर्भ संग्रह के रूप में किया।
प्रत्येक प्रश्न छवि को संकoded करने से पहले परिवर्तित किया गया था (अर्थात, गैर-semantic संशोधन जैसे आकार बदलना या फसल), और फिर कोसाइन समानता का उपयोग करके संग्रह में सबसे समान आइटम से मेल खाता था; एक मेल खाता था केवल तभी गिना जाता था जब मूल छवि शीर्ष परिणाम के रूप में पुनर्प्राप्त की जाती थी।
तीन एनकोडरों की तुलना की गई: रेसनेट -152; डीआईएनओवी 2 वीआईटी-बी / 14; और सीएलआईपी वीआईटी-बी / 32।
चार प्रकार के गैर-semantic छवि परिवर्तनों का उपयोग किया गया था: ज्यामितीय (फ्लिप और घुमाव); फसल (प्रत्येक किनारे से 20, 50, या 100 पिक्सल को हटाना); पिक्सेलीकरण (गॉसियन धुंधला, जोड़ा शोर, या 128 या 256 पिक्सल तक डाउनसैम्पल करना); और रंग (ग्रेस्केल, उल्टा, या लाल, हरा, या नीला ओवरले)।

पूरक सामग्री से, डेटा में लागू किए गए परिवर्तनों के उदाहरण – डेटा ऑगमेंटेशन प्रीप्रोसेसिंग में भी आम दिनचर्या।
लेखकों ने तब छवि पुनर्प्राप्ति में रिसाव के लिए परीक्षण किया:

5,000 फ्लिकर 30 के प्रश्न छवियों पर रिसाव का पता लगाने की सटीकता जो विभिन्न गैर-semantic परिवर्तनों के अधीन थीं।
तीनों एनकोडरों ने असंशोधित छवियों पर उत्कृष्ट प्रदर्शन किया, और सीएलआईपी फसल, क्षैतिज फ्लिप, शोर, और आकार बदलने पर भरोसेमंद बना रहा, रेसनेट को पिक्सेल स्तर और रंग परिवर्तनों पर पार करते हुए।
डीआईएनओवी 2 ने रंग परिवर्तनों (संभवतः इसके स्व-पर्यवेक्षित डिजाइन के कारण, लेखकों का मत है) के प्रति मजबूत प्रतिरोध दिखाया, लेकिन ज्यामितीय संपादित और फसल पर कमजोर था – दोनों ही डुप्लिकेट डेटासेट में सामान्य हैं।
चूंकि लायोन में पहले से ही सीएलआईपी एम्बेडिंग शामिल है, और इसकी निरंतर मजबूती और गति को देखते हुए, सीएलआईपी को मुख्य विश्लेषण के लिए डिफ़ॉल्ट एनकोडर के रूप में चुना गया था।
कठिन और नरम रिसाव
प्रदर्शन का मूल्यांकन विभिन्न कोसाइन समानता थ्रेशोल्ड के साथ किया गया ताकि समान और लगभग-डुप्लिकेट छवियों (कठिन और नरम रिसाव) के बीच अंतर किया जा सके।
कठिन रिसाव को परिभाषित करने के लिए 0.98 का थ्रेशोल्ड चुना गया था, जिसके परिणामस्वरूप कोई गलत सकारात्मक नहीं था और समान छवियों का पता लगाने में उत्कृष्टता थी।
नरम रिसाव के लिए, 0.95 का थ्रेशोल्ड चुना गया था, जिससे अधिक लगभग-डुप्लिकेट पुनर्प्राप्त किए जा सकते थे, जबकि लगभग-शून्य गलत सकारात्मक दर बनाए रखी जा सकती थी। सटीकता पर पुनरावृत्ति को प्राथमिकता दी गई, और परिणामों को रूढ़िवादी तरीके से अनुमानित किया गया:

रिसाव का पता लगाने के लिए थ्रेशोल्ड के चयन के लिए रिसीवर ऑपरेटिंग विशेषता वक्र का उपयोग किया गया। दोनों परिवर्तित और परिवर्तित नहीं की गई स्थितियों के तहत उच्च एयूसी स्कोर यह दर्शाते हैं कि लगभग-डुप्लिकेट को अन्यथा असंबंधित छवियों से विश्वसनीय रूप से अलग किया जा सकता है, यहां तक कि जब न्यूनतम परिवर्तन मौजूद हों।
इन्ट्रा-डेटासेट रिसाव
इन्ट्रा-डेटासेट रिसाव को प्रशिक्षण और मूल्यांकन विभाजन के बीच छवि ओवरलैप की पहचान करके गणना किया गया था – एक ही डेटासेट के भीतर। केवल उन डेटासेट पर विश्लेषण किया गया था जिनमें बेंचमार्क और प्रशिक्षण या प्री-प्रशिक्षण विभाजन दोनों थे; कोको, जीसीसी, इमेजनेट, ओपनइमेजेस, और टेक्स्टकैप्स।
कोको के लिए, परीक्षण सेट की तुलना प्रशिक्षण सेट, मूल्यांकन सेट, और अनलेबल्ड उपसेट से की गई, और सत्यापन सेट की तुलना प्रशिक्षण और अनलेबल्ड उपसेट से की गई।
इन्ट्रा-डेटासेट रिसाव की उच्चतम दर इमेजनेट के परीक्षण और सत्यापन विभाजन में देखी गई, जिसमें कठिन रिसाव 1.58% तक पहुंच गया और नरम रिसाव 2% से कम था। जीसीसी और कोको इसके बाद आए, कोको वैल 2017 में 3% का नरम रिसाव दिखा रहा था, और इसके परीक्षण विभाजन 1.35% और 1.38% के बीच थे। ओपनइमेजेस में कठिन रिसाव 0.05% पर कम था, लेकिन नरम रिसाव दोनों परीक्षण और सत्यापन सेट में 1.3% से अधिक था। टेक्स्टकैप्स में कुल रिसाव 0.69% पर सबसे कम था, जिसमें कोई कठिन रिसाव नहीं देखा गया:

इन्ट्रा-डेटासेट रिसाव दर, प्रत्येक मूल्यांकन विभाजन के साथ जुड़े प्रशिक्षण डेटा के साथ ओवरलैप के अनुपात को दिखा रहा है।












