विचार नेता
कैसे पूर्वाग्रह आपकी एआई/एमएल रणनीति को मार डालेगा और इसके बारे में क्या करना है
‘पूर्वाग्रह’ किसी भी प्रकार के मॉडल में एक स्थिति का वर्णन करता है जिसमें मॉडल प्रेरित करने वाले या इनपुट डेटा के लिए सटीक रूप से प्रतिक्रिया नहीं करता है क्योंकि इसे पर्याप्त उच्च-गुणवत्ता, विविध डेटा के साथ प्रशिक्षित नहीं किया गया है ताकि सटीक प्रतिक्रिया प्रदान की जा सके। एक उदाहरण होगा एप्पल की फेसियल रिकग्निशन फोन अनलॉक सुविधा, जो गहरी त्वचा टोन वाले लोगों के लिए हल्की त्वचा टोन के लोगों की तुलना में काफी अधिक दर से विफल रही। मॉडल को पर्याप्त गहरी त्वचा वाले लोगों की तस्वीरों पर प्रशिक्षित नहीं किया गया था। यह पूर्वाग्रह का एक अपेक्षाकृत कम जोखिम वाला उदाहरण था, लेकिन यही कारण है कि ईयू एआई अधिनियम ने मॉडल की प्रभावशीलता (और नियंत्रण) को बाजार में जाने से पहले साबित करने के लिए आवश्यकताओं को आगे बढ़ाया है। व्यावसायिक, वित्तीय, स्वास्थ्य या व्यक्तिगत स्थितियों पर प्रभाव डालने वाले मॉडल के आउटपुट वाले मॉडल पर भरोसा किया जाना चाहिए, या वे उपयोग नहीं किए जाएंगे।
डेटा के साथ पूर्वाग्रह से निपटना
उच्च-गुणवत्ता वाले डेटा की बड़ी मात्रा
कई महत्वपूर्ण डेटा प्रबंधन अभ्यासों के बीच, एआई/एमएल मॉडल में पूर्वाग्रह को दूर करने और कम करने के लिए एक प्रमुख घटक बड़ी मात्रा में उच्च-गुणवत्ता, विविध डेटा प्राप्त करना है। इसके लिए कई संगठनों के साथ सहयोग की आवश्यकता होती है जिनके पास ऐसा डेटा है। पारंपरिक रूप से, डेटा अधिग्रहण और सहयोग गोपनीयता और/या आईपी सुरक्षा चिंताओं से चुनौतित होते हैं – संवेदनशील डेटा मॉडल मालिक को भेजा नहीं जा सकता है, और मॉडल मालिक अपने आईपी को डेटा मालिक को लीक करने का जोखिम नहीं उठा सकता है। एक सामान्य काम के आसपास मॉक या सिंथेटिक डेटा के साथ काम करना है, जो उपयोगी हो सकता है लेकिन वास्तविक, पूर्ण-संदर्भ डेटा का उपयोग करने की तुलना में सीमाएं हैं। यहीं पर गोपनीयता-सुधार प्रौद्योगिकियां (पीईटी) बहुत जरूरी जवाब देती हैं।
सिंथेटिक डेटा: करीब, लेकिन पर्याप्त नहीं
सिंथेटिक डेटा वास्तविक डेटा की नकल करने के लिए कृत्रिम रूप से उत्पन्न किया जाता है। यह करना मुश्किल है, लेकिन एआई टूल्स के साथ थोड़ा आसान हो रहा है। अच्छी गुणवत्ता वाला सिंथेटिक डेटा वास्तविक डेटा के समान सुविधा दूरी होनी चाहिए, या यह उपयोगी नहीं होगा। गुणवत्तापूर्ण सिंथेटिक डेटा का उपयोग प्रशिक्षण डेटा की विविधता को प्रभावी ढंग से बढ़ाने के लिए किया जा सकता है bằng छोटे, हाशिए पर पड़े आबादी के लिए अंतराल को भरने के लिए, या ऐसी आबादी के लिए जिनके पास एआई प्रदाता के पास पर्याप्त डेटा नहीं है। सिंथेटिक डेटा का उपयोग वास्तविक दुनिया में पर्याप्त मात्रा में नहीं मिलने वाले किनारे के मामलों को संबोधित करने के लिए भी किया जा सकता है। इसके अलावा, संगठन सिंथेटिक डेटा सेट तैयार कर सकते हैं ताकि डेटा निवास और गोपनीयता आवश्यकताओं को संतुष्ट किया जा सके जो वास्तविक डेटा तक पहुंच को अवरुद्ध करते हैं। यह अच्छा लगता है; हालांकि, सिंथेटिक डेटा केवल पहेली का एक टुकड़ा है, समाधान नहीं।
सिंथेटिक डेटा की एक स्पष्ट सीमा वास्तविक दुनिया से डिस्कनेक्ट है। उदाहरण के लिए, केवल सिंथेटिक डेटा पर प्रशिक्षित स्वायत्त वाहन वास्तविक, अप्रत्याशित सड़क की स्थिति से जूझेंगे। इसके अलावा, सिंथेटिक डेटा वास्तविक दुनिया के डेटा से पूर्वाग्रह विरासत में मिलता है जिसका उपयोग इसे उत्पन्न करने के लिए किया जाता है – हमारे चर्चा का उद्देश्य लगभग हराना। निष्कर्ष में, सिंथेटिक डेटा फाइन-ट्यूनिंग और किनारे के मामलों को संबोधित करने के लिए एक उपयोगी विकल्प है, लेकिन मॉडल प्रभावशीलता में महत्वपूर्ण सुधार और पूर्वाग्रह को कम करने में अभी भी वास्तविक दुनिया के डेटा तक पहुंच पर निर्भर करता है।
एक बेहतर तरीका: पीईटी के माध्यम से वास्तविक डेटा
पीईटी डेटा की रक्षा करते हैं जबकि इसका उपयोग किया जा रहा है। एआई/एमएल मॉडल के संबंध में, वे मॉडल के चलने वाले आईपी की भी रक्षा कर सकते हैं – “एक पत्थर से दो पक्षी।” पीईटी का उपयोग करने वाले समाधान मॉडल को प्रशिक्षित करने के लिए वास्तविक, संवेदनशील डेटासेट का विकल्प प्रदान करते हैं जो पहले डेटा गोपनीयता और सुरक्षा चिंताओं के कारण सुलभ नहीं थे। यह वास्तविक डेटा तक पहुंच को अनलॉक करना पूर्वाग्रह को कम करने का सबसे अच्छा विकल्प है। लेकिन यह वास्तव में कैसे काम करेगा?
वर्तमान में, अग्रणी विकल्प एक गोपनीय कंप्यूटिंग वातावरण के साथ शुरू होते हैं। फिर, एक पीईटी आधारित सॉफ्टवेयर समाधान के साथ एक एकीकरण जो इसे तैयार करता है बॉक्स से बाहर उपयोग करने के लिए जबकि डेटा शासन और सुरक्षा आवश्यकताओं को संबोधित करता है जो एक मानक ट्रस्टेड एक्जीक्यूशन एनवायरनमेंट (TEE) में शामिल नहीं हैं। इस समाधान के साथ, मॉडल और डेटा दोनों गोपनीय कंप्यूटिंग वातावरण में भेजने से पहले एन्क्रिप्ट किए जाते हैं। वातावरण कहीं भी होस्ट किया जा सकता है, जो डेटा स्थानीयकरण आवश्यकताओं को संबोधित करते समय महत्वपूर्ण है। इसका मतलब है कि मॉडल आईपी और इनपुट डेटा की सुरक्षा दोनों की गणना के दौरान बनाए रखी जाती है – ट्रस्टेड एक्जीक्यूशन एनवायरनमेंट प्रदाता के पास भी इसके अंदर मॉडल या डेटा तक पहुंच नहीं है। एन्क्रिप्टेड परिणाम समीक्षा के लिए वापस भेजे जाते हैं और लॉग समीक्षा के लिए उपलब्ध होते हैं।
यह प्रवाह सर्वोत्तम गुणवत्ता वाले डेटा को अनलॉक करता है, चाहे वह कहीं भी हो या इसका स्वामित्व किसी के पास हो, जो पूर्वाग्रह को कम करने और हम पर भरोसा करने के लिए उच्च-प्रभावशीलता वाले मॉडल बनाने का मार्ग प्रदान करता है। यह प्रवाह वह है जिसका वर्णन ईयू एआई अधिनियम ने अपनी आवश्यकताओं में एक एआई नियामक सैंडबॉक्स के लिए किया है।
नैतिक और कानूनी अनुपालन को सुविधाजनक बनाना
अच्छी गुणवत्ता वाले वास्तविक डेटा प्राप्त करना कठिन है। डेटा गोपनीयता और स्थानीयकरण आवश्यकताएं तुरंत उन डेटासेट तक पहुंच को सीमित कर देती हैं जिन तक संगठन पहुंच सकते हैं। नवाचार और विकास के लिए होने के लिए, डेटा को उन लोगों तक पहुंचाने की आवश्यकता है जो इसका मूल्य निकाल सकते हैं।
ईयू एआई अधिनियम के अनुच्छेद 54 में “उच्च जोखिम” मॉडल प्रकार के लिए आवश्यकताओं को निर्धारित किया गया है जो बाजार में जाने से पहले साबित किया जाना चाहिए। संक्षेप में, टीमों को एक एआई नियामक सैंडबॉक्स के भीतर वास्तविक दुनिया के डेटा का उपयोग करके पर्याप्त मॉडल प्रभावशीलता और शीर्षक III अध्याय 2 में विस्तृत सभी नियंत्रणों के साथ अनुपालन प्रदर्शित करने की आवश्यकता होगी। नियंत्रणों में निगरानी, पारदर्शिता, व्याख्या, डेटा सुरक्षा, डेटा संरक्षण, डेटा कमी, और मॉडल सुरक्षा शामिल हैं – सोचें डेवसेक + डेटा ऑप्स।
पहली चुनौती वास्तविक दुनिया के डेटा सेट को खोजना होगा – जैसा कि ऐसे मॉडल प्रकार के लिए यह आंतरिक रूप से संवेदनशील डेटा है। तकनीकी गारंटी के बिना, कई संगठन अपने डेटा के साथ मॉडल प्रदाता पर भरोसा करने से हिचकिचा सकते हैं या ऐसा करने की अनुमति नहीं दी जा सकती है। इसके अलावा, अधिनियम द्वारा “एआई नियामक सैंडबॉक्स” की परिभाषा एक चुनौती है अपने आप में। कुछ आवश्यकताओं में शामिल हैं कि डेटा को मॉडल चलाने के बाद प्रणाली से हटा दिया जाना चाहिए, साथ ही साथ शासन नियंत्रण, प्रवर्तन, और यह साबित करने के लिए रिपोर्टिंग।
कई संगठनों ने आउट-ऑफ-द-बॉक्स डेटा क्लीन रूम (DCR) और ट्रस्टेड एक्जीक्यूशन एनवायरनमेंट (TEE) का उपयोग करने की कोशिश की है। लेकिन, अपने आप में, ये प्रौद्योगिकियां डेटा और एआई नियामक आवश्यकताओं को पूरा करने और संचालित करने के लिए महत्वपूर्ण विशेषज्ञता और काम की आवश्यकता होती है। डीसीआर का उपयोग करना आसान है, लेकिन अभी तक अधिक मजबूत एआई/एमएल आवश्यकताओं के लिए उपयोगी नहीं है। टीईई सुरक्षित सर्वर हैं और अभी भी एक एकीकृत सहयोग मंच की आवश्यकता है जो जल्दी से उपयोगी हो। यह, हालांकि, पीईटी प्लेटफार्मों को टीईई के साथ एकीकृत करने के अवसर की पहचान करता है ताकि उस काम को हटा दिया जा सके, सेटअप और एआई नियामक सैंडबॉक्स का उपयोग तेजी से कर सकें, और संवेदनशील डेटा का अधिग्रहण और उपयोग कर सकें।
विविध और व्यापक डेटासेट को गोपनीयता-संरक्षित तरीके से उपयोग करने की अनुमति देकर, ये प्रौद्योगिकियां यह सुनिश्चित करने में मदद करती हैं कि एआई और एमएल प्रथाओं का डेटा गोपनीयता से संबंधित नैतिक मानकों और कानूनी आवश्यकताओं (जैसे जीडीपीआर और यूरोप में ईयू एआई अधिनियम) के अनुरूप हो। सारांश में, जबकि आवश्यकताएं अक्सर सुनने योग्य ग्रंट्स और सिसकियों के साथ मिलती हैं, ये आवश्यकताएं वास्तव में हमें बेहतर मॉडल बनाने के लिए मार्गदर्शन कर रही हैं जिन पर हम भरोसा कर सकते हैं और महत्वपूर्ण डेटा-संचालित निर्णय लेने के लिए भरोसा कर सकते हैं जबकि मॉडल विकास और अनुकूलन के लिए उपयोग किए जाने वाले डेटा विषयों की गोपनीयता की रक्षा करते हुए यूरोप में।












