साक्षात्कार
एमी स्टीयर, ग्रेटेल.एआई में प्रिंसिपल मशीन लर्निंग साइंटिस्ट – साक्षात्कार श्रृंखला

एमी स्टीयर ग्रेटेल.एआई में प्रिंसिपल मशीन लर्निंग साइंटिस्ट हैं, जो दुनिया का सबसे उन्नत गोपनीयता इंजीनियरिंग प्लेटफ़ॉर्म है। ग्रेटेल डेटा-चालित प्रौद्योगिकी के ताने-बाने में गोपनीयता को डिज़ाइन द्वारा आसानी से एम्बेड करना संभव बनाता है। इसके एआई-आधारित, ओपन-सोर्स लाइब्रेरी संवेदनशील जानकारी को परिवर्तित करने, गुमनाम करने और संश्लेषित करने के लिए डिज़ाइन की गई हैं।
एमी एक अत्यधिक प्रतिभाशाली मशीन लर्निंग और डेटा साइंटिस्ट हैं जिनके पास 20 से अधिक वर्षों का अनुभव है। उनका जुनून बड़े डेटा और मशीन लर्निंग, डेटा माइनिंग, आर्टिफ़िशियल इंटेलिजेंस और सांख्यिकी से तकनीकों का उपयोग करके उसे उजागर करने के लिए है। वह पूर्वानुमान मॉडलिंग, वर्गीकरण, क्लस्टरिंग, असामान्य पता लगाने, डेटा दृश्यीकरण, समूह विधियों, जानकारी पुनर्प्राप्ति, साइबर सुरक्षा विश्लेषण, एनएलपी, अनुशंसा मॉडल और उपयोगकर्ता व्यवहार विश्लेषण में अत्यधिक कुशल हैं।
आपको कंप्यूटर विज्ञान और मशीन लर्निंग में करियर बनाने के लिए क्या आकर्षित किया?
मेरा शुद्ध, बेशर्म, दीर्घकालिक डेटा के प्रति प्यार। डेटा की शक्ति, रहस्य, आकर्षण और संभावना ने मुझे हमेशा आकर्षित किया है। कंप्यूटर विज्ञान और मशीन लर्निंग डेटा की संभावना को हार्नेस करने के लिए उपकरण हैं। यह एक ऐसे क्षेत्र में काम करने के लिए बहुत मजेदार है जहां राज्य की कला बहुत तेजी से आगे बढ़ रही है। मुझे अनुसंधान और उत्पाद का संगम बहुत पसंद है। यह बहुत संतोषजनक है जब आप कटिंग-एज विचारों को थोड़ा आगे बढ़ाते हैं और फिर उन्हें मौजूदा उत्पाद आवश्यकताओं के अनुसार आकार देते हैं।
जो पाठक परिचित नहीं हैं, वे सिंथेटिक डेटा क्या है इसकी व्याख्या कर सकते हैं?
सिंथेटिक डेटा वह डेटा है जो मूल डेटा की तरह दिखता है और कार्य करता है, लेकिन पर्याप्त रूप से अलग है कि यह कुछ उपयोग के मामले को संतुष्ट करता है। सबसे आम उपयोग का मामला मूल डेटा में जानकारी की गोपनीयता की रक्षा करने की आवश्यकता है। एक अन्य उपयोग का मामला मूल डेटासेट के आकार को बढ़ाने के लिए अतिरिक्त डेटा बनाने की आवश्यकता है। एक और उपयोग का मामला मूल डेटासेट में वर्ग असंतुलन या जनसांख्यिकीय पूर्वाग्रह को संबोधित करने में मदद करना है।
सिंथेटिक डेटा हमें नए और नवाचारी उत्पादों और समाधानों को विकसित करने की अनुमति देता है जब आवश्यक डेटा अन्यथा मौजूद या उपलब्ध नहीं होगा।
ग्रेटेल प्लेटफ़ॉर्म एपीआई के माध्यम से सिंथेटिक डेटा कैसे बनाता है?
ग्रेटेल गोपनीयता इंजीनियरिंग एपीआई आपको ग्रेटेल में डेटा को निगलने और निकालने वाले डेटा का अन्वेषण करने की अनुमति देते हैं। ये वही एपीआई हैं जिनका उपयोग हमारे कंसोल द्वारा किया जाता है। एपीआई को उजागर करके, हम विकासकर्ताओं और डेटा वैज्ञानिकों को ग्रेटेल के आसपास अपने कार्यप्रवाह बनाने के लिए सशक्त बनाने की उम्मीद करते हैं।
कंसोल सिंथेटिक डेटा बनाना बहुत आसान बनाता है, लेकिन एपीआई आपको अपने कार्यप्रवाह में सिंथेटिक डेटा बनाने को एकीकृत करने की अनुमति देते हैं। मुझे एपीआई का उपयोग करना पसंद है क्योंकि यह मुझे सिंथेटिक डेटा बनाने को एक विशिष्ट उपयोग के मामले में अनुकूलित करने की अनुमति देता है।
ग्रेटेल द्वारा प्रदान किए जाने वाले कुछ उपकरणों पर चर्चा करें जो सिंथेटिक डेटा की गुणवत्ता का मूल्यांकन करने में मदद करते हैं?
सिंथेटिक डेटा बनाने के बाद, ग्रेटेल एक सिंथेटिक रिपोर्ट बनाएगा। इस रिपोर्ट में आप सिंथेटिक डेटा गुणवत्ता स्कोर (एसक्यूएस) और गोपनीयता सुरक्षा स्तर ग्रेड (पीपीएल) देख सकते हैं।
एसक्यूएस स्कोर एक अनुमान है कि जेनरेट किए गए सिंथेटिक डेटा में मूल डेटासेट के समान सांख्यिकीय गुणों को कितनी अच्छी तरह से बनाए रखा गया है। इस अर्थ में, एसक्यूएस स्कोर को एक उपयोगिता स्कोर या एक विश्वास स्कोर के रूप में देखा जा सकता है कि क्या वैज्ञानिक निष्कर्ष जो सिंथेटिक डेटासेट से निकाले जाते हैं वे समान होंगे यदि आप मूल डेटासेट का उपयोग करते हैं।
सिंथेटिक डेटा गुणवत्ता स्कोर व्यक्तिगत गुणवत्ता मेट्रिक्स को जोड़कर गणना की जाती है: फील्ड वितरण स्थिरता, फील्ड संबंध स्थिरता और गहरी संरचना स्थिरता।
फील्ड वितरण स्थिरता एक माप है कि सिंथेटिक डेटा में मूल डेटा के समान फील्ड वितरण कितनी अच्छी तरह से बनाए रखा गया है। फील्ड संबंध स्थिरता एक माप है कि फील्ड के बीच संबंध कितनी अच्छी तरह से सिंथेटिक डेटा में बनाए रखा गया है। और अंत में, गहरी संरचना स्थिरता गहरी, बहु-फील्ड वितरण और संबंधों की सांख्यिकीय अखंडता को मापती है। इसका अनुमान लगाने के लिए, ग्रेटेल मूल डेटा पर पहले एक प्रिंसिपल घटक विश्लेषण (पीसीए) करता है, फिर सिंथेटिक डेटा पर फिर से।
ग्रेटेल गोपनीयता फिल्टर कैसे काम करते हैं?
ग्रेटेल गोपनीयता फिल्टर सिंथेटिक डेटा पर प्रतिकूल हमलों की प्रकृति पर किए गए शोध का परिणाम है। गोपनीयता फिल्टर सिंथेटिक डेटा में कमजोरियों के निर्माण को रोकते हैं जो प्रतिकूल लोगों द्वारा शोषण किया जा सकता है। हमारे पास दो गोपनीयता फिल्टर हैं, पहला समानता फिल्टर है और दूसरा आउटलियर फिल्टर है। समानता फिल्टर सिंथेटिक रिकॉर्ड के निर्माण को रोकता है जो एक प्रशिक्षण रिकॉर्ड के समान हैं। ये प्रतिकूल लोगों के लिए मूल डेटा में अंतर्दृष्टि प्राप्त करने के लिए प्राथमिक लक्ष्य हैं। दूसरा गोपनीयता फिल्टर आउटलियर फिल्टर है। यह सिंथेटिक रिकॉर्ड के निर्माण को रोकता है जो प्रशिक्षण डेटा द्वारा परिभाषित स्थान में एक आउटलियर होगा। आउटलियर्स को सिंथेटिक डेटासेट में प्रकट किया जा सकता है और प्रतिकूल हमलों द्वारा शोषण किया जा सकता है। वे एक गंभीर गोपनीयता जोखिम हैं।
सिंथेटिक डेटा एआई पूर्वाग्रह को कम करने में कैसे मदद कर सकता है?
सबसे आम तकनीक डेटा में प्रतिनिधित्व पूर्वाग्रह को संबोधित करना है जो एआई प्रणाली में खिलाया जाता है। उदाहरण के लिए, यदि आपके डेटा में एक मजबूत वर्ग असंतुलन है या आपके डेटासेट में जनसांख्यिकीय पूर्वाग्रह है, तो ग्रेटेल उपकरण प्रदान करता है जो असंतुलन को मापने और सिंथेटिक डेटा में इसे हल करने में मदद करते हैं। डेटा में पूर्वाग्रह को हटाकर, आप अक्सर एआई प्रणाली में पूर्वाग्रह को भी हटा देते हैं जो डेटा पर बनाया गया है।
आप नए मशीन लर्निंग प्रौद्योगिकियों के बारे में जानने का आनंद लेते हैं, आप व्यक्तिगत रूप से सभी परिवर्तनों के साथ कैसे रहते हैं?
पढ़ें, पढ़ें, और फिर पढ़ें, लोल! मुझे अपने दिन की शुरुआत नए एमएल प्रौद्योगिकियों के बारे में पढ़कर करना पसंद है। मुझे टूवर्ड्स डेटा साइंस, एनालिटिक्स विद्या और समाचार पत्रों जैसे द सीक्वेंस में लेख पढ़ना पसंद है। फेसबुक एआई, गूगल एआई और ओपनमाइंड जैसे ब्लॉग हैं जो बहुत अच्छे हैं। न्यूरिप्स, आईसीएमएल, आईसीएलआर, एआईएसटीएटीएस जैसे कई अच्छे सम्मेलन हैं जिनका पालन करना है।
मुझे ऐसे उपकरण भी पसंद हैं जो उद्धरण ट्रेल्स को ट्रैक करते हैं, आपको पसंदीदा लेखों के समान लेख खोजने में मदद करते हैं और जो आपकी विशिष्ट रुचियों को जानते हैं और पृष्ठभूमि में एक लेख की तलाश में रहते हैं जो आपको रुचिकर लग सकता है। ज़ेटा अल्फा एक ऐसा उपकरण है जिसका मैं बहुत उपयोग करता हूं।
अंत में, आप अपने सहयोगियों के साथ समान रुचियों के लाभ को कम नहीं आंक सकते हैं। ग्रेटेल में, एमएल टीम उन शोध पत्रों को ट्रैक करती है जो हम जिस क्षेत्र में अन्वेषण करते हैं और अक्सर दिलचस्प पत्रों पर चर्चा करने के लिए मिलते हैं।
मशीन लर्निंग के भविष्य के लिए आपकी दृष्टि क्या है?
डेटा तक आसान पहुंच मशीन लर्निंग में एक महान नवाचार युग की शुरुआत करेगी जो स्वास्थ्य सेवा, वित्त, विनिर्माण और जीव विज्ञान जैसे क्षेत्रों में नवाचार को बढ़ावा देगी। ऐतिहासिक रूप से, एमएल में कई ग्राउंड-ब्रेकिंग प्रगति को बड़ी मात्रा में समृद्ध डेटा के लिए जिम्मेदार ठहराया जा सकता है। हालांकि, ऐतिहासिक रूप से, बहुत सारे शोध को डेटा तक पहुंच या साझा करने में असमर्थता के कारण बाधित किया गया है क्योंकि गोपनीयता चिंताओं के कारण। जैसे ही ग्रेटेल जैसे उपकरण इस बाधा को हटा देते हैं, डेटा तक पहुंच लोकतांत्रिक हो जाएगी। पूरा मशीन लर्निंग समुदाय समृद्ध, बड़े डेटासेट तक पहुंच से लाभान्वित होगा, न कि केवल कुछ शीर्ष मेगा-कंपनियों के लिए।
क्या ग्रेटेल के बारे में और कुछ है जो आप साझा करना चाहेंगे?
यदि आप डेटा से प्यार करते हैं, तो आप ग्रेटेल से प्यार करेंगे (तो मुझे स्पष्ट रूप से ग्रेटेल से प्यार है!)। डेटा तक आसान पहुंच हर डेटा वैज्ञानिक के लिए एक कांटा रही है जिसे मैंने कभी जाना है। ग्रेटेल में, हमें गर्व है कि हमने एक कंसोल और एपीआई सेट बनाया है जो निजी, साझा करने योग्य डेटा बनाना संभव बनाता है। हम दृढ़ता से विश्वास करते हैं कि डेटा तब अधिक मूल्यवान होता है जब यह साझा किया जाता है।
धन्यवाद महान साक्षात्कार के लिए और अपने अंतर्दृष्टि साझा करने के लिए, पाठक जो अधिक जानना चाहते हैं उन्हें ग्रेटेल.एआई पर जाना चाहिए।












