एआई मॉडल और प्लेटफ़ॉर्म

डेटागेन ने एआई के लिए सिंथेटिक डेटा बनाने के लिए $18 मिलियन का निवेश हासिल किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

इज़राइली स्टार्टअप कंपनी डेटागेन ने हाल ही में $18.5 मिलियन डॉलर जुटाए हैं एक प्लेटफ़ॉर्म बनाने के लिए जो एआई कंपनियों के लिए सिंथेटिक डेटा बनाता है।

किसी भी कृत्रिम बुद्धिमत्ता कंपनी को एक ही मूल चुनौती का सामना करना पड़ता है, अपने एआई मॉडल को प्रशिक्षित करने के लिए आवश्यक डेटा एकत्र करना। उच्च-गुणवत्ता वाले प्रशिक्षण डेटा की आवश्यकता इतनी अधिक है कि इसके लिए एक पूरा उप-उद्योग बन गया है जो एआई कंपनियों को अपने मॉडल को प्रशिक्षित करने के लिए आवश्यक डेटा प्रदान करता है। एआई और एआई-संबंधित कंपनियां हमेशा अपने लिए आवश्यक डेटा प्राप्त करने के नए तरीकों की तलाश में रहती हैं। इस प्रशिक्षण डेटा को प्राप्त करने का एक तरीका यह है कि बस इसे बनाया जाए या उत्पन्न किया जाए।

फॉर्च्यून की रिपोर्ट के अनुसार, डेटागेन अपने स्वयं के मशीन लर्निंग मॉडल का उपयोग करके अन्य कंपनियों के लिए सिंथेटिक डेटा बनाने में माहिर है, विशेष रूप से छवि और वीडियो डेटा। कंपनी द्वारा उत्पन्न डेटा तब उनके ग्राहकों द्वारा अपने स्वयं के एआई मॉडल को प्रशिक्षित करने के लिए उपयोग किया जाता है। डेटागेन के सीईओ और संस्थापक, ऑफिर चाकोन के अनुसार, कंपनी कुछ घंटों में एक पूरी सिंथेटिक डेटासेट बना सकती है। यह आमतौर पर डेटासेट को उपयोग के लिए तैयार करने में लगने वाले समय से काफी तेज है, जो अक्सर सप्ताह या महीनों की लेबलिंग डेटा होती है।

कंपनियों के लिए सिंथेटिक डेटा आकर्षक होने के अलावा इसके कई अन्य कारण हैं, जो इसकी तैयारी की तुलनात्मक गति के अलावा हैं। सिंथेटिक डेटा वास्तविक डेटा की तरह गोपनीयता संबंधी चिंताओं के साथ नहीं आता है। जैसे ही अधिक कानून लोगों के डेटा की गोपनीयता की रक्षा के लिए बनाए जाते हैं, सिंथेटिक प्रशिक्षण डेटा होना अधिक आकर्षक हो जाता है। प्रौद्योगिकी विश्लेषण फर्म गार्टनर द्वारा दिए गए एक अनुमान के अनुसार, 2023 तक दुनिया की लगभग 65% आबादी के डेटा को कुछ प्रकार के डेटा गोपनीयता कानून द्वारा संरक्षित किया जाएगा।

हालांकि सिंथेटिक डेटा वास्तविक लोगों पर आधारित नहीं है, फिर भी यह पूर्वाग्रह से ग्रस्त हो सकता है। सिंथेटिक डेटा मॉडल द्वारा उत्पन्न डेटा में मूल प्रशिक्षण डेटा के समान पैटर्न होंगे, जिसका अर्थ है कि यदि डेटासेट पूर्वाग्रह से ग्रस्त है तो नए उत्पन्न डेटा में भी वे पूर्वाग्रह मौजूद होंगे। डेटागेन में उत्पन्न डेटा में डेटा पूर्वाग्रह को कम करने के लिए रणनीतियाँ हैं। सिंथेटिक डेटा में पूर्वाग्रह को कम करने के लिए एक तरीका दुर्लभ घटनाओं की घटना दर को बढ़ाना है, जिसका अर्थ है कि यदि डेटासेट में एक वर्ग कम प्रतिनिधित्व किया जाता है तो इसकी घटना दर को अधिक समान बनाने के लिए बढ़ाया जा सकता है।

दुर्लभ घटनाओं की घटना दर को बढ़ाने की तकनीक संभावित रूप से खतरनाक परिदृश्यों से संबंधित डेटासेट बनाने के लिए बहुत महत्वपूर्ण है। एक स्वायत्त वाहन के लिए उपयोग किए जाने वाले डेटासेट पर विचार करें। वाहन को दुर्लभ घटनाओं, जैसे कि सड़क में एक सिंकहोल के खुलने पर, पर विश्वसनीय रूप से प्रतिक्रिया करनी चाहिए। हालांकि, ये घटनाएं बहुत दुर्लभ हैं, और इन घटनाओं के लिए प्रशिक्षण डेटा प्राप्त करना मुश्किल है। इस कारण से, इन दुर्लभ घटनाओं के लिए अक्सर प्रशिक्षण डेटा उत्पन्न किया जाना चाहिए।

चाकोन ने फॉर्च्यून के माध्यम से समझाया:

“हमारे ग्राहकों को उन सभी पैरामीटरों पर पूरा नियंत्रण है जो वे जो डेटा बनाते हैं। वास्तविक दुनिया में इसका अर्थ है कि एक बार यह तैनात हो जाने के बाद, आप सुनिश्चित हो सकते हैं कि यह विभिन्न डोमेन में, विभिन्न जातीयताओं के साथ, विभिन्न भौगोलिक स्थानों में या आप कल्पना कर सकते हैं किसी भी वातावरण में अच्छी तरह से काम करेगा। “

डेटागेन जेनरेटिव एडवर्सेरियल नेटवर्क (GANs) का उपयोग करके वास्तविक दुनिया की वस्तुओं और घटनाओं के यथार्थवादी अनुकरण उत्पन्न करता है। चाकोन ने समझाया कि कंपनी इनडोर वातावरण या मानव धारणा से संबंधित किसी भी चीज़ के यथार्थवादी उदाहरण बना सकती है। उदाहरण के लिए, डेटागेन द्वारा उत्पन्न एक छवि डेटासेट में वेयरहाउस लॉजिस्टिक्स के लिए एक रोबोटिक पिकिंग आर्म को प्रशिक्षित करने के लिए उपयोग की जाने वाली वस्तुओं के उदाहरण शामिल हो सकते हैं, जो वास्तविक चीज़ के समान दिखते हैं। डेटागेन का सॉफ़्टवेयर एक दृश्य जाल को एक भौतिकी सिमुलेशन प्रणाली के साथ जोड़कर 3D वस्तुएं बना सकता है।

डेटागेन में निवेशकों में उच्च-प्रोफ़ाइल व्यक्तियों और कंपनियों का एक विविध समूह शामिल है। निवेशकों में एनवीडिया के एआई अनुसंधान प्रभाग और मैक्स प्लैंक इंस्टीट्यूट फॉर इंटेलिजेंट सिस्टम के निदेशक, साथ ही कैग्ले के सीईओ एंथोनी गोल्डब्लूम शामिल हैं। डेटागेन 3D वस्तुओं को एक दृश्य जाल को एक भौतिकी सिमुलेशन प्रणाली के साथ जोड़कर बनाता है। निवेशकों में डेटागेन में उच्च-प्रोफ़ाइल व्यक्तियों और कंपनियों का एक विविध समूह शामिल है।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।