साक्षात्कार
एलेक्स रैटनर, स्नॉर्कल एआई के सीईओ और सह-संस्थापक – साक्षात्कार श्रृंखला

एलेक्स रैटनर स्नॉर्कल एआई के सीईओ और सह-संस्थापक हैं, जो स्टैनफोर्ड एआई लैब से निकली एक कंपनी है।
स्नॉर्कल एआई मैनुअल एआई विकास प्रक्रियाओं को प्रोग्रामेटिक समाधानों में बदलकर एआई विकास को तेज और व्यावहारिक बनाता है। स्नॉर्कल एआई उद्यमों को अपने अनूठे कार्यभार के लिए एआई विकसित करने में सक्षम बनाता है, जो उनके प्रोप्राइटरी डेटा और ज्ञान का उपयोग करके 10-100 गुना तेजी से होता है।
आपको कंप्यूटर विज्ञान में शुरू से ही क्या आकर्षित किया?
कंप्यूटर विज्ञान में दो बहुत ही रोमांचक पहलू हैं जब आप युवा होते हैं। एक, आप जितनी तेजी से सीख सकते हैं उतनी तेजी से सीख सकते हैं और निर्माण कर सकते हैं, तेजी से प्रतिक्रिया देने के लिए, एक शिक्षक की प्रतीक्षा किए बिना। दो, आप बिना किसी की अनुमति लिए बहुत कुछ बना सकते हैं!
मैं एक छोटे बच्चे के रूप में इन कारणों से प्रोग्रामिंग में गया। मुझे सटीकता की आवश्यकता भी पसंद थी। मैं जटिल प्रक्रियाओं और दिनचर्या को स abstracting करने और फिर उन्हें मॉड्यूलर तरीके से एन्कोड करने की प्रक्रिया से प्यार करता था।
बाद में, एक वयस्क के रूप में, मैं एक परामर्श कार्य में कंप्यूटर विज्ञान में पेशेवर रूप से वापस आया, जहां मुझे पेटेंट कॉर्पस के कुछ बुनियादी विश्लेषण लिखने का काम सौंपा गया था। मैं यह देखकर आकर्षित हुआ कि मानव ज्ञान – जो कुछ भी किसी ने कभी पेटेंट करने योग्य माना था – आसानी से उपलब्ध था, लेकिन इतना असुलभ था क्योंकि जटिल तकनीकी पाठ और मल्टी-मॉडल डेटा पर भी सबसे सरल विश्लेषण करना मुश्किल था।
यह मुझे वापस ग्रेड स्कूल में ले गया, स्टैनफोर्ड में एनएलपी पर ध्यान केंद्रित करते हुए, जो कि प्राकृतिक भाषा पर एमएल/एआई का उपयोग करने का क्षेत्र है।
आप पहली बार स्टैनफोर्ड में स्नॉर्कल ओपन-सोर्स परियोजना शुरू की और इसका नेतृत्व किया, तो आप हमें इन शुरुआती दिनों की यात्रा के माध्यम से चल सकते हैं?
उस समय हम, उद्योग में कई लोगों की तरह, नए एल्गोरिदम विकसित करने पर ध्यान केंद्रित कर रहे थे – और सभी “फैंसी” मशीन लर्निंग स्टफ जो लोग समुदाय में शोध और प्रकाशित करते थे।
हालांकि, हम वास्तविक दुनिया की समस्याओं में इसकी जड़ें रखने के लिए हमेशा बहुत प्रतिबद्ध थे – मुख्य रूप से स्टैनफोर्ड में डॉक्टरों और वैज्ञानिकों के साथ। लेकिन जब भी हम एक नया मॉडल या एल्गोरिदम पेश करते थे, तो प्रतिक्रिया होती थी “हाँ, हम इसे आजमाएंगे, लेकिन हमें सभी लेबल वाले प्रशिक्षण डेटा की आवश्यकता होगी जिसे हम बनाने के लिए समय नहीं है!”
हम देख रहे थे कि बड़ी अनकही समस्या लेबलिंग और क्यूरेटिंग उस प्रशिक्षण डेटा के आसपास थी – इसलिए हमने अपना整个 ध्यान उस पर केंद्रित किया, जिसने स्नॉर्कल परियोजना और “डेटा-केंद्रित एआई” की अवधारणा शुरू की।
स्नॉर्कल में एक डेटा-केंद्रित एआई दृष्टिकोण है, तो आप इसकी परिभाषा क्या है और यह मॉडल-केंद्रित एआई विकास से कैसे अलग है?
डेटा-केंद्रित एआई का अर्थ है बेहतर मॉडल बनाने के लिए बेहतर डेटा बनाना।
यह मॉडल-केंद्रित एआई के विपरीत है – लेकिन इसके साथ मिलकर काम करता है। मॉडल-केंद्रित एआई में, डेटा वैज्ञानिक या शोधकर्ता मानते हैं कि डेटा स्थिर है और बेहतर परिणाम प्राप्त करने के लिए मॉडल आर्किटेक्चर और पैरामीटर को समायोजित करने में अपनी ऊर्जा डालते हैं।
शोधकर्ता मॉडल-केंद्रित एआई में अभी भी महान काम करते हैं, लेकिन ऑफ-द-शेल्फ मॉडल और ऑटो एमएल तकनीकों में इतनी सुधार हुई है कि मॉडल चयन उत्पादन समय में कमोडिटाइज्ड हो गया है। जब ऐसा होता है, तो इन मॉडलों में सुधार करने का सबसे अच्छा तरीका उन्हें अधिक और बेहतर डेटा प्रदान करना है।
एक डेटा-केंद्रित एआई दृष्टिकोण के मूल सिद्धांत क्या हैं?
डेटा-केंद्रित एआई का मूल सिद्धांत सरल है: बेहतर डेटा बेहतर मॉडल बनाता है।
हमारे शोध पत्र में, हमने इसे “डेटा प्रोग्रामिंग” कहा है। यह विचार है कि यदि आप एक मजबूत मॉडल को पर्याप्त उदाहरणों के साथ खिलाते हैं और अपेक्षित आउटपुट, तो मॉडल उन पैटर्न को दोहराने का तरीका सीखता है।
यह एक बड़ी चुनौती प्रस्तुत करता है जितना आप उम्मीद कर सकते हैं। अधिकांश डेटा में कोई लेबल नहीं हैं – या कम से कम आपके अनुप्रयोग के लिए कोई उपयोगी लेबल नहीं हैं। मैनुअल रूप से उस डेटा को लेबल करने से तedium, समय, और मानव प्रयास की आवश्यकता होती है।
डेटा-सेंट्रिक एआई के लिए प्रोग्रामेटिक का क्या अर्थ है?
मैनुअल रूप से डेटा लेबल करने में गंभीर चुनौतियाँ हैं। ऐसा करने से मानव घंटों की आवश्यकता होती है, और कभी-कभी वे मानव घंटे महंगे हो सकते हैं। चिकित्सा दस्तावेजों, उदाहरण के लिए, केवल डॉक्टरों द्वारा लेबल किए जा सकते हैं।
इसके अलावा, मैनुअल लेबलिंग स्प्रिंट अक्सर एकल-उपयोग परियोजनाओं के बराबर होते हैं। लेबलर डेटा को एक कठोर स्कीमा के अनुसार लेबल करते हैं। यदि एक व्यवसाय की जरूरतें बदलती हैं और एक अलग सेट के लेबल की मांग करती हैं, तो लेबलर को शुरू से शुरू करना होगा।
प्रोग्रामेटिक दृष्टिकोण डेटा-केंद्रित एआई इन दोनों समस्याओं को कम करते हैं। स्नॉर्कल एआई की प्रोग्रामेटिक लेबलिंग प्रणाली विभिन्न संकेतों को शामिल करती है – विरासत मॉडल से लेकर मौजूदा लेबल तक और बाहरी ज्ञान आधारों तक – संभावित लेबल विकसित करने के लिए। हमारा प्राथमिक संकेत स्रोत विषय विशेषज्ञ हैं जो डेटा वैज्ञानिकों के साथ मिलकर लेबलिंग फंक्शन बनाने के लिए सहयोग करते हैं। वे अपने विशेषज्ञ निर्णय को स्केलेबल नियमों में एन्कोड करते हैं, जिससे एक निर्णय में निवेश किया गया प्रयास दर्जनों या सैकड़ों डेटा बिंदुओं पर प्रभाव डाल सकता है।
यह फ्रेमवर्क लचीला भी है। यदि व्यवसाय की जरूरतें बदलती हैं और नए लेबल की मांग करती हैं, तो उपयोगकर्ता लेबलिंग फंक्शन जोड़ते हैं, हटाते हैं और समायोजित करते हैं ताकि नए लेबल को घंटों के बजाय दिनों में लागू किया जा सके।
यह डेटा-केंद्रित दृष्टिकोण अलेबल्ड डेटा के तेजी से स्केलिंग को कैसे सक्षम बनाता है?
हमारा प्रोग्रामेटिक दृष्टिकोण डेटा-केंद्रित एआई अलेबल्ड डेटा के तेजी से स्केलिंग को सक्षम बनाता है प्रत्येक चुनाव के प्रभाव को बढ़ाकर। एक बार विषय विशेषज्ञ एक प्रारंभिक, छोटे सेट के मैदान की स्थापना करते हैं, तो वे तेजी से पुनरावृत्ति के लिए डेटा वैज्ञानिकों के साथ सहयोग करना शुरू करते हैं। वे कुछ लेबलिंग फंक्शन परिभाषित करते हैं, एक त्वरित मॉडल प्रशिक्षित करते हैं, लेबलिंग फंक्शन के प्रभाव का विश्लेषण करते हैं, और फिर लेबलिंग फंक्शन जोड़ते हैं, हटाते हैं या समायोजित करते हैं जैसा आवश्यक है।
प्रत्येक चक्र मॉडल प्रदर्शन में सुधार करता है जब तक कि यह परियोजना के लक्ष्यों को पूरा या उससे अधिक नहीं कर लेता। यह डेटा लेबलिंग कार्य के महीनों को केवल घंटों में कम कर सकता है। स्नॉर्कल शोध परियोजना में, हमारे शोधकर्ताओं ने एक दिन में 20,000 दस्तावेज लेबल किए – एक मात्रा जो मैनुअल लेबलर को दस सप्ताह या अधिक ले सकती थी।
स्नॉर्कल में कई एआई समाधान हैं, जिनमें स्नॉर्कल फ्लो, स्नॉर्कल जेनग्लो और स्नॉर्कल फाउंड्री शामिल हैं। इन ऑफरिंग्स के बीच क्या अंतर हैं?
स्नॉर्कल एआई सूट उपयोगकर्ताओं को लेबलिंग फंक्शन बनाने की अनुमति देता है (जैसे कि दस्तावेजों में कीवर्ड या पैटर्न की तलाश करना) मिनटों में लाखों डेटा बिंदुओं को प्रोग्रामेटिक रूप से लेबल करने के लिए, एक-एक करके मैनुअल रूप से टैग करने के बजाय।
यह कंपनियों के लिए आवश्यक समय को संपीड़ित करता है ताकि वे अपने प्रोप्राइटरी डेटा को उत्पादन-तैयार मॉडल में अनुवादित कर सकें और उनसे मूल्य निकालना शुरू कर सकें। स्नॉर्कल एआई उद्यमों को मानव-इन-द-लूप दृष्टिकोण को कुशलता से मानव निर्णय और विषय विशेषज्ञ ज्ञान को शामिल करके स्केल करने में सक्षम बनाता है।
यह अधिक पारदर्शी और समझने योग्य एआई के लिए dẫnता है, जो उद्यमों को पूर्वाग्रह को प्रबंधित करने और जिम्मेदार परिणाम प्रदान करने में सक्षम बनाता है।
बात करने के लिए, स्नॉर्कल एआई फॉर्च्यून 500 उद्यमों को सक्षम बनाता है:
- मॉडल प्रशिक्षित करने या आरएजी में सुधार करने के लिए उच्च गुणवत्ता वाले लेबल वाले डेटा विकसित करने के लिए;
- फाइन-ट्यूनिंग के साथ एलएलएम को अनुकूलित करने के लिए;
- एलएलएम को विशेष मॉडल में डिस्टिल करने के लिए जो बहुत छोटे और संचालित करने में सस्ते हैं;
- प्री-ट्रेनिंग के साथ डोमेन और कार्य-विशिष्ट एलएलएम बनाने के लिए।
आपके लिए सबसे महत्वपूर्ण शोध पत्र कौन सा है?
एक प्रमुख पत्र मूल रूप से डेटा प्रोग्रामिंग (प्रोग्रामेटिक रूप से प्रशिक्षण डेटा लेबलिंग) और स्नॉर्कल पर था।
स्नॉर्कल के भविष्य के लिए आपकी दृष्टि क्या है?
मैं स्नॉर्कल को एक विश्वसनीय साथी के रूप में देखता हूं जो सभी बड़े उद्यमों के लिए जो एआई के बारे में गंभीर हैं।
स्नॉर्कल फ्लो बड़े उद्यमों में डेटा विज्ञान टीमों के लिए एक सार्वभौमिक उपकरण बन जाना चाहिए – चाहे वे अपने संगठनों के लिए कस्टम बड़े भाषा मॉडल को फाइन-ट्यून कर रहे हों, छवि वर्गीकरण मॉडल बना रहे हों, या सरल, तैनात करने योग्य लॉजिस्टिक रिग्रेशन मॉडल बना रहे हों।
किसी भी प्रकार के मॉडल की आवश्यकता जो एक व्यवसाय को चाहिए, उन्हें इसे प्रशिक्षित करने के लिए उच्च गुणवत्ता वाले लेबल वाले डेटा की आवश्यकता होगी।
साक्षात्कार के लिए धन्यवाद, पाठक जो और जानना चाहते हैं उन्हें स्नॉर्कल एआई पर जाना चाहिए,












