साक्षात्कार
सैम स्टोन, पीएम, ओपनडोर में प्राइसिंग – साक्षात्कार श्रृंखला

सैम वित्त और मशीन लर्निंग के चौराहे पर उत्पादों को बनाने के बारे में उत्साहित हैं। वह वर्तमान में ओपनडोर में प्राइसिंग ग्रुप के लिए उत्पाद के प्रमुख हैं, एक लेट-स्टेज स्टार्टअप जो घरों को तुरंत खरीदने और बेचने के लिए एल्गोरिदम का उपयोग करता है, जिससे घर मालिकों को अपने घर को सूचीबद्ध करने और होस्ट करने की परेशानी और अनिश्चितता से बचाया जा सकता है।
आपको मशीन लर्निंग और डेटा साइंस में शुरू में क्या आकर्षित किया?
कॉलेज के बाद, मैंने एक बड़े पेशेवर सेवा फर्म के लिए काम किया जिसने सैकड़ों कॉलेज ग्रेजुएट्स को एक ही प्रवेश स्तर की स्थिति में नियुक्त किया। जैसे ही मैं भर्ती में शामिल हुआ, मुझे यह देखकर आश्चर्य और निराशा हुई कि फर्म के भीतर लोगों की राय कैसे भिन्न थी कि कौन से उम्मीदवार विशेषताएं सफलता का कारण बनती हैं। यह एक वास्तविक समस्या की तरह लगा, जहां स्पष्टता की कमी थी। लेकिन मुझे यह तथ्य उत्साहित किया कि हमारे पास पिछले नौकरी के आवेदकों और नए नौकरी के परिणामों पर पर्याप्त डेटा था जो पहले जुड़े या गहराई से विश्लेषित नहीं किए गए थे। इसलिए मैंने इसका इलाज एक सांख्यिकीय समस्या के रूप में करना शुरू किया, बुनियादी उपकरणों जैसे रेखीय प्रतिगमन का उपयोग किया। समय के साथ, परियोजना एक स्टार्टअप में विकसित हुई, और हमने जिन विधियों का उपयोग किया उनमें अधिक जटिलता आई। उदाहरण के लिए, हम साक्षात्कार से सीधे असंरचित ऑडियो और पाठ को संसाधित करना चाहते थे, और इससे हमें अधिक शक्तिशाली मशीन लर्निंग मॉडल जैसे न्यूरल नेटवर्क को अपनाने के लिए प्रेरित किया।
ओपनडोर के स्वचालित मूल्यांकन मॉडल (ओवीएम) पर चर्चा करें, और यह कैसे एक संपत्ति के अनुमानित मूल्य की गणना करता है?
ओपनडोर मूल्यांकन मॉडल (ओवीएम) हमारे व्यवसाय का एक मूलभूत हिस्सा है और कई डाउनस्ट्रीम मूल्य निर्धारण अनुप्रयोगों में खिलाता है।
कई मायनों में, ओवीएम एक典型 खरीदार या विक्रेता की तरह व्यवहार करता है – यह एक पड़ोस के आसपास देखता है, जिसमें हाल ही में बिके हुए घरों के प्रकार और कीमतें शामिल हैं। हालांकि, घरों की कीमत निर्धारण के लिए, विशेष रूप से संयुक्त राज्य अमेरिका में घरों की विविधता को देखते हुए, केवल तुलनात्मक बिक्री की कीमतों पर देखना पर्याप्त नहीं है। यह बहुत अधिक जटिल है। हम कई कारकों पर विचार करते हैं, जिनमें वर्ग फुटेज और पिछवाड़े की जगह से लेकर स्नानघर और बेडरूम की संख्या, लेआउट, व्यस्त सड़कों, अपग्रेड और बहुत कुछ शामिल हैं। ओवीएम को संपत्ति कर जानकारी, बाजार की प्रवृत्तियों के साथ-साथ कई घर और पड़ोस-विशिष्ट संकेतों सहित विभिन्न डेटा स्रोतों से खिलाया जाता है। हम पिछले मानव समायोजन पर भी देखते हैं ताकि हम घरों पर औसत समायोजन मूल्य की गणना कर सकें। और हम इन मूल्यों को पैमाने पर परिष्कृत कर सकते हैं। जैसे ही हम बाजारों के लिए अधिक मानव समायोजन डेटा एकत्र करते हैं, डेटा सेट बढ़ता है और ओवीएम के प्रदर्शन में सुधार होता है। यह एक प्रतिक्रिया लूप है जो समय के साथ लगातार प्रदर्शन में सुधार करता है।
इसके अलावा अत्यधिक सटीक होने के अलावा, इसका कम विलंबता और उच्च कवरेज के साथ चलना आवश्यक है। इसका अर्थ है कि जब भी हम एक नए बाजार में प्रवेश करते हैं, तो हमें ओवीएम की क्षमताओं का विस्तार करने की आवश्यकता होती है ताकि यह घर मालिकों को पड़ोस और घर के प्रकार के पार कर सके।
कौन सी विभिन्न मशीन लर्निंग विधियों का उपयोग किया जाता है?
जब हम ओवीएम का निर्माण शुरू किया, तो हमने मुख्य रूप से हमारे खरीदारों और विक्रेताओं के निर्णय लेने की प्रक्रिया को बेहतर ढंग से समझने के लिए रेखीय सांख्यिकीय मॉडल पर भरोसा किया। लेकिन समय के साथ, ओवीएम विकसित हुआ और अब एक न्यूरल नेटवर्क पर आधारित है, विशेष रूप से एक सियामीज नेटवर्क वास्तुकला पर। हम खरीदारों और विक्रेताओं के व्यवहार को एम्बेड करने के लिए इसका उपयोग करते हैं, जिसमें तुलनात्मक घरों का चयन, उन्हें समायोजित करना और उन्हें वजन देना शामिल है। यह महत्वपूर्ण है क्योंकि हमने पाया है कि उच्च सटीकता प्राप्त करने के लिए, मॉडल को इन महत्वपूर्ण चरणों को प्रतिबिंबित करने की आवश्यकता है जो बाजार के प्रतिभागी अपनी वास्तुकला में अनुसरण करते हैं।
न्यूरल नेटवर्क का उपयोग करने के कई लाभों में से एक यह है कि यह डेटा को सभी बाजारों में पचाने और स्थानीय सूक्ष्म न्यूज़ का पता लगाने के लिए पर्याप्त सटीकता और लचीलापन है। परिणामस्वरूप, जब ओपनडोर एक नए बाजार में लॉन्च होता है या एक मौजूदा बाजार में इन्वेंट्री का विस्तार करता है, तो हम उसी मॉडल का उपयोग कर सकते हैं, जो उत्पादन मॉडल को संस्थापित करने से जुड़े इंजीनियरिंग इन्फ्रास्ट्रक्चर कार्य को बहुत कुछ दरकिनार करता है। इसके बजाय, हम नए डेटा को मौजूदा मॉडल के माध्यम से चलाते हैं, जो कि हमारे इंजीनियरों द्वारा प्रक्रिया पर बिताए जाने वाले समय को काफी कम कर देता है।
ओपनडोर में ओवीएम के अलावा कई अन्य मशीन लर्निंग विधियों का भी उपयोग किया जाता है। इसमें निर्णय पेड़, क्लस्टरिंग तकनीक, रैंकिंग प्रणाली और अनुकूलन एल्गोरिदम शामिल हैं।
ओपनडोर पर निर्भर करने वाला डेटा कहां से एकत्र किया जाता है?
हमारे एल्गोरिदम द्वारा सबसे मूल्यवान डेटा भी अक्सर सबसे कठिन डेटा होता है जिसे खोजना होता है। यह डेटा है जिसे हम स्वयं उत्पन्न करते हैं या प्रोप्राइटरी संबंधों के माध्यम से विकसित करते हैं। हम घरों की सूची जैसे तीसरे पक्ष के रियल एस्टेट डेटा के संयोजन का उपयोग करते हैं, जिसमें बिक्री तिथि, बेडरूम और बाथरूम की संख्या, वर्ग फुटेज और बहुत कुछ शामिल है। इसके अलावा, हम उन विशेषताओं पर देखते हैं जो घरों की विशिष्टता को इंगित करती हैं, जो केवल मानव विशेषज्ञता ही प्रदान कर सकती है, जैसे कि प्रकाश, सड़क शोर, उपकरणों और फिनिशिंग की गुणवत्ता और बहुत कुछ। हम उन घरों से डेटा एकत्र करते हैं जो पहले से ही बाजार में हैं, साथ ही उन घरों से भी जो बाजार से बाहर हैं जहां मालिकों ने हमारे साथ जानकारी साझा की है।
ओपनडोर के प्रयासों पर चर्चा करें जो कच्चे डेटा के अवशोषण को शक्तिशाली बनाने के लिए बुनियादी ढांचे की गति और विश्वसनीयता में सुधार करने के लिए किए जा रहे हैं?
किसी भी नए बाजार लॉन्च से पहले, हम कई वर्षों के ऐतिहासिक डेटा को अवशोषित करते हैं। उच्च गुणवत्ता वाला डेटा हमारे एल्गोरिदम और स्थानीय ऑपरेटरों को प्रशिक्षित करने के लिए महत्वपूर्ण है ताकि वे बाजार की विविधताओं को समझ सकें। गति और विश्वसनीयता में सुधार के लिए, हमने लचीले डेटा मैपिंग टूल और नए डेटा फील्ड कवरेज का मूल्यांकन करने के लिए स्वचालित उपकरण बनाए हैं। इन टूल्स के साथ, यह हमें कई वर्षों के ऐतिहासिक रियल एस्टेट लेनदेन डेटा को अवशोषित और सत्यापित करने में कुछ घंटे या दिन लगते हैं, सप्ताह नहीं।
एक और रणनीति जिस पर हमने निवेश किया है वह है प्रोएक्टिव, स्वचालित डेटा गुणवत्ता निगरानी। हमने ऐसे सिस्टम स्थापित किए हैं जो प्रत्येक चरण में अवशोषित और परिवर्तित किए जा रहे डेटा के वितरण की जांच करते हैं, वास्तविक समय में। उदाहरण के लिए, यदि हम एक विशिष्ट बाजार में औसतन 20% नए सूचीकरण को अपार्टमेंट के रूप में वर्गीकृत करने की अपेक्षा करते हैं, और फिर आज 50% नए सूचीकरण अपार्टमेंट के रूप में वर्गीकृत हैं, तो यह एक इंजीनियर के लिए जांच के लिए एक अलर्ट सेट करेगा।
विशेषज्ञ मानव निर्णय को मशीन लर्निंग एल्गोरिदम के साथ कैसे जोड़ा जाता है ताकि प्रदर्शन में सुधार के लिए प्रतिक्रिया लूप बनाया जा सके?
हमारे इन-हाउस मूल्य निर्धारण विशेषज्ञ हमारे मूल्य निर्धारण निर्णयों में एक बड़ी भूमिका निभाते हैं, हमारे एल्गोरिदम के साथ मिलकर काम करते हैं। जहां मशीनें अभी भी अंधे धब्बे हैं, हमारे विशेषज्ञ ऑपरेटर भरते हैं, और हम विभिन्न चरणों में उन पर भरोसा करते हैं। उदाहरण के लिए, वे इनपुट डेटा जैसे कि कुछ नवीनीकरण परियोजनाओं की गुणवत्ता जोड़ते या सत्यापित करते हैं। वे मध्यवर्ती निर्णय लेते हैं कि कौन सी विशेषताएं मूल्यांकन करना मुश्किल हो सकता है, और वे उपयोगकर्ता-सामने वाले निर्णय भी लेते हैं, जैसे कि कौन से ऑफ़र स्वीकार किए जाने चाहिए। मानव तत्व हमारी रणनीति में महत्वपूर्ण रहेगा और हम मानते हैं कि विशेषज्ञों और एल्गोरिदम को मिलाना सबसे अच्छा है।
बैकटेस्टिंग को परिभाषित करें और ओपनडोर में इसके महत्व पर चर्चा करें?
बैकटेस्टिंग एक मॉडल की सटीकता का मूल्यांकन करने का एक तरीका है जो ऐतिहासिक डेटा का उपयोग करता है। उदाहरण के लिए, हम ओपनडोर मूल्यांकन मॉडल को जनवरी 2015 से जनवरी 2021 तक के डेटा पर प्रशिक्षित कर सकते हैं। इस संदर्भ में, “प्रशिक्षित” का अर्थ है कि हम ऐतिहासिक इनपुट, जैसे घर की विशेषताएं, और परिणाम, जैसे बिके हुए घरों की कीमतें, मॉडल को खिलाते हैं। और, बदले में, मॉडल इनपुट और परिणामों के बीच एक संबंध सीखता है। फिर हम इस मॉडल को लेते हैं, जो इन नए संबंधों को प्रतिबिंबित करता है, और हम इसे एक और सेट ऐतिहासिक डेटा में खिलाते हैं, जैसे कि फरवरी 2021 से। क्योंकि डेटा ऐतिहासिक है, हम जानते हैं कि परिणाम क्या हैं, और हम उन्हें मॉडल की भविष्यवाणियों से कितना भिन्न है, इसका मूल्यांकन कर सकते हैं।
यह प्रक्रिया ओपनडोर में बहुत महत्वपूर्ण है, और यह हमारे सभी मशीन लर्निंग उत्पादों के लिए उपयोग की जाती है। यह ओवरफिटिंग नामक समस्या के जोखिम को कम करता है, जो तब होता है जब एक मशीन लर्निंग मॉडल ऐतिहासिक डेटा में पैटर्न की पहचान करता है जो वास्तव में वहां नहीं होते हैं। उदाहरण के लिए, स्प्यूरियस संबंध जो वास्तविक दुनिया की भविष्यवाणी में मदद नहीं करते हैं। यह हमें नए उत्पादों और रणनीतियों पर वास्तविक दुनिया के महंगे ए/बी परीक्षण चलाने से भी बचाता है जिन्हें ऐतिहासिक डेटा के आधार पर समाप्त किया जा सकता है।
क्या ओपनडोर के बारे में और कुछ है जिसे आप साझा करना चाहेंगे?
हम भर्ती कर रहे हैं! यदि आप रियल एस्टेट के भविष्य का निर्माण करने में रुचि रखते हैं, और/या फिनटेक, मशीन लर्निंग, और उपभोक्ता उत्पादों के चौराहे पर काम करने में रुचि रखते हैं, तो आवेदन करें! हम विभिन्न कार्यों और शहरों में खुले पदों की पेशकश करते हैं। हमारे करियर पेज को यहां देखें।
धन्यवाद इस शानदार साक्षात्कार के लिए, पाठक जो अधिक जानना चाहते हैं उन्हें ओपनडोर पर जाना चाहिए।












