Entretiens
Sam Stone, PM, Pricing at Opendoor – Série d’entretiens

Sam est passionné par la création de produits à l’intersection de la finance et du machine learning. Il est actuellement le responsable du produit pour le groupe de tarification d’Opendoor, une startup en phase tardive qui utilise des algorithmes pour acheter et vendre des maisons instantanément, épargnant ainsi aux propriétaires les tracas et l’incertitude de la mise en vente de leur maison et de l’accueil.
Qu’est-ce qui vous a initialement attiré vers le machine learning et la science des données ?
Après mes études, j’ai travaillé pour une grande entreprise de services professionnels qui embauchait des centaines de diplômés dans le même poste d’entrée. Au fur et à mesure que j’étais impliqué dans le recrutement, j’ai été frappé et déçu par la façon dont les opinions des gens au sein de l’entreprise différaient énormément sur les attributs des candidats qui conduisaient au succès. Cela semblait être un problème très important, où la clarté faisait défaut. Mais j’étais enthousiaste à l’idée que nous avions suffisamment de données sur les anciens candidats et les résultats des nouveaux embauches qui n’avaient jamais été connectés ou profondément analysés. Alors, j’ai commencé à travailler sur cela, en le traitant comme un problème statistique, en utilisant des outils de base tels que la régression linéaire. Au fil du temps, le projet a grandi et les méthodes que nous avons utilisées sont devenues plus sophistiquées. Par exemple, nous voulions traiter directement les données audio et textuelles non structurées des entretiens, et cela nous a amenés à adopter des modèles de machine learning plus puissants, tels que les réseaux de neurones.
Pouvez-vous discuter du modèle de valorisation automatisé d’Opendoor (OVM) et de la façon dont il calcule la valeur estimée d’une propriété ?
Le modèle de valorisation d’Opendoor (OVM) est une pièce maîtresse de notre entreprise et alimente de nombreuses applications de tarification en aval.
À bien des égards, l’OVM se comporte comme un acheteur ou un vendeur typique – il examine les quartiers, y compris les types et les prix des maisons récemment vendues. Cependant, lorsqu’il s’agit de la tarification des maisons, en particulier compte tenu de la diversité des maisons aux États-Unis, il ne suffit pas de regarder uniquement les prix des ventes comparables. C’est beaucoup plus complexe que cela. Nous prenons en compte une variété de facteurs, allant de la superficie et de l’espace du jardin à la quantité de salles de bains et de chambres, la disposition, les routes encombrées, les améliorations et bien plus encore. L’OVM est alimenté par une multitude de sources de données, notamment des informations sur les impôts fonciers, les tendances du marché ainsi que de nombreux signaux spécifiques aux maisons et aux quartiers. Nous recherchons également les ajustements humains précédents sur les maisons pour calculer la valeur d’ajustement moyenne. Et nous pouvons affiner ces valeurs à mesure que nous collectons davantage de données d’ajustement humain pour les marchés, ce qui améliore les performances de l’OVM. C’est une boucle de rétroaction qui améliore continuellement les performances au fil du temps.
En plus d’être très précis, il doit fonctionner avec une faible latence et une grande couverture. Cela signifie que chaque fois que nous entrons dans un nouveau marché, nous devons étendre les capacités de l’OVM pour nous assurer qu’il peut servir les propriétaires à travers les quartiers et les types de maisons.
Quelles sont certaines des différentes méthodologies de machine learning utilisées ?
Lorsque nous avons commencé à construire l’OVM, nous nous sommes principalement appuyés sur des modèles statistiques linéaires pour mieux comprendre les processus de prise de décision de nos acheteurs et vendeurs. Mais au fil du temps, l’OVM a évolué et est maintenant basé sur un réseau de neurones, plus précisément une architecture appelée réseau siamois. Nous utilisons cela pour intégrer les comportements des acheteurs et des vendeurs, y compris la sélection de maisons comparables, les ajustements et les pondérations. C’est essentiel car nous avons constaté qu’il est nécessaire que les modèles reflètent ces étapes clés que les participants au marché suivent dans leur architecture.
L’un des nombreux avantages de l’utilisation d’un réseau de neurones est qu’il a la précision et la flexibilité pour digérer des données dans tous les marchés et détecter des nuances locales granulaires. Par conséquent, lorsque Opendoor lance un nouveau marché ou étend son inventaire dans un marché existant, nous pouvons utiliser le même modèle, en évitant ainsi une grande partie du travail d’infrastructure d’ingénierie qui découle de la mise en production d’un nouveau modèle. Au lieu de cela, nous exécutons de nouvelles données via le modèle existant, ce qui réduit considérablement le temps que nos ingénieurs passent sur le processus.
Il existe également de nombreuses autres méthodologies de machine learning que nous utilisons chez Opendoor, en plus des réseaux de neurones. Cela inclut, mais n’est pas limité à, les arbres de décision, les techniques de regroupement, les systèmes de classement et les algorithmes d’optimisation.
Opendoor repose sur d’énormes quantités de données, où ces données sont-elles collectées ?
Les données que nos algorithmes trouvent les plus précieuses sont également souvent les données les plus difficiles à trouver. Ce sont les données que nous générons nous-mêmes ou que nous développons via des relations propriétaires. Nous utilisons une combinaison de données internes et de données immobilières tierces, notamment des points de données à partir de listes, comme la date de vente, le nombre de chambres et de salles de bains, la superficie et bien plus encore. En outre, nous examinons les caractéristiques qui indiquent l’unicité des maisons, qui sont des choses que seule l’expertise humaine peut fournir, telles que l’éclairage, le bruit de la rue, la qualité des appareils et des finitions, et bien plus encore. Nous collectons des données sur les maisons qui sont déjà sur le marché, ainsi que sur les maisons hors marché dont les propriétaires nous ont fourni des informations.
Pouvez-vous discuter des efforts d’Opendoor pour améliorer la vitesse et la fiabilité de l’infrastructure qui alimente son ingestion de données brutes ?
Avant chaque lancement de marché, nous ingérons de nombreuses années de données historiques. Des données de haute qualité sont essentielles pour former à la fois nos algorithmes et nos opérateurs locaux pour nous assurer qu’ils comprennent les variations au sein de ce marché. Pour améliorer la vitesse, la qualité et la fiabilité, nous avons construit des outils de mappage de données flexibles et des outils pour évaluer automatiquement la couverture de nouveaux champs de données. Avec ces outils en place, il nous faut maintenant seulement quelques heures ou jours pour ingérer et valider de grandes quantités de données de transactions immobilières historiques, au lieu de semaines.
Une autre stratégie dans laquelle nous avons investi est la surveillance proactive de la qualité des données automatisée. Nous avons mis en place des systèmes qui vérifient les distributions des données que nous ingérons et transformons à chaque étape du processus, en temps réel. Par exemple, si nous nous attendons à ce que dans un marché particulier, 20 % des nouvelles listes soient en moyenne des appartements, et que aujourd’hui 50 % des nouvelles listes sont classées comme des appartements, cela déclenchera une alerte pour qu’un ingénieur enquête.
Comment le jugement humain expert est-il combiné avec les algorithmes de machine learning pour créer des boucles de rétroaction de performances toujours améliorées ?
Nos experts en tarification internes jouent un rôle énorme dans nos décisions de tarification, travaillant en tandem avec nos algorithmes. Là où les machines ont encore des angles morts, nos opérateurs experts comblent ces lacunes, et nous nous appuyons sur eux à travers diverses étapes. Par exemple, ils ajoutent ou vérifient les données de saisie, comme la qualité de certains projets de rénovation. Ils prennent des décisions intermédiaires sur les caractéristiques qui pourraient être difficiles à évaluer, et ils prennent également des décisions orientées vers l’utilisateur, comme les offres que nous devrions accepter. L’élément humain sera toujours critique dans notre stratégie, et nous croyons que le mariage d’experts et d’algorithmes est le meilleur.
Pouvez-vous définir le backtesting et en discuter l’importance chez Opendoor ?
Le backtesting est un moyen d’évaluer la précision d’un modèle en utilisant des données historiques. Par exemple, nous pouvons former le modèle de valorisation d’Opendoor sur des données allant de janvier 2015 à janvier 2021. Dans ce contexte, « former » signifie que nous alimentons le modèle avec des entrées historiques, comme les attributs des maisons, et des résultats, comme les prix de vente des maisons, et que le modèle apprend une relation entre les entrées et les résultats. Ensuite, nous prenons ce modèle, qui reflète ces nouvelles relations apprises, et nous alimentons une autre série de données historiques, disons de février 2021. Puisque les données sont historiques, nous connaissons les résultats, et nous pouvons mesurer à quel point ces résultats diffèrent des prévisions.
Ce processus est très important chez Opendoor, et il est utilisé pour tous nos produits de machine learning. Il réduit le risque d’un problème appelé sur-ajustement, qui se produit lorsque un modèle de machine learning identifie des modèles dans les données historiques qui n’existent pas réellement. Par exemple, des corrélations erronées qui n’aident pas à la prévision du monde réel. Il nous épargne également de réaliser des tests A/B coûteux dans le monde réel sur de nouveaux produits et stratégies qui peuvent être éliminés sur la base de données historiques.
Y a-t-il autre chose que vous aimeriez partager sur Opendoor ?
Nous recrutons ! Si vous êtes intéressé par la construction de l’avenir de l’immobilier, et/ou par le travail à l’intersection de la fintech, du machine learning et des produits grand public, veuillez postuler ! Nous avons des postes ouverts dans toutes les fonctions et les villes. Consultez notre page carrières ici.
Merci pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Opendoor.












