Interviews
Sam Stone, PM, Pricing at Opendoor – Interview Series

Sam is gepassioneerd over het bouwen van producten op het snijvlak van financiën en machine learning. Hij is momenteel het hoofd van Product voor de Pricing Group bij Opendoor, een late-stage startup die algoritmes gebruikt om huizen direct te kopen en verkopen, waardoor eigenaren de rompslomp en onzekerheid van het te koop aanbieden van hun huis en het ontvangen van bezoekers bespaard blijven.
Wat trok je aanvankelijk aan tot machine learning en data science?
Na mijn studie werkte ik voor een groot professioneel dienstverlenend bedrijf dat honderden afgestudeerden in dezelfde instapfunctie aannam. Toen ik betrokken raakte bij het wervingsproces, was ik geschokt en ontmoedigd door hoe sterk de meningen van mensen binnen het bedrijf verschilden over welke kenmerken van kandidaten tot succes leidden. Het leek een echt belangrijk probleem, waar duidelijkheid ontbrak. Maar ik was enthousiast over het feit dat we over veel gegevens over voorgaande sollicitanten en nieuwe medewerkers beschikten die nooit diepgaand waren geanalyseerd. Dus ik begon eraan te werken, door het te behandelen als een statistisch probleem, met behulp van basisinstrumenten zoals lineaire regressie. Na verloop van tijd groeide het project uit tot een startup, en de methoden die we gebruikten werden geavanceerder. Bijvoorbeeld, we wilden ongestructureerde audio- en tekstgegevens uit interviews direct verwerken, en dat leidde ertoe dat we krachtigere machine learning-modellen zoals neurale netwerken gingen gebruiken.
Kunt u Opendoors geautomatiseerde taxatiemodel (OVM) bespreken en hoe het de geschatte waarde van een onroerend goed berekent?
Het Opendoor Taxatiemodel (OVM) is een kernonderdeel van onze business en voedt veel downstream prijs-toepassingen.
Op veel manieren gedraagt OVM zich als een typische koper of verkoper – het kijkt naar een buurt, inclusief de soorten en prijzen van onlangs verkochte woningen. Echter, als het gaat om het prijzen van huizen, vooral gezien de diversiteit van huizen in de VS, is het niet genoeg om alleen naar de prijzen van vergelijkbare verkoop te kijken. Het is veel complexer dan dat. We nemen een verscheidenheid aan factoren in overweging, variërend van de oppervlakte en achtertuinruimte tot het aantal badkamers en slaapkamers, indeling, drukke wegen, upgrades en meer. OVM wordt gevoed door een veelheid van gegevensbronnen, waaronder informatie over onroerendgoedbelasting, markttrends en veel specifieke signalen voor huizen en buurten. We kijken ook naar eerdere menselijke aanpassingen op huizen om de gemiddelde aanpassingswaarde te berekenen. En we kunnen deze waarden verfijnen met schaal. Naarmate we meer menselijke aanpassingsgegevens voor markten verzamelen, groeit de gegevensset en verbetert de prestatie van OVM. Het is een feedbacklus die de prestatie voortdurend verbetert.
Naast het feit dat het zeer nauwkeurig is, moet het ook met lage latentie en hoge dekking werken. Dat betekent dat elke keer dat we een nieuwe markt betreden, we de mogelijkheden van OVM moeten uitbreiden om ervoor te zorgen dat het huiseigenaren in buurten en huistypen kan bedienen.
Wat zijn enkele van de verschillende machine learning-methodologieën die worden gebruikt?
Toen we voor het eerst OVM begonnen te bouwen, vertrouwden we voornamelijk op lineaire statistische modellen om het beslissingsproces van onze kopers en verkopers beter te begrijpen. Maar met de tijd is OVM geëvolueerd en is het nu gebaseerd op een neurale netwerk, specifiek een zogenaamd Siamese Network. We gebruiken dit om de gedragingen van kopers en verkopers te embedden, waaronder het selecteren van vergelijkbare huizen, het aanpassen en wegen ervan. Dit is essentieel omdat we hebben ontdekt dat modellen om hoge nauwkeurigheid te bereiken, deze cruciale stappen die marktpartijen in hun architectuur volgen, moeten weerspiegelen.
Een van de vele voordelen van het gebruik van een neurale netwerk is dat het de precisie en flexibiliteit heeft om gegevens over alle markten te verwerken en lokale nuances te detecteren. Als gevolg daarvan kunnen we, wanneer Opendoor in een nieuwe markt lanceert of de voorraad in een bestaande markt uitbreidt, hetzelfde model gebruiken, waardoor veel van de engineering-infrastructuurwerkzaamheden die nodig zijn voor het instantiëren van een nieuw productiemodel, worden omzeild. In plaats daarvan voeren we nieuwe gegevens door het bestaande model, wat de tijd die onze ingenieurs aan het proces besteden, aanzienlijk vermindert.
Er zijn ook veel andere machine learning-methodologieën die we bij Opendoor gebruiken, naast neurale netwerken. Dit omvat, maar is niet beperkt tot, beslissingsbomen, clusteranalysetechnieken, rangschikkingsystemen en optimalisatiealgoritmen.
Opendoor is afhankelijk van enorme hoeveelheden gegevens, waar worden deze gegevens verzameld?
De gegevens die onze algoritmes het meest waardevol vinden, zijn ook vaak de gegevens die het moeilijkst te vinden zijn. Dit zijn de gegevens die we zelf genereren of ontwikkelen via propriëtaire relaties. We gebruiken een combinatie van interne gegevens en externe onroerendgoedgegevens, waaronder gegevenspunten uit advertenties, zoals de verkoopdatum, het aantal slaapkamers en badkamers, de oppervlakte en meer. Bovendien kijken we naar kenmerken die de uniekheid van huizen aangeven, die dingen zijn die alleen menselijke expertise kan bieden, zoals verlichting, straatgeluid, kwaliteit van apparaten en afwerkingen en veel meer. We verzamelen gegevens van huizen die al op de markt zijn, evenals van huizen die niet op de markt zijn, waarvan de eigenaren informatie met ons hebben gedeeld.
Kunt u enkele van Opendoors inspanningen bespreken om de snelheid en betrouwbaarheid van de infrastructuur die de rauwe gegevensinname aandrijft, te verbeteren?
Vóór elke lancering van een nieuwe markt, nemen we veel historische gegevens op. Hoge kwaliteit gegevens zijn essentieel voor het trainen van zowel onze algoritmes als onze lokale operators, om ervoor te zorgen dat ze de variaties binnen die markt begrijpen. Om de snelheid, kwaliteit en betrouwbaarheid te verbeteren, hebben we flexibele gegevenskaartinstrumenten en instrumenten voor het automatisch beoordelen van de dekking van nieuwe gegevensvelden gebouwd. Met deze instrumenten in plaats, duurt het ons slechts een paar uur of dagen om grote hoeveelheden historische onroerendgoedtransactiegegevens op te nemen en te valideren, in plaats van weken.
Een andere strategie waarin we hebben geïnvesteerd, is proactieve, geautomatiseerde gegevenskwaliteitsbewaking. We hebben systemen ingesteld die de verdeling van de gegevens die we opnemen en transformeren op elk moment van het proces controleren, in real-time. Bijvoorbeeld, als we verwachten dat in een bepaalde markt gemiddeld 20% van de nieuwe advertenties appartementen zijn, en dan vandaag 50% van de nieuwe advertenties als appartementen zijn geclassificeerd, zal dat een alarm voor een ingenieur afgeven om te onderzoeken.
Hoe wordt expert-menselijke beoordeling gecombineerd met machine learning-algoritmes om feedbackloops van steeds beter presterende prestaties te creëren?
Onze in-house prijsexperts spelen een enorme rol in onze prijsbeslissingen, samenwerkend met onze algoritmes. Waar machines nog steeds blindspots hebben, vullen onze expert-operators deze aan, en we vertrouwen op hen in verschillende fasen. Bijvoorbeeld, voegen ze invoergegevens toe of verifiëren deze, zoals de kwaliteit van bepaalde renovatieprojecten. Ze nemen tussentijdse beslissingen over welke kenmerken moeilijk te waarderen kunnen zijn, en ze nemen ook gebruikersgerichte beslissingen, zoals welke aanbiedingen we moeten accepteren. Het menselijke element zal altijd kritiek zijn voor onze strategie en we geloven dat het koppelen van experts en algoritmes het beste is.
Kunt u backtesting definiëren en de belangrijkheid ervan bij Opendoor bespreken?
Backtesting is een manier om de nauwkeurigheid van een model te beoordelen met behulp van historische gegevens. Bijvoorbeeld, we kunnen het Opendoor Taxatiemodel trainen op gegevens van januari 2015 tot januari 2021. In deze context betekent “trainen” dat we historische invoer, zoals woningkenmerken, en resultaten, zoals verkoopprijzen van woningen, aan het model voeden. En, op zijn beurt, leert het model een relatie tussen invoer en resultaten. Vervolgens nemen we dit model, dat deze nieuwe geleerde relaties weerspiegelt, en voeren we een andere set historische gegevens in, zeg van februari 2021. Omdat de gegevens historisch zijn, weten we de resultaten, en we kunnen meten hoeveel deze afwijken van de voorspellingen.
Dit proces is zeer belangrijk bij Opendoor en wordt gebruikt voor al onze machine learning-producten. Het vermindert het risico van een probleem dat overfitting wordt genoemd, waarbij een machine learning-model patronen in historische gegevens identificeert die er eigenlijk niet zijn. Bijvoorbeeld, spurious correlaties die niet helpen bij echte wereldvoorspelling. Het bespaart ons ook de kosten van het uitvoeren van kostbare real-world A/B-tests op nieuwe producten en strategieën die op basis van historische gegevens kunnen worden geëlimineerd.
Is er nog iets anders dat u over Opendoor zou willen delen?
We zijn aan het werven! Als u geïnteresseerd bent in het bouwen van de toekomst van onroerend goed, en/of werken aan het snijvlak van fintech, machine learning en consumentenproducten, solliciteer dan! We hebben open functies in verschillende functies en steden. Bekijk onze carrièrepagina hier.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Opendoor bezoeken.












