Interviews
Sam Stone, PM, Pricing at Opendoor – Interview-Serie

Sam ist leidenschaftlich daran interessiert, Produkte an der Schnittstelle von Finanzen und Maschinellem Lernen zu entwickeln. Er ist derzeit der Leiter des Produktmanagements für die Pricing-Gruppe bei Opendoor, einem späten Startup, das Algorithmen verwendet, um Häuser sofort zu kaufen und zu verkaufen, wodurch Hauseigentümer den Ärger und die Unsicherheit des Anbietens und der Bewirtung ihrer Häuser vermeiden können.
Was hat Sie ursprünglich zum Maschinellem Lernen und zur Datenwissenschaft hingezogen?
Nach dem College arbeitete ich für ein großes Beratungsunternehmen, das Hunderte von Absolventen in die gleiche Einstiegsposition einstellte. Als ich mich mit dem Einstellungsprozess beschäftigte, war ich von den unterschiedlichen Meinungen innerhalb des Unternehmens über die Eigenschaften von Kandidaten, die zum Erfolg führten, überrascht und enttäuscht. Es schien ein sehr wichtiges Problem zu sein, bei dem Klarheit fehlte. Aber ich war begeistert von der Tatsache, dass wir reichlich Daten über vergangene Bewerber und neue Mitarbeiter hatten, die noch nie verbunden oder tiefgehend analysiert worden waren. Also begann ich, daran zu arbeiten, und behandelte es als statistisches Problem, indem ich grundlegende Werkzeuge wie lineare Regression verwendete. Im Laufe der Zeit wuchs das Projekt zu einem Startup heran, und die Methoden, die wir verwendeten, wurden komplexer. Zum Beispiel wollten wir unstrukturierte Audio- und Textdaten aus Interviews direkt verarbeiten, und das führte uns zur Verwendung leistungsfähigerer Maschinellem-Lernen-Modelle wie Neuronale Netze.
Können Sie Opendoors automatisiertes Bewertungsmodell (OVM) erläutern und wie es den geschätzten Wert einer Immobilie berechnet?
Das Opendoor-Bewertungsmodell (OVM) ist ein wichtiger Teil unseres Geschäfts und fließt in viele nachgelagerte Preis-Anwendungen ein.
Auf viele Weise verhält sich OVM wie ein typischer Käufer oder Verkäufer – es schaut sich in einem Stadtteil um, einschließlich der Arten und Preise von kürzlich verkauften Häusern. Allerdings reicht es bei der Preisbildung von Häusern, insbesondere angesichts der Vielfalt von Häusern in den USA, nicht aus, nur auf die Preise von vergleichbaren Verkäufen zu schauen. Es ist viel komplexer als das. Wir berücksichtigen eine Vielzahl von Faktoren, von der Wohnfläche und dem Garten bis zur Anzahl der Badezimmer und Schlafzimmer, der Aufteilung, der Lautstärke der Straßen, der Ausstattung und vielem mehr. OVM wird von einer Vielzahl von Datenquellen gespeist, einschließlich Informationen über Grundsteuern, Markttrends sowie viele haus- und nachbarschaftsspezifische Signale. Wir suchen auch nach vorherigen menschlichen Anpassungen an Häusern, um den durchschnittlichen Anpassungswert zu berechnen. Und wir können diese Werte mit der Skalierung verfeinern. Wenn wir mehr menschliche Anpassungsdaten für Märkte sammeln, wächst die Datenmenge und verbessert die Leistung von OVM. Es ist ein Feedback-Schleife, die die Leistung kontinuierlich über die Zeit verbessert.
Zusätzlich zu seiner hohen Genauigkeit muss es mit niedriger Latenz und hoher Abdeckung laufen. Das bedeutet, dass wir jedes Mal, wenn wir in einen neuen Markt eintreten, die Fähigkeiten von OVM erweitern müssen, um sicherzustellen, dass es Hauseigentümer in ganz verschiedenen Stadtteilen und Häusertypen bedienen kann.
Welche verschiedenen Maschinellem-Lernen-Methoden werden verwendet?
Als wir OVM zum ersten Mal aufbauten, verließen wir uns hauptsächlich auf lineare statistische Modelle, um unsere Käufer- und Verkäufer-Entscheidungsprozesse besser zu verstehen. Aber im Laufe der Zeit entwickelte sich OVM und basiert jetzt auf einem neuronalen Netz, insbesondere einer Architektur namens Siamese-Netzwerk. Wir verwenden es, um die Verhaltensweisen von Käufern und Verkäufern zu integrieren, einschließlich der Auswahl von vergleichbaren Häusern, der Anpassung und der Gewichtung. Dies ist entscheidend, da wir festgestellt haben, dass Modelle, um eine hohe Genauigkeit zu erreichen, diese wichtigen Schritte, die Marktteilnehmer in ihrer Architektur befolgen, widerspiegeln müssen.
Einer der vielen Vorteile der Verwendung eines neuronalen Netzes ist, dass es die Präzision und Flexibilität besitzt, Daten über alle Märkte zu verarbeiten und granulare lokale Nuancen zu erkennen. Als Ergebnis können wir, wenn Opendoor in einen neuen Markt startet oder das Inventar in einem bestehenden Markt erweitert, das gleiche Modell verwenden und viel von der Ingenieursarbeitsinfrastruktur umgehen, die mit der Instantiierung eines neuen Produktionsmodells verbunden ist. Stattdessen führen wir neue Daten durch das bestehende Modell aus, was die Zeit, die unsere Ingenieure für den Prozess aufwenden, erheblich reduziert.
Es gibt auch viele andere Maschinellem-Lernen-Methoden, die wir bei Opendoor verwenden, zusätzlich zu neuronalen Netzen. Dazu gehören, aber nicht beschränkt auf, Entscheidungsbäume, Clustering-Techniken, Rankingsysteme und Optimierungsalgorithmen.
Opendoor verlässt sich auf enorme Mengen an Daten, wo werden diese Daten gesammelt?
Die Daten, die unsere Algorithmen am meisten schätzen, sind oft auch die Daten, die am schwersten zu finden sind. Dies sind die Daten, die wir selbst generieren oder über proprietäre Beziehungen entwickeln. Wir verwenden eine Kombination aus internen Daten und externen Immobilien-Daten, einschließlich Datenpunkten aus Listings, wie dem Verkaufsdatum, der Anzahl der Schlafzimmer und Badezimmer, der Wohnfläche und vielem mehr. Zusätzlich betrachten wir Merkmale, die die Einzigartigkeit der Häuser anzeigen, die nur menschliche Expertise liefern kann, wie Beleuchtung, Straßenlärm, Qualität der Geräte und Oberflächen und vielem mehr. Wir sammeln Daten von Häusern, die bereits auf dem Markt sind, sowie von außerhalb des Marktes, bei denen die Eigentümer Informationen mit uns geteilt haben.
Können Sie einige von Opendoors Bemühungen zur Verbesserung der Geschwindigkeit und Zuverlässigkeit der Infrastruktur erläutern, die die Rohdaten-Verarbeitung antreibt?
Bevor wir in einen neuen Markt eintreten, verarbeiten wir viele Jahre historische Daten. Hohe Qualität der Daten ist entscheidend, um unsere Algorithmen und unsere lokalen Betreiber zu trainieren, um sicherzustellen, dass sie die Variationen innerhalb dieses Marktes verstehen. Um die Geschwindigkeit zu verbessern, haben wir flexible Daten-Mapping-Tools und Tools für die automatische Überprüfung der Abdeckung neuer Datenfelder entwickelt. Mit diesen Tools können wir große Mengen an historischen Immobilien-Transaktionsdaten in nur wenigen Stunden oder Tagen verarbeiten und validieren, anstatt Wochen.
Ein weiterer Ansatz, in den wir investiert haben, ist proaktives, automatisiertes Daten-Qualitäts-Monitoring. Wir haben Systeme eingerichtet, die die Verteilung der Daten, die wir verarbeiten und transformieren, in Echtzeit überprüfen. Zum Beispiel, wenn wir erwarten, dass in einem bestimmten Markt im Durchschnitt 20% der neuen Listings Apartments sind, und dann heute 50% der neuen Listings als Apartments klassifiziert sind, wird dies ein Alarm für einen Ingenieur auslösen, um zu untersuchen.
Wie wird menschliche Experten-Urteilsfähigkeit mit den Maschinellem-Lernen-Algorithmen kombiniert, um Feedback-Schleifen mit immer besserer Leistung zu schaffen?
Unsere internen Preis-Experten spielen eine enorme Rolle bei unseren Preis-Entscheidungen, indem sie in Zusammenarbeit mit unseren Algorithmen arbeiten. Wo Maschinen immer noch blind sind, füllen unsere Experten-Betreiber die Lücken aus, und wir verlassen uns auf sie in verschiedenen Stadien. Zum Beispiel fügen sie oder überprüfen Eingabedaten, wie die Qualität bestimmter Renovierungsprojekte. Sie treffen Zwischenentscheidungen darüber, welche Merkmale schwer zu bewerten sein könnten, und sie treffen auch benutzerorientierte Entscheidungen, wie welche Angebote wir annehmen sollten. Der menschliche Faktor wird immer entscheidend für unsere Strategie sein, und wir glauben, dass die Kombination von Experten und Algorithmen die beste ist.
Können Sie Backtesting definieren und seine Bedeutung bei Opendoor erläutern?
Backtesting ist eine Methode, um die Genauigkeit eines Modells mit historischen Daten zu bewerten. Zum Beispiel trainieren wir das Opendoor-Bewertungsmodell auf Daten von Januar 2015 bis Januar 2021. In diesem Kontext bedeutet “trainieren”, dass wir historische Eingaben, wie Hausmerkmale, und Ergebnisse, wie Verkaufspreise von Häusern, dem Modell zuführen. Und im Gegenzug lernt das Modell eine Beziehung zwischen Eingaben und Ergebnissen. Dann nehmen wir dieses Modell, das diese neu gelernten Beziehungen widerspiegelt, und füttern es mit einer anderen Menge historischer Daten, sagen wir von Februar 2021. Weil die Daten historisch sind, wissen wir die Ergebnisse, und wir können messen, wie sehr sie von den Vorhersagen abweichen.
Dieser Prozess ist sehr wichtig bei Opendoor, und er wird für alle unsere Maschinellem-Lernen-Produkte verwendet. Es reduziert das Risiko eines Problems namens Overfitting, wenn ein Maschinellem-Lernen-Modell Muster in historischen Daten erkennt, die tatsächlich nicht existieren. Zum Beispiel spurious Korrelationen, die nicht bei der realen Vorhersage helfen. Es rettet uns auch vor teuren realen A/B-Tests auf neuen Produkten und Strategien, die aufgrund historischer Daten eliminiert werden können.
Gibt es noch etwas, das Sie über Opendoor teilen möchten?
Wir suchen nach neuen Mitarbeitern! Wenn Sie daran interessiert sind, die Zukunft des Immobilienmarktes zu gestalten und/oder an der Schnittstelle von Finanztechnologie, Maschinellem Lernen und Verbraucherprodukten zu arbeiten, bewerben Sie sich bitte! Wir haben offene Stellen in verschiedenen Funktionen und Städten. Besuchen Sie unsere Karriereseite hier.
Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Opendoor besuchen.












