Interviuri
Sam Stone, PM, Pricing la Opendoor – Seria de interviuri

Sam este pasionat de a construi produse la intersecția dintre finanțe și învățare automată. El este în prezent Șeful de Produs pentru Grupul de Preturi de la Opendoor, o companie de statut avansat care utilizează algoritmi pentru a cumpăra și vinde case instantaneu, salvând astfel proprietarii de casa de problemele și incertitudinile listării casei și a gazdelor.
Ce v-a atras inițial către învățarea automată și știința datelor?
După facultate, am lucrat pentru o mare firmă de servicii profesionale care a angajat sute de absolvenți de facultate în aceeași poziție de intrare. Pe măsură ce am devenit implicat în procesul de angajare, am fost șocat și dezamăgit de faptul că opiniile oamenilor din cadrul firmei diferă foarte mult în ceea ce privește atributele candidaților care conduc la succes. Părea a fi o problemă foarte importantă, unde lipsea claritatea. Dar am fost încântat de faptul că aveam date ample despre candidații și rezultatele noilor angajați care nu fuseseră niciodată conectate sau analizate în profunzime. Așa că am început să lucrez la acest proiect, tratându-l ca pe o problemă statistică, utilizând instrumente de bază precum regresia liniară. Pe parcurs, proiectul a crescut și s-a transformat într-o companie, iar metodele pe care le-am utilizat au devenit mai sofisticate. De exemplu, am vrut să procesăm direct sunete și texte nestructurate din interviuri, și asta ne-a condus spre adoptarea unor modele de învățare automată mai puternice, precum rețelele neuronale.
Puteți discuta despre modelul de evaluare automată Opendoor (OVM) și despre cum calculează valoarea estimată a unei proprietăți?
Modelul de Evaluare Opendoor (OVM) este o parte esențială a afacerii noastre și se reflectă în multe aplicații de prețuri downstream.
În multe feluri, OVM se comportă ca un cumpărător sau vânzător tipic – examinează cartierul, inclusiv tipurile și prețurile caselor vândute recent. Cu toate acestea, atunci când vine vorba de stabilirea prețurilor caselor, în special având în vedere diversitatea caselor din Statele Unite, nu este suficient să se ia în considerare doar prețurile vânzărilor comparabile. Este mult mai complex decât atât. Luăm în considerare o varietate de factori, de la suprafața în metri pătrați și spațiu din curte până la numărul de băi și dormitoare, dispunere, drumuri aglomerate, modernizări și multe altele. OVM este alimentat de o multitudine de surse de date, inclusiv informații despre taxe pe proprietate, tendințe de piață, precum și multe semnale specifice caselor și cartierelor. De asemenea, căutăm ajustări umane anterioare asupra caselor pentru a calcula valoarea medie de ajustare. Și suntem capabili să rafinăm aceste valori cu ajutorul scalabilității. Pe măsură ce colectăm mai multe date de ajustare umană pentru piețe, setul de date crește și îmbunătățește performanța OVM. Este un buclă de feedback care îmbunătățește continuu performanța în timp.
În plus față de faptul că este foarte precis, trebuie să ruleze cu latență scăzută și acoperire ridicată. Acest lucru înseamnă că de fiecare dată când intrăm pe o piață nouă, trebuie să extindem capacitățile OVM pentru a ne asigura că poate deservi proprietarii de case din diverse cartiere și tipuri de case.
Care sunt unele dintre diferitele metodologii de învățare automată utilizate?
Când am început să construim OVM, ne-am bazat în principal pe modele statistice liniare pentru a înțelege mai bine procesul de luare a deciziilor de cumpărare și vânzare. Cu toate acestea, pe parcurs, OVM s-a dezvoltat și se bazează acum pe o rețea neuronală, în special pe o arhitectură numită Rețea Siameză. Utilizăm aceasta pentru a încorpora comportamentele cumpărătorilor și vânzătorilor, inclusiv selectarea caselor comparabile, ajustarea și ponderarea lor. Acest lucru este vital deoarece am constatat că, pentru a obține o acuratețe ridicată, modelele trebuie să reflecte aceste etape cheie pe care participanții la piață le urmează în arhitectura lor.
Una dintre multele beneficii ale utilizării unei rețele neuronale este că are precizia și flexibilitatea de a digera date din toate piețele și de a detecta nuanțe locale granulare. Ca urmare, atunci când Opendoor lansează o piață nouă sau extinde stocul într-o piață existentă, putem utiliza același model, ocolind astfel o mare parte din infrastructura de inginerie care vine din instantaneearea unui nou model de producție. În schimb, rulează noi date prin modelul existent, ceea ce reduce semnificativ timpul pe care inginerii noștri îl petrec cu acest proces.
Există și multe alte metodologii de învățare automată pe care le utilizăm la Opendoor, în afara rețelelor neuronale. Acestea includ, dar nu se limitează la, arbori de decizie, tehnici de clustering, sisteme de rangare și algoritmi de optimizare.
Opendoor se bazează pe cantități uriașe de date, de unde sunt colectate aceste date?
Datele pe care algoritmii noștri le găsesc cel mai de preț sunt, de asemenea, adesea cele mai greu de găsit. Acestea sunt datele pe care le generăm noi înșine sau le dezvoltăm prin relații exclusive. Utilizăm o combinație de date interne și date externe de imobiliare, inclusiv puncte de date din listări, cum ar fi data vânzării, numărul de dormitoare și băi, suprafața în metri pătrați și multe altele. În plus, examinăm caracteristici care indică unicitatea caselor, care sunt lucruri pe care doar expertiza umană le poate furniza, cum ar fi iluminarea, zgomotul de pe stradă, calitatea aparatelor și finisajelor și multe altele. Colectăm date de la casele care sunt deja pe piață, precum și de la casele de pe piața secundară ale căror proprietari ne-au împărtășit informații.
Puteți discuta despre eforturile Opendoor de a îmbunătăți viteza și fiabilitatea infrastructurii care alimentează ingestia de date brute?
Înainte de lansarea oricărei piețe noi, ingestăm mulți ani de date istorice. Datele de calitate sunt vitale pentru antrenarea atât a algoritmilor noștri, cât și a operatorilor locali, pentru a ne asigura că aceștia înțeleg variațiile din cadrul pieței. Pentru a îmbunătăți viteza, calitatea și fiabilitatea, am construit instrumente flexibile de mapare a datelor și instrumente pentru evaluarea automată a acoperirii noilor câmpuri de date. Cu aceste instrumente în loc, ne ia doar câteva ore sau zile pentru a ingesta și valida cantități mari de date istorice de tranzacții imobiliare, în loc de săptămâni.
O altă strategie în care am investit este monitorizarea calității datelor automate și proactive. Am configurat sisteme care verifică distribuțiile datelor pe care le ingestăm și le transformăm la fiecare etapă a procesului, în timp real. De exemplu, dacă ne așteptăm ca, într-o anumită piață, 20% din noile listări să fie, în medie, apartamente, și apoi, astăzi, 50% din noile listări sunt clasificate ca apartamente, acest lucru va declanșa o alertă pentru un inginer să investigheze.
Cum se combină judecata umană expertă cu algoritmii de învățare automată pentru a crea bucle de feedback cu performanțe din ce în ce mai bune?
Experții noștri de prețuri interni joacă un rol enorm în deciziile noastre de prețuri, lucrând în tandem cu algoritmii noștri. În locurile în care mașinile încă au puncte oarbe, operatorii noștri experți le completează, și ne bazăm pe ei în diverse etape. De exemplu, ei adaugă sau verifică date de intrare, cum ar fi calitatea anumitor proiecte de renovare. Ei iau decizii intermediare despre ce caracteristici ar putea fi greu de evaluat și, de asemenea, iau decizii cu impact direct asupra utilizatorilor, cum ar fi care oferte ar trebui să acceptăm. Elementul uman va fi întotdeauna critic în strategia noastră și credem că căsătoria dintre experți și algoritmi este cea mai bună.
Puteți defini backtesting-ul și discuta despre importanța sa la Opendoor?
Backtesting-ul este o modalitate de a evalua acuratețea unui model utilizând date istorice. De exemplu, putem antrena Modelul de Evaluare Opendoor pe date de la ianuarie 2015 până în ianuarie 2021. În acest context, “antrenare” înseamnă că alimentăm modelul cu intrări istorice, cum ar fi atributele caselor, și rezultate, cum ar fi prețurile caselor vândute, și, în schimb, modelul învață o relație între intrări și rezultate. Apoi, luăm acest model, care reflectă aceste relații nou învățate, și îl alimentăm cu un alt set de date istorice, de exemplu, de la februarie 2021. Deoarece datele sunt istorice, știm rezultatele și putem măsura cât de mult acestea se abat de la previziuni.
Acest proces este foarte important la Opendoor și este utilizat pentru toate produsele noastre de învățare automată. Reduce riscul unei probleme numite suprainvățare, care apare atunci când un model de învățare automată identifică modele în datele istorice care nu sunt, de fapt, acolo. De exemplu, corelații spurii care nu ajută la previziuni reale. De asemenea, ne salvează de la a rula teste A/B costisitoare în lumea reală pentru noi produse și strategii care pot fi eliminate pe baza datelor istorice.
Există altceva pe care ați dori să îl împărtășiți despre Opendoor?
Angajăm! Dacă sunteți interesați de a construi viitorul imobiliarelor și/sau de a lucra la intersecția dintre fintech, învățare automată și produse de consum, vă rugăm să aplicați! Avem posturi deschise în diverse funcții și orașe. Verificați pagina noastră de carieră aici.
Mulțumim pentru acest interviu minunat. Citiitorii care doresc să afle mai multe despre Opendoor ar trebui să viziteze Opendoor.












