Intervjuer
Sam Stone, PM, Pricing at Opendoor – Intervju-serie

Sam är passionerad om att bygga produkter vid skärningspunkten mellan finans och maskinlärande. Han är för närvarande Head of Product för Pricing-gruppen på Opendoor, ett sent stadium-startup som använder algoritmer för att köpa och sälja hem direkt, vilket sparar hemägare besväret och osäkerheten med att lista sitt hem och hålla i visningar.
Vad var det som initialt drog dig till maskinlärande och datavetenskap?
Efter college arbetade jag för ett stort företag som anställde hundratals universitetsstudenter i samma inträdesposition. När jag blev involverad i rekryteringen blev jag slagen och besviken över hur vilt människors åsikter inom företaget skiljde sig åt när det gällde vilka kandidatattribut som ledde till framgång. Det verkade som ett mycket viktigt problem, där tydlighet saknades. Men jag blev entusiastisk över det faktum att vi hade gott om data om tidigare jobbsökande och nyanställdas resultat som aldrig hade kopplats eller djupgående analyserats. Så jag började arbeta med det, och behandlade det som ett statistiskt problem, med hjälp av grundläggande verktyg som linjär regression. Över tiden växte projektet till en startup, och metoderna vi använde blev mer avancerade. Till exempel ville vi bearbeta ostrukturerad ljud- och textdata från intervjuer direkt, och det ledde oss till att anta kraftfullare maskinlärandemodeller som neurala nätverk.
Kan du diskutera Opendoors automatiserade värderingsmodell (OVM) och hur den beräknar den uppskattade värdet av en fastighet?
Opendoor Värderingsmodellen (OVM) är en central del av vår verksamhet och matar in i många nedströmsprisapplikationer.
På många sätt beter sig OVM som en typisk köpare eller säljare – den tittar på hela grannskapet, inklusive typer och priser på nyligen sålda hem. Men när det gäller att prissätta hem, särskilt med tanke på den mångfald av hem runt om i USA, räcker det inte att enbart titta på priserna på jämförbara försäljningar. Det är mycket mer komplext än så. Vi tar en mängd olika faktorer i beaktande, från boyta och bakgård till antalet badrum och sovrum, layout, bulleriga vägar, uppgraderingar och mycket mer. OVM matas med en mängd olika datakällor, inklusive fastighetsskattsinformation, marknadstrender samt många hem- och grannskapsspecifika signaler. Vi letar också efter tidigare mänskliga justeringar på hem för att beräkna den genomsnittliga justeringsvärdet. Och vi kan förbättra dessa värden med skala. När vi samlar in mer mänsklig justeringsdata för marknader, växer datamängden och förbättrar OVM-prestandan. Det är en återkopplingsloop som kontinuerligt förbättrar prestandan över tid.
Utöver att vara mycket exakt måste den också köras med låg latens och hög täckning. Det betyder att varje gång vi går in på en ny marknad måste vi utöka OVM:s kapacitet för att säkerställa att den kan betjäna hemägare över hela grannskap och hemtyper.
Vilka är några av de olika maskinlärandemodellerna som används?
När vi först började bygga OVM förlitade vi oss främst på linjära statistiska modeller för att bättre förstå våra köpares och säljares beslutsprocess. Men över tiden har OVM utvecklats och är nu baserat på ett neuronnät, specifikt en arkitektur som kallas Siamese Network. Vi använder detta för att infoga köpares och säljares beteenden, inklusive urval av jämförbara hem, justeringar och viktning. Detta är avgörande eftersom vi har funnit att för att uppnå hög noggrannhet måste modellerna återspegla dessa viktiga steg som marknadsaktörer följer i sin arkitektur.
En av de många fördelarna med att använda ett neuronnät är att det har precision och flexibilitet att bearbeta data över alla marknader och upptäcka lokala nyanser. Som ett resultat, när Opendoor lanserar på en ny marknad eller utökar lager i en befintlig marknad, kan vi använda samma modell, och kringgå mycket av den ingenjörsarbete som kommer från att skapa en ny produktionsmodell. Istället kör vi ny data genom den befintliga modellen, vilket signifikant minskar den tid våra ingenjörer tillbringar på processen.
Det finns också många andra maskinlärandemodeller som vi använder på Opendoor, utöver neuronnät. Detta inkluderar, men är inte begränsat till, beslutsfattande träd, klustermetoder, rangordningssystem och optimeringsalgoritmer.
Opendoor förlitar sig på enorma mängder data, var samlas denna data in?
Den data som våra algoritmer finner mest värdefull är också ofta den data som är svårast att hitta. Det är den data som vi genererar själva eller utvecklar via proprietära relationer. Vi använder en kombination av intern data och tredjeparts fastighetsdata, inklusive datapunkter från listor, som försäljningsdatum, antal sovrum och badrum, boyta och mycket mer. Dessutom tittar vi på funktioner som indikerar hemmens unikhet, som är saker som endast mänsklig expertis kan tillhandahålla, som belysning, gatubuller, kvalitet på apparater och ytor och mycket mer. Vi samlar in data från hem som redan är på marknaden, samt från hem som inte är på marknaden, där ägarna har delat information med oss.
Kan du diskutera några av Opendoors insatser för att förbättra hastigheten och tillförlitligheten i infrastrukturen som driver dess rådatainmatning?
Före varje ny marknads Lansering samlar vi in många års historiska data. Högkvalitativ data är avgörande för att träna både våra algoritmer och våra lokala operatörer, för att säkerställa att de förstår variationerna inom den marknaden. För att förbättra hastigheten, kvaliteten och tillförlitligheten har vi byggt flexibla datamappningsverktyg och verktyg för automatisk bedömning av täckningen av nya datafält. Med dessa verktyg på plats tar det oss bara några timmar eller dagar att mata in och validera stora mängder historiska fastighetsdata, istället för veckor.
En annan strategi som vi har investerat i är proaktiv, automatisk datakvalitetsövervakning. Vi har skapat system som kontrollerar fördelningen av den data som vi matar in och omvandlar vid varje steg i processen, i realtid. Till exempel, om vi förväntar oss att i en viss marknad 20% av nya listor i genomsnitt är lägenheter, och sedan idag 50% av de nya listorna är klassificerade som lägenheter, kommer det att utlösa en varning för en ingenjör att undersöka.
Hur kombineras expertmänskligt omdöme med maskinlärandealgoritmer för att skapa återkopplingsloopar av alltmer förbättrad prestanda?
Våra in-house prisanalytiker spelar en avgörande roll över hela vår prissättningsprocess, och arbetar i tandem med våra algoritmer. Där maskiner fortfarande har blindfläckar fyller våra expertoperatörer i, och vi förlitar oss på dem genom olika stadier. Till exempel lägger de till eller verifierar indata, som kvaliteten på vissa renoveringsprojekt. De fattar också mellanbeslut om vilka funktioner som kan vara svåra att värdera, och de fattar också användarorienterade beslut, som vilka erbjudanden vi ska acceptera. Den mänskliga faktorn kommer alltid att vara avgörande för vår strategi, och vi tror att äktenskapet mellan experter och algoritmer är det bästa.
Kan du definiera backtesting och diskutera dess betydelse på Opendoor?
Backtesting är ett sätt att bedöma noggrannheten i en modell med hjälp av historiska data. Till exempel kan vi träna Opendoor Värderingsmodellen på data från januari 2015 till januari 2021. I detta sammanhang betyder “träna” att vi matar in historiska indata, som hemattribut, och resultat, som sålda hempriser, till modellen. Och i sin tur lär sig modellen en relation mellan indata och resultat. Sedan tar vi denna modell, som återspeglar dessa nyinlärda relationer, och matar in en annan uppsättning historiska data, till exempel från februari 2021. Eftersom datan är historisk vet vi resultaten, och vi kan mäta hur mycket de avviker från förutsägelserna.
Denna process är mycket viktig på Opendoor, och den används för alla våra maskinlärandeprodukter. Den minskar risken för ett problem som kallas överanpassning, som är när en maskinlärandemodell identifierar mönster i historiska data som inte verkligen finns. Till exempel, slumpmässiga korrelationer som inte hjälper till med verklig prognostisering. Den sparar oss också från att köra dyra verkliga A/B-tester på nya produkter och strategier som kan elimineras baserat på historiska data.
Finns det något annat du skulle vilja dela om Opendoor?
Vi rekryterar! Om du är intresserad av att bygga framtidens fastighetsbransch, och/eller arbeta vid skärningspunkten mellan fintech, maskinlärande och konsumentprodukter, vänligen ansök! Vi har lediga roller över hela verksamheten och i olika städer. Kolla in vår karriärsida här.
Tack för det underbara samtalet, läsare som vill veta mer bör besöka Opendoor.












