访谈

山姆·斯通,Opendoor 定价产品经理 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

山姆热衷于在金融和机器学习交叉点上构建产品。他目前是Opendoor定价团队的产品负责人,Opendoor是一家使用算法来即时买卖房屋的晚期创业公司,节省了房主在上市和举办开放日时的麻烦和不确定性。

是什么最初吸引你进入机器学习和数据科学领域?

大学毕业后,我在一家大型专业服务公司工作,该公司每年会招聘数百名大学毕业生进入同一个入门级职位。当我参与招聘工作时,我被公司内部对候选人属性的看法差异所震惊和沮丧。这似乎是一个非常重要的问题,但缺乏明确的答案。然而,我很高兴我们有大量的历史数据和新员工的结果,这些数据和结果以前从未被连接或深入分析过。所以,我开始处理这个问题,使用基本工具如线性回归。随着时间的推移,项目逐渐发展成为一个创业公司,我们使用的方法变得更加复杂。例如,我们希望直接处理面试中的非结构化音频和文本数据,这导致我们采用了更强大的机器学习模型,如神经网络。

您能否讨论Opendoor的自动估值模型(OVM),以及它如何计算房产的估计值?

Opendoor估值模型(OVM)是我们业务的核心组成部分,并且为许多下游定价应用程序提供输入。

在很多方面,OVM的行为类似于典型的买家或卖家——它查看整个社区,包括最近出售的房屋类型和价格。然而,在定价房屋时,尤其是考虑到美国各地房屋的多样性,仅仅查看可比销售的价格是不够的。这是一个更复杂的问题。我们考虑了从平方英尺和后院空间到浴室和卧室数量、布局、繁忙的道路、升级和更多因素。OVM由多种数据源提供信息,包括财产税信息、市场趋势以及许多房屋和社区特有的信号。我们还查看以前的人工调整数据,以计算平均调整值。随着我们收集更多的人工调整数据,我们可以改进OVM的性能。这种反馈循环随着时间的推移不断提高性能。

除了高度准确外,它还必须具有低延迟和高覆盖率。这意味着每次我们进入一个新市场,我们都需要扩展OVM的能力,以确保它可以为整个社区和房屋类型的房主提供服务。

在Opendoor中使用了哪些不同的机器学习方法?

当我们第一次开始构建OVM时,我们主要依赖于线性统计模型来更好地理解我们的买家和卖家的决策过程。但是随着时间的推移,OVM已经发展成为基于神经网络的模型,特别是称为Siamese网络的架构。我们使用它来嵌入买家和卖家的行为,包括选择可比房屋、调整和加权。这种方法对于实现高精度至关重要,因为我们发现模型需要在其架构中反映市场参与者所遵循的关键步骤。

使用神经网络的一个主要好处是它具有精度和灵活性,可以处理所有市场的数据,并检测局部细微差别。因此,当Opendoor进入一个新市场或在现有市场中扩大库存时,我们可以使用相同的模型,绕过从实例化新生产模型中产生的大量工程基础工作。相反,我们将新数据运行通过现有模型,这大大减少了我们的工程师在此过程中花费的时间。

除了神经网络外,我们在Opendoor还使用了其他许多机器学习方法,包括但不限于决策树、聚类技术、排名系统和优化算法。

Opendoor的算法从哪里收集如此大量的数据?

我们的算法最有价值的数据也是最难找到的数据。这些数据是我们自己生成的,或者通过专有关系开发的。我们使用内部数据和第三方房地产数据的组合,包括来自房源的数据点,例如销售日期、卧室和浴室数量、平方英尺等。此外,我们还查看反映房屋独特性的功能,这些功能只有人类专长才能提供,例如照明、街道噪音、电器和饰面的质量等。我们从已经上市的房屋和房主与我们分享信息的非上市房屋中收集数据。

您能否讨论Opendoor为提高原始数据摄取基础设施的速度和可靠性所做的努力?

在每次新市场推出之前,我们都会摄取多年的历史数据。高质量的数据对于训练我们的算法和本地运营商至关重要,以确保他们了解市场内的差异。为了提高速度、质量和可靠性,我们构建了灵活的数据映射工具和自动评估新数据字段覆盖范围的工具。有了这些工具,我们可以在几小时或几天内摄取和验证大量的历史房地产交易数据,而不是几周。

我们投资的另一个策略是主动、自动的数据质量监控。我们设置了系统来实时检查我们摄取和转换的数据的分布,在每个过程步骤中。如果我们预计某个市场中20%的新房源平均是公寓,而今天50%的新房源被归类为公寓,这将触发工程师调查的警报。

如何将专家的人类判断与机器学习算法结合起来,创建反馈循环以不断提高性能?

我们的内部定价专家在我们的定价决策中发挥着巨大的作用,与我们的算法密切合作。我们的专家运营商填补了机器的盲点,我们依赖他们的各个阶段。例如,他们添加或验证输入数据,例如某些翻新项目的质量。他们对可能难以估值的功能做出中间决策,并且他们还做出面向用户的决策,例如我们应该接受哪些报价。人类元素将始终是我们战略的关键组成部分,我们相信将专家和算法结合起来是最佳方法。

您能否定义回测并讨论其在Opendoor中的重要性?

回测是一种使用历史数据评估模型准确性的方法。例如,我们可能会在2015年1月至2021年1月的数据上训练Opendoor估值模型。在这种情况下,“训练”意味着我们将历史输入(如房屋属性)和结果(如售出房屋价格)馈送到模型中,模型从中学习输入和结果之间的关系。然后我们将这个模型(它反映了这些新学习的关系)馈送到另一组历史数据中,例如2021年2月的数据。由于数据是历史的,我们知道结果,并且可以衡量预测与实际结果之间的差异。

这个过程对于Opendoor的所有机器学习产品都非常重要。它降低了过拟合的风险,即机器学习模型识别出历史数据中的模式,但这些模式在现实世界预测中并不真正存在。它还可以节省我们在新产品和策略上进行昂贵的真实世界A/B测试的成本,这些产品和策略可以根据历史数据被淘汰。

您是否还有其他关于Opendoor的信息想要分享?

我们正在招聘!如果您有兴趣从事房地产行业的未来建设,或者在金融科技、机器学习和消费品领域的交叉点工作,请申请!我们在各个职能和城市都有开放的职位。请访问我们的职业页面

感谢这次精彩的采访,希望读者能够通过访问Opendoor网站来了解更多信息。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。