インタビュー
サム・ストーン、OpendoorのPricing PM – インタビュー・シリーズ

サムは、金融と機械学習の交差点で製品を構築することに情熱を注いでいます。現在、住宅を瞬時に買い売りするアルゴリズムを使用する後期スタートアップであるOpendoorのPricingグループの製品責任者です。
機械学習とデータサイエンスに最初に惹かれたのは何ですか?
大学卒業後、私は数百人の大学卒業生を同じエントリーレベルのポジションに採用する大手プロフェッショナルサービス会社で働きました。採用に関与するにつれて、会社内の人々の意見が、どのような候補者属性が成功につながるかについて、非常に異なっていることに驚かされ、失望しました。重要な問題ではありましたが、明確性が欠けているように感じました。しかし、過去のジョブ・アプライアントと新入社員の成果に関する豊富なデータが存在し、まだ深く分析されたことがないという事実に興奮しました。そこで、私はそれを統計的な問題として扱い、線形回帰などの基本的なツールを使用して作業を開始しました。プロジェクトは時間の経過とともに成長し、使用する方法はより洗練されました。例えば、インタビューからの非構造化オーディオとテキストを直接処理したいと考え、ニューラル・ネットワークなどのより強力な機械学習モデルを採用するようになりました。
Opendoorの自動評価モデル(OVM)について、およびそれが物件の推定値をどのように計算するかについて説明してください。
Opendoor評価モデル(OVM)は、私たちのビジネスの重要な部分であり、下流の価格設定アプリケーションに多大な影響を与えます。
多くの点で、OVMは典型的な買い手や売り手のように動作します。近隣の住宅の種類や価格を調べます。しかし、特に米国の住宅の多様性を考えると、推定価格にのみ比較販売価格を考慮することは不十分です。より複雑な要因を考慮する必要があります。床面積、裏庭の広さ、バスルームや寝室の数、レイアウト、騒々しい道路、改修、さらに多くの要素を考慮します。OVMは、物件税情報、市場動向、住宅や近隣の特定の信号を含む多数のデータ・ソースから供給されます。また、住宅に対する過去の人間による調整を計算して平均調整値を算出します。さらに、スケールを拡大することでこれらの値を洗練することができます。市場ごとに人間による調整データを収集することで、データセットを拡大し、OVMのパフォーマンスを向上させることができます。これは、継続的にパフォーマンスを向上させるフィードバック・ループです。
高い精度を保つだけでなく、低遅延と高いカバレッジで動作する必要があります。つまり、新しい市場に参入するたびに、OVMの機能を拡大して、さまざまな近隣や住宅タイプの所有者に対応できるようにする必要があります。
どのような機械学習手法が使用されていますか?
OVMを構築し始めた当初は、買い手と売り手の意思決定プロセスをよりよく理解するために、主に線形統計モデルを使用していました。しかし、時間の経過とともに、OVMは発展し、現在はニューラル・ネットワーク、特にシアメース・ネットワークと呼ばれるアーキテクチャに基づいています。買い手と売り手の行動、例えば類似の住宅の選択、調整、重み付けを埋め込むためにこれを使用します。これは非常に重要です。高い精度を達成するには、モデルが市場参加者の主なステップを反映する必要があるからです。
ニューラル・ネットワークを使用する利点の1つは、すべての市場でデータを消化し、地元のニュアンスを検出できる精度と柔軟性を持っていることです。結果として、Opendoorが新しい市場に参入したり、既存の市場で在庫を拡大したりするときに、同じモデルを使用できます。新しいデータを既存のモデルに供給するだけで済みます。これにより、エンジニアがプロセスに費やす時間を大幅に削減できます。
Opendoorでは、ニューラル・ネットワーク以外にも、決定木、クラスタリング・テクニック、ランキング・システム、最適化アルゴリズムなど、多数の機械学習手法を使用しています。
Opendoorが使用するデータはどこから集められていますか?
私たちのアルゴリズムが最も価値のあるデータは、同時に最も入手が難しいデータでもあります。これは、自社で生成したデータか、独自の関係を通じて開発したデータです。リストからのデータ、販売日、寝室とバスルームの数、床面積など、第三者による不動産データを組み合わせて使用しています。さらに、人間の専門知識のみが提供できる、住宅のユニークさを示す特徴、例えば照明、道路の騒音、家電や仕上げの品質なども調べます。既に市場に出ている住宅だけでなく、所有者が情報を共有してくれた非市場の住宅からのデータも収集しています。
Opendoorの生のデータ・インジェストを支えるインフラストラクチャの速度と信頼性を向上させる取り組みについて説明してください。
新しい市場への参入前に、多数の歴史的なデータをインジェストします。高品質のデータは、アルゴリズムと地元のオペレーターをトレーニングするために不可欠です。速度、品質、信頼性を向上させるために、柔軟なデータ・マッピング・ツールと新しいデータ・フィールドのカバレッジを自動的に評価するツールを構築しました。これらのツールを使用することで、歴史的な不動産取引データの大量なインジェストと検証を、数週間ではなく、数時間または数日で実行できます。
もう1つの戦略は、自動化されたデータの品質モニタリングです。データの分布を各ステップでリアルタイムにチェックするシステムを設置しています。例えば、ある市場で新しいリストの20%が平均してアパートであると予想している場合、今日新しいリストの50%がアパートとして分類されている場合、エンジニアが調査するためのアラートが発生します。
専門家の人間の判断と機械学習アルゴリズムをどのように組み合わせて、パフォーマンスを向上させるフィードバック・ループを作成していますか?
私たちの価格決定における専門家は、アルゴリズムと密接に協力して働いています。機械がまだ盲点を持っている場所では、専門家が補完し、さまざまな段階で依存しています。例えば、特定の改修プロジェクトの品質を追加または検証したり、中間的な決定を下したり、ユーザー向けの決定を下したりします。人間の要素は私たちの戦略にとって重要であり、専門家とアルゴリズムを組み合わせることが最良のアプローチであると信じています。
バックテストの定義とOpendoorでのその重要性について説明してください。
バックテストとは、歴史的なデータを使用してモデルの精度を評価する方法です。例えば、Opendoor評価モデルを2015年1月から2021年1月までのデータでトレーニングします。「トレーニング」とは、歴史的な入力、例えば住宅の特性と、結果、例えば販売価格をモデルに供給することを意味します。モデルは入力と結果の関係を学習し、2015年1月から2021年1月までの別の歴史的なデータセットをモデルに供給します。歴史的なデータであるため、結果を予測からどれだけ乖離しているかを測定できます。
このプロセスはOpendoorでは非常に重要であり、すべての機械学習製品で使用されています。オーバーフィッティングと呼ばれる問題、つまり歴史的なデータに実際には存在しないパターンを機械学習モデルが特定することを減らすためです。さらに、実世界のA/Bテストを実行する必要性を減らし、歴史的なデータに基づいて新しい製品や戦略を排除できます。
Opendoorについてさらに共有したいことがありますか?
私たちは採用しています!不動産の未来を構築したり、フィンテック、機械学習、消費者製品の交差点で働きたい方は、ぜひ応募してください。さまざまな機能や都市でのオープン・ポジションがあります。詳細はこちらのキャリア・ページをご覧ください。
素晴らしいインタビュー、ご覧になった読者にOpendoorについてもっと知りたい方は、Opendoorを訪れてください。












