인터뷰
샘 스톤, Opendoor의 Pricing 담당 PM – 인터뷰 시리즈

샘은 금융과 기계 학습의 교차점에서 제품을 구축하는 것에 열정을 가지고 있습니다. 그는 현재 Opendoor의 Pricing 그룹의 제품 책임자입니다. Opendoor는 알고리즘을 사용하여 즉시 집을 사고 팔 수 있는 후기 스타트업입니다. 이것은 집주인들이 집을 목록에 올리고 호스팅하는 번거로움과 불확실성을 피할 수 있도록 도와줍니다.
기계 학습과 데이터 과학에 처음으로 관심을 가지게 된 것은 무엇입니까?
대학을 졸업한 후, 나는 수백 명의 대학 신입생을 같은 입사 직위에 고용하는 큰 전문 서비스 회사에서 일했습니다. 나는 채용에 참여할 수록, 회사 내에서 후보자 특성이 성공으로 이어지는지에 대한 의견이 매우 다르다는 사실에 놀랐고, 실망했습니다. 이것은 매우 중요한 문제였으며, 명확성이 부족했습니다. 그러나 나는 과거의 작업申请자와 신규 고용 결과에 대한 데이터가 충분히 있었으며, 이것은 결코 연결되거나 깊이 분석되지 않았습니다. 그래서 나는 이것을 통계 문제로 다루기 시작했습니다. 기본 도구인 선형 회귀를 사용했습니다. 시간이 지남에 따라, 프로젝트는 성장했고, 우리는 더 복잡한 기계 학습 모델인 신경망을 채택했습니다.
Opendoor의 자동 가치 평가 모델(OVM)에 대해 논의해 주시겠습니까? 그리고 어떻게 하면 특정 부동산의 추정 가치를 계산할 수 있습니까?
Opendoor 가치 평가 모델(OVM)은 우리 사업의 핵심 부분입니다. 이것은 많은 다운스트림 가격 적용에 영향을 미칩니다.
여러 가지 방면에서 OVM은 일반적인 구매자나 판매자와 비슷하게 작동합니다. 그것은 이웃을 살펴보며, 최근에 판매된 집의 유형과 가격을 확인합니다. 그러나 집을 가격 매기기 위해, 특히 미국 전역의 다양한 집을 고려할 때, 단순히 비교 가능한 판매 가격만을 살펴보는 것은 충분하지 않습니다. 이것은 훨씬 더 복잡합니다. 우리는 평방 피트, 후원 공간, 욕실 및 침실의 수, 레이아웃, 바쁜 도로, 업그레이드 등 다양한 요인을 고려합니다. OVM은 재산세 정보, 시장 동향 및 많은 집 및 이웃 특정 신호와 같은 다양한 데이터 소스를 통해 공급됩니다. 이전的人工 조정에 대한 데이터도 수집하여 평균 조정 값을 계산합니다. 또한 우리는 이러한 값을 확장함으로써 개선할 수 있습니다. 시장에 대한 인간 조정 데이터를 더 많이 수집할수록, 데이터 세트는 성장하고 OVM의 성능을 향상시킵니다. 이것은 지속적으로 성능을 개선하는 피드백 루프입니다.
높은 정확도를 갖는 것 외에도, 낮은 지연 시간과 높은 커버리지가 필요합니다. 즉, 새로운 시장에 진입할 때마다 OVM의 기능을 확장하여 모든 지역과 집 유형의 주택 소유자를 지원할 수 있어야 합니다.
기계 학습 방법론 중 어떤 것이 사용됩니까?
우리가 OVM을 처음 구축했을 때, 우리는 구매자와 판매자의 의사 결정 과정에 대한 선형 통계 모델을 주로 사용했습니다. 그러나 시간이 지남에 따라, OVM은 발전하여 현재는 신경망, 특히 시아메스 네트워크 아키텍처를 기반으로 합니다. 우리는 이를 통해 구매자와 판매자의 행동, 비교 가능한 집의 선택, 조정 및 가중치를 포함하는 임베딩을 수행합니다. 이것은 필수적입니다. 왜냐하면 우리는 높은 정확도를 달성하기 위해 모델이 이러한 시장 참여자의 주요 단계를 반영해야 한다는 것을 발견했기 때문입니다.
신경망을 사용하는 많은ประโยชน 중 하나는 데이터를 모든 시장에서 소화하고 미세한 지역적 특성을 감지하는 정밀도와 유연성을 갖는다는 것입니다. 따라서 Opendoor이 새로운 시장에 진입하거나 기존 시장에서 재고를 확장할 때, 우리는 동일한 모델을 사용할 수 있습니다. 이는 새로운 프로덕션 모델을 인스턴스화하는 데 필요한 엔지니어링 인프라 작업을 많이 생략할 수 있습니다. 대신, 우리는 새로운 데이터를 기존 모델을 통해 실행하여 엔지니어가 프로세스에 소요하는 시간을 크게 줄일 수 있습니다.
Opendoor에서 신경망 외에도 많은 다른 기계 학습 방법론을 사용합니다. 이는 의사 결정 트리, 클러스터링 기술, 랭킹 시스템 및 최적화 알고리즘을 포함합니다.
Opendoor에서 사용하는大量의 데이터는 어디에서 수집합니까?
알고리즘이 가장 가치 있게 여기는 데이터는 또한 가장 khó 찾는 데이터입니다. 이것은 우리가 직접 생성하거나 독점적 관계를 통해 개발하는 데이터입니다. 우리는 내부 데이터와 제3자 부동산 데이터를 결합하여 사용합니다. 이는 목록에서 판매 날짜, 침실 및 욕실의 수, 평방 피트 등과 같은 데이터 포인트를 포함합니다. 또한, 조명, 도로 소음, 가전제품 및 마감의 품질과 같은 집의 고유성에 대한 특징을 살펴봅니다. 우리는 이미 시장에 있는 집과 우리와 정보를 공유한 집 주인으로부터의 데이터를 수집합니다.
Opendoor의 원시 데이터 수집을 위한 인프라의 속도와 신뢰성을 개선하기 위한 노력에 대해 논의해 주시겠습니까?
새로운 시장에 진입하기 전에, 우리는 많은 역사적인 데이터를 수집합니다. 높은 품질의 데이터는 알고리즘과 지역 운영자를 교육하는 데 필수적입니다. 속도, 품질 및 신뢰성을 개선하기 위해, 우리는 유연한 데이터 매핑 도구와 새로운 데이터 필드의 범위를 자동으로 평가하는 도구를 구축했습니다. 이러한 도구를 사용하면, 역사적인 부동산 거래 데이터를 수집하고 검증하는 데 몇 시간 또는 며칠이 걸릴 뿐입니다. 이전에는 몇 주가 걸렸습니다.
또 다른 전략은 자동 데이터 품질 모니터링에 투자하는 것입니다. 우리는 각 단계에서 처리되는 데이터의 분포를 실시간으로 확인하는 시스템을 설정했습니다. 예를 들어, 특정 시장에서 평균적으로 20%의 새로운 목록이 아파트인 경우, 오늘 50%의 새로운 목록이 아파트로 분류된 경우, 이는 엔지니어가 조사할 경고를 발생시킵니다.
전문가의 인간 판단과 기계 학습 알고리즘을 어떻게 결합하여 지속적으로 성능을 개선하는 피드백 루프를 만들 수 있습니까?
우리의 내부 가격 전문가들은 가격 결정 과정 전반에 걸쳐 중요한 역할을 합니다. 기계는 여전히盲點이 있는 경우, 전문가가 이를 보완하며, 우리는 다양한 단계에서 이를 신뢰합니다. 예를 들어, 입력 데이터를 추가하거나 확인하고, 중간 결정에 대한 특정 특징을 만들며, 사용자와 상호작용하는 결정도 합니다. 인간 요소는 우리의 전략에 항상 중요하며, 우리는 전문가와 알고리즘을 결합하는 것이 가장 좋다고 믿습니다.
백테스팅을 정의하고 Opendoor에서 그 중요성을 논의해 주시겠습니까?
백테스팅은 역사적인 데이터를 사용하여 모델의 정확성을 평가하는 방법입니다. 예를 들어, 우리는 Opendoor 가치 평가 모델을 2015년 1월부터 2021년 1월까지의 데이터로 훈련시킬 수 있습니다. 여기서 “훈련”은 역사적인 입력과 결과를 모델에 공급하여 입력과 결과 간의 관계를 학습한다는 것을 의미합니다. 그런 다음 우리는 이 모델을 사용하여 다른 역사적인 데이터 세트, 예를 들어 2021년 2월의 데이터를 공급합니다. 데이터가 역사적인 데이터이므로, 결과를 알고 있으며, 예측과 얼마나 다르지는지 측정할 수 있습니다.
이 프로세스는 Opendoor에서 매우 중요하며, 모든 기계 학습 제품에 사용됩니다. 이는 과적합이라는 문제를 줄입니다. 과적합은 기계 학습 모델이 역사적인 데이터에서 실제로 존재하지 않는 패턴을 식별하는 경우입니다. 예를 들어, 실제 예측에 도움이 되지 않는 우연한 상관관계입니다. 또한, 새로운 제품과 전략에 대한 실제 A/B 테스트의 비용을 절약합니다. 이러한 테스트는 역사적인 데이터를 기반으로 제거할 수 있습니다.
Opendoor에 대해 더 공유하고 싶은 것이 있습니까?
우리는 채용 중입니다! 실거래가 부동산의 미래를 구축하거나, 금융 기술, 기계 학습 및 소비자 제품의 교차점에서 일하는 데 관심이 있다면, 지원해 주세요! 우리는 다양한 기능과 도시에서 열린 역할을 가지고 있습니다. 여기에서 우리의 채용 페이지를 확인하세요.
이번 인터뷰에 감사드립니다. 더 많은 정보를 원하는 독자는 Opendoor를 방문하세요.












