Интервью
Сэм Стоун, PM, ценообразование в Opendoor – Интервью

Сэм увлечен созданием продуктов на пересечении финансов и машинного обучения. В настоящее время он является руководителем отдела продукта для группы ценообразования в Opendoor, поздней стадии стартапа, который использует алгоритмы для покупки и продажи домов мгновенно, экономя домовладельцам хлопоты и неопределенность, связанные с выставлением их дома на продажу и проведением показов.
Что изначально привлекло вас к машинному обучению и науке о данных?
После колледжа я работал в крупной компании профессиональных услуг, которая нанимала сотни выпускников колледжа на одну и ту же должность. Когда я стал участвовать в процессе найма, я был поражен и разочарован тем, насколько сильно мнения людей внутри компании различались относительно того, какие атрибуты кандидата приводят к успеху. Казалось, что это очень важная проблема, где не хватало ясности. Но я был взволнован тем, что у нас было много данных о прошлых заявителях на работу и результатах новых сотрудников, которые никогда не были связаны или глубоко проанализированы. Итак, я начал работать над этим, рассматривая это как статистическую проблему, используя базовые инструменты, такие как линейная регрессия. Со временем проект вырос в стартап, и методы, которые мы использовали, стали более сложными. Например, мы хотели обработать неструктурированные аудио- и текстовые данные из интервью直接, и это привело нас к использованию более мощных моделей машинного обучения, таких как нейронные сети.
Можете ли вы обсудить модель автоматической оценки Opendoor (OVM) и то, как она рассчитывает предполагаемую стоимость недвижимости?
Модель оценки Opendoor (OVM) является ключевым элементом нашего бизнеса и влияет на многие последующие приложения ценообразования.
Во многих отношениях OVM ведет себя как типичный покупатель или продавец – он смотрит на район, включая типы и цены недавно проданных домов. Однако, когда речь идет о ценообразовании на дома, особенно учитывая разнообразие домов по всей территории США, недостаточно просто смотреть на цены сравнимых продаж. Это намного сложнее. Мы учитываем широкий спектр факторов, от площади и размера заднего двора до количества ванных комнат и спален, планировки, шумных дорог, улучшений и многое другое. OVM питается множеством источников данных, включая информацию о налогообложении недвижимости, рыночные тенденции, а также многие специфические для дома и района сигналы. Мы также ищем предыдущие человеческие корректировки на домах, чтобы вычислить среднее значение корректировки. И мы можем усовершенствовать эти значения с помощью масштаба. Когда мы собираем больше человеческих корректировочных данных для рынков, набор данных растет, и улучшается производительность OVM. Это обратная связь, которая непрерывно улучшает производительность с течением времени.
Помимо высокой точности, она должна работать с низкой задержкой и высокой степенью покрытия. Это означает, что каждый раз, когда мы вступаем в новый рынок, нам нужно расширить возможности OVM, чтобы обеспечить его способность обслуживать домовладельцев по всей территории районов и типов домов.
Какие разные методологии машинного обучения используются?
Когда мы впервые начали строить OVM, мы в основном полагались на линейные статистические модели, чтобы лучше понять процесс принятия решений покупателями и продавцами. Но со временем OVM развивался и теперь основан на нейронной сети, в частности, на архитектуре, называемой Сиамской сетью. Мы используем это для встраивания поведения покупателей и продавцов, включая выбор сравнимых домов, корректировку и взвешивание. Это важно, поскольку мы обнаружили, что для достижения высокой точности модели должны отражать эти ключевые шаги, которые участники рынка следуют в своей архитектуре.
Одним из многих преимуществ использования нейронной сети является то, что она имеет точность и гибкость, чтобы переварить данные по всем рынкам и обнаружить тонкие местные нюансы. В результате, когда Opendoor запускает новый рынок или расширяет запасы на существующем рынке, мы можем использовать одну и ту же модель, минуя большую часть инженерной работы, связанной с созданием новой производственной модели. Вместо этого мы запускаем новые данные через существующую модель, что значительно снижает время, которое наши инженеры тратят на этот процесс.
Существует также множество других методологий машинного обучения, которые мы используем в Opendoor, помимо нейронных сетей. Это включает, но не ограничивается, деревья решений, методы кластеризации, системы ранжирования и алгоритмы оптимизации.
Opendoor полагается на огромные объемы данных, где эти данные собираются?
Данные, которые наши алгоритмы находят наиболее ценными, также часто являются самыми трудными для нахождения. Это данные, которые мы генерируем сами или разрабатываем через проприетарные отношения. Мы используем комбинацию внутренних данных и данных о недвижимости третьих сторон, включая данные о списках, таких как дата продажи, количество спален и ванных комнат, площадь и многое другое. Кроме того, мы смотрим на функции, которые указывают на уникальность домов, которые могут быть предоставлены только человеческим опытом, такие как освещение, шум улицы, качество бытовой техники и отделки, и многое другое. Мы собираем данные из домов, которые уже находятся на рынке, а также из домов, которые не находятся на рынке, где владельцы поделились информацией с нами.
Можете ли вы обсудить некоторые усилия Opendoor по улучшению скорости и надежности инфраструктуры, которая питает его сырые данные?
Перед запуском нового рынка мы поглощаем много лет исторических данных. Высококачественные данные имеют решающее значение для обучения наших алгоритмов и наших местных операторов, чтобы обеспечить их понимание вариаций внутри этого рынка. Чтобы улучшить скорость, качество и надежность, мы построили гибкие инструменты для сопоставления данных и инструменты для автоматической оценки покрытия новых полей данных. С этими инструментами на месте это занимает у нас всего несколько часов или дней, чтобы поглотить и проверить большие объемы исторических данных о недвижимости, вместо недель.
Другой стратегией, в которую мы инвестировали, является активный, автоматический мониторинг качества данных. Мы установили системы, которые проверяют распределения данных, которые мы поглощаем и преобразуем на каждом этапе процесса, в режиме реального времени. Например, если мы ожидаем, что на определенном рынке 20% новых списков в среднем являются квартирами, и затем сегодня 50% новых списков классифицируются как квартиры, это запускает оповещение для инженера, чтобы расследовать.
Как человеческая экспертиза объединяется с алгоритмами машинного обучения, чтобы создать обратные связи постоянно улучшаемой производительности?
Наши внутренние эксперты по ценообразованию играют огромную роль в наших решениях о ценообразовании, работая в тандеме с нашими алгоритмами. Где машины все еще имеют слепые пятна, наши экспертные операторы заполняют их, и мы полагаемся на них на различных этапах. Например, они добавляют или проверяют входные данные, такие как качество определенных проектов реконструкции. Они принимают промежуточные решения о том, какие функции могут быть трудно оценить, и они также принимают решения, ориентированные на пользователя, такие как какие предложения мы должны принять. Человеческий элемент всегда будет иметь решающее значение для нашей стратегии, и мы считаем, что сочетание экспертов и алгоритмов является лучшим.
Можете ли вы определить, что такое обратное тестирование, и обсудить его важность в Opendoor?
Обратное тестирование – это способ оценить точность модели, используя исторические данные. Например, мы можем обучить модель оценки Opendoor на данных с января 2015 года по январь 2021 года. В этом контексте “обучить” означает, что мы подаем исторические входные данные, такие как атрибуты дома, и результаты, такие как цены проданных домов, в модель. И, в свою очередь, модель учит отношения между входными и выходными данными. Затем мы берем эту модель, которая отражает эти новые отношения, и подаем в нее другой набор исторических данных, скажем, с февраля 2021 года. Поскольку данные исторические, мы знаем результаты, и мы можем измерить, насколько они отклоняются от прогнозов.
Этот процесс очень важен в Opendoor и используется для всех наших продуктов машинного обучения. Он снижает риск проблемы, называемой переобучением, когда модель машинного обучения выявляет закономерности в исторических данных, которые на самом деле не существуют. Например, случайные корреляции, которые не помогают в реальном прогнозировании. Он также спасает нас от проведения дорогостоящих реальных тестов А/Б на новые продукты и стратегии, которые можно исключить на основе исторических данных.
Есть ли что-то еще, что вы хотели бы поделиться об Opendoor?
Мы нанимаем! Если вы заинтересованы в построении будущего недвижимости и/или работе на пересечении финтех, машинного обучения и потребительских продуктов, пожалуйста, подайте заявку! У нас есть открытые позиции по всем функциям и городам. Посетите нашу страницу карьер здесь.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Opendoor.












