Взгляд Anderson
ИИ обеспечивает улучшенный отслеживание владения недвижимостью за рубежом в Великобритании

Новые исследования двух университетов Великобритании направлены на проливание большего света на потенциальное состояние отмывания денег на основе недвижимости в Великобритании, особенно на высокоценном рынке лондонской недвижимости.
Согласно результатам проекта, общее количество «необычных» внутренних объектов недвижимости (т.е. объектов, которые не используются в качестве постоянного места жительства владельцами или арендаторами) составляет около 138 000 только в Лондоне.
Эта цифра на 44% выше официальных данных, которые предоставляются и периодически обновляются правительством Великобритании.
Исследователи использовали различные методы обработки естественного языка (NLP), а также дополнительные данные и подтверждающие исследования, чтобы расширить ограниченную официальную информацию, которую правительство Великобритании предоставляет о проценте, стоимости, местонахождении и типах недвижимости, принадлежащей офшорным компаниям в Великобритании, наиболее прибыльными из которых являются в столице.
Исследования показали, что общая стоимость офшорной, низко используемой и арендуемой недвижимости в Великобритании составляет примерно 145-174 миллиарда фунтов стерлингов по approximately 144 000-164 000 объектов недвижимости.
Также было обнаружено, что офшорная недвижимость такого типа обычно более дорогая и имеет характерные закономерности в отношении ее местонахождения в Великобритании.
Исследователи оценивают, что офшорная недвижимость нестандартного использования (UDP) представляет 7,5% от общей стоимости недвижимости, и что 56 миллиардов фунтов стерлингов от общей стоимости ограничены только 42 000 жилыми помещениями.
В статье говорится:
‘Индивидуальная офшорная недвижимость очень дорогая, даже по стандартам UDP, кроме того, она сконцентрирована в центре Лондона с сильной пространственной автокорреляцией.
‘Напротив, вложенная офшорная недвижимость немного менее сконцентрирована в центральном Лондоне, но более высоко сконцентрирована в целом, и почти нет пространственной корреляции.’
Анализ дополненных данных показывает, что большое количество офшорной недвижимости принадлежит сущностям в зависимых территориях (CD), а второе место по количеству занимают британские заморские территории (в таблице ниже ‘PWW2’ обозначает страны, получившие независимость от Великобритании после Второй мировой войны).

Распределение иностранной недвижимости, согласно результатам новой статьи. Источник: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf
Статья отмечает:
‘Фактически, только 4 территории, Британские Виргинские острова, Джерси, Гернси и остров Мэн, связаны с 78% всех объектов недвижимости.’
Новые улучшенные данные позволили определить под-объекты, существующие внутри известной офшорной недвижимости – возможность, обычно ограниченная плоскими и ограниченными данными, предоставляемыми в официальных цифрах.
Результаты также показывают, что офшорная, арендуемая и низко используемая недвижимость заметно более географически сконцентрирована, чем обычные дома, и кроме того, сконцентрирована в более дорогих районах.

Визуализированные карты концентрации, связанные с различными типами иностранной недвижимости в Лондоне. Источник: https://arxiv.org/pdf/2207.10931.pdf
Об вышеуказанной графике авторы комментируют:
‘Офшорная недвижимость имеет некоторые чрезвычайно высокие концентрации, где целое жилое развитие принадлежит офшорной компании.’
Авторы опубликовали код для своей обработки данных.
Новая статья озаглавлена Что в прачечной? Картирование и характеристика офшорной недвижимости в Лондоне, и исходит от исследователей факультета окружающей среды Университета Колледжа Лондона и департамента экономики Университета Кингстона.
Решение проблемы
Авторы отмечают, что после десятилетий усилий по контролю использования недвижимости для отмывания денег в Великобритании, потребовалось опубликование утечки списка офшорной недвижимости в Великобритании британским изданием Private Eye в 2015 году, чтобы побудить правительство Великобритании опубликовать регулярно обновляемый список офшорной недвижимости в большинстве регионов Великобритании, известный как Офшорные компании, владеющие недвижимостью в Англии и Уэльсе (OCOD).
Исследователи отмечают, что хотя OCOD является шагом вперед в исследованиях и анализе офшорного владения и потенциального отмывания денег в Великобритании, данные имеют ряд ограничений, некоторые из которых являются важными:
‘Эти адреса могут быть неполными, содержать вложенные объекты, где несколько объектов существует в одной строке или номере титула, они также не содержат информации о том, является ли объект недвижимости жилым, коммерческим или чем-то другим.
‘Такие данные плохого качества делают понимание распределения и характеристик офшорной недвижимости в Великобритании сложной задачей.’
Особенно трудно получить данные о недвижимости, сдаваемой в аренду, такой как объекты Airbnb, поскольку публично доступные данные ограничены или отсутствуют. Кроме того, Шотландия (часть Великобритании) не делает свой собственный реестр продаж недвижимости публично доступным, в отличие от Англии и Уэльса.
Чтобы устранить некоторые несоответствия вокруг классификации недвижимости, правительство Великобритании ввело систему уникального номера недвижимости (UPRN), предназначенную для обеспечения более четких отношений между различными источниками данных о недвижимости. Однако авторы отмечают* ‘хотя использование UPRN является обязательным,几乎 ни один правительственный департамент не использует его, что означает, что связывание данных требует продвинутых обработки данных навыков‘.
Таким образом, новые исследования были направлены на то, чтобы сделать данные более детальными и информативными.
Сбор и соединение данных
В пределах любой отдельной страны адресные форматы обычно предсказуемы и последовательны, что также применимо к адресам Великобритании. Таким образом, столкнувшись с ‘плоскими’, текстовыми данными адресов (такими, как те, которые предоставляются OCOD), появилось несколько открытых решений для парсинга адресов, чтобы перекрестно ссылаться на другие источники данных.
Однако многие из них обучены с использованием Open Street map данных, которые могут давать адреса, которые на самом деле могут содержать десятки или даже сотни вложенных подадресов (таких, как квартиры в широком диапазоне адресов для жилого дома). Следовательно, даже такой известный парсер адресов, как libpostal, имел трудности при попытке разобрать неполные адреса.
Чтобы создать парсер для своего проекта, исследователи новой статьи использовали несколько публично доступных наборов данных. Ключевые данные были предоставлены OCOD, а компонент очистки данных использовал набор данных Land Registry Price dataset, вместе с набором данных VOA ratings и Office of National Statistics Postcode Directory (ONSPD).
Данные Airbnb были получены из домена InsideAirbnb, который включает только целые дома, сдаваемые в аренду, поэтому исключая первоначально предложенное использование Airbnb (т.е. сдачу в аренду части своего дома на случайной основе).
Набор данных исследователей о низко используемой недвижимости был дополнен информацией, полученной из успешных запросов на предоставление информации, в основном собранных для предыдущего проекта.
Базовые данные OCOD представляют собой файл.CSV с запятыми, имеющий хорошую степень структуры и предсказуемый формат.

Конвейер состоял из пяти стадий: маркировки, парсинга, расширения, классификации и сокращения. Вначале любой отдельный адрес мог решиться в реальной жизни в несколько вложенных объектов, хотя это не явно указано в правительственных данных.
Исследователи выполнили некоторую легкую синтаксическую предварительную обработку, затем импортировали данные в programmatic, платформу, предназначенную для создания аннотированных наборов данных NLP без ручного маркирования. Здесь сущности были помечены с использованием регулярных выражений (Regex), чтобы описать восемь типов именованных сущностей (см. изображение ниже):

С добавлением этих меток набор данных был извлечен в виде файла JSON, с удаленными перекрывающимися метками простыми правилами.
Кроме того, вывод программы был использован для обучения прогностической модели для SpaCy, основанной на RoBERTa от Facebook. После удаления шума исследователи создали набор сравнения из 1000 случайно помеченных наблюдений. Оценка точности несупервизируемых данных будет оцениваться по этому набору сравнения.
Парсинг адресов представлял собой ряд проблем. Авторы присвоили каждому символу свой собственный ряд и каждому классу меток свой собственный столбец, а затем обратно распространили столбцы, чтобы сгенерировать полные строки адресов.
Поскольку некоторые отдельные адреса содержали несколько различных жилых помещений, было необходимо расширить базу данных, разделив отдельные адреса на под-объекты, присутствующие в дополнительных базах данных.
После этого стадия классификации адресов перекрестно ссылалась все найденные почтовые индексы с использованием базы данных ONSPD. Этот процесс связывает данные адресов с переписью и другими демографическими данными и также индивидуализирует под-объекты, которые ранее были скрыты за неясными адресами данных OCOD.
Наконец, процесс сокращения адресов отфильтровал все недомesticные объекты (т.е. коммерческие помещения) из групп вложенных объектов.
Анализ
Чтобы протестировать точность улучшенных данных, авторы, как упоминалось ранее, создали образец набора сравнения, который был отложен от общего потока анализа и использовался только для проверки точности прогнозов и анализов.
Ручная проверка для набора сравнения включала использование программного обеспечения для карт, а также анализ изображений объектов недвижимости, представленных в отложенном наборе, и интернет-поисков для оценки типа объекта недвижимости. Затем производительность данных была измерена по точности, полноте и F1-оценкам.
Стоимость низко используемой и жилой недвижимости была получена с помощью базовой графической модели, того же метода, который был использован для вывода объектов UDP.
Задача распознавания именованных сущностей (NER), протестированная на высоко затратном, вручную помеченном наборе сравнения, получила F1-оценку 0,96 (близко к ‘100%’, в плане точности).

F1-оценки для задачи маркировки NER. Некоторая неравномерность обнаружена, поскольку процесс немного переоценивает количество жилых объектов и занижает общее количество бизнеса, из-за структуры улучшенных данных.
Что касается UDP в Лондоне, окончательные результаты показывают общее количество 138 000 записей – на 44% больше, чем 94 000, представленных в исходном наборе данных OCOD (т.е. недавних официальных данных).

Разбивка типов объектов недвижимости по классификации 2-го типа.
Результаты показывают, что общая стоимость офшорной недвижимости составляет примерно 56 миллиардов фунтов стерлингов, а общая стоимость низко используемой недвижимости оценивается в 85 миллиардов фунтов стерлингов.
Авторы отмечают:
‘[Все] UDP намного более дорогие, чем средняя цена конвенциональной недвижимости в размере 600 тысяч фунтов.’
Такой тип улучшенных данных может быть необходим для борьбы с использованием спекуляций на недвижимости в качестве деятельности по отмыванию денег в Великобритании. Авторы отмечают растущий объем исследований и общей литературы, который предполагает, что улучшенные данные могут помочь в борьбе со спекуляциями на недвижимости, и заключают:
‘Эти данные могут быть использованы социологами, экономистами и политиками для обеспечения того, чтобы попытки снижения отмывания денег и высоких цен на недвижимость были основаны на подробных данных, отражающих реальную ситуацию.’
* Мое преобразование INLINE-цитаты авторов в гиперссылки.
Опубликовано впервые 25 июля 2022 года.












