Andersons Blickwinkel
KI bietet verbesserte Nachverfolgung von Offshore-Immobilienbesitz im Vereinigten Königreich

Neue Forschungsergebnisse von zwei britischen Universitäten zielen darauf ab, ein größeres Licht auf den potenziellen Zustand von immobilienbasiertem Geldwäsche im Vereinigten Königreich, insbesondere auf dem hochpreisigen Londoner Immobilienmarkt, zu werfen.
Laut den Ergebnissen des Projekts beträgt die Gesamtzahl der “unkonventionellen” inländischen Immobilien (d. h. Immobilien, die nicht langfristig als Wohnungen von Eigentümern oder Mietern genutzt werden) in London allein etwa 138.000.
Diese Zahl ist 44 % höher als die offiziellen Zahlen, die vom britischen Staat bereitgestellt und regelmäßig aktualisiert werden.
Die Forscher verwendeten verschiedene Techniken des Natural Language Processing (NLP) sowie zusätzliche Daten und korroborative Forschung, um die begrenzten offiziellen Informationen, die die britische Regierung über den Prozentsatz, den Wert, den Standort und die Arten von Immobilien, die von Offshore-Unternehmen im Vereinigten Königreich besessen werden, bereitstellt, zu erweitern, insbesondere in der Hauptstadt.
Die Forschung ergab, dass die Gesamtsumme der Offshore-, Low-Use- und Airbnb -ähnlichen (d. h. “gelegentliche Nutzung”) Immobilien im Vereinigten Königreich insgesamt etwa 145-174 Milliarden GBP über etwa 144.000-164.000 Immobilien beträgt.
Es wurde auch festgestellt, dass Offshore-Immobilien dieser Art typischerweise teurer sind und Signaturen-Muster in Bezug auf ihren Standort im Vereinigten Königreich aufweisen.
Die Forscher schätzen, dass Offshore-besessene “Unkonventionelle Inländische Immobilie” (UDP) 7,5 % des gesamten inländischen Wertes ausmacht und dass 56 Milliarden GBP des geschätzten Wertes auf nur 42.000 Wohnungen begrenzt sind.
Die Studie besagt:
‘Einzelne Offshore-Immobilien sind sehr teuer, sogar im Vergleich zu UDP, und sind auf das Zentrum von London konzentriert, mit starker räumlicher Autokorrelation.
‘Im Gegensatz dazu ist die verschachtelte Offshore-Immobilie weniger auf das Zentrum von London konzentriert, aber allgemein stärker konzentriert, und es gibt fast keine räumliche Korrelation.’
Die Analyse der erweiterten Daten zeigt, dass eine große Anzahl von Offshore-Immobilien Eigentum von Entitäten in den Crown-Abhängigkeiten (CD) ist, während die zweitgrößte Zahl von britischen Übersee-Territorien (in der folgenden Grafik bedeutet “PWW2” Länder, die nach dem Zweiten Weltkrieg von Großbritannien unabhängig wurden) ausgemacht wird.

Verteilung von ausländischem Immobilienbesitz, gemäß den Ergebnissen der neuen Studie. Quelle: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf
Die Studie bemerkt:
‘Tatsächlich sind nur 4 Territorien, die Britischen Jungferninseln, Jersey, Guernsey und die Insel Man, mit 78 % aller Immobilien verbunden.’
Die neuen erweiterten Daten haben es ermöglicht, Sub-Immobilien zu bestimmen, die innerhalb einer bekannten Offshore-Immobilie existieren – eine Fähigkeit, die normalerweise durch die flache und begrenzte Daten der offiziellen Zahlen behindert wird.
Die Ergebnisse zeigen auch, dass Offshore-, Airbnb- und Low-Use-Immobilien bemerkenswert geografisch konzentrierter sind als normale Wohnungen und zusätzlich in höheren Wertgebieten konzentriert sind.

Visualisierte Konzentrationskarten in Bezug auf verschiedene Arten von ausländischem Immobilienbesitz in London. Quelle: https://arxiv.org/pdf/2207.10931.pdf
Zu dem obigen Graphen bemerken die Autoren:
‘Offshore-Immobilien haben einige extrem hohe Konzentrationen, wo eine ganze Wohnanlage von einem Offshore-Unternehmen besessen wird.’
Die Autoren haben Code für ihre Verarbeitungspipeline veröffentlicht.
Die neue Studie trägt den Titel Was ist in der Wäscherei? Offshore-besessene inländische Immobilie in London kartieren und charakterisieren und stammt von Forschern der Fakultät für Bauwesen an der University College London und der Kingston University’s Department of Economics.
Das Problem angehen
Die Autoren bemerken, dass es nach Jahrzehnten der Bemühungen, die Verwendung von Immobilien für Geldwäschezwecke im Vereinigten Königreich zu kontrollieren, der Veröffentlichung einer geleakten Liste von Offshore-Immobilien im Vereinigten Königreich durch die britische Veröffentlichung Private Eye im Jahr 2015 bedurfte, um die britische Regierung zu veranlassen, eine regelmäßig aktualisierte Liste von Offshore-Immobilien in den meisten Teilen des Vereinigten Königreichs zu veröffentlichen, bekannt als Offshore-Unternehmen, die Immobilien in England und Wales besitzen (OCOD).
Die Forscher bemerken, dass OCOD ein Schritt in Richtung Forschung und Analyse von Offshore-Besitz und potenzieller Geldwäsche im Vereinigten Königreich ist, die Daten jedoch eine Reihe von Einschränkungen aufweisen, einige davon wesentlich:
‘Diese Adressen können unvollständig sein, verschachtelte Eigentümer enthalten, wobei multiple Eigentümer in einer einzigen Zeile oder Titelnummer existieren, und sie enthalten keine Informationen darüber, ob die Immobilie domestic, gewerblich oder etwas anderes ist.
‘Eine solche schlechte Datenqualität macht es schwierig, die Verteilung und die Merkmale von Offshore-Immobilien im Vereinigten Königreich zu verstehen.’
Es ist besonders schwierig, Daten über gelegentlich vermietete Immobilien wie Airbnb-Immobilien zu erhalten, da öffentlich verfügbare Daten begrenzt oder nicht existent sind. Zusätzlich macht Schottland (ein Teil des Vereinigten Königreichs) seinen eigenen Register von Immobilienverkäufen nicht öffentlich verfügbar, im Gegensatz zu England und Wales.
Um einige der Inkonsistenzen um die Immobilienklassifizierung zu beheben, führte die britische Regierung die Unique Property Reference Number (UPRN)-System ein, das darauf ausgelegt ist, klarere Beziehungen zwischen verschiedenen Immobiliendatenquellen zu ermöglichen. Die Autoren bemerken jedoch* ‘obwohl die Verwendung der UPRN vorgeschrieben ist, verwendet fast kein Regierungsministerium sie, was bedeutet, dass das Verbinden der Daten erweiterte Datenverarbeitungsfähigkeiten erfordert‘.
Daher zielte die neue Forschung darauf ab, die Daten granularer und informativer zu machen.
Daten sammeln und verbinden
Innerhalb eines einzelnen Landes sind Adressformate normalerweise vorhersehbar und konsistent, was auch auf britische Adressen zutrifft. Wenn also “flache”, textbasierte Adressendaten (wie die von OCOD bereitgestellten) vorliegen, sind eine Reihe von Open-Source-Adress-Parser-Lösungen entstanden, um Adressen mit anderen Datenquellen zu verknüpfen.
Einige dieser Lösungen sind jedoch mit OpenStreetMap-Daten trainiert, die Adressen liefern können, die tatsächlich Dutzende oder sogar Hunderte von verschachtelten Sub-Adressen (wie Apartments in einem Apartmentblock) enthalten. Folglich hatte sogar ein renommierter Adress-Parser wie libpostal Schwierigkeiten, wenn er versuchte, unvollständige Adressen zu parsen.
Um den Parser für ihr Projekt zu erstellen, verwendeten die Forscher der neuen Studie eine Reihe von öffentlich verfügbaren Datensätzen. Die wichtigsten Daten wurden von OCOD bereitgestellt, während die Datenreinigungskomponente den Land Registry Price -Datensatz verwendete, zusammen mit dem VOA-Ratings-Listing-Datensatz und dem Office of National Statistics Postcode Directory (ONSPD).
Die Airbnb-Daten stammten von der InsideAirbnb-Domain, die nur ganze Häuser umfasst, die vermietet werden, und somit den ursprünglich vorgeschlagenen Anwendungsfall für Airbnb (d. h. die Vermietung von Teilen oder dem gesamten eigenen Zuhause auf gelegentlicher Basis) ausschließt.
Die Autoren haben ihre Low-Use-Immobilien-Datensammlung durch Informationen ergänzt, die durch erfolgreiche Freedom-of-Information-Anfragen (FOI) gesammelt wurden, die hauptsächlich für ein früheres Projekt gesammelt wurden.
Die Basisdaten von OCOD sind eine.CSV-Datei mit Komma-getrennten Werten und einem guten Grad an Struktur und vorhersehbarer Format.

Die Pipeline bestand aus fünf Stufen: Markierung, Parsing, Erweiterung, Klassifizierung und Kontraktion. Zu Beginn konnte jede einzelne Adresse in der Realität auf multiple verschachtelte Immobilien verweisen, obwohl dies in den vom Staat bereitgestellten Daten nicht explizit ist.
Die Forscher führten einige leichte syntaktische Vorverarbeitung durch, dann importierten sie die Daten in programmatic, eine Plattform, die darauf ausgelegt ist, annotierte NLP-Datensätze ohne manuelle Markierung zu erstellen. Hier wurden Entitäten mit regulären Ausdrücken (Regex) markiert, um acht Arten von benannten Entitäten zu beschreiben (siehe Bild unten):

Mit diesen Markierungen wurde der Datensatz als JSON-Datei extrahiert, wobei Überschneidungen durch einfache Regeln-basierte Routinen entfernt wurden.
Zusätzlich wurde die Ausgabe von programmatic verwendet, um ein prädiktives Modell für SpaCy zu trainieren, das auf Facebooks RoBERTa basiert. Nach der Entfernung von Rauschen erstellten die Forscher einen Ground-Truth-Vergleichsdatensatz von 1000 zufällig markierten Beobachtungen. Die Genauigkeit der unsuperviseden Daten würde schließlich gegen diesen Ground-Truth bewertet.
Die Adressen-Parsing stellte eine Reihe von Herausforderungen dar. Die Autoren wiesen jedem Zeichenbereich seine eigene Zeile und jeder Markierungsklasse ihre eigene Spalte zu und propagierten dann die Spalten zurück, um vollständige Adressenzeilen zu generieren.
Da einige einzelne Adressen mehrere unterschiedliche Wohnungen enthielten, war es notwendig, die Datenbank zu erweitern, indem einzelne Adressen in Sub-Immobilien untergeordnet wurden, die in komplementären Datenbanken vorhanden waren.
Danach erfolgte die Adressen-Klassifizierungsstufe, die alle gefundenen Postcodes mit der ONSPD-Datenbank abglich. Dieser Prozess verbindet die Adressendaten mit Zensus- und anderen demografischen Daten und individuiert Sub-Immobilien, die zuvor hinter den undurchsichtigen Adressen der OCOD-Daten verborgen waren.
Schließlich filterte der Adressen-Kontraktionsprozess alle nicht-domestischen Immobilien (d. h. Gewerbeimmobilien) aus den verschachtelten Immobiliengruppen heraus.
Analyse
Um die Genauigkeit der erweiterten Daten zu testen, erstellten die Autoren, wie bereits erwähnt, einen Ground-Truth-Datensatz, der von der allgemeinen Analyse zurückgehalten wurde und nur zur Überprüfung der Genauigkeit der Vorhersagen und Analysen verwendet wurde.
Die manuelle Überprüfung des Ground-Truth umfasste die Verwendung von Kartensoftware sowie die Analyse von Bildern der in der zurückgehaltenen Menge enthaltenen Immobilien und von Internet-Suchen, um den Immobilientyp zu bewerten. Danach wurde die Leistung der Daten anhand von Präzision, Recall und F1-Scores gemessen.
Der Wert von Low-Use- und domesticen Immobilien wurde mit einem grundlegenden grafischen Modell ermittelt, dem gleichen Verfahren, das auch zur Inferenz von UDP-Immobilien verwendet wurde.
Die NER-Aufgabe, die gegen den hochwertigen, manuell markierten Ground-Truth getestet wurde, erzielte einen F1-Score von 0,96 (nahe an “100 %”, in Bezug auf Genauigkeit).

F1-Scores für die NER-Markierungs-Aufgabe. Einige Unregelmäßigkeiten sind vorhanden, da der Prozess die Anzahl der domesticen Immobilien leicht überschätzt und die Gesamtzahl der Gewerbeimmobilien unterschätzt, aufgrund der Struktur der erweiterten Daten.
Was die UDPs in London betrifft, zeigen die endgültigen Ergebnisse eine Gesamtsumme von 138.000 Einträgen – 44 % mehr als die 94.000, die im ursprünglichen OCOD-Datensatz (d. h. den aktuellen offiziellen Zahlen) enthalten sind.

Aufschlüsselung der Immobilientypen unter Typ 2-Klassifizierung.
Die Ergebnisse zeigen, dass der Gesamtwert der Offshore-Immobilien bei etwa 56 Milliarden GBP liegt, während der Gesamtwert der Low-Use-Immobilien auf etwa 85 Milliarden GBP geschätzt wird.
Die Autoren bemerken:
‘[Alle] UDPs sind viel teurer als der Durchschnittspreis von 600.000 GBP für konventionelle Immobilien.’
Diese Art von verbesserten Daten kann notwendig sein, um die Verwendung von Immobilienspekulation als Geldwäsche-Aktivität im Vereinigten Königreich zu bekämpfen. Die Autoren bemerken den wachsenden Forschungs- und Literaturbestand, der darauf hindeutet, dass verbesserte Daten bei der Bekämpfung von AML-Immobilien-Spekulation helfen können, und schließen:
‘Diese Daten können von Soziologen, Ökonomen und politischen Entscheidungsträgern verwendet werden, um sicherzustellen, dass Versuche, Geldwäsche und hohe Immobilienpreise zu reduzieren, auf detaillierten Daten basieren, die die reale Situation widerspiegeln.’
* Meine Umwandlung der Autoren-Inline-Zitate in Hyperlinks.
Erstveröffentlicht am 25. Juli 2022.












