Andersons hoek
AI biedt verbeterde tracking van offshore-eigendom van onroerend goed in het VK

Nieuw onderzoek van twee Britse universiteiten heeft als doel om meer licht te werpen op de potentiële staat van witwassen van geld via onroerend goed in het Verenigd Koninkrijk, en met name in de zeer gewilde Londense onroerendgoedmarkt.
Volgens de resultaten van het project bedraagt het totale aantal ‘onconventionele’ binnenlandse eigendommen (d.w.z. eigendommen die niet op lange termijn worden gebruikt als woningen door eigenaren of huurders) ongeveer 138.000 in Londen alleen.
Dit cijfer is 44% hoger dan de officiële cijfers, die worden geleverd en periodiek bijgewerkt door de Britse regering.
De onderzoekers gebruikten verschillende technieken voor Natural Language Processing (NLP), samen met aanvullende gegevens en ondersteunend onderzoek, om de beperkte officiële informatie die de Britse regering beschikbaar maakt over het percentage, de waarde, de locatie en de soorten onroerend goed dat in het VK wordt bezeten door offshore-bedrijven, te vergroten, waarvan de meest winstgevende in de hoofdstad zijn.
Het onderzoek toonde aan dat de totale hoeveelheid offshore-, laaggebruikte en airbnb-achtige (d.w.z. ‘casuele bezetting’) eigendommen in het VK collectief een waarde hebben van ongeveer £145-174 miljard GBP over ongeveer 144.000-164.000 eigendommen.
Het toonde ook aan dat offshore-eigendommen van dit type over het algemeen duurder zijn en significante patronen vertonen in verband met hun locatie in het VK.
De onderzoekers schatten dat offshore-eigendom van het type Onconventioneel binnenlands eigendom (UDP) 7,5% van de totale binnenlandse waarde vertegenwoordigt, en dat £56 miljard van de geschatte waarde beperkt is tot slechts 42.000 woningen.
Het artikel zegt:
‘Individuele offshore-eigendommen zijn zelfs volgens de UDP-normen zeer duur, bovendien zijn ze geconcentreerd in het centrum van Londen met sterke ruimtelijke autocorrelatie.
‘In tegenstelling tot genestete offshore-eigendommen zijn deze enigszins minder geconcentreerd in centraal Londen, maar zijn ze over het algemeen meer geconcentreerd, er is ook bijna geen ruimtelijke correlatie.’
Analyse van de verhoogde gegevens toont aan dat een groot aantal offshore-eigendommen in bezit zijn van entiteiten in de Crown Dependencies (CD), met het tweede grootste aantal dat wordt vertegenwoordigd door Britse Overzeese Gebieden (in de onderstaande grafiek wordt ‘PWW2’ aangeduid als landen die onafhankelijk werden van Groot-Brittannië na de Tweede Wereldoorlog).

Verdeling van buitenlands bezit, volgens de resultaten van het nieuwe artikel. Bron: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf
Het artikel merkt op:
‘Feitelijk zijn slechts 4 gebieden, de Britse Maagdeneilanden, Jersey, Guernsey en het eiland Man, geassocieerd met 78% van alle eigendommen.’
De nieuwe verhoogde gegevens hebben het mogelijk gemaakt om sub-eigendommen te bepalen die bestaan binnen een bekend buitenlands bezit – een functionaliteit die meestal wordt gehinderd door de platte en beperkte gegevens die in de officiële cijfers worden verstrekt.
De resultaten geven ook aan dat offshore-, airbnb- en laaggebruikte eigendommen opvallend meer geografisch geconcentreerd zijn dan normale woningen, en zijn bovendien geconcentreerd in hogere waardegebieden.

Visualisatie van concentratiekaarten met betrekking tot verschillende soorten buitenlands bezit in Londen. Bron: https://arxiv.org/pdf/2207.10931.pdf
Over de bovenstaande grafiek merken de auteurs op:
‘Offshore binnenlands eigendom heeft enkele extreem hoge concentraties waar een hele woonwijk in bezit is van een offshore-bedrijf.’
De auteurs hebben code vrijgegeven voor hun verwerkingpijplijn.
Het nieuwe artikel heeft als titel Wat zit er in de wasserette? Kaart en karakterisering van offshore-eigendom van onroerend goed in Londen, en komt van onderzoekers aan The Bartlett Faculty of the Built Environment van University College London, en Kingston University’s Department of Economics.
Het probleem aanpakken
De auteurs merken op dat na decennia van inspanningen om het gebruik van onroerend goed voor het witwassen van geld in het Verenigd Koninkrijk te bestrijden, het vrijgeven van een gelekte lijst van offshore-eigendom van onroerend goed in het VK door de Britse publicatie Private Eye in 2015 nodig was om de Britse regering ertoe te brengen om een regelmatig bijgewerkt overzicht van offshore-eigendom van onroerend goed in het grootste deel van het VK te publiceren, bekend als Buitenlandse bedrijven die onroerend goed bezitten in Engeland en Wales (OCOD).
De onderzoekers merken op dat hoewel OCOD een stap vooruit is in onderzoek en analyse van buitenlands eigendom en potentieel witwassen van geld in het VK, de gegevens een aantal beperkingen hebben, waarvan sommige cruciaal zijn:
‘Deze adressen kunnen onvolledig zijn, geneste eigendommen bevatten, waar meerdere eigendommen bestaan binnen één rij of titelnummer, het bevat ook geen informatie over of het eigendom een woning, bedrijf of iets anders is.
‘Dergelijke slechte kwaliteit gegevens maken het moeilijk om de verdeling en kenmerken van offshore-eigendom van onroerend goed in het VK te begrijpen.’
Het is vooral moeilijk om gegevens te verkrijgen over casual-verhuurde eigendommen, zoals airbnb-eigendommen, aangezien openbaar beschikbare gegevens beperkt of niet-bestaand zijn. Bovendien maakt Schotland (een deel van het Verenigd Koninkrijk) zijn eigen register van onroerendgoedtransacties niet openbaar beschikbaar, in tegenstelling tot Engeland en Wales.
Om enkele van de inconsistenties rond eigendomclassificatie te compenseren, heeft de Britse regering het Unieke Eigendomsreferentienummer (UPRN) systeem ingevoerd, dat is ontworpen om duidelijkere relaties over diverse eigendomsgegevensbronnen mogelijk te maken. De auteurs merken echter op* ‘hoewel het gebruik van UPRN verplicht is, gebruikt vrijwel geen enkel overheidsdepartement het, waardoor het koppelen van de gegevens geavanceerde gegevensverwerking vaardigheden vereist’.
Daarom heeft het nieuwe onderzoek als doel gesteld om de gegevens meer granulair en inzichtelijk te maken.
Gegevens verzamelen en verbinden
Binnen elk afzonderlijk land zijn adresformaten meestal voorspelbaar en consistent, wat ook van toepassing is op Britse adressen. Daarom zijn, geconfronteerd met ‘platte’, tekstgebaseerde adresgegevens (zoals die verstrekt door OCOD), een aantal open source-adresparser-oplossingen ontstaan om adressen te kruisverwijzen naar andere gegevensbronnen.
Echter, veel van deze zijn getraind met Open Street map gegevens, die adressen kunnen opleveren die in werkelijkheid tientallen of zelfs honderden geneste sub-adressen kunnen bevatten (zoals appartementen in een breed adres voor een appartementencomplex). Gevolglijk heeft zelfs een gerenommeerde adresparser als libpostal moeite ondervonden bij het parseren van onvolledige adressen.
Om de parser voor hun project te maken, hebben de onderzoekers van het nieuwe artikel een aantal openbaar beschikbare datasets gebruikt. De belangrijkste gegevens werden verstrekt door OCOD, terwijl het gegevensreinigingscomponent het Land Registry Price dataset gebruikte, samen met de VOA ratings lijst van datasets, en het Office of National Statistics Postcode Directory (ONSPD).
De airbnb-gegevens kwamen van de InsideAirbnb domein, die alleen hele woningen omvat die worden verhuurd, en dus de oorspronkelijk voorgestelde use-case voor airbnb (d.w.z. het verhuren van een deel van je eigen woning op een occasionele basis) uitsluit.
De auteurs low-use eigendomsdataset werd aangevuld met informatie die werd verkregen via succesvolle Freedom of Information (FOI) verzoeken, die voornamelijk werden verzameld voor een eerder project.
De basisgegevens van OCOD is een.CSV komma-gescheiden bestand met een redelijke mate van structuur en voorspelbaar formaat.

De pijplijn bestond uit vijf fasen: labeling, parsing, expanding, classifying en contracting. Aan het begin kon elk individueel adres in werkelijkheid meerdere geneste eigendommen omvatten, hoewel dit niet expliciet is in de door de regering verstrekte gegevens.
De onderzoekers voerden enige lichte syntactische voorverwerking uit, en importeerden vervolgens de gegevens in programmatic, een platform dat is ontworpen om geannoteerde NLP-datasets te maken zonder handmatige labeling. Hier werden entiteiten gelabeld met behulp van reguliere expressies (Regex) om acht soorten genoemde entiteiten te beschrijven (zie afbeelding hieronder):

Met deze labels toegevoegd, werd de dataset geëxporteerd als een JSON-bestand, met label-overlappingen verwijderd door eenvoudige regelgebaseerde routines.
Bovendien werd de output van programmatic gebruikt om een voorspellend model te trainen voor SpaCy, ondersteund door Facebook’s RoBERTa. Eenmaal gedenoiseerd, creëerden de onderzoekers een ground truth-vergelijkingsset van 1000 willekeurig gelabelde observaties. De nauwkeurigheidsscore van onbegeleide gegevens zou uiteindelijk worden geëvalueerd tegen deze ground truth.
Adresparseren bood een aantal uitdagingen. De auteurs wijdden elk karakteraanhangsel zijn eigen rij en elk labelklasse zijn eigen kolom, en backpropageerden vervolgens de kolommen om complete adresrijen te genereren.
Aangezien sommige enkele adressen meerdere distincte woningen bevatten, was het noodzakelijk om de database uit te breiden door enkele adressen te onderverdelen in sub-eigendommen die aanwezig waren in aanvullende databases.
Na dit, cross-referenced de adresclassificeringsfase alle gevonden postcodes met behulp van de ONSPD-database. Deze procedure verbindt de adresgegevens met census- en andere demografische gegevens, en individueert sub-eigendommen die eerder verborgen waren achter de ondoorzichtige adressen van de OCOD-gegevens.
Ten slotte filterde het adrescontracteringsproces alle niet-woningen (d.w.z. commerciële panden) uit geneste eigendomsgroepen.
Analyse
Om de nauwkeurigheid van de verhoogde gegevens te testen, hebben de auteurs, zoals eerder vermeld, een sample ground truth-set gemaakt dat werd teruggehouden van de algemene analyse, en alleen werd gebruikt om de nauwkeurigheid van de voorspellingen en analyses te testen.
Handmatige controle voor de ground truth omvatte het gebruik van kaartsoftware, evenals analyse van foto’s van de eigendommen die in de teruggehouden set werden weergegeven, en van internetzoekopdrachten om het type eigendom te evalueren. Vervolgens werd de prestatie van de gegevens gemeten tegen precisie, recall en F1-scores.
De waarde van laaggebruikte en binnenlandse eigendommen werd verkregen met een basismodel, dezelfde methode die ook werd gebruikt om UDP-eigendommen af te leiden.
De NER-taak, getest tegen de high-effort, handmatig gelabelde ground truth, behaalde een F1-score van 0,96 (dicht bij ‘100%’, in termen van nauwkeurigheid).

F1-scores voor de NER-labelingtaak. Enige onevenwichtigheid wordt gevonden, aangezien het proces de hoeveelheid woningen enigszins overschat en de totale hoeveelheid bedrijven onderschat, vanwege de structuur van de verhoogde gegevens.
Met betrekking tot UDP’s in Londen, laten de definitieve resultaten een totaal van 138.000 entries zien – 44% meer dan de 94.000 die in de oorspronkelijke OCOD-dataset worden weergegeven (d.w.z. recente officiële cijfers).

De verdeling van eigendomstypen onder type 2-classificatie.
De resultaten geven aan dat de totale waarde van de offshore-eigendommen ongeveer £56 miljard bedraagt, terwijl de totale waarde van laaggebruikte eigendommen wordt geschat op £85 miljard.
De auteurs merken op:
‘[Alle] UDP’s zijn veel duurder dan de gemiddelde conventionele eigendomswaarde van £600.000.’
Dit soort verbeterde gegevens kan nodig zijn om het gebruik van onroerendgoedspeculatie als een activiteit voor het witwassen van geld in het VK te bestrijden. De auteurs merken op dat er een groeiend aantal onderzoeken en literatuur is dat suggereert dat verbeterde gegevens kunnen helpen bij het bestrijden van AML-onroerendgoedspeculatie, en concluderen:
‘Deze gegevens kunnen worden gebruikt door sociologen, economen en beleidsmakers om ervoor te zorgen dat pogingen om het witwassen van geld en hoge onroerendgoedprijzen te verminderen, zijn gebaseerd op gedetailleerde gegevens die de werkelijke situatie weerspiegelen.’
* Mijn conversie van de inline-citatie van de auteurs naar hyperlinks.
First published 25th juli 2022.












