Andersons vinkel

AI tilbyder forbedret sporingsmulighed for ejendomsbesiddelse i udlandet i Storbritannien

mm
Føj Unite.AI til dine foretrukne kilder på Google

Nyt forskning fra to britiske universiteter søger at kaste mere lys over den potentielle tilstand af ejendomsbaseret hvidvaskning i Storbritannien, og især på det højt værdsatte London ejendelsmarked.

Ifølge projektets resultater, er det totale antal ‘uconventionelle’ indenlandske ejendomme (dvs. ejendomme, der ikke bruges langtids som beboelse af ejere eller lejere) på omkring 138.000 i London alene.

Dette tal er 44% højere end de officielle tal, som leveres og opdateres periodisk af den britiske regering.

Forskerne anvendte forskellige Natural Language Processing (NLP) teknikker, sammen med yderligere data og bekræftende forskning, for at udvide den begrænsede officielle information, som den britiske regering giver om procentdelen, værdien, beliggenheden og typerne af ejendomme, der ejes af selskaber i udlandet i Storbritannien, hvoraf de mest lukrative er i hovedstaden.

Forskningen fandt, at det totale antal ejendomme i udlandet, lavt brug og airbnb-stil (dvs. ‘casual besættelse’) i Storbritannien er samlet set værd omkring 145-174 mia. GBP over ca. 144.000-164.000 ejendomme.

Den fandt også, at ejendomme i udlandet af denne type er typisk mere dyre og har signaturmønstre i forhold til, hvor de er beliggende i Storbritannien.

Forskerne estimerer, at ejendomme i udlandet, der ejes af Uconventionelle indenlandske ejendomme (UDP), repræsenterer 7,5% af den samlede indenlandske værdi, og at 56 mia. GBP af den estimerede værdi er begrænset til kun 42.000 beboelser.

Artiklen siger:

‘Enkeltstående ejendomme i udlandet er meget dyre, selv efter standarden for UDP, og de er koncentreret om centrum af London med stærk spatial autocorrelation.

‘Til gengæld er indlejrede ejendomme i udlandet noget mindre koncentreret om central London, men mere højkoncentreret i almindelighed, og der er næsten ingen spatial korrelation.’

Analyse af de forbedrede data viser, at et stort antal ejendomme i udlandet tilhører enheder i Crown Dependencies (CD), med det næststørste antal repræsenteret af britiske oversøiske territorier (i diagrammet nedenfor betegnes ‘PWW2’ lande, der opnåede uafhængighed fra Storbritannien efter 2. verdenskrig).

Fordeling af ejendomme i udlandet ifølge resultaterne fra den nye artikel. Kilde: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf

Fordeling af ejendomme i udlandet ifølge resultaterne fra den nye artikel. Kilde: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf

Artiklen bemærker:

‘Faktisk er det kun 4 territorier, British Virgin Islands, Jersey, Guernsey og Isle of Man, der er forbundet med 78% af alle ejendomme.’

Den nye forbedrede data har gjort det muligt at bestemme under-ejendomme, der findes inden for en kendt ejendom i udlandet – en funktion, der normalt er hæmmet af den flade og begrænsede data, der leveres i de officielle tal.

Resultaterne viser også, at ejendomme i udlandet, airbnb og lavt brug er bemærkelsesværdigt mere geografisk koncentreret end normale hjem, og er desuden koncentreret i højere værdi områder.

Heat-kort relateret til forskellige typer ejendomme i udlandet i London. Kilde: https://arxiv.org/pdf/2207.10931.pdf

Visualiseret koncentrationskort relateret til forskellige typer ejendomme i udlandet i London. Kilde: https://arxiv.org/pdf/2207.10931.pdf

Om ovenstående diagram siger forfatterne:

‘Ejendomme i udlandet har nogle ekstremt høje koncentrationer, hvor en hel boligudvikling ejes af et selskab i udlandet.’

Forfatterne har frigivet kode for deres procespipeline.

Den nye artikel er titlen Hvad er der i vaskemaskinen? Kartografi og karakterisering af ejendomme i udlandet i London, og kommer fra forskere ved The Bartlett Faculty of the Built Environment på University College London og Kingston Universitys afdeling for økonomi.

At løse problemet

Forfatterne bemærker, at efter årtiers indsats for at kontrollere brugen af ejendom til hvidvaskningsformål i Storbritannien, tog det frigivelsen af en lækket liste over ejendomme i udlandet i Storbritannien af den britiske udgivelse Private Eye i 2015 for at få den britiske regering til at offentliggøre en regelmæssigt opdateret liste over ejendomme i udlandet i Storbritannien, kendt som Selskaber i udlandet, der ejer ejendom i England og Wales (OCOD).

Forskerne bemærker, at selvom OCOD er et skridt i retning af forskning og analyse af ejendomseje og potentiel hvidvaskning i Storbritannien, har dataene en række begrænsninger, nogle af dem afgørende:

‘Disse adresser kan være ufuldstændige, indeholde indlejrede ejendomme, hvor multiple ejendomme findes inden for en enkelt række eller titelnummer, og de indeholder ingen information om, hvorvidt ejendommen er en bolig, forretning eller noget andet.

‘Sådanne dårlige data gør det vanskeligt at forstå fordelingen og karakteristikken af ejendomme i udlandet i Storbritannien.’

Det er særligt vanskeligt at få data om lejede ejendomme, såsom airbnb-ejendomme, da offentligt tilgængelige data er begrænsede eller ikke-eksisterende. Desuden gør Skotland (en del af Storbritannien) ikke sin egen register over ejendomssalg offentligt tilgængelig, til forskel fra England og Wales.

For at imødegå nogle af inkonsistenserne omkring ejendomsklassificering, introducerede den britiske regering det Unikke Ejendomsreferencenummer (UPRN) system, designet til at muliggøre klarere relationer på tværs af forskellige ejendomsdatakilder. Forskerne bemærker dog* ‘mens brugen af UPRN er påkrævet, bruger næsten ingen regeringsafdeling det, hvilket betyder, at sammenkædning af data kræver avancerede dataforarbejdning færdigheder.

Derfor satte den nye forskning sig for at gøre dataene mere detaljerede og indsigtsgivende.

At indsamle og forbinde data

Inden for ethvert enkelt land er adresseformater normalt forudsigelige og konsistente, og dette gælder også for britiske adresser. Derfor har en række åbne adresse-parsningsløsninger opstået for at krydskontrollere adresser med andre datakilder.

Men mange af disse er trænet med Open Street map data, som kan give adresser, der i virkeligheden kan rumme titals eller endda hundredvis af indlejrede underadresser (såsom lejligheder i en bred adresse for en lejlighedsblok). Følgelig har selv en anerkendt adresse-parser som libpostal havt svært ved at parse ufuldstændige adresser.

For at oprette parseren til deres projekt, anvendte artiklens forfattere en række offentligt tilgængelige datasæt. Den vigtigste data blev leveret af OCOD, mens datarensningskomponenten anvendte Land Registry Price dataset, sammen med VOA ratings listingsæt og Office of National Statistics Postcode Directory (ONSPD).

Airbnb -data kom fra InsideAirbnb domænet, som kun omfatter hele hjem, der udlejes, og derfor udelukker den oprindelige foreslåede brugsformål for Airbnb (dvs. udlejning af hele eller dele af sin egen bolig på en lejlighedsvis basis).

Forfatternes lavt brug ejendomsdataset blev suppleret med informationer, der blev modtaget fra succesfulde Freedom of Information (FOI) anmodninger, hovedsagelig indsamlet til et tidligere projekt.

Grunddata fra OCOD er en.CSV kommaadskillet fil med en god grad af struktur og forudsigelig format.

Pipeline bestod af fem faser: labeling, parsing, udvidelse, klassificering og kontraktion. Til at begynde med kunne enhver enkelt adresse løse sig i virkeligheden til multiple indlejrede ejendomme, selvom dette ikke er eksplicit i regeringsleverede data.

Forskerne udførte nogen let syntaktisk forarbejdning, og herefter importerer de data til programmatic, en platform designet til at oprette annoterede NLP datasæt uden håndmærkning. Her blev enheder mærket med regulære udtryk (Regex) for at beskrive otte typer af navngivne enheder (se billedet nedenfor):

Med disse mærker tilføjet, blev datasættet eksporteret som en JSON fil, med overlappende mærker fjernet ved simple regelbaserede rutiner.

Desuden blev programmatic’s output anvendt til at træne en prædictiv model for SpaCy, underbygget af Facebooks RoBERTa. Når den var renset, oprettede forskerne en grund sandhed sammenligningsæt på 1000 tilfældigt mærkede observationer. Præcisionskarakteren for usupervisede data ville til sidst blive evaluaret mod denne grund sandhed.

Adresse-parsing præsenterede en række udfordringer. Forfatterne tildelte hver karakterrække sin egen række og hver mærkeklasse sin egen kolonne, og herefter backpropagatede de kolonnerne for at generere komplette adresse rækker.

Da nogle enkeltadresser havde multiple distinkte beboelser, var det nødvendigt at udvide databasen ved at underopdele enkeltadresser i under-ejendomme, der fandtes i supplerende databaser.

Efter dette var adresseklassificeringsfasen krydskontrollere alle beliggende postnumre ved hjælp af ONSPD databasen. Denne proces forbinder op adresse data til folketælling og andre demografiske data, og individuerer under-ejendomme, der tidligere var skjult bag de uigennemsigtige adresser i OCOD data.

Til sidst filtrerede adressekontraktionsprocessen alle ikke-boligejendomme (dvs. kommercielle ejendomme) ud fra indlejrede ejendomme.

Analyse

For at teste nøjagtigheden af de forbedrede data, oprettede forfatterne, som nævnt tidligere, en stikprøve grund sandhed, der blev holdt tilbage fra den generelle analyse, og kun anvendt til at teste nøjagtigheden af forudsigelserne og analyserne.

Manuel kontrol for grund sandheden inkluderede brugen af kortsoftware, samt analyse af billeder af ejendommene, der var med i den tilbageholdte stikprøve, og af internetsøgninger for at evaluere ejendomstypen. Herefter blev dataens præstation målt mod præcision, recall og F1 scores.

Værdien af lavt brug og boligejendomme blev erhvervet med en grundlæggende grafisk model, samme metode, der blev anvendt til at slutte UDP ejendomme.

NER-opgaven, testet mod den høj indsats, manuelt mærkede grund sandhed, opnåede en F1 score på 0,96 (tæt på ‘100%’, i forhold til nøjagtighed).

F1 scores for NER mærkningsopgaven. Nogen ujævnhed findes, da processen let overestimerer antallet af boligejendomme og underestimerer det totale antal virksomheder, på grund af strukturen i de forbedrede data.

F1 scores for NER mærkningsopgaven. Nogen ujævnhed findes, da processen let overestimerer antallet af boligejendomme og underestimerer det totale antal virksomheder, på grund af strukturen i de forbedrede data.

Med hensyn til UDP’er i London viser de endelige resultater et totalt antal på 138.000 poster – 44% mere end de 94.000, der er med i den originale OCOD datasæt (dvs. de seneste officielle tal).

Fordelingen af ejendomstyper under type 2 klassificering.

Fordelingen af ejendomstyper under type 2 klassificering.

Resultaterne viser, at den totale værdi af ejendomme i udlandet ligger omkring 56 mia. GBP, mens den totale værdi af lavt brug ejendomme estimeres til 85 mia. GBP.

Forfatterne bemærker:

‘[Alle] UDP’er er meget mere dyre end gennemsnitsprisen for en konventionel ejendom på 600.000 GBP.’

Denne type forbedret data kan være nødvendig for at bekæmpe brugen af ejendomsspekulation som en hvidvaskningsaktivitet i Storbritannien. Forfatterne bemærker den voksende mængde af forskning og almindelig litteratur, der antyder, at forbedret data kan hjælpe med at bekæmpe AML ejendomsspekulation, og konkluderer:

‘Denne data kan anvendes af sociologer, økonomer og politikere til at sikre, at forsøg på at reducere hvidvaskning og høje ejendomspriser er baseret på detaljerede data, der reflekterer den virkelige situation.’

 

* Min konvertering af forfatternes inline-citation til hyperlinks.

Offentliggjort første gang den 25. juli 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai