Andersons vinkel

AI tilbyr forbedret sporing av utenlandske eiendomseiere i Storbritannia

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ny forskning fra to britiske universiteter har som mål å kaste mer lys over den potensielle tilstanden for eiendomsbasert hvitvasking i Storbritannia, og spesielt i den høyt prisede London-eiendomsmarkedet.

Ifølge prosjektets resultater, er det totale antallet “uvanlige” hjemlige eiendommer (dvs. eiendommer som ikke brukes over lengre perioder som boliger av eiere eller leietakere) på rundt 138 000 i London alene.

Dette tallet er 44% høyere enn de offisielle tallene, som leveres og oppdateres jevnlig av den britiske regjeringen.

Forskerne brukte ulike tekniker for naturlig språkbehandling (NLP), sammen med ekstra data og støttende forskning, for å utvide den begrensede offisielle informasjonen som den britiske regjeringen gjør tilgjengelig om prosenten, verdi, plassering og typer eiendommer eid av utenlandske selskaper i Storbritannia, der de mest lukrative er i hovedstaden.

Forskningen fant at det totale antallet utenlandske, lavt brukte og airbnb-lignende (dvs. “tilfeldig okkupasjon”) eiendommer i Storbritannia er kollektivt verdt rundt 145-174 milliarder GBP over omtrent 144 000-164 000 eiendommer.

Den fant også at utenlandske eiendommer av denne typen vanligvis er mer dyre og har signaturmønster i forhold til hvor de er plassert i Storbritannia.

Forskerne estimerer at utenlandske eide “uvanlige hjemlige eiendommer” (UDP) representerer 7,5% av den totale hjemlige verdi, og at 56 milliarder av den estimerte verdi er begrenset til bare 42 000 boliger.

Artikkelen sier:

‘Enkeltstående utenlandske eiendommer er svært dyre, selv i forhold til UDP, i tillegg er de konsentrert i sentrum av London med sterk romlig autokorrelasjon.

‘I motsetning er innlejrede utenlandske eiendommer noe mindre konsentrert i sentrale London, men mer høyt konsentrert generelt, og det er nesten ingen romlig korrelasjon.’

Analyse av den utvidede datoen viser at et stort antall utenlandske eiendommer tilhører enheter i Crown Dependencies (CD), med det nest største antallet representert av britiske oversjøiske territorier (i grafen nedenfor betegnes “PWW2” land som oppnådde uavhengighet fra Storbritannia etter andre verdenskrig).

Fordeling av utenlandske eide eiendommer, ifølge resultater fra den nye artikkelen. Kilde: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf

Fordeling av utenlandske eide eiendommer, ifølge resultater fra den nye artikkelen. Kilde: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf

Artikkelen observerer:

‘I virkeligheten er det bare 4 territorier, British Virgin Islands, Jersey, Guernsey og Isle of Man, som er assosiert med 78% av alle eiendommer.’

Den nye, forbedrede datoen har gjort det mulig å bestemme under-eiendommer som eksisterer innen en kjent utenlandskeid eiendom – en evne som vanligvis er hindret av den flate og begrensede datoen i de offisielle tallene.

Resultatene indikerer også at utenlandske, airbnb og lavt brukte eiendommer er mer geografisk konsentrert enn vanlige hjem, og er i tillegg konsentrert i høyere verdier.

Heat-kart relatert til ulike typer utenlandske eide eiendommer i London. Kilde: https://arxiv.org/pdf/2207.10931.pdf

Visualiserte konsentrasjonskart relatert til ulike typer utenlandske eide eiendommer i London. Kilde: https://arxiv.org/pdf/2207.10931.pdf

Om ovennevnte graf, kommenterer forfatterne:

‘Utenlandske hjemlige eiendommer har noen ekstremt høye konsentrasjoner hvor en hel boligutvikling eies av et utenlandsk selskap.’

Forfatterne har gjort kode for deres prosesseringssystem tilgjengelig.

Den nye artikkelen heter Hva er i vaskemaskinen? Kartlegging og karakterisering av utenlandske eide hjemlige eiendommer i London, og kommer fra forskere ved The Bartlett Faculty of the Built Environment ved University College London, og Kingston Universitys avdeling for økonomi.

Å løse problemet

Forfatterne bemerker at etter tiår med innsats for å kontrollere bruken av eiendom for hvitvaskingsformål i Storbritannia, tok det utgivelsen av en lekket liste over utenlandske eide britiske eiendommer av den britiske publikasjonen Private Eye i 2015 til å få den britiske regjeringen til å publisere en jevnlig oppdatert liste over utenlandske eide eiendommer i de fleste deler av Storbritannia, kjent som Utenlandske selskaper som eier eiendom i England og Wales (OCOD).

Forskerne observerer at selv om OCOD er et skritt i riktig retning for forskning og analyse av utenlandsk eierskap og potensiell hvitvasking i Storbritannia, har datoen en rekke begrensninger, noen av dem kritiske:

‘Disse adressene kan være ufullstendige, inneholde innlejrede eiendommer, hvor flere eiendommer eksisterer innen en enkelt rad eller tittelnummer, den inneholder også ingen informasjon om hvorvidt eiendommen er hjemlig, forretningsmessig eller noe annet.

‘Slike dårlige kvalitetsdata gjør det vanskelig å forstå distribusjonen og karakteristikkene til utenlandske eide eiendommer i Storbritannia.’

Det er spesielt vanskelig å få tak i data om tilfeldig leide eiendommer, slik som airbnb-eiendommer, ettersom offentlig tilgjengelig data er begrenset eller ikke-eksisterende. I tillegg gjør Skottland (en del av Storbritannia) ikke sin egen register over eiendomssalg offentlig tilgjengelig, i motsetning til England og Wales.

For å motvirke noen av inkonsistensene rundt eiendomsklassifisering, innførte den britiske regjeringen det unike eiendomsreferansenummer (UPRN)-systemet, designet for å muliggjøre tydeligere relasjoner over diverse eiendomsdatakilder. Forskerne bemerker imidlertid* ‘mens bruk av UPRN er pålagt, bruker nesten ingen regjeringsavdeling det, noe som gjør at kobling av data krever avansert dataforedling ferdigheter.

Derfor satte den nye forskningen ut til å gjøre datoen mer granulert og innsiktsfull.

Samling og kobling av data

Innenfor et enkelt land er adresseformat vanligvis forutsigbare og konsistente, også gjeldende for britiske adresser. Derfor, når man står overfor “flate”, tekstbaserte adresse-data (slik som det som leveres av OCOD), har en rekke åpne kilde-adresseparsningsløsninger dukket opp for å krysseferiere adresser med andre datakilder.

Imidlertid er mange av disse trent ved hjelp av Open Street Map-data, som kan føre til adresser som faktisk kan inneholde titalls eller hundredvis av innlejrede underadresser (slik som leiligheter i en bredt omfattende adresse for en leiebygning). Derfor har selv en anerkjent adresseparser som libpostal hatt vanskeligheter når det gjelder å parsere ufullstendige adresser.

For å lage parseren for deres prosjekt, brukte den nye artikkelen forskernes en rekke offentlig tilgjengelige datamengder. Den viktigste datoen ble levert av OCOD, mens datarensningkomponenten brukte Land Registry Price dataset, sammen med VOA-ratings-listen og Office of National Statistics Postcode Directory (ONSPD).

Airbnb -dataene kom fra InsideAirbnb-domenet, som bare inkluderer hele hjem som leies ut, og dermed ekskluderer den opprinnelige foreslåtte bruksmåten for Airbnb (dvs. å leie ut hele eller deler av eget hjem på en tilfeldig basis).

Forfatternes lavt brukte eiendommer-dataset ble supplert med informasjon mottatt fra vellykkede Freedom of Information (FOI)-forespørsler, hovedsakelig samlet inn for et tidligere prosjekt.

Grunddatat i OCOD er en.CSV-kommaadskilt fil med en god grad av struktur og forutsigbar format.

Rørledningen bestod av fem stadier: merking, parsing, utvidelse, klassifisering og kontrahering. I utgangspunktet kunne en enkelt adresse løse seg i virkeligheten til flere innlejrede eiendommer, selv om dette ikke er eksplisitt i regjeringsleverte data.

Forskerne utførte noen lette syntaktiske forbehandlinger, og deretter importerte datoen til programmatic, en plattform designet for å lage annoterte NLP-datasett uten håndmerking. Her ble enheter merket med regulære uttrykk (Regex) for å beskrive åtte typer navngitte enheter (se bilde nedenfor):

Med disse merkene lagt til, ble datasettene eksportert som en JSON-fil, med merk-overlapp fjernet ved hjelp av enkle regelbaserte rutiner.

I tillegg ble programmatic-utdata brukt til å trene en prediktiv modell for SpaCy, underbygget av Facebooks RoBERTa. Når den var renset, skapte forskerne en sammenligningssett på 1000 tilfeldig merkte observasjoner. Nøyaktighetspoengene for uovervåket data ville til slutt bli evaluert mot dette sammenligningssettet.

Adresse-parsing presenterte en rekke utfordringer. Forfatterne tildelte hver tegnrekke sin egen rad og hver merkeklasse sin egen kolonne, og deretter backpropagerte kolonnene for å generere fullstendige adresserader.

Ettersom enkelte enkeltadresser hadde flere distinkte boliger, var det nødvendig å utvide databasen ved å underdele enkeltadresser i under-eiendommer som fantes i komplementære databaser.

Etter dette, koblet adresse-klassifiseringsstadiet alle funnet postnummer ved hjelp av ONSPD-databasen. Denne prosessen kobler opp adresse-data til folketelling og andre demografiske data, og også individuerer under-eiendommer som tidligere var skjult bak de uklare adressene i OCOD-dataene.

Til slutt filtrerte adresse-kontraktionsprosessen ut alle ikke-hjemlige eiendommer (dvs. kommersielle eiendommer) fra innlejrede eiendommer.

Analyse

For å teste nøyaktigheten av den forbedrede datoen, skapte forfatterne, som tidligere nevnt, en prøve-sammenligningssett som ble holdt tilbake fra den generelle analysen, og bare brukt til å teste nøyaktigheten av forutsagn og analyser.

Manuell sjekking for sammenligningssettet inkluderte bruk av kartprogramvare, samt analyse av bilder av eiendommene som var med i sammenligningssettet, og av internett-søk for å evaluere typen eiendom. Deretter ble datatilgangens ytelse målt mot presisjon, gjentakelse og F1-poeng.

Verdien av lavt brukte og hjemlige eiendommer ble funnet med en grundig grafisk modell, samme metode som ble brukt til å slutte UDP-eiendommer.

NER-oppgaven, testet mot den høye innsatsen, manuelt merkte sammenligningssettet, fikk en F1-poeng på 0,96 (nær ‘100%’, i forhold til nøyaktighet).

F1-poeng for NER-merking. Noen ujevnheter finnes, siden prosessen lett overestimerer antallet hjemlige eiendommer og underestimerer det totale antallet bedrifter, på grunn av strukturen i den forbedrede datoen.

F1-poeng for NER-merking. Noen ujevnheter finnes, siden prosessen lett overestimerer antallet hjemlige eiendommer og underestimerer det totale antallet bedrifter, på grunn av strukturen i den forbedrede datoen.

Angående UDP-er i London, viser de endelige resultater en total på 138 000 poster – 44% mer enn de 94 000 som er med i den originale OCOD-datasett (dvs. nylige offisielle tall).

Oppdeling av eiendomstyper under type 2-klassifisering.

Oppdeling av eiendomstyper under type 2-klassifisering.

Resultatene indikerer at den totale verdien av de utenlandske eiendommene ligger på rundt 56 milliarder GBP, mens den totale verdien av lavt brukte eiendommer estimeres til 85 milliarder GBP.

Forfatterne bemerker:

‘[Alle] UDP-er er mye dyrere enn gjennomsnittsprisen for konvensjonelle eiendommer på 600 000 pund.’

Denne type forbedret data kan være nødvendig for å bekjempe bruken av eiendomsspekulasjon som en hvitvaskingsaktivitet i Storbritannia. Forfatterne bemerker den voksende mengden forskning og generell litteratur som antyder at forbedret data kan bidra til å bekjempe AML-eiendomsspekulasjon, og konkluderer:

‘Denne datoen kan brukes av sosiologer, økonomer og politiske beslutningstakere for å sikre at forsøk på å redusere hvitvasking og høye eiendomspriser er basert på detaljert data som reflekterer den virkelige situasjonen.’

 

* Min konvertering av forfatternes inline-citater til lenker.

Først publisert 25. juli 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai