Andersonův úhel

Umělá inteligence nabízí lepší sledování vlastnictví nemovitostí v zahraničí ve Spojeném království

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum dvou britských univerzit se snaží více osvětlit potenciální stav praní špinavých peněz v oblasti nemovitostí ve Spojeném království, zejména na vysoce ceněném londýnském realitním trhu.

Podle výsledků projektu je celkový počet “netradičních” domácích nemovitostí (tj. nemovitostí, které nejsou dlouhodobě používány jako bydlení vlastníky nebo nájemci) v Londýně sám o sobě kolem 138 000.

Tento počet je o 44 % vyšší než oficiální údaje, které jsou dodávány a pravidelně aktualizovány britskou vládou.

Vědci použili různé techniky zpracování přirozeného jazyka (NLP), spolu s dalšími daty a podpůrným výzkumem, aby rozšířili omezené oficiální informace, které britská vláda poskytuje o procentu, hodnotě, umístění a typech nemovitostí vlastněných zahraničními společnostmi ve Spojeném království, z nichž nejvýnosnější jsou v hlavním městě.

Výzkum zjistil, že celková hodnota zahraničních, málo využívaných a airbnb-stylů (tj. “náhodného obsazení”) nemovitostí ve Spojeném království je společně odhadnuta na částku mezi 145-174 miliardami GBP, a to napříč přibližně 144 000-164 000 nemovitostmi.

Také zjistil, že zahraniční nemovitosti tohoto typu jsou obvykle dražší a mají charakteristické vzorce, pokud jde o jejich umístění ve Spojeném království.

Vědci odhadují, že zahraničně vlastněné “netradiční domácí nemovitosti” (UDP) představují 7,5 % z celkové hodnoty nemovitostí, a že 56 miliard GBP z odhadované hodnoty je omezeno pouze na 42 000 bytů.

Článek uvádí:

‘Jednotlivé zahraniční nemovitosti jsou velmi drahé, dokonce i ve srovnání s UDP, navíc se soustřeďují na centrum Londýna s silnou prostorovou auto-korelací.

‘Naopak zahraniční nemovitosti vnořené do jiných subjektů jsou méně koncentrované v centru Londýna, ale více koncentrované obecně, a téměř neexistuje prostorová korelace.’

Analýza rozšířených dat ukazuje, že velký počet zahraničních nemovitostí patří entitám v Crown Dependencies (CD), s druhým největším počtem zahraničních území (v grafu níže, “PWW2” označuje země, které získaly nezávislost na Británii po druhé světové válce).

Rozdělení zahraničně vlastněných nemovitostí, podle výsledků nové studie. Zdroj: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf

Rozdělení zahraničně vlastněných nemovitostí, podle výsledků nové studie. Zdroj: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf

Článek dále uvádí:

‘Ve skutečnosti jsou pouze 4 území, Britské Panenské ostrovy, Jersey, Guernsey a Ostrov Man, spojena s 78 % všech nemovitostí.’

Nová rozšířená data umožnila určit sub-nemovitosti, které existují u známých zahraničně vlastněných nemovitostí – schopnost, která je obvykle ztížena plochými a omezenými údaji poskytnutými v oficiálních datech.

Výsledky také ukazují, že zahraniční, airbnb a málo využívané nemovitosti jsou podstatně více geograficky koncentrované než normální domy, a navíc se soustřeďují do vyšších hodnotových oblastí.

Heat-mapy související se zahraničně vlastněnými nemovitostmi v Londýně. Zdroj: https://arxiv.org/pdf/2207.10931.pdf

Visualizované koncentrační mapy související se zahraničně vlastněnými nemovitostmi v Londýně. Zdroj: https://arxiv.org/pdf/2207.10931.pdf

K výše uvedenému grafu autoři uvádějí:

‘Zahraniční domácí nemovitosti mají některé extrémně vysoké koncentrace, kde je celá developerská projekt vlastněna zahraniční společností.’

Autoři zveřejnili kód pro svou zpracovatelskou pipeline.

Nová studie nese název Co je v prádelně? Mapování a charakterizace zahraničně vlastněných domácích nemovitostí v Londýně, a pochází od výzkumníků z The Bartlett Faculty of the Built Environment na University College London, a Kingston University’s Department of Economics.

Řešení problému

Autoři uvádějí, že po desetiletích úsilí o kontrolu používání nemovitostí k praní špinavých peněz ve Spojeném království, to trvalo až do zveřejnění uniklého seznamu zahraničně vlastněných britských nemovitostí britským časopisem Private Eye v roce 2015, aby britská vláda zveřejnila pravidelně aktualizovaný seznam zahraničně vlastněných nemovitostí ve většině Spojeného království, známý jako Zahraniční společnosti, které vlastní nemovitosti v Anglii a Walesu (OCOD).

Výzkumníci uvádějí, že ačkoli OCOD je krokem vpřed ve výzkumu a analýze zahraničního vlastnictví a potenciálního praní špinavých peněz ve Spojeném království, data mají řadu omezení, z nichž některá jsou zásadní:

‘Tyto adresy mohou být neúplné, obsahovat vnořené nemovitosti, kde existuje více nemovitostí v rámci jedné řádky nebo titulu, a také neobsahují žádné informace o tom, zda se jedná o domácí, obchodní nebo jinou nemovitost.

‘Taková nízkokvalitní data činí pochopení distribuce a charakteristik zahraničně vlastněných nemovitostí ve Spojeném království obtížným.’

Je zvláště obtížné získat data o náhodně pronajatých nemovitostech, jako jsou nemovitosti Airbnb, protože veřejně dostupná data jsou omezená nebo neexistují. Kromě toho Skotsko (část Spojeného království) nezpřístupňuje své vlastní registry prodeje nemovitostí veřejnosti, na rozdíl od Anglie a Walesu.

Aby se vyrovnaly některé nesrovnalosti kolem klasifikace nemovitostí, britská vláda zavedla systém Unique Property Reference Number (UPRN), který má umožnit jasnější vztahy napříč různými zdroji dat o nemovitostech. Autoři však uvádějí* ‘ačkoli je používání UPRN povinné, téměř žádný vládní odbor jej nepoužívá, což znamená, že propojení dat vyžaduje pokročilé zpracování dat dovednosti.

Proto se nový výzkum snažil učinit data více podrobnými a přehlednými.

Shromažďování a propojování dat

V rámci jednotlivých zemí jsou adresní formáty obvykle předvídatelné a konzistentní, což platí i pro adresy ve Spojeném království. Proto, když čelíme “plochým”, textovým adresním údajům (jako jsou ty, které poskytuje OCOD), vyvinula se řada otevřených řešení pro adresní analýzu, která umožňují křížové odkazy na další zdroje dat.

Však mnoho z nich je vyškolených pomocí Open Street map dat, která mohou vést k adresám, které mohou hostit desítky nebo dokonce stovky vnořených sub-adres (jako jsou apartmány v širokém adresním rozsahu pro bytový blok). V důsledku toho i uznávaný adresní parser, jako je libpostal, měl potíže při pokusu o rozbor neúplných adres.

Pro vytvoření parseru pro svůj projekt autoři použili řadu veřejně dostupných datových sad. Klíčová data byla poskytnuta OCOD, zatímco komponenta pro čištění dat používala datovou sadu Land Registry Price, spolu s VOA ratings seznamem dat a Office of National Statistics Postcode Directory (ONSPD).

Data z Airbnb pocházela z InsideAirbnb domény, která zahrnuje pouze celé domy, které jsou pronajaty, a vylučuje původně navrhované použití Airbnb (tj. pronájem části vlastního domu na příležitostné základě).

Autoři také rozšířili datovou sadu málo využívaných nemovitostí o informace získané z úspěšných žádostí o svobodný přístup k informacím (FOI), většinou shromážděných pro předchozí projekt.

Základní data OCOD je soubor.CSV s dobrým stupněm struktury a předvídatelného formátu.

Pipeline se skládala z pěti fází: označování, parsování, rozšiřování, klasifikace a kontrakce. Na začátku mohla každá adresa v reálném životě vyřešit více vnořených nemovitostí, i když to není explicitně uvedeno v datech poskytnutých vládou.

Vykonali lehkou syntaktickou předzpracování, poté importovali data do programmatic, platformy navržené pro vytváření anotovaných NLP dat bez ručního označování. Zde byly entity označeny pomocí regulárních výrazů (Regex) pro popis osmi typů pojmenovaných entit (viz obrázek níže):

S těmito označkami přidány, byla datová sada extrahována jako soubor JSON, s překryvy označků odstraněny pomocí jednoduchých pravidel.

Dále byl výstup z programmatic používán pro výcvik prediktivního modelu pro SpaCy, podpořeného Facebookovým RoBERTa. Jakmile byly data očištěna, autoři vytvořili srovnávací sadu 1000 náhodně označených pozorování. Skóre přesnosti nesupervizovaných dat by bylo nakonec vyhodnoceno proti této srovnávací sadě.

Parsování adres představovalo řadu výzev. Autoři přiřadili každému znakovému rozsahu svůj vlastní řádek a každou třídu označků svou vlastní sloupec, a poté zpětně propojili sloupce, aby vygenerovali úplné adresní řádky.

Ponieważ některé jediné adresy měly více různých obydlí, bylo nutné rozšířit databázi, a to rozdělením jediných adres na sub-nemovitosti přítomné v doplňkových databázích.

Po tomto kroku fáze klasifikace adres křížově odkazy na všechny umístěné poštovní směrovací čísla pomocí databáze ONSPD. Tento proces propojuje adresní data s daty sčítání lidu a dalších demografických dat, a také individuuje sub-nemovitosti, které byly dříve skryty za neprůhlednými adresami dat OCOD.

Nakonec proces kontrakce adres filtroval všechny ne-domácí nemovitosti (tj. komerční prostory) z vnořených skupin nemovitostí.

Analýza

Aby otestovali přesnost rozšířených dat, autoři, jak je uvedeno výše, vytvořili vzorek srovnávací sady, který byl vyhrazen pro testování přesnosti předpovědí a analýz.

Ruční kontrola srovnávací sady zahrnovala použití mapového softwaru, stejně jako analýzu obrázků nemovitostí uvedených ve srovnávací sadě, a internetových vyhledávání pro vyhodnocení typu nemovitosti. Poté byla výkon dat měřen proti přesnosti, rekalibraci a F1 skóre.

Hodnota málo využívaných a domácích nemovitostí byla získána pomocí základního grafického modelu, stejnou metodou, která byla použita také pro odvození UDP nemovitostí.

Úkol NER, testovaný proti vysoce úsilí, ručně označené srovnávací sadě, získal F1 skóre 0,96 (blízko ‘100 %’, pokud jde o přesnost).

F1 skóre pro úkol NER. Některé nerovnosti jsou nalezeny, protože proces mírně nadhodnocuje počet domácích nemovitostí a podhodnocuje celkový počet obchodních nemovitostí, kvůli struktuře rozšířených dat.

F1 skóre pro úkol NER. Některé nerovnosti jsou nalezeny, protože proces mírně nadhodnocuje počet domácích nemovitostí a podhodnocuje celkový počet obchodních nemovitostí, kvůli struktuře rozšířených dat.

Co se týče UDP v Londýně, konečné výsledky ukazují celkový počet 138 000 záznamů – 44 % více než 94 000 uvedených v původní datové sadě OCOD (tj. nedávné oficiální údaje).

Rozdělení typů nemovitostí podle klasifikace 2. typu.

Rozdělení typů nemovitostí podle klasifikace 2. typu.

Výsledky ukazují, že celková hodnota zahraničních nemovitostí se pohybuje kolem 56 miliard GBP, zatímco celková hodnota málo využívaných nemovitostí je odhadnuta na 85 miliard GBP.

Autoři uvádějí:

‘[Všechny] UDP jsou mnohem dražší než průměrná cena konvenční nemovitosti ve výši 600 tisíc GBP.’

Tento typ vylepšených dat může být nezbytný pro boj proti používání nemovitostí jako činnosti pro praní špinavých peněz ve Spojeném království. Autoři uvádějí rostoucí množství výzkumů a literatury, které naznačují, že vylepšená data mohou pomoci v boji proti praní špinavých peněz, a uzavírají:

‘Tato data mohou být použita sociology, ekonomickými a politickými rozhodčími, aby zajistili, že snahy o snížení praní špinavých peněz a vysoké ceny nemovitostí jsou založeny na podrobných datech, které odrážejí skutečnou situaci.’

 

* Moje konverze inline citací autorů na hypertextové odkazy.

Poprvé zveřejněno 25. července 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai