Kąt Andersona
AI oferuje ulepszoną śledzenie własności nieruchomości za granicą w Wielkiej Brytanii

Nowe badania przeprowadzone przez dwa uniwersytety w Wielkiej Brytanii mają na celu rzucenie większego światła na potencjalny stan prania brudnych pieniędzy w oparciu o nieruchomości w Wielkiej Brytanii, a szczególnie na bardzo cenionym rynku nieruchomości w Londynie.
Zgodnie z wynikami projektu, łączna liczba “niekonwencjonalnych” nieruchomości krajowych (tj. nieruchomości, które nie są używane długoterminowo jako miejsca zamieszkania przez właścicieli lub najemców) wynosi około 138 000 tylko w Londynie.
Ta liczba jest o 44% wyższa niż oficjalne dane, które są dostarczane i okresowo aktualizowane przez rząd Wielkiej Brytanii.
Badacze użyli różnych technik przetwarzania języka naturalnego (NLP), wraz z dodatkowymi danymi i potwierdzającymi badaniami, aby rozszerzyć ograniczone oficjalne informacje, które rząd Wielkiej Brytanii udostępnia na temat procentu, wartości, położenia i rodzajów nieruchomości należących do firm zagranicznych w Wielkiej Brytanii, z których najbardziej lukratywne znajdują się w stolicy.
Badania wykazały, że łączna wartość nieruchomości za granicą, o niskim wykorzystaniu i w stylu Airbnb (tj. “okazjonalne zajmowanie”) w Wielkiej Brytanii wynosi około 145-174 miliardów funtów szterlingów, rozłożonych na około 144 000-164 000 nieruchomości.
Stwierdzono również, że nieruchomości za granicą tego typu są zwykle droższe i mają charakterystyczne wzorce pod względem ich położenia w Wielkiej Brytanii.
Badacze szacują, że nieruchomości za granicą należące do niekonwencjonalnych nieruchomości domowych (UDP) stanowią 7,5% łącznej wartości domowej, a 56 miliardów funtów szterlingów z szacowanej wartości jest ograniczonych do zaledwie 42 000 domów.
W artykule stwierdzono:
‘Poszczególne nieruchomości za granicą są bardzo drogie, nawet w porównaniu z UDP, dodatkowo są one skoncentrowane w centrum Londynu z silną przestrzenną autokorelacją.
‘W przeciwieństwie do zagranicznych nieruchomości zagnieżdżonych, które są mniej skoncentrowane w centralnym Londynie, ale bardziej wysoko skoncentrowane ogólnie, nie ma prawie żadnej przestrzennej korelacji.’
Analiza uzupełnionych danych wykazuje, że duża liczba nieruchomości za granicą należy do podmiotów w zależnościach koronnych (CD), a drugą co do wielkości liczbę stanowią terytoria zamorskie Wielkiej Brytanii (na poniższym wykresie “PWW2” oznacza kraje, które uzyskały niepodległość od Wielkiej Brytanii po II wojnie światowej).

Rozmieszczenie własności zagranicznej, zgodnie z wynikami nowego artykułu. Źródło: https://arxiv.org/src/2207.10931v1/anc/Offshore_London_Supplementary_Material.pdf
W artykule stwierdzono:
‘W rzeczywistości tylko 4 terytoria, Brytyjskie Wyspy Dziewicze, Jersey, Guernsey i Wyspa Man, są związane z 78% wszystkich nieruchomości.’
Nowe, ulepszone dane umożliwiły określenie podnieruchomości, które istnieją w ramach znanej nieruchomości zagranicznej – możliwość, która zwykle jest utrudniona przez płaskie i ograniczone dane dostarczane w oficjalnych danych.
Wyniki wskazują również, że nieruchomości za granicą, Airbnb i nieruchomości o niskim wykorzystaniu są znacznie bardziej skoncentrowane geograficznie niż normalne domy i są dodatkowo skoncentrowane w obszarach o wyższej wartości.

Wizualizowane mapy koncentracji związane z różnymi rodzajami własności zagranicznej w Londynie. Źródło: https://arxiv.org/pdf/2207.10931.pdf
O powyższym wykresie autorzy komentują:
‘Nieruchomości domowe za granicą mają niezwykle wysokie koncentracje, gdzie cały development mieszkań jest własnością firmy zagranicznej.’
Autorzy udostępnili kod dla swojego potoku przetwarzania.
Nowy artykuł nosi tytuł Co jest w pralce? Mapowanie i charakteryzowanie nieruchomości domowych za granicą w Londynie, i pochodzi od badaczy z Wydziału Środowiska Zbudowanego Uniwersytetu College London oraz Wydziału Ekonomii Uniwersytetu Kingston.
Rozwiązywanie problemu
Autorzy zauważają, że po dziesięcioleciach wysiłków w celu kontrolowania wykorzystania nieruchomości do celów prania brudnych pieniędzy w Wielkiej Brytanii, to opublikowanie w 2015 roku przez brytyjskie czasopismo Private Eye wycieku listy nieruchomości za granicą w Wielkiej Brytanii, spowodowało, że rząd Wielkiej Brytanii opublikował regularnie aktualizowaną listę nieruchomości za granicą w większości Wielkiej Brytanii, znaną jako Spółki zagraniczne, które posiadają nieruchomości w Anglii i Walii (OCOD).
Badacze zauważają, że chociaż OCOD jest krokiem naprzód w badaniach i analizie własności zagranicznej i potencjalnego prania pieniędzy w Wielkiej Brytanii, dane te mają szereg ograniczeń, niektóre z nich są kluczowe:
‘Adresy te mogą być niekompletne, zawierać zagnieżdżone nieruchomości, gdzie wiele nieruchomości istnieje w ramach jednego adresu lub numeru tytułu, nie zawierają również informacji o tym, czy nieruchomość jest domem, firmą czy czymś innym.
‘Taki słaby jakościowo danych sprawia, że zrozumienie rozkładu i charakterystyki nieruchomości za granicą w Wielkiej Brytanii jest wyzwaniem.’
Szczególnie trudno jest uzyskać dane o nieruchomościach wynajmowanych okazjonalnie, takich jak nieruchomości Airbnb, ponieważ dostępne publicznie dane są ograniczone lub nieistniejące. Dodatkowo Szkocja (część Wielkiej Brytanii) nie udostępnia swojego własnego rejestru sprzedaży nieruchomości do publicznej wiadomości, w przeciwieństwie do Anglii i Walii.
Aby przeciwdziałać niektórym niekonsekwencjom w klasyfikacji nieruchomości, rząd Wielkiej Brytanii wprowadził system Unikalnego Numeru Referencyjnego Nieruchomości (UPRN), zaprojektowany w celu umożliwienia wyraźniejszych relacji między różnymi źródłami danych o nieruchomościach. Jednak autorzy zauważają* ‘chociaż użycie UPRN jest nakazane, prawie żaden rządowy departament go nie używa, co oznacza, że łączenie danych wymaga zaawansowanych umiejętności przetwarzania danych umiejętności‘.
Stąd nowe badania miały na celu uczynienie danych bardziej szczegółowymi i wnikliwymi.
Zbieranie i łączenie danych
W ramach jednego kraju formaty adresowe są zwykle przewidywalne i spójne, co dotyczy również adresów w Wielkiej Brytanii. Stąd, w obliczu “płaskich”, opartych na tekście danych adresowych (takich jak te dostarczane przez OCOD), wiele otwartoźródłowych rozwiązań do parsowania adresów pojawiło się w celu skorelowania adresów z innymi źródłami danych.
Jednak wiele z nich jest szkolonych przy użyciu danych Open Street Map, co może prowadzić do adresów, które mogą faktycznie hostować dziesiątki lub nawet setki zagnieżdżonych podadresów (takich jak mieszkania w bloku mieszkań). W związku z tym nawet tak renomowany parser adresowy jak libpostal miał trudności przy próbie parsowania niekompletnych adresów.
Aby stworzyć parser dla swojego projektu, badacze nowego artykułu użyli kilku publicznie dostępnych zbiorów danych. Kluczowe dane zostały dostarczone przez OCOD, podczas gdy składnik czyszczenia danych wykorzystywał zestaw danych Land Registry Price, wraz z VOA ratings oraz Office of National Statistics Postcode Directory (ONSPD).
Dane Airbnb pochodziły z InsideAirbnb, które obejmuje tylko całe domy, które są wynajmowane, wykluczając pierwotnie proponowany przypadek użycia dla Airbnb (tj. wynajmowanie części lub całości własnego domu okazjonalnie).
Zbioru danych o nieruchomościach o niskim wykorzystaniu uzupełniono o informacje uzyskane z powodzenia wniosków o informację publiczną, głównie zebranych dla poprzedniego projektu.
Podstawowe dane OCOD to plik CSV z przecinkiem jako separatorem, o dobrej strukturze i przewidywalnym formacie.

Potok składał się z pięciu etapów: etykietowania, parsowania, rozszerzania, klasyfikacji i kontrahowania. Na początku każdy adres mógł rozwiązać się w rzeczywistości do wielu zagnieżdżonych nieruchomości, chociaż nie jest to jawne w danych rządowych.
Badacze przeprowadzili lekkie przetwarzanie składniowe, a następnie zaimportowali dane do programmatic, platformy zaprojektowanej do tworzenia zestawów danych NLP bez ręcznego etykietowania. Tutaj encje były etykietowane przy użyciu wyrażeń regularnych (Regex) w celu opisania ośmiu rodzajów nazwanych encji (patrz obraz poniżej):

Z tymi etykietami dodanymi, zestaw danych został wyodrębniony jako plik JSON, z usuniętymi nakładającymi się etykietami za pomocą prostych reguł opartych na routine.
Ponadto, dane wyjściowe z programmatic zostały wykorzystane do szkolenia modelu predykcyjnego dla SpaCy, opartego na RoBERTa od Facebooka. Po usunięciu szumu, badacze utworzyli zestaw porównawczy 1000 losowo oznaczonych obserwacji. Wynik dokładności danych niesupervised będzie ostatecznie oceniony w stosunku do tego zestawu porównawczego.
Parsowanie adresów przedstawiło szereg wyzwań. Autorzy przypisali każdemu zakresowi znaków własny wiersz i każdej klasie etykiety własną kolumnę, a następnie wykorzystali kolumny wstecznie, aby wygenerować pełne wiersze adresowe.
Ponieważ niektóre pojedyncze adresy zawierały wiele odrębnych nieruchomości, konieczne było rozszerzenie bazy danych, poprzez podział pojedynczych adresów na podnieruchomości obecne w uzupełniających bazach danych.
Następnie, etap klasyfikacji adresów skorelował wszystkie zlokalizowane kody pocztowe przy użyciu bazy danych ONSPD. Ten proces łączy dane adresowe z danymi spisowymi i innymi danymi demograficznymi, a także indywidualizuje podnieruchomości, które wcześniej były ukryte za nieprzezroczystymi adresami danych OCOD.
W końcu, proces kontrahowania adresów wyfiltrował wszystkie nieruchomości niebędące domami (tj. nieruchomości komercyjne) z grup zagnieżdżonych nieruchomości.
Analiza
Aby przetestować dokładność ulepszonych danych, autorzy, jak wcześniej wspomniano, utworzyli zestaw danych porównawczych, który został wyłączony z ogólnego przebiegu analizy i został użyty tylko do testowania dokładności predykcji i analiz.
Manualna weryfikacja zestawu porównawczego obejmowała użycie oprogramowania mapowego, a także analizę zdjęć nieruchomości przedstawionych w zestawie porównawczym, oraz wyszukiwań internetowych w celu oceny rodzaju nieruchomości. Następnie, wyniki zostały zmierzone w stosunku do precyzji, recallu i wyników F1.
Wartość nieruchomości o niskim wykorzystaniu i domowej została uzyskana za pomocą podstawowego modelu graficznego, tego samego, który został użyty do wnioskowania o nieruchomościach UDP.
Zadanie NER, przetestowane w stosunku do zestawu porównawczego oznaczonego ręcznie, uzyskało wynik F1 na poziomie 0,96 (bliski “100%”, w kategoriach dokładności).

Wyniki F1 dla zadania NER. Niektóre nierówności są widoczne, ponieważ proces nieznacznie przeszacowuje liczbę nieruchomości domowych i zaniża łączną liczbę firm, ze względu na strukturę ulepszonych danych.
Co się tyczy UDP w Londynie, ostateczne wyniki pokazują łączną liczbę 138 000 wpisów – 44% więcej niż 94 000 zawartych w oryginalnym zestawie danych OCOD (tj. ostatnie oficjalne dane).

Rozbicie rodzajów nieruchomości według klasyfikacji 2.
Wyniki wskazują, że łączna wartość nieruchomości za granicą wynosi około 56 miliardów funtów szterlingów, podczas gdy łączna wartość nieruchomości o niskim wykorzystaniu jest szacowana na 85 miliardów funtów szterlingów.
Autorzy zauważają:
‘[Wszystkie] UDP są znacznie droższe niż średnia cena nieruchomości konwencjonalnej, wynosząca 600 000 funtów.’
Ten rodzaj ulepszonych danych może być konieczny do walki z wykorzystaniem spekulacji na rynku nieruchomości jako działalności prania brudnych pieniędzy w Wielkiej Brytanii. Autorzy zauważają rosnący zbiór badań i literatury, który sugeruje, że ulepszone dane mogą pomóc w walce z AML spekulacjami na rynku nieruchomości, i kończą:
‘Te dane mogą być wykorzystane przez socjologów, ekonomistów i decydentów, aby zapewnić, że próby redukcji prania pieniędzy i wysokich cen nieruchomości opierają się na szczegółowych danych, które odzwierciedlają rzeczywistą sytuację.’
* Moja konwersja cytatów autorów do linków.
Pierwotnie opublikowane 25 lipca 2022.












