Ajatusjohtajat

On-premise Data Lakehouse -arkkitehtuuri

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Nykypäivän datajohtamisessa pankkien on kyettävä hallitsemaan ja analysoimaan suuria määriä dataa, jotta ne voisivat ylläpitää kilpailukykyään. Data lakehouse esittää vallankumouksellisen käsitteen, joka muuttaa datahallintaa rahoitussektorilla. Tämä innovatiivinen arkkitehtuuri yhdistää parhaat ominaisuudet data warehouse ja data lake -ratkaisuista. Se tarjoaa yhdenmukaisen alustan sekä rakenteisten että rakenteettomien datojen tallentamiseen, prosessointiin ja analysointiin, mikä tekee siitä arvokkaan varan pankkeja, jotka haluavat hyödyntää dataansa strategiseen päätöksentekoon.

Data-arkkitehtuurin kehitys

Matka data lakehouseen on ollut evolutiivinen. Perinteiset data warehouse -ratkaisut ovat pitkään olleet pankkien analytiikan selkärangan, tarjoten rakenteisen datatallennuksen ja nopean kyselysuorituskyvyn. Viimeaikaisen sosiaalisen median, asiakastiedon ja IoT-laitteiden määrän räjähdysmäisen kasvun myötä data lake -ratkaisut ovat nousseet nykyaikaisiksi ratkaisuiksi suurten määrien raakadatien tallentamiseen.

Data lakehouse edustaa seuraavaa askelta tässä kehityksessä, sillä se siltaa data warehouse – ja data lake -ratkaisujen välistä kuilua. Pankkien, kuten Akbankin, näkökulmasta tämä tarkoittaa, että voimme nyt nauttia molempien maailmojen eduista – data warehouse -ratkaisujen rakenteisuudesta ja suorituskyvystä sekä data lake -ratkaisujen joustavuudesta ja skaalautuvuudesta.

Data Lakehouse -käsitteet

Hybridi-arkkitehtuuri

Data lakehouse yhdistää data lake – ja data warehouse -ratkaisujen vahvuudet. Tämä hybridi-lähestymistapa mahdollistaa pankkien tallentaa suuria määriä raakadataa samalla, kun ne voivat suorittaa nopeita ja monimutkaisia kyselyjä, jotka ovat tyypillisiä data warehouse -ratkaisuille.

Yhdenmukainen data-alusta

Yksi data lakehouse -ratkaisun merkittävimmistä etuoista on sen kyky yhdistää rakenteiset ja rakenteettomat datat yhdessä alustassa. Pankkien näkökulmasta tämä tarkoittaa, että voimme analyysin perinteisiä transaktiodataa asiakastiedon kanssa, jotta saamme kattavamman näkymän liiketoiminnastamme ja asiakkaistamme.

Merkittävät ominaisuudet ja hyödyt

Data lakehouse -ratkaisut tarjoavat useita avainhyötyjä, jotka ovat erityisen arvokkaita pankkisektorilla.

Skaalautuvuus

Kun datamäärämme kasvaa, lakehouse-arkkitehtuuri voi helposti skaalautua tämän kasvun mukana. Tämä on pankkitoiminnassa olennaisen tärkeää, jossa keräämme jatkuvasti suuria määriä transaktio- ja asiakastietoja. Lakehouse mahdollistaa meidän varastointi- ja prosessointikapasiteettien laajentamisen ilman, että seurauksena on toiminnan keskeytyminen.

Joustavuus

Voimme tallentaa ja analysoida erilaisia datatyyppejä, kuten transaktiotietoja ja asiakirjeitä. Tämä joustavuus on arvokasta nykyisessä pankkitoiminnassa, jossa sosiaalisen median, asiakaspalvelun ja muiden lähteiden rakenteettomat datat voivat tarjota arvokkaita oivalluksia, kun ne yhdistetään perinteisiin rakenteisiin tietoihin.

Reaaliaikainen analyysi

Tämä on olennaisen tärkeää petosten havaitsemisessa, riskien arvioinnissa ja asiakkaiden kokemusten mukauttamisessa. Pankkitoiminnassa datan analysointi reaaliajassa voi merkitä eroa petoksen estämisessä ja miljoonien menettämisessä. Se myös mahdollistaa henkilökohtaisten palvelujen tarjoamisen ja nopeiden päätöksien tekemisen lainojen hyväksymisistä ja sijoitussuositusten antamisesta.

Kustannustehokkuus

Data-infrastruktuurin konsolidoimalla voimme vähentää yleiskustannuksia. Sen sijaan, että ylläpitäisimme erillisiä järjestelmiä data warehouse – ja big data -analytiikkaa varten, data lakehouse mahdollistaa näiden toimintojen yhdistämisen. Tämä vähentää kustannuksia laitteiston ja ohjelmistojen osalta sekä yksinkertaa IT-infrastruktuuria, mikä johtaa alemmaksi ylläpitokustannuksiksi.

Datahallinta

Parannettu kyky toteuttaa tehokkaita datahallintatoimia, jotka ovat olennaisen tärkeät sääntelykohteissamme. Data lakehouse -ratkaisun yhdenmukainen luonne tekee siitä helpomman soveltaa johdonmukaisia data-laatu-, turvallisuus- ja yksityisyyskäytäntöjä kaikkiin tietoihimme. Tämä on erityisen tärkeää pankkitoiminnassa, jossa on noudatettava tiukkoja säädöksiä, kuten GDPR:iä, PSD2:ia ja eri maiden pankkisäädöksiä.

On-premise Data Lakehouse -arkkitehtuuri

On-premise data lakehouse on data lakehouse -arkkitehtuuri, joka on toteutettu organisaation omassa datakeskuksessa eikä pilvipalvelussa. Monille pankkeille, mukaan lukien Akbank, on-premise -ratkaisun valinta johtuu usein sääntelyvaatimuksista, data-suvereniteetin huolesta ja tarpeesta täydelliseen hallintaan data-infrastruktuurista.

Ydinrakenteet

On-premise data lakehouse koostuu tyypillisesti neljästä ydinrakenteesta:

  • Datatallennuskerros
  • Dataprosessointikerros
  • Metatietojen hallinta
  • Turvallisuus ja hallinta

Nämä rakenteet ovat kaikki olennaisen tärkeät luotettavan ja tehokkaan datahallintajärjestelmän luomisessa.

On-premise Data Lakehouse -arkkitehtuuri yksityiskohtaisesti

Datatallennuskerros

Tallennuskerros on on-premise data lakehouse -arkkitehtuurin perusta. Käytämme yhdistelmää Hadoop Distributed File System (HDFS) ja objektitallennusratkaisuja hallinnoimaan laajoja datavarastoja. Rakenteisten datojen, kuten asiakastietojen ja transaktiotietojen, osalta hyödyntämme Apache Iceberg:ia. Tämä avoin taulukkoformaatti tarjoaa erinomaisen suorituskyvyn suurten tietojoukkojen kyselyille ja päivittämisille. Dynaamisempien datojen, kuten reaaliaikaisen transaktiologien, osalta käytämme Apache Hudi:a, joka mahdollistaa yhdistämisen ja inkrementaalisen prosessoinnin.

Dataprosessointikerros

Dataprosessointikerros on se, missä “taikaa” tapahtuu. Käytämme sekä erä- että reaaliaikaisia prosessointimenetelmiä monipuolisten datatarpeidemme käsittelyyn.

ETL-prosesseissa (Extract, Transform, Load) käytämme Informatica PowerCenteriä, joka mahdollistaa datan integroinnin eri lähteistä pankin sisällä. Olemme myös alkaneet käyttää dbt (data build tool):ia datan muokkaamiseen data warehouse -ympäristössämme.

Apache Spark on avainroolissa suurten datamäärien analytiikassa, mahdollistaen monimutkaisten analyysien suorittamisen. Reaaliaikaisessa prosessoinnissa, erityisesti petosten havaitsemisessa ja reaaliaikaisissa asiakasoksauksissa, käytämme Apache Flink:iä.

Kysely ja analyysi

Jotta datatutkijamme ja analyytikkomme voivat johtaa oivalluksia datalakehouse -järjestelmästämme, olemme toteuttaneet Trino:n interaktiiviseen kyselyyn. Tämä mahdollistaa nopeat SQL-kyselyt koko datalake -ympäristössämme, riippumatta siitä, missä data on tallennettu.

Metatietojen hallinta

Metatietojen hallinta on olennaisen tärkeää datalakehouse -järjestelmämme järjestyksen ylläpitämiseksi. Käytämme Apache Hive metastorea yhdessä Apache Icebergin kanssa datan katalogointiin ja indeksointiin. Olemme myös toteuttaneet Amundsen:in, LinkedInin avoimen lähdekoodin metatietojen moottorin, jotta auttaisimme datajoukkoomme löytämään ja ymmärtämään datalakehouse -järjestelmässämme olevia tietoja.

Turvallisuus ja hallinta

Pankkisektorilla turvallisuus ja hallinta ovat ensisijaisen tärkeät. Käytämme Apache Ranger:ia pääsyoikeuksien hallintaan ja datan yksityisyyden suojaamiseen, varmistaen, että arkaluontoiset asiakastiedot ovat vain valtuutettujen henkilöiden saatavilla. Datapolun ja audittauksen osalta olemme toteuttaneet Apache Atlas:in, joka auttaa meitä seuraamaan datan virtausta järjestelmiimme ja noudattamaan sääntelyvaatimuksia.

Toteutusasiat

Infrastruktuurin vaatimukset

On-premise data lakehouse -järjestelmän toteuttaminen edellyttää merkittävää infrastruktuurisijoitusta. Akbankissa olemme joutuneet päivittämään laitteistoa vastaamaan kasvavia tallennus- ja prosessointivaatimuksia. Tähän on kuulunut suorituskykyiset palvelimet, luotettava verkostoitusvälineistö ja skaalautuvat tallennusratkaisut.

Integrointi olemassa oleviin järjestelmiin

Yksi tärkeimmistä haasteistamme oli integrointi datalakehouse -järjestelmään olemassa oleviin järjestelmiin. Kehittimme asteittaisen siirtymissuunnitelman, jossa siirsimme dataa ja prosesseja perinteisistä järjestelmistä uuteen arkkitehtuuriin vaiheittain. Tämä lähestymistapa mahdollisti liiketoiminnan jatkumisen siirtymisen aikana.

Suorituskyky ja skaalautuvuus

Suorituskyvyn varmistaminen datamäärien kasvaessa on ollut tärkeä fokus. Olemme toteuttaneet datan jakamisstrategioita ja optimoinut kyselymoottoreita, jotta voidaan ylläpitää nopeita kyselyvastauksia datamäärien kasvaessa.

Haasteet ja parhaat käytännöt

Yleiset haasteet

Matkallamme on-premise data lakehouse -järjestelmän toteuttamiseen olemme kohdanneet useita haasteita:

  • Datatallennusongelmat, erityisesti perinteisten järjestelmien kanssa
  • Suorituskyvyn ylläpitäminen datamäärien kasvaessa
  • Datatason ylläpitäminen erilaisten datalähteiden yli
  • Tiimimme kouluttaminen uusille teknologioille ja prosesseille

Parhaat käytännöt

Tässä ovat joitakin parhaita käytäntöjämme:

  • Toteuta vahva datahallinta alusta alkaen
  • Investoi datan laatuun ja prosesseihin
  • Tarjoa kattava koulutus tiimille
  • Aloita pilot-projektilla ennen laajaa toteutusta
  • Arvioi ja optimoi arkkitehtuuriasi säännöllisesti

Tulevaisuuden suuntaukset

Tulevaisuudessa näemme useita mielenkiintoisia kehityssuuntauksia data lakehouse -alueella:

  • Tekoälyn ja koneoppimisen kasvava käyttöönotto datahallinnassa ja analytiikassa
  • Suurempi integrointi reunakomputoinnin kanssa
  • Automaation parantuminen datahallinnassa ja -laadussa
  • Avointen teknologioiden jatkuva kehitys data lakehouse -arkkitehtuureja tukevia

Johtopäätös

On-premise data lakehouse edustaa merkittävää askelta eteenpäin datahallinnassa pankkisektorilla. Akbankissa se on mahdollistanut yhdenmukaisen data-infrastruktuurin, parantaneen analytiikkakapasiteettimme ja ylläpitänyt korkeimman tason data-turvallisuutta ja -hallintaa.

Kun jatkamme pankkiteknologian jatkuvasti muuttuvassa maisemassa, data lakehouse on ilman epäilyä tärkeässä roolissa kyvyssämme hyödyntää dataa strategiseen etuihin. Pankkeja, jotka haluavat pysyä kilpailukykyisinä digitaalisessa aikakaudessa, on otettava tosissaan data lakehouse -arkkitehtuuri, riippumatta siitä, onko se on-premise vai pilvipohjainen, eikä se ole enää vaihtoehto, vaan välttämätöntä.

Metin Sarıkaya johtaa tietovarasto-, liiketoimintatiedon ja Big Data -aloitteita Akbankissa, joka on yksi Turkin suurimmista pankeista. Hänellä on laaja kokemus tietohallinnon kehityksestä pankkisektorilla perinteisistä tietovarastoista älykkäisiin arkkitehtuureihin.