Ajatusjohtajat
On-premise Data Lakehouse -arkkitehtuuri
Nykypäivän datajohtamisessa pankkien on kyettävä hallitsemaan ja analysoimaan suuria määriä dataa, jotta ne voisivat ylläpitää kilpailukykyään. Data lakehouse esittää vallankumouksellisen käsitteen, joka muuttaa datahallintaa rahoitussektorilla. Tämä innovatiivinen arkkitehtuuri yhdistää parhaat ominaisuudet data warehouse ja data lake -ratkaisuista. Se tarjoaa yhdenmukaisen alustan sekä rakenteisten että rakenteettomien datojen tallentamiseen, prosessointiin ja analysointiin, mikä tekee siitä arvokkaan varan pankkeja, jotka haluavat hyödyntää dataansa strategiseen päätöksentekoon.
Data-arkkitehtuurin kehitys
Matka data lakehouseen on ollut evolutiivinen. Perinteiset data warehouse -ratkaisut ovat pitkään olleet pankkien analytiikan selkärangan, tarjoten rakenteisen datatallennuksen ja nopean kyselysuorituskyvyn. Viimeaikaisen sosiaalisen median, asiakastiedon ja IoT-laitteiden määrän räjähdysmäisen kasvun myötä data lake -ratkaisut ovat nousseet nykyaikaisiksi ratkaisuiksi suurten määrien raakadatien tallentamiseen.
Data lakehouse edustaa seuraavaa askelta tässä kehityksessä, sillä se siltaa data warehouse – ja data lake -ratkaisujen välistä kuilua. Pankkien, kuten Akbankin, näkökulmasta tämä tarkoittaa, että voimme nyt nauttia molempien maailmojen eduista – data warehouse -ratkaisujen rakenteisuudesta ja suorituskyvystä sekä data lake -ratkaisujen joustavuudesta ja skaalautuvuudesta.
Data Lakehouse -käsitteet
Hybridi-arkkitehtuuri
Data lakehouse yhdistää data lake – ja data warehouse -ratkaisujen vahvuudet. Tämä hybridi-lähestymistapa mahdollistaa pankkien tallentaa suuria määriä raakadataa samalla, kun ne voivat suorittaa nopeita ja monimutkaisia kyselyjä, jotka ovat tyypillisiä data warehouse -ratkaisuille.
Yhdenmukainen data-alusta
Yksi data lakehouse -ratkaisun merkittävimmistä etuoista on sen kyky yhdistää rakenteiset ja rakenteettomat datat yhdessä alustassa. Pankkien näkökulmasta tämä tarkoittaa, että voimme analyysin perinteisiä transaktiodataa asiakastiedon kanssa, jotta saamme kattavamman näkymän liiketoiminnastamme ja asiakkaistamme.
Merkittävät ominaisuudet ja hyödyt
Data lakehouse -ratkaisut tarjoavat useita avainhyötyjä, jotka ovat erityisen arvokkaita pankkisektorilla.
Skaalautuvuus
Kun datamäärämme kasvaa, lakehouse-arkkitehtuuri voi helposti skaalautua tämän kasvun mukana. Tämä on pankkitoiminnassa olennaisen tärkeää, jossa keräämme jatkuvasti suuria määriä transaktio- ja asiakastietoja. Lakehouse mahdollistaa meidän varastointi- ja prosessointikapasiteettien laajentamisen ilman, että seurauksena on toiminnan keskeytyminen.
Joustavuus
Voimme tallentaa ja analysoida erilaisia datatyyppejä, kuten transaktiotietoja ja asiakirjeitä. Tämä joustavuus on arvokasta nykyisessä pankkitoiminnassa, jossa sosiaalisen median, asiakaspalvelun ja muiden lähteiden rakenteettomat datat voivat tarjota arvokkaita oivalluksia, kun ne yhdistetään perinteisiin rakenteisiin tietoihin.
Reaaliaikainen analyysi
Tämä on olennaisen tärkeää petosten havaitsemisessa, riskien arvioinnissa ja asiakkaiden kokemusten mukauttamisessa. Pankkitoiminnassa datan analysointi reaaliajassa voi merkitä eroa petoksen estämisessä ja miljoonien menettämisessä. Se myös mahdollistaa henkilökohtaisten palvelujen tarjoamisen ja nopeiden päätöksien tekemisen lainojen hyväksymisistä ja sijoitussuositusten antamisesta.
Kustannustehokkuus
Data-infrastruktuurin konsolidoimalla voimme vähentää yleiskustannuksia. Sen sijaan, että ylläpitäisimme erillisiä järjestelmiä data warehouse – ja big data -analytiikkaa varten, data lakehouse mahdollistaa näiden toimintojen yhdistämisen. Tämä vähentää kustannuksia laitteiston ja ohjelmistojen osalta sekä yksinkertaa IT-infrastruktuuria, mikä johtaa alemmaksi ylläpitokustannuksiksi.
Datahallinta
Parannettu kyky toteuttaa tehokkaita datahallintatoimia, jotka ovat olennaisen tärkeät sääntelykohteissamme. Data lakehouse -ratkaisun yhdenmukainen luonne tekee siitä helpomman soveltaa johdonmukaisia data-laatu-, turvallisuus- ja yksityisyyskäytäntöjä kaikkiin tietoihimme. Tämä on erityisen tärkeää pankkitoiminnassa, jossa on noudatettava tiukkoja säädöksiä, kuten GDPR:iä, PSD2:ia ja eri maiden pankkisäädöksiä.
On-premise Data Lakehouse -arkkitehtuuri
On-premise data lakehouse on data lakehouse -arkkitehtuuri, joka on toteutettu organisaation omassa datakeskuksessa eikä pilvipalvelussa. Monille pankkeille, mukaan lukien Akbank, on-premise -ratkaisun valinta johtuu usein sääntelyvaatimuksista, data-suvereniteetin huolesta ja tarpeesta täydelliseen hallintaan data-infrastruktuurista.
Ydinrakenteet
On-premise data lakehouse koostuu tyypillisesti neljästä ydinrakenteesta:
- Datatallennuskerros
- Dataprosessointikerros
- Metatietojen hallinta
- Turvallisuus ja hallinta
Nämä rakenteet ovat kaikki olennaisen tärkeät luotettavan ja tehokkaan datahallintajärjestelmän luomisessa.
On-premise Data Lakehouse -arkkitehtuuri yksityiskohtaisesti
Datatallennuskerros
Tallennuskerros on on-premise data lakehouse -arkkitehtuurin perusta. Käytämme yhdistelmää Hadoop Distributed File System (HDFS) ja objektitallennusratkaisuja hallinnoimaan laajoja datavarastoja. Rakenteisten datojen, kuten asiakastietojen ja transaktiotietojen, osalta hyödyntämme Apache Iceberg:ia. Tämä avoin taulukkoformaatti tarjoaa erinomaisen suorituskyvyn suurten tietojoukkojen kyselyille ja päivittämisille. Dynaamisempien datojen, kuten reaaliaikaisen transaktiologien, osalta käytämme Apache Hudi:a, joka mahdollistaa yhdistämisen ja inkrementaalisen prosessoinnin.
Dataprosessointikerros
Dataprosessointikerros on se, missä “taikaa” tapahtuu. Käytämme sekä erä- että reaaliaikaisia prosessointimenetelmiä monipuolisten datatarpeidemme käsittelyyn.
ETL-prosesseissa (Extract, Transform, Load) käytämme Informatica PowerCenteriä, joka mahdollistaa datan integroinnin eri lähteistä pankin sisällä. Olemme myös alkaneet käyttää dbt (data build tool):ia datan muokkaamiseen data warehouse -ympäristössämme.
Apache Spark on avainroolissa suurten datamäärien analytiikassa, mahdollistaen monimutkaisten analyysien suorittamisen. Reaaliaikaisessa prosessoinnissa, erityisesti petosten havaitsemisessa ja reaaliaikaisissa asiakasoksauksissa, käytämme Apache Flink:iä.
Kysely ja analyysi
Jotta datatutkijamme ja analyytikkomme voivat johtaa oivalluksia datalakehouse -järjestelmästämme, olemme toteuttaneet Trino:n interaktiiviseen kyselyyn. Tämä mahdollistaa nopeat SQL-kyselyt koko datalake -ympäristössämme, riippumatta siitä, missä data on tallennettu.
Metatietojen hallinta
Metatietojen hallinta on olennaisen tärkeää datalakehouse -järjestelmämme järjestyksen ylläpitämiseksi. Käytämme Apache Hive metastorea yhdessä Apache Icebergin kanssa datan katalogointiin ja indeksointiin. Olemme myös toteuttaneet Amundsen:in, LinkedInin avoimen lähdekoodin metatietojen moottorin, jotta auttaisimme datajoukkoomme löytämään ja ymmärtämään datalakehouse -järjestelmässämme olevia tietoja.
Turvallisuus ja hallinta
Pankkisektorilla turvallisuus ja hallinta ovat ensisijaisen tärkeät. Käytämme Apache Ranger:ia pääsyoikeuksien hallintaan ja datan yksityisyyden suojaamiseen, varmistaen, että arkaluontoiset asiakastiedot ovat vain valtuutettujen henkilöiden saatavilla. Datapolun ja audittauksen osalta olemme toteuttaneet Apache Atlas:in, joka auttaa meitä seuraamaan datan virtausta järjestelmiimme ja noudattamaan sääntelyvaatimuksia.
Toteutusasiat
Infrastruktuurin vaatimukset
On-premise data lakehouse -järjestelmän toteuttaminen edellyttää merkittävää infrastruktuurisijoitusta. Akbankissa olemme joutuneet päivittämään laitteistoa vastaamaan kasvavia tallennus- ja prosessointivaatimuksia. Tähän on kuulunut suorituskykyiset palvelimet, luotettava verkostoitusvälineistö ja skaalautuvat tallennusratkaisut.
Integrointi olemassa oleviin järjestelmiin
Yksi tärkeimmistä haasteistamme oli integrointi datalakehouse -järjestelmään olemassa oleviin järjestelmiin. Kehittimme asteittaisen siirtymissuunnitelman, jossa siirsimme dataa ja prosesseja perinteisistä järjestelmistä uuteen arkkitehtuuriin vaiheittain. Tämä lähestymistapa mahdollisti liiketoiminnan jatkumisen siirtymisen aikana.
Suorituskyky ja skaalautuvuus
Suorituskyvyn varmistaminen datamäärien kasvaessa on ollut tärkeä fokus. Olemme toteuttaneet datan jakamisstrategioita ja optimoinut kyselymoottoreita, jotta voidaan ylläpitää nopeita kyselyvastauksia datamäärien kasvaessa.
Haasteet ja parhaat käytännöt
Yleiset haasteet
Matkallamme on-premise data lakehouse -järjestelmän toteuttamiseen olemme kohdanneet useita haasteita:
- Datatallennusongelmat, erityisesti perinteisten järjestelmien kanssa
- Suorituskyvyn ylläpitäminen datamäärien kasvaessa
- Datatason ylläpitäminen erilaisten datalähteiden yli
- Tiimimme kouluttaminen uusille teknologioille ja prosesseille
Parhaat käytännöt
Tässä ovat joitakin parhaita käytäntöjämme:
- Toteuta vahva datahallinta alusta alkaen
- Investoi datan laatuun ja prosesseihin
- Tarjoa kattava koulutus tiimille
- Aloita pilot-projektilla ennen laajaa toteutusta
- Arvioi ja optimoi arkkitehtuuriasi säännöllisesti
Tulevaisuuden suuntaukset
Tulevaisuudessa näemme useita mielenkiintoisia kehityssuuntauksia data lakehouse -alueella:
- Tekoälyn ja koneoppimisen kasvava käyttöönotto datahallinnassa ja analytiikassa
- Suurempi integrointi reunakomputoinnin kanssa
- Automaation parantuminen datahallinnassa ja -laadussa
- Avointen teknologioiden jatkuva kehitys data lakehouse -arkkitehtuureja tukevia
Johtopäätös
On-premise data lakehouse edustaa merkittävää askelta eteenpäin datahallinnassa pankkisektorilla. Akbankissa se on mahdollistanut yhdenmukaisen data-infrastruktuurin, parantaneen analytiikkakapasiteettimme ja ylläpitänyt korkeimman tason data-turvallisuutta ja -hallintaa.
Kun jatkamme pankkiteknologian jatkuvasti muuttuvassa maisemassa, data lakehouse on ilman epäilyä tärkeässä roolissa kyvyssämme hyödyntää dataa strategiseen etuihin. Pankkeja, jotka haluavat pysyä kilpailukykyisinä digitaalisessa aikakaudessa, on otettava tosissaan data lakehouse -arkkitehtuuri, riippumatta siitä, onko se on-premise vai pilvipohjainen, eikä se ole enää vaihtoehto, vaan välttämätöntä.












