Tankeledere

Forståelse af On-Premise Data Lakehouse Arkitektur

mm
Føj Unite.AI til dine foretrukne kilder på Google

I dagens datadrevne banklandskab er evnen til effektivt at håndtere og analysere store mængder data afgørende for at fastholde en konkurrencemæssig fordel. Data lakehouse præsenterer en revolutionerende koncept, der former om, hvordan vi tilgår datastyring i den finansielle sektor. Denne innovative arkitektur kombinerer de bedste funktioner fra data warehouse og data lakes. Den giver en samlet platform for lagring, behandling og analyse af både struktureret og ustruktureret data, hvilket gør det til en uvurderlig aktiv for banker, der søger at udnytte deres data til strategisk beslutningstagning.

Udviklingen af Dataarkitekturer

Rejsen til data lakehouses har været evolutionær i naturen. Traditionelle data warehouse har længe været rygraden i bankanalyse, og tilbyder struktureret dataopbevaring og hurtig forespørgselsservice. Men med den seneste eksplosion af ustruktureret data fra kilder, herunder sociale medier, kundeinteraktioner og IoT-enheder, opstod data lakes som en samtidig løsning til at opbevare store mængder rådata.

Data lakehouse repræsenterer det næste skridt i denne udvikling, og broer gapet mellem data warehouse og data lakes. For banker som Akbank betyder det, at vi nu kan nyde fordelene ved begge verdener – struktur og service fra data warehouse, og fleksibilitet og skalerbarhed fra data lakes.

Nøglekoncepter for Data Lakehouse

Hybrid Arkitektur

I sin kerne integrerer en data lakehouse styrkerne fra data lakes og data warehouse. Denne hybridtilgang giver banker mulighed for at opbevare store mængder rådata, mens de stadig kan udføre hurtige, komplekse forespørgsler, typisk for data warehouse.

Samlet Data Platform

En af de mest betydningsfulde fordele ved en data lakehouse er dens evne til at kombinere struktureret og ustruktureret data på en enkelt platform. For banker betyder det, at vi kan analysere traditionel transaktionsdata sammen med ustruktureret data fra kundeinteraktioner, og give en mere komplet oversigt over vores forretning og kunder.

Nøglefunktioner og Fordele

Data lakehouses tilbyder flere nøglefunktioner, der er særligt værdifulde i den finansielle sektor.

Skalerbarhed

Da vores data volumener vokser, kan lakehouse-arkitekturen let skaleres til at imødekomme denne vækst. Dette er afgørende i bankverdenen, hvor vi konstant akkumulerer store mængder transaktions- og kundedata. Lakehouse giver os mulighed for at udvide vores lagrings- og behandlingskapacitet uden at forstyrre vores eksisterende operationer.

Fleksibilitet

Vi kan opbevare og analysere forskellige datatyper, fra transaktionsposter til kundeemail. Denne fleksibilitet er uvurderlig i dagens bankmiljø, hvor ustruktureret data fra sociale medier, kundeserviceinteraktioner og andre kilder kan give rigelige indsighter, når de kombineres med traditionel struktureret data.

Real-time Analyse

Dette er afgørende for svigagtigelse, risikovurdering og personlige kundeoplevelser. I bankverdenen kan evnen til at analysere data i real-time betyde forskellen på at stoppe en svigagtig transaktion og tabe millioner. Det giver os også mulighed for at tilbyde personlige tjenester og træffe beslutninger om lån og investeringsanbefalinger på få sekunder.

Omstillingsvenlighed

Ved at konsolidere vores datainfrastruktur kan vi reducere de samlede omkostninger. I stedet for at vedligeholde separate systemer til data warehouse og big data-analyse giver en data lakehouse os mulighed for at kombinere disse funktioner. Dette reducerer ikke kun hardware- og softwareomkostninger, men simplificerer også vores IT-infrastruktur, hvilket fører til lavere vedligeholdelses- og driftsomkostninger.

Datastyring

Forbedret evne til at implementere robuste datastyringspraksis, afgørende i vores højt regulerede branche. Den samlede natur af en data lakehouse gør det lettere at anvende konsekvente datakvalitets-, sikkerheds- og privatlivsforanstaltninger på tværs af alle vores data. Dette er særligt vigtigt i bankverdenen, hvor vi skal overholde strenge regler som GDPR, PSD2 og forskellige nationale bankregler.

On-Premise Data Lakehouse Arkitektur

En on-premise data lakehouse er en data lakehouse-arkitektur, der implementeres inden for en organisations egne datacentre, snarere end i skyen. For mange banker, herunder Akbank, er valget af en on-premise-løsning ofte drevet af regulatoriske krav, datasuverænitet og behovet for fuld kontrol over vores datainfrastruktur.

Kernecomponenter

En on-premise data lakehouse består typisk af fire kernecomponenter:

  • Dataopbevaringslag
  • Dataprocesseringslag
  • Metadatastyring
  • Sikkerhed og styring

Hver af disse komponenter spiller en afgørende rolle i at skabe et robust, effektivt og sikret datasystem.

Detailed Arkitektur af On-Premise Data Lakehouse

Dataopbevaringslag

Opbevaringslaget er grundlaget for en on-premise data lakehouse. Vi bruger en kombination af Hadoop Distributed File System (HDFS) og objektlagringsløsninger til at styre vores store datalager. Til struktureret data, som kundeoplysninger og transaktionsposter, udnytter vi Apache Iceberg. Denne åbne tabelformat giver fremragende ydeevne til forespørgsler og opdatering af store datasæt. Til vores mere dynamiske data, som real-time transaktionslog, bruger vi Apache Hudi, som giver mulighed for upserts og inkrementel behandling.

Dataprocesseringslag

Dataprocesseringslaget er, hvor magien sker. Vi anvender en kombination af batch- og real-time-behandling til at håndtere vores forskellige databehov.

Til ETL-processer bruger vi Informatica PowerCenter, som giver os mulighed for at integrere data fra forskellige kilder på tværs af banken. Vi har også begyndt at inkorporere dbt (data build tool) til at transformere data i vores data warehouse.

Apache Spark spiller en afgørende rolle i vores big data-behandling, og giver os mulighed for at udføre komplekse analyser på store datasæt. Til real-time-behandling, især til svigagtigelse og real-time kundeindsigt, bruger vi Apache Flink.

Forespørgsel og Analyse

For at give vores datavidenskabsfolk og analytikere mulighed for at udlede indsighter fra vores data lakehouse, har vi implementeret Trino til interaktiv forespørgsel. Dette giver mulighed for hurtige SQL-forespørgsler på tværs af vores hele datalager, uanset hvor data er opbevaret.

Metadatastyring

Effektiv metadatastyring er afgørende for at opretholde orden i vores data lakehouse. Vi bruger Apache Hive metastore i kombination med Apache Iceberg til at katalogisere og indeksere vores data. Vi har også implementeret Amundsen, LinkedIns åbne metadata-engine, til at hjælpe vores datahold med at opdage og forstå data, der er tilgængelig i vores lakehouse.

Sikkerhed og Styring

I bankverdenen er sikkerhed og styring af allerhøjeste prioritet. Vi bruger Apache Ranger til adgangskontrol og dataprotektion, og sikrer, at følsomme kundedata kun er tilgængelige for autoriseret personale. Til dataækvivalens og revision har vi implementeret Apache Atlas, som hjælper os med at spore datastrømmen gennem vores systemer og overholde regulatoriske krav.

Implementeringsovervejelser

Infrastrukturkrav

Implementering af en on-premise data lakehouse kræver betydelig infrastrukturinvestering. Hos Akbank har vi måttet opgradere vores hardware til at håndtere de øgede lagrings- og behandlingskrav. Dette inkluderede højtydende servere, robust netværksudstyr og skalerbare lagringsløsninger.

Integration med Eksisterende Systemer

En af vores største udfordringer var integrationen af data lakehouse med vores eksisterende systemer. Vi udviklede en faseret migrationsstrategi, og flyttede gradvist data og processer fra vores ældre systemer til den nye arkitektur. Denne tilgang gav os mulighed for at opretholde forretningskontinuitet, mens vi overgik til det nye system.

Ydeevne og Skalerbarhed

At sikre høj ydeevne, mens vores data vokser, har været en nøglefokus. Vi har implementeret dataopdelingsstrategier og optimeret vores forespørgselsservice til at opretholde hurtige forespørgselssvar, selv når vores data volumener øges.

Udfordringer og Bedste Praksis

Almindelige Udfordringer

På vores rejse til at implementere en on-premise data lakehouse har vi mødt flere udfordringer:

  • Dataintegrationsproblemer, især med ældre systemer
  • At opretholde ydeevne, mens data volumener vokser
  • At sikre datakvalitet på tværs af forskellige datakilder
  • At uddanne vores team på nye teknologier og processer

Bedste Praksis

Her er nogle bedste praksis, vi har antaget:

  • Implementer stærk datastyring fra starten
  • Investér i datakvalitetsværktøjer og -processer
  • Giv omfattende uddannelse til vores team
  • Start med et pilotprojekt, før fuld implementering
  • Gennemgå og optimer jævnligt vores arkitektur

Fremtidige Tendenser

Settende fremad ser vi flere spændende tendenser i data lakehouse-rummet:

  • Øget anvendelse af AI og maskinlæring til datastyring og -analyse
  • Større integration af edge computing med data lakehouses
  • Forbedret automation i datastyring og -kvalitetsstyring
  • Fortsat udvikling af åbne teknologier, der understøtter data lakehouse-arkitekturer

Konklusion

On-premise data lakehouse repræsenterer et betydeligt spring fremad i datastyring for den finansielle sektor. Hos Akbank har det givet os mulighed for at samle vores datainfrastruktur, forbedre vores analytiske kapaciteter og opretholde de højeste standarder for datasikkerhed og -styring.

Da vi fortsætter med at navigere i det konstant skiftende landskab af bankteknologi, vil data lakehouse uden tvivl spille en afgørende rolle i vores evne til at udnytte data til strategisk fordel. For banker, der søger at fastholde en konkurrencemæssig fordel i den digitale tidsalder, er det ikke længere et valg, men en nødvendighed at overveje en data lakehouse-arkitektur – enten on-premise eller i skyen.

Metin Sarıkaya leder Data Warehouse, Business Intelligence og Big Data-initiativerne hos Akbank, en af Tyrkiets største banker. Han har omfattende erfaring med udviklingen af datastyring i banksektoren, fra traditionelle datawarehouse til avancerede arkitekturer.