Myslitelé

Pojednání o architektuře on-premise Data Lakehouse

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V dnešní datové krajině bankovnictví je schopnost efektivně spravovat a analyzovat obrovské množství dat zásadní pro udržení konkurenční výhody. Data Lakehouse představuje revoluční koncept, který mění způsob, jakým přistupujeme k datové správě v finančním sektoru. Tato inovativní architektura kombinuje nejlepší funkce datových skladů a datových jezer. Poskytuje jednotnou platformu pro ukládání, zpracování a analýzu jak strukturovaných, tak nestrukturovaných dat, což z ní činí nepostradatelný aktiv pro banky, které chtějí využít svá data pro strategické rozhodování.

Evolution of Data Architectures

Cesta k datovému jezeru byla evoluční. Tradiční datové sklady byly dlouho páteřní součástí bankovních analýz, nabízející strukturované úložiště dat a rychlé dotazovací výkon. Nicméně, s nedávnou explozí nestrukturovaných dat zdrojů, včetně sociálních médií, zákaznických interakcí a zařízení IoT, se datová jezera stala moderním řešením pro uložení obrovských množství surových dat.

Datové jezero představuje další krok v této evoluci, most mezi datovými sklady a datovými jezery. Pro banky, jako je Akbank, to znamená, že můžeme nyní využívat výhod obou světů – struktury a výkonu datových skladů a flexibility a škálovatelnosti datových jezer.

Key Concepts of Data Lakehouse

Hybrid Architecture

V jádru datového jezera spojuje síly datových jezer a datových skladů. Tento hybridní přístup umožňuje bankám ukládat obrovské množství surových dat, zatímco stále udržuje schopnost provádět rychlé a složité dotazy typické pro datové sklady.

Unified Data Platform

Jednou z nejvýznamnějších výhod datového jezera je jeho schopnost kombinovat strukturovaná a nestrukturovaná data na jediné platformě. Pro banky to znamená, že můžeme analyzovat tradiční transakční data společně s nestrukturovanými daty zákaznických interakcí, poskytující tak komplexnější pohled na naše podnikání a zákazníky.

Key Features and Benefits

Datová jezera nabízejí několik klíčových výhod, které jsou besonders cenné v bankovním sektoru.

Scalability

Jak naše datové objemy rostou, architektura jezera může snadno škálovat, aby tuto růst akomodovala. To je zásadní v bankovnictví, kde neustále nahromadíme obrovské množství transakčních a zákaznických dat. Jezero umožňuje nám rozšířit naše úložné a procesní kapacity bez narušení našich stávajících operací.

Flexibility

Můžeme ukládat a analyzovat různé typy dat, od transakčních záznamů po zákaznické e-maily. Tato flexibilita je nepostradatelná v dnešním bankovním prostředí, kde nestrukturovaná data ze sociálních médií, zákaznických interakcí a dalších zdrojů mohou poskytnout bohaté informace, když jsou kombinována s tradičními strukturovanými daty.

Real-time Analytics

To je zásadní pro detekci podvodů, hodnocení rizik a personalizované zákaznické zkušenosti. V bankovnictví může schopnost analyzovat data v reálném čase znamenat rozdíl mezi zastavením podvodné transakce a ztrátou milionů. Také nám umožňuje nabízet personalizované služby a učinit rozhodnutí o schválení půjček nebo investičních doporučeních v okamžiku.

Cost-Effectiveness

Konsolidací naší datové infrastruktury můžeme snížit celkové náklady. Místo udržování samostatných systémů pro datové sklady a big data analytics umožňuje datové jezero kombinovat tyto funkce. To nejen snižuje náklady na hardware a software, ale také zjednodušuje naši IT infrastrukturu, vedoucí k nižším nákladům na údržbu a provoz.

Data Governance

Vylepšená schopnost implementovat robustní datovou správu praktiky, které jsou zásadní v našem vysoce regulovaném odvětví. Jednotná povaha datového jezera usnadňuje aplikaci konzistentních opatření pro kvalitu, bezpečnost a ochranu dat napříč všemi našimi daty. To je besonders důležité v bankovnictví, kde musíme dodržovat přísné regulace, jako je GDPR, PSD2 a různé národní bankovní regulace.

On-Premise Data Lakehouse Architecture

On-premise datové jezero je architektura datového jezera implementovaná v rámci datové centra organizace, spíše než v cloudu. Pro mnoho bank, včetně Akbank, je výběr on-premise řešení často dán regulatorními požadavky, obavami o suverenitu dat a potřebou úplné kontroly nad naší datovou infrastrukturou.

Hlavní komponenty

On-premise datové jezero typicky sestává ze čtyř hlavních komponent:

  • Úložná vrstva dat
  • Zpracovací vrstva dat
  • Správa metadat
  • Bezpečnost a správa

Každá z těchto komponent hraje zásadní roli při vytváření robustního, efektivního a zabezpečeného systému správy dat.

Detailed Architecture of On-Premise Data Lakehouse

Úložná vrstva dat

Úložná vrstva je základem on-premise datového jezera. Používáme kombinaci Hadoop Distributed File System (HDFS) a řešení objektového úložiště pro správu našich rozsáhlých úložišť dat. Pro strukturovaná data, jako jsou informace o zákaznických účtech a transakčních záznamech, využíváme Apache Iceberg. Tento otevřený formát tabulky poskytuje vynikající výkon pro dotazování a aktualizaci velkých datových sad. Pro naše dynamická data, jako jsou reálné transakční logy, používáme Apache Hudi, který umožňuje upserty a inkrementální zpracování.

Zpracovací vrstva dat

Zpracovací vrstva dat je místem, kde se děje magie. Používáme kombinaci batch a reálného zpracování, aby se vyřídily naše rozmanité datové potřeby.

Pro ETL procesy používáme Informatica PowerCenter, které nám umožňuje integrovat data z různých zdrojů napříč celou bankou. Začali jsme také zahrnovat dbt (data build tool) pro transformaci dat v našem datovém skladu.

Apache Spark hraje zásadní roli v našem zpracování big dat, umožňující nám provádět komplexní analýzy na velkých datových sadách. Pro reálné zpracování, zejména pro detekci podvodů a reálné zákaznické přehledy, používáme Apache Flink.

Dotaz a analýza

Abychom umožnili našim datovým vědcům a analytikům získat přehledy z našeho datového jezera, implementovali jsme Trino pro interaktivní dotazování. To umožňuje rychlé SQL dotazy napříč celým naším datovým jezerem, bez ohledu na to, kde jsou data uložena.

Správa metadat

Efektivní správa metadat je zásadní pro udržení pořádku v našem datovém jezeru. Používáme Apache Hive metastore v kombinaci s Apache Iceberg pro katalogizaci a indexaci našich dat. Implementovali jsme také Amundsen, open-source metadata engine od LinkedIn, aby nám pomohl objevit a pochopit data dostupná v našem jezeru.

Bezpečnost a správa

V bankovním sektoru je bezpečnost a správa zásadní. Používáme Apache Ranger pro kontrolu přístupu a ochranu dat, zajišťující, že citlivá zákaznická data jsou přístupná pouze autorizovaným osobám. Pro datovou linii a auditování implementovali jsme Apache Atlas, který nám pomáhá sledovat tok dat našich systémů a dodržovat regulatorní požadavky.

Implementation Considerations

Infrastrukturální požadavky

Implementace on-premise datového jezera vyžaduje významné investice do infrastruktury. V Akbank jsme museli upgradovat naše hardwarové vybavení, aby se vyřídily zvýšené požadavky na úložiště a zpracování. To zahrnovalo high-performance servery, robustní síťové vybavení a škálovatelná úložiště.

Integrace s existujícími systémy

Jednou z našich hlavních výzev byla integrace datového jezera s našimi stávajícími systémy. Vyvinuli jsme fázový migrační strategii, postupně přesouvající data a procesy z našich legacy systémů do nové architektury. Tento přístup nám umožnil udržet kontinuitu podnikání, zatímco přecházíme na nový systém.

Výkon a škálovatelnost

Zajištění vysoké výkonnosti, zatímco naše data rostou, bylo naší hlavní prioritou. Implementovali jsme strategie dělení dat a optimalizovali naše dotazovací motory, aby se udržela rychlá odezva dotazů i při rostoucích objemech dat.

Challenges and Best Practices

Common Challenges

Během naší cesty k implementaci on-premise datového jezera jsme čelili několika výzvám:

  • Problémy s integrací dat, zejména s legacy systémy
  • Udržování výkonu, zatímco naše datové objemy rostou
  • Zajištění datové kvality napříč různými zdroji dat
  • Školení našeho týmu na nových technologiích a procesech

Best Practices

Zde jsou některé osvědčené postupy, které jsme přijali:

  • Implementovat silnou datovou správu od začátku
  • Investovat do nástrojů a procesů pro datovou kvalitu
  • Poskytnout komplexní školení pro náš tým
  • Zahájit s pilotním projektem před plnou implementací
  • Pravidelně přehodnotit a optimalizovat naši architekturu

Future Trends

Pohledem do budoucnosti vidíme několik zajímavých trendů v oblasti datového jezera:

  • Zvyšující se adopce AI a strojového učení pro datovou správu a analýzu
  • Větší integrace edge computingu s datovým jezerem
  • Vylepšená automatizace v datové správě a kvalitě
  • Pokračující evoluce open-source technologií podporujících architekturu datového jezera

Conclusion

On-premise datové jezero představuje významný skok vpřed v datové správě pro bankovní sektor. V Akbank nám umožnilo sjednotit naši datovou infrastrukturu, vylepšit naše analytické schopnosti a udržet nejvyšší standardy datové bezpečnosti a správy.

Jako pokračujeme v navigaci neustále se měnící krajiny bankovních technologií, datové jezero bude bezpochyby hrát zásadní roli v naší schopnosti využít data pro strategickou výhodu. Pro banky, které chtějí zůstat konkurenceschopné v digitální éře, vážné zvažování architektury datového jezera – ať už on-premise nebo v cloudu – již není volitelné, je imperativní.

Metin Sarıkaya vede Data Warehouse, Business Intelligence a Big Data iniciativy v Akbank, jedné z největších tureckých bank. Má rozsáhlé zkušenosti s evolucí správy dat v bankovním sektoru, od tradičních datových skladů po nejmodernější architektury.