Лідери думок

Розуміння архітектури локальної Data Lakehouse

mm
Додайте Unite.AI до бажаних джерел у Google

У сучасному банківському ландшафті, де дані керують усім, здатність ефективно керувати та аналізувати величезні об’єми даних є вирішальною для підтримання конкурентної переваги. Концепція Data Lakehouse представляє революційну ідею, яка змінює наш підхід до керування даними в фінансовому секторі. Ця інноваційна архітектура поєднує найкращі риси даних складів та даних озер. Вона забезпечує єдину платформу для зберігання, обробки та аналізу як структурованих, так і неструктурованих даних, роблячи її невід’ємним активом для банків, які хочуть використовувати свої дані для стратегічного прийняття рішень.

Еволюція архітектур даних

Шлях до Data Lakehouse був еволюційним. Традиційні дані складів давно були основою банківської аналітики, пропонуючи структуроване зберігання даних та швидку продуктивність запитів. Однак із недавнім вибухом неструктурованих даних з джерел, включаючи соціальні мережі, взаємодію з клієнтами та пристрої IoT, дані озера виникли як сучасне рішення для зберігання великих обсягів сирих даних.

Data Lakehouse представляє собою наступний крок в цій еволюції, мостячи розрив між даними складами та даними озерами. Для банків, таких як Akbank, це означає, що ми тепер можемо користуватися перевагами обох світів – структури та продуктивності даних складів, а також гнучкості та масштабованості даних озер.

Ключові концепції Data Lakehouse

Гібридна архітектура

У своєму ядрі Data Lakehouse інтегрує сильні сторони даних озер та даних складів. Цей гібридний підхід дозволяє банкам зберігати величезні об’єми сирих даних, зберігаючи при цьому можливість виконання швидких та складних запитів, характерних для даних складів.

Єдина платформа даних

Однією з найважливіших переваг Data Lakehouse є її здатність поєднувати структуровані та неструктуровані дані в єдиній платформі. Для банків це означає, що ми можемо аналізувати традиційні транзакційні дані поряд з неструктурованими даними з взаємодії з клієнтами, забезпечуючи більш повне бачення нашого бізнесу та клієнтів.

Ключові особливості та переваги

Data Lakehouse пропонує кілька ключових переваг, які особливо цінні в банківському секторі.

Масштабованість

Як наші об’єми даних зростають, архітектура Lakehouse може легко масштабуватися для задоволення цього зростання. Це важливо в банківській сфері, де ми постійно накопичуємо величезні об’єми транзакційних та клієнтських даних. Lakehouse дозволяє нам розширити наші можливості зберігання та обробки даних без порушення наших існуючих операцій.

Гнучкість

Ми можемо зберігати та аналізувати різні типи даних, від транзакційних записів до електронних листів клієнтів. Ця гнучкість невід’ємна в сучасному банківському середовищі, де неструктуровані дані з соціальних мереж, взаємодії з клієнтами та інших джерел можуть забезпечити цінні знання при поєднанні з традиційними структурованими даними.

Аналітика в реальному часі

Це важливо для виявлення шахрайства, оцінки ризиків та персоналізованого клієнтського досвіду. У банківській сфері здатність аналізувати дані в реальному часі може означати різницю між зупиненням шахрайської транзакції та втратою мільйонів. Це також дозволяє нам пропонувати персоналізовані послуги та приймати рішення про кредитування чи інвестиційні рекомендації за секунди.

Економічна ефективність

Об’єднавши нашу інфраструктуру даних, ми можемо зменшити загальні витрати. Замість підтримки окремих систем для даних складів та великих даних, Data Lakehouse дозволяє нам поєднати ці функції. Це не тільки зменшує витрати на апаратне та програмне забезпечення, але й спрощує нашу інфраструктуру ІТ, що призводить до нижчих витрат на технічне обслуговування та операції.

Керування даними

Покращена можливість реалізації міцних практик керування даними, важливих у нашій високорегульованій галузі. Єдина природа Data Lakehouse робить її легшою для застосування послідовних заходів щодо якості даних, безпеки та конфіденційності по всім нашим даним. Це особливо важливо в банківській сфері, де ми повинні відповідати суворим нормативним вимогам, таким як GDPR, PSD2 та різні національні банківські регуляції.

Архітектура локальної Data Lakehouse

Локальна Data Lakehouse – це архітектура Data Lakehouse, реалізована всередині власних центрів даних організації, а не в хмарі. Для багатьох банків, включаючи Akbank, вибір локального рішення часто зумовлений нормативними вимогами, проблемами суверенітету даних та необхідністю повного контролю над нашою інфраструктурою даних.

Ключові компоненти

Локальна Data Lakehouse зазвичай складається з чотирьох ключових компонентів:

  • Шар зберігання даних
  • Шар обробки даних
  • Керування метаданими
  • Безпека та керування

Кожен з цих компонентів відіграє важливу роль у створенні надійного, ефективного та безпечного системи керування даними.

Детальна архітектура локальної Data Lakehouse

Шар зберігання даних

Шар зберігання даних є основою локальної Data Lakehouse. Ми використовуємо комбінацію Hadoop Distributed File System (HDFS) та рішень об’єктного зберігання для керування нашими величезними репозиторіями даних. Для структурованих даних, таких як інформація про клієнтів та транзакційні записи, ми використовуємо Apache Iceberg. Цей відкритий формат таблиць забезпечує відмінну продуктивність для запитів та оновлення великих наборів даних. Для наших більш динамічних даних, таких як журнали транзакцій в реальному часі, ми використовуємо Apache Hudi, який дозволяє виконувати операції upsert та інкрементальну обробку.

Шар обробки даних

Шар обробки даних – це місце, де відбувається магія. Ми використовуємо комбінацію пакетної та обробки в реальному часі для обробки наших різноманітних потреб даних.

Для процесів ETL ми використовуємо Informatica PowerCenter, який дозволяє нам інтегрувати дані з різних джерел по всьому банку. Ми також почали впроваджувати dbt (інструмент будівництва даних) для перетворення даних у нашому складі даних.

Apache Spark відіграє важливу роль у нашій обробці великих даних, дозволяючи нам виконувати складні аналітичні операції над великими наборами даних. Для обробки в реальному часі, особливо для виявлення шахрайства та отримання клієнтських знань в реальному часі, ми використовуємо Apache Flink.

Запит та аналіз

Щоб дозволити нашим науковцям-даним та аналітикам отримувати знання з нашого складу даних, ми реалізували Trino для інтерактивних запитів. Це дозволяє виконувати швидкі запити SQL по всьому нашому складу даних, незалежно від того, де знаходяться дані.

Керування метаданими

Ефективне керування метаданими є важливим для підтримання порядку у нашому складі даних. Ми використовуємо Apache Hive metastore у поєднанні з Apache Iceberg для каталогізації та індексації наших даних. Ми також реалізували Amundsen, відкритий двигун метаданих LinkedIn, щоб допомогти нашій команді даних відкрити та зрозуміти дані, доступні у нашому озері.

Безпека та керування

У банківському секторі безпека та керування є найважливішими. Ми використовуємо Apache Ranger для контролю доступу та конфіденційності даних, забезпечуючи, щоб чутливі клієнтські дані були доступні лише авторизованим особам. Для лінійності даних та аудиту ми реалізували Apache Atlas, який допомагає нам відстежувати потік даних через наші системи та відповідати нормативним вимогам.

Розгляд реалізації

Вимоги до інфраструктури

Реалізація локальної Data Lakehouse вимагає значних інвестицій в інфраструктуру. У Akbank ми були змушені модернізувати нашу апаратуру для задоволення зростаючих вимог до зберігання та обробки даних. Це включало високопродуктивні сервери, надійне обладнання мережі та масштабовані рішення для зберігання.

Інтеграція з існуючими системами

Однією з наших ключових проблем була інтеграція складу даних з нашими існуючими системами. Ми розробили фазований план міграції, поступово переміщаючи дані та процеси з наших старих систем до нової архітектури. Цей підхід дозволив нам підтримувати бізнес-цілісність під час переходу до нової системи.

Продуктивність та масштабованість

Забезпечення високої продуктивності при зростанні наших даних було ключовим фокусом. Ми реалізували стратегії розділення даних та оптимізували наші механізми запитів для підтримання швидкої відповіді на запити навіть при зростанні обсягів даних.

Виклики та найкращі практики

Поширені виклики

Під час нашого шляху до реалізації локальної Data Lakehouse ми зустріли кілька викликів:

  • Проблеми інтеграції даних, особливо з старими системами
  • Збереження продуктивності при зростанні обсягів даних
  • Забезпечення якості даних з різних джерел
  • Навчання нашої команди нових технологій та процесів

Найкращі практики

Ось деякі найкращі практики, яких ми дотримуємося:

  • Реалізуйте міцне керування даними з самого початку
  • Інвестуйте в інструменти та процеси якості даних
  • Надайте всебічне навчання вашій команді
  • Почніть з пілотного проекту перед повномасштабною реалізацією
  • Регулярно переглядайте та оптимізуйте вашу архітектуру

Майбутні тенденції

Оглядаючи майбутнє, ми бачимо кілька цікавих тенденцій у сфері Data Lakehouse:

  • Збільшення прийняття штучного інтелекту та машинного навчання для керування даними та аналітики
  • Більша інтеграція обчислення на краю з Data Lakehouse
  • Покращена автоматизація у керуванні даними та якості
  • Постійна еволюція відкритих технологій, що підтримують архітектури Data Lakehouse

Висновок

Локальна Data Lakehouse представляє собою значний крок вперед у керуванні даними для банківського сектора. У Akbank це дозволило нам уніфікувати нашу інфраструктуру даних, покращити наші аналітичні можливості та підтримувати найвищі стандарти безпеки та керування даними.

Як ми продовжимо навігацію у постійно змінюваному ландшафті банківської технології, Data Lakehouse безумовно відіграє важливу роль у нашій здатності використовувати дані для стратегічної переваги. Для банків, які хочуть залишатися конкурентоспроможними у цифрову епоху, серйозне розгляднання архітектури Data Lakehouse – як локальної, так і в хмарі – вже не є варіантом, а обов’язковим.

Метін Сарикая керує складом даних, бізнес-інтелектом та великими даними в Akbank, одному з найбільших банків Туреччини. Він має великий досвід у розвитку управління даними в банківському секторі, від традиційних складів даних до передових архітектур.