Основи ШІ
Що таке ETL? (Extract, Transform, Load) Методологія та випадки використання
ETL означає “екстракт, трансформ, завантаження”. Це процес, який інтегрує дані з різних джерел у єдиний репозиторій, щоб їх можна було обробити та проаналізувати, щоб отримати корисну інформацію. Ця корисна інформація допомагає підприємствам приймати рішення, засновані на даних, та розвиватися.
“Дані – це нова нафта.”
Клайв Гамбі, математик
Глобальне створення даних зросло експоненційно, так що, згідно з Forbes, на поточному рівні люди подвоюють створення даних кожні два роки. В результаті сучасний стек даних еволюціонував. Дані мартів були перетворені на дані сховища, а коли цього було недостатньо, були створені дані озера. Хоча в усіх цих різних інфраструктурах один процес залишився тим самим, процес ETL.
У цій статті ми розглянемо методологію ETL, її випадки використання, її переваги та те, як цей процес допоміг сформувати сучасний ландшафт даних.
Методологія ETL
ETL дозволяє інтегрувати дані з різних джерел у одне місце, щоб їх можна було обробити, проаналізувати та поділитися з зацікавленими сторонами підприємств. Це забезпечує цілісність даних, які будуть використовуватися для звітності, аналізу та прогнозування з моделями машинного навчання. Це триступеневий процес, який витягує дані з多 джерел, трансформує їх та завантажує у бізнес-інструменти. Ці бізнес-інструменти потім використовуються підприємствами для прийняття рішень, заснованих на даних.
Фаза екстракції
На цьому етапі дані витягується з різних джерел за допомогою запитів SQL, кодів Python, СУБД (систем управління базами даних) або інструментів ETL. Найпоширеніші джерела:
- Програмне забезпечення CRM (управління відносинами з клієнтами)
- Інструмент аналізу
- Дані сховища
- База даних
- Хмарні платформи зберігання
- Інструменти продажів та маркетингу
- Мобільні додатки
Ці джерела можуть бути структурованими або неструктурованими, тому формат даних на цьому етапі не є уніфікованим.
Фаза трансформації
На етапі трансформації витягнуті сирі дані трансформуються та компілюються у формат, який підходить для цільової системи. Для цього сирі дані проходять через кілька підпроцесів трансформації, таких як:
- Очистка – виправлення неконсистентних та відсутніх даних.
- Стандартизація – застосування уніфікованого форматування.
- Видалення дублікатів – видалення надлишкових даних.
- Виявлення аутлієрів – виявлення та нормалізація аутлієрів.
- Сортування – організація даних для підвищення ефективності.
Крім перетворення даних, існують інші причини для необхідності трансформації даних. Нульові значення, якщо вони присутні в даних, повинні бути видалені; крім того, часто трапляються дані, які є надлишковими та не приносять жодної цінності для бізнесу; такі дані видаляються на етапі трансформації для збереження місця зберігання системи. Це проблеми, які вирішуються на етапі трансформації.
Фаза завантаження
Як тільки сирі дані витягнуті та перетворені, вони завантажуються до цільової системи, яка зазвичай є або дані сховища, або дані озера. Існують два різних способи виконання фази завантаження.
- Повне завантаження: усі дані завантажуються одразу вперше в цільову систему. Це технічно менш складно, але займає більше часу. Це ідеально, коли розмір даних не надто великий.
- Інкрементне завантаження: інкрементне завантаження, як випливає з назви, здійснюється інкрементально. Воно має дві підкатегорії.
- Потокове інкрементне завантаження: дані завантажуються з інтервалами, зазвичай щодня. Це найкраще, коли дані знаходяться у невеликих кількостях.
- Пакетне інкрементне завантаження: у пакетному типі інкрементного завантаження дані завантажуються пакетами з інтервалом між двома пакетами. Це ідеально, коли дані надто великі. Це швидко, але технічно складніше.
Типи інструментів ETL
ETL здійснюється двома способами: ручний ETL або безкодовий ETL. У ручному ETL майже немає автоматизації. Все кодується командою, що складається з науковців-даних, аналітиків-даних та інженерів-даних. Усі трубопроводи витягування, трансформації та завантаження проектуються для всіх наборів даних вручну. Це все призводить до великих втрат продуктивності та ресурсів.
Альтернативою є безкодовий ETL; ці інструменти зазвичай мають функції перетягування та випускання. Ці інструменти повністю усувають необхідність кодування, що дозволяє навіть нектехнічним працівникам виконувати ETL. Завдяки їхній інтерактивній конструкції та інклюзивному підходу більшість підприємств використовують Informatica, Integrate.io, IBM Storage, Hadoop, Azure, Google Cloud Dataflow та Oracle (ORCL ) Data Integrator для своїх операцій ETL.
Існують чотири типи інструментів безкодового ETL у галузі даних.
- Комерційні інструменти ETL
- Відкриті інструменти ETL
- Інструменти ETL на замовлення
- Хмарні інструменти ETL
Найкращі практики для ETL
Існують деякі практики та протоколи, яких слід дотримуватися для забезпечення оптимізованого трубопроводу ETL. Найкращі практики обговорюються нижче:
- Поняття контексту даних: як дані збираються та що означають метрики, повинні бути належним чином зрозумілі. Це допоможе визначити, які атрибути є надлишковими та повинні бути видалені.
- Пункти відновлення: у разі порушення трубопроводу та витоку даних слід мати протоколи для відновлення виточених даних.
- Журнал ETL: повинен бути підтриманий журнал ETL, який містить запис кожного процесу, який був виконаний з даними до, під час та після циклу ETL.
- Аудит: слід здійснювати перевірку даних через інтервал, просто щоб переконатися, що дані знаходяться у стані, який ви хотіли б.
- Маленький розмір даних: розмір баз даних та їхніх таблиць повинен бути малим, щоб дані були розподілені більш горизонтально, ніж вертикально. Ця практика забезпечує підвищення швидкості обробки та, відповідно, прискорення процесу ETL.
- Створення шару кешу: шар кешу – це високошвидкісний шар зберігання даних, який зберігає недавно використані дані на диску, де їх можна швидко доступити. Ця практика допомагає заощадити час, коли запитується закешований дані системою.
- Паралельна обробка: розгляд ETL як серійного процесу споживає велику частку часу та ресурсів підприємства, що робить весь процес надзвичайно неефективним. Рішенням є паралельна обробка та кілька інтеграцій ETL одночасно.
Використання ETL
ETL робить операції гладкими та ефективними для підприємств багатьма способами, але ми обговоримо три найпопулярніші випадки використання тут.
Завантаження у хмару:
Локальне зберігання даних – це дорогий варіант, який заставляє підприємства витрачати ресурси на покупку, утримання, запуск та обслуговування серверів. Щоб уникнути всіх цих проблем, підприємства можуть безпосередньо завантажувати дані у хмару. Це зберігає цінні ресурси та час, які можна інвестувати в інші аспекти процесу ETL.
Об’єднання даних з різних джерел:
Дані часто розкидані по різних системах у організації. Об’єднання даних з різних джерел у одному місці, щоб їх можна було обробити та проаналізувати, а потім поділитися з зацікавленими сторонами пізніше, здійснюється за допомогою процесу ETL. ETL забезпечує, що дані з різних джерел форматуються уніфіковано, залишаючи цілісність даних цілою.
Прогнозне моделювання:
Приняття рішень, заснованих на даних, – це краєвид успішної бізнес-стратегії. ETL допомагає підприємствам, витягуючи дані, трансформуючи їх та завантажуючи їх у бази даних, пов’язані з моделями машинного навчання. Ці моделі машинного навчання аналізують дані після проходження процесу ETL, а потім роблять прогнози на основі цих даних.
Майбутнє ETL у ландшафті даних
ETL безумовно грає роль хребта для архітектури даних; чи буде це так і надалі, залишається невідомим, оскільки з введенням Zero ETL у галузі технологій відбуваються великі зміни. З Zero ETL не буде необхідності у традиційних процесах витягування, трансформації та завантаження, а дані будуть передаватися безпосередньо до цільової системи майже в реальному часі.
Існують численні нові тенденції в екосистемі даних. Перейдіть на unite.ai, щоб розширити свої знання про технологічні тенденції.












