AI:n perusteet
Mitä on ETL? (Extract, Transform, Load) -menetelmä ja käyttötapaukset
ETL on lyhenne sanoista “extract, transform, load”, ja se on prosessi, joka yhdistää eri lähteistä peräisin olevat tiedot yhteen repositorioon, jotta ne voidaan käsitellä ja analysoida, ja niistä voidaan tehdä hyödyllisiä johtopäätöksiä. Nämä hyödylliset johtopäätökset auttavat yrityksiä tekemään datalähtöisiä päätöksiä ja kasvaa.
“Data on uusi öljy.”
Clive Humby, matemaatikko
Globaali datan luominen on kasvanut eksponentiaalisesti, ja nykyisin ihmiset luovat dataa kahdessa vuodessa kaksi kertaa enemmän kuin aiemmin. Tämän seurauksena moderni data-arkkitehtuuri on kehittynyt. Data-martit on muunnettu data-variastoiksi, ja kun se ei ole riittänyt, on luotu data-järviä. Kaikissa näissä eri infrastruktuureissa yksi prosessi on kuitenkin pysynyt samana, ETL-prosessi.
Tässä artikkelissa tarkastelemme ETL-menetelmää, sen käyttötapauksia, sen hyötyjä ja sitä, miten tämä prosessi on muovannut modernin data-maiseman.
ETL-menetelmä
ETL mahdollistaa eri lähteistä peräisin olevien tietojen yhdistämisen yhteen paikkaan, jotta ne voidaan käsitellä, analysoida ja jakaa yritysten sidosryhmille. Se varmistaa käytettävien tietojen eheytensä raportoinnin, analyysin ja ennustamisen koneoppimismalleilla. Se on kolme vaihetta: data haetaan useista lähteistä, muunnetaan ja ladataan liiketoimintatyökaluihin. Nämä liiketoimintatyökalut käytetään yrityksissä datalähtöisten päätösten tekemiseen.
Extract-vaihe
Tässä vaiheessa data haetaan useista lähteistä SQL-kyselyjen, Python-koodien, DBMS:n (tietokannan hallintajärjestelmän) tai ETL-työkalujen avulla. Yleisimmät lähteet ovat:
- CRM (asiakassuhteiden hallintajärjestelmä)
- Analytics-työkalu
- Data-variasto
- Tietokanta
- Pilvitallennuspalvelut
- Myynti- ja markkinointityökalut
- Mobiilisovellukset
Nämä lähteet ovat joko rakenteisia tai rakenteettomia, minkä vuoksi datan muoto ei ole yhdenmukainen tässä vaiheessa.
Transform-vaihe
Muunnosvaiheessa haettu raakadata muunnetaan ja kootaan muotoon, joka on sovelias kohdesysteemille. Tämä edellyttää useita muunnosaliprosesseja, kuten:
- Puhdistus: epäjohdonmukaiset ja puuttuvat tiedot korjataan.
- Standardisointi: yhdenmukainen muotoilu sovelletaan koko ajan.
- Duplikaattien poisto: tarpeettomat tiedot poistetaan.
- Poikkeamien havaitseminen: poikkeamat havaitaan ja normalisoidaan.
- Järjestäminen: data järjestetään tavalla, joka lisää tehokkuutta.
Lisäksi datan uudelleenmuotoilun tarpeen vuoksi on muita syitä muunnokselle. Null-arvot, jos ne ovat läsnä, poistetaan; lisäksi on usein läsnä poikkeamia, jotka vaikuttavat analyysiin negatiivisesti, ja ne käsitellään muunnosvaiheessa. Usein tulee vastaan tietoja, jotka ovat tarpeettomia eivätkä tuo arvoa liiketoiminnalle; tällaiset tiedot poistetaan muunnosvaiheessa säästääkseen järjestelmän tallennustilaa. Nämä ovat ongelmia, jotka ratkaistaan muunnosvaiheessa.
Load-vaihe
Kun raakadata on haettu ja muunnettu, se ladataan kohdesysteemiin, joka on yleensä joko data-variasto tai data-järvi. On kaksi eri tapaa suorittaa latausvaihe.
- Täysi lataus: kaikki data ladataan kerran ensimmäisellä kertaa kohdesysteemiin. Se on teknisesti vähemmän monimutkainen, mutta vie enemmän aikaa. Se on ihanteellinen, kun datan koko ei ole liian suuri.
- Osittainen lataus: osittainen lataus suoritetaan osissa. Sillä on kaksi alaluokkaa.
- Virta-osittainen lataus: data ladataan välein, yleensä päivittäin. Tämäntyyppinen lataus on paras, kun data on pieniä määriä.
- Erä-osittainen lataus: erätyyppisessä osittaisessa latauksessa data ladataan erissä, ja välissä on väli. Se on ihanteellinen, kun data on liian suurta. Se on nopea, mutta teknisesti monimutkaisempi.
ETL-työkalujen tyypit
ETL suoritetaan kahdella tavalla, manuaalisesti tai ilman koodia. Manuaalisessa ETL:ssä on vähän tai ei lainkaan automaatiota. Kaikki putkistot haetaan, muunnetaan ja ladataan manuaalisesti tiimillä, johon kuuluvat data-tieteilijä, data-analyytikko ja data-insinööri. Tämä aiheuttaa suuren tuottavuuden ja resurssien menetyksen.
Alternatiivina on ilman koodia suoritettava ETL; nämä työkalut sisältävät usein raahaus- ja pudotusominaisuuksia. Nämä työkalut poistavat koodauksen tarpeen, joten niitä voivat käyttää jopa ei-tekniikkaan perehtyneet työntekijät. Useimmat yritykset käyttävät Informatica, Integrate.io, IBM Storage, Hadoop, Azure, Google Cloud Dataflow ja Oracle (ORCL ) Data Integrator -työkaluja ETL-toiminnassa.
Data-alalla on olemassa neljä tyyppiä ilman koodia suoritettavia ETL-työkaluja.
- Kaupalliset ETL-työkalut
- Avoin lähdekoodin ETL-työkalut
- Mukautetut ETL-työkalut
- Pilvipohjaiset ETL-työkalut
ETL:n parhaat käytännöt
On olemassa joitakin käytäntöjä ja protokollia, jotka tulisi noudattaa optimaalisen ETL-putkistoon saavuttamiseksi. Parhaat käytännöt ovat seuraavat:
- Datan kontekstin ymmärtäminen: on ymmärrettävä, miten data kerätään ja mitä mittaukset tarkoittavat. Tämä auttaa tunnistamaan, mitkä ominaisuudet ovat tarpeettomia ja poistettavia.
- Palautuskohtien määrittäminen: jos putkisto on rikki ja on tapahtunut datavuoto, on olemassa protokollat datan palauttamiseksi.
- ETL-kirja: on ylläpidettävä ETL-kirjaa, joka sisältää kaikki prosessit, jotka on suoritettu datan kanssa ennen, aikana ja jälkeen ETL-kierron.
- Tarkastus: on pidettävä tarkkaa silmällä dataa jonkin ajan välein vain varmistamaan, että data on halutussa tilassa.
- Pieni datan koko: tietokantojen ja niiden taulujen koko tulisi pitää pieninä siten, että data on jaettu enemmän vaakasuunnassa kuin pystysuunnassa. Tämä käytäntö varmistaa prosessoinnin nopeuden lisäämisen ja ETL-prosessin nopeuttamisen.
- Välimuistin kerroksen luominen: välimuisti on nopea datatallennuskerros, joka tallentaa äskettäin käytetyn datan levylle, josta se voidaan hakea nopeasti. Tämä käytäntö säästää aikaa, kun välimuistissa oleva data on se, mitä järjestelmä pyytää.
- Rinnakkaisprosessi: ETL:n käsittely sarjamuotoisena prosessina vie suuren osan yrityksen ajasta ja resursseja, mikä tekee koko prosessin erittäin tehokkaaksi. Ratkaisu on suorittaa rinnakkaisprosessi ja useita ETL-integrointeja samanaikaisesti.
ETL:n käyttötapaukset
ETL tekee yritysten toiminnasta sileää ja tehokasta useilla tavoilla, mutta tarkastelemme tässä kolmea suosituinta käyttötapausta.
Pilviin lataaminen:
Dataa tallentaminen paikallisesti on kallis vaihtoehto, joka saa yritykset käyttämään resursseja palvelimien ostamiseen, ylläpitämiseen ja ylläpitämiseen. Välttääkseen tämän vaivan yritykset voivat ladata datan suoraan pilveen. Tämä säästää arvokkaita resursseja ja aikaa, jota voidaan sitten käyttää parantamaan muita ETL-prosessin osia.
Erilaisten lähteiden tietojen yhdistäminen:
Data on usein hajallaan eri järjestelmissä organisaatiossa. ETL-prosessia käytetään yhdistämään dataa eri lähteistä yhteen paikkaan, jotta sitä voidaan käsitellä ja analysoida, ja myöhemmin jakaa sidosryhmille. ETL varmistaa, että data eri lähteistä on yhdenmukaisessa muodossa, ja datan eheys säilyy.
Ennustava mallinnus:
Datalähtöinen päätöksenteko on menestyksekkään liiketoimintastrategian kulmakivi. ETL auttaa yrityksiä haettua dataa, muuttaa sitä ja ladata sitä tietokantoihin, jotka on linkitetty koneoppimismalleihin. Nämä koneoppimismallit analysoida dataa ETL-prosessin jälkeen ja tekevät ennusteita siitä.
ETL:n tulevaisuus data-maailmassa
ETL toimii varmasti datan arkkitehtuurin selkärankana; on kuitenkin nähtävä, säilyykö se tulevaisuudessa, koska Zero ETL:n esittely teknologia-alalla tuo suuria muutoksia. Zero ETL:ssä perinteiset haussa-, muunnos- ja latausprosessit eivät ole enää tarpeen, vaan data siirretään suoraan kohdesysteemiin lähes reaaliajassa.
On olemassa useita uusia trendejä data-ekosysteemissä. Tutustu unite.ai -sivustoon, jotta voit laajentaa tietojasi teknologia-alan trendeistä.












