Základy AI

Co je datové vědy?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Obor datové vědy parece být stále větší a populárnější každý den. Podle LinkedIn, datové vědy byly jedním z nejrychleji rostoucích oborů v roce 2017 a v roce 2020 Glassdoor označil práci datového vědce jako jednu z nejlepších prací ve Spojených státech. Vzhledem k rostoucí popularitě datové vědy není překvapením, že se o tento obor zajímá stále více lidí. Přesto, co je datové vědy vlastně?

Seznamte se s datovou vědou, strávíme nějaký čas definováním datové vědy, prozkoumáním toho, jak big data a umělá inteligence mění tento obor, naučíme se o některých běžných nástrojích datové vědy a prozkoumáme einige příklady datové vědy.

Co je datové vědy?

Než budeme moci prozkoumat některé nástroje nebo příklady datové vědy, budeme chtít získat stručnou definici datové vědy.

Definování „datové vědy“ je vlastně trochu složité, protože tento termín je aplikován na mnoho různých úkolů a metod výzkumu a analýzy. Můžeme začít tím, že si připomene, co znamená termín „věda“. Věda je systematické studium fyzického a přírodního světa prostřednictvím pozorování a experimentování, s cílem zlepšit lidské chápání přírodních procesů. Důležitými slovy v této definici jsou „pozorování“ a „chápání“.

Pokud datové vědy jsou procesem porozumění světu prostřednictvím vzorců v datech, pak odpovědností datového vědce je transformovat data, analyzovat data a extrahovat vzorce z dat. Jinými slovy, datový vědec je vybaven daty a používá řadu různých nástrojů a technik, aby data připravil na analýzu a poté analyzoval data pro významné vzorce.

Role datového vědce je podobná roli tradičního vědce. Oba se zabývají analýzou dat, aby podporovaly nebo vyvrátily hypotézy o tom, jak svět funguje, a snaží se dát smysl vzorcům v datech, aby zlepšily naše chápání světa. Datoví vědci používají stejné vědecké metody jako tradiční vědci. Datový vědec začíná shromažďováním pozorování o některých jevech, které by chtěl studovat. Poté formuluje hypotézu o jevu a snaží se najít data, která jeho hypotézu vyvrátí.

Pokud hypotéza není vyvrácena daty, může být schopen vytvořit teorii nebo model, o tom, jak jev funguje, který může být dále testován, zda platí pro jiná podobná data. Pokud je model dostatečně robustní, pokud vysvětluje vzorce dobře a není vyvrácen během dalších testů, může být dokonce použit k předpovědi budoucích výskytů jevu.

Datový vědec obvykle nebude shromažďovat svá vlastní data prostřednictvím experimentu. Obvykle nebude navrhovat experimenty s kontrolami a dvojitě zaslepenými testy, aby objevil rušivé proměnné, které by mohly interferovat s hypotézou. Většina dat analyzovaných datovým vědcem bude pocházet z pozorovacích studií a systémů, což je způsob, jakým může být role datového vědce odlišná od role tradičního vědce, který tends to provádět více experimentů.

Rovněž, datový vědec může být požádán, aby provedl formu experimentování zvanou A/B testování, kde jsou provedeny úpravy systému, který shromažďuje data, aby se zjistilo, jak se vzorce v datech změní.

Nezávisle na technikách a nástrojích, které se používají, datové vědy nakonec cílí na zlepšení našeho chápání světa tím, že dávají smysl datům, a data jsou získávána prostřednictvím pozorování a experimentování. Datové vědy jsou procesem používání algoritmů, statistických principů a různých nástrojů a strojů k získání poznatků z dat, poznatků, které nám pomáhají porozumět vzorcům ve světě kolem nás.

Co dělají datoví vědci?

Můžete vidět, že jakákoli činnost, která zahrnuje analýzu dat vědeckým způsobem, může být nazvána datovou vědou, což je část toho, co dělá definici datové vědy tak obtížnou. Abychom to učinili jasnějším, prozkoumejte některé aktivity, které datový vědec může dělat denně.

Datové vědy spojují mnoho různých disciplín a specializací. Foto: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

V libovolný den, datový vědec může být požádán, aby: vytvořil schéma pro ukládání a načítání dat, vytvořil data ETL (extrakce, transformace, načtení) potrubí a vyčistil data, použil statistické metody, vytvořil datové visualizace a řídicí panely, implementoval algoritmy umělé inteligence a strojového učení, udělal doporučení pro akce na základě dat.

Podrobněji, datový vědec může být vyžadován, aby zpracoval instalaci technologií potřebných pro ukládání a načítání dat, s ohledem na hardware i software. Osoba odpovědná za tuto pozici může být také nazvána „Data Engineer“. Nicméně, některé společnosti zahrnují tyto odpovědnosti do role datového vědce. Datový vědec může také potřebovat vytvořit, nebo pomoci vytvořit, ETL potrubí. Data se zřídka objevují ve formátu, který datový vědec potřebuje. Místo toho, data budou potřebovat být přijata v surové formě z datové zdroje, transformována do použitelného formátu a předzpracována (věci jako standardizace dat, odstranění redundancí a odstranění poškozených dat).

Statistické metody datové vědy

Aplikace statistiky je nezbytná k tomu, aby se pouhé pohledání na data a interpretace stalo skutečnou vědou. Statistické metody se používají k extrahování relevantních vzorců z datových sad, a datový vědec potřebuje být dobře seznámen se statistickými koncepty. Musí být schopen rozlišit významné korelace od náhodných korelací, kontrolujících rušivé proměnné. Musí také vědět, které nástroje použít k určení, které funkce v datové sadě jsou důležité pro model/mají prediktivní sílu. Datový vědec potřebuje vědět, kdy použít regresní přístup vs. klasifikační přístup, a kdy se starat o průměr vzorku vs. medián vzorku. Datový vědec by nebyl vědcem bez těchto kritických dovedností.

Datová visualizace

Kritickou částí role datového vědce je komunikace jeho zjištění ostatním. Pokud datový vědec nemůže účinně komunikovat svá zjištění ostatním, pak důsledky jeho zjištění nemají žádný význam. Datový vědec by měl být také účinným vypravěčem. To znamená, že produkuje visualizace, které komunikují relevantní body o datové sadě a vzorcích objevených v ní. Existuje velké množství různých nástrojů pro datovou visualizaci, které datový vědec může použít, a může visualizovat data pro účely počáteční, základní explorace (exploratorní analýza dat) nebo visualizovat výsledky, které model produkuje.

Doporučení a obchodní aplikace

Datový vědec potřebuje mít some intuice o požadavcích a cílech své organizace nebo podniku. Datový vědec potřebuje rozumět těmto věcem, protože potřebuje vědět, jaké typy proměnných a funkcí by měl analyzovat, zkoumat vzorce, které pomohou jeho organizaci dosáhnout jejích cílů. Datový vědec potřebuje být vědom si omezení, pod kterých operuje, a předpokladů, které vedení organizace dělá.

Strojové učení a umělá inteligence

Strojové učení a další algoritmy a modely umělé inteligence jsou nástroje, které datoví vědci používají k analýze dat, identifikaci vzorců v datech, určení vztahů mezi proměnnými a předpovědí budoucích událostí.

Tradiční datové vědy vs. big datové vědy

Jak metody sběru dat se staly sofistikovanějšími a databáze většími, vznikl rozdíl mezi tradičními datovými vědami a „big data“ vědami.

Tradiční datové analýzy a datové vědy se provádějí pomocí deskriptivní a exploratorní analýzy, s cílem najít vzorce a analyzovat výsledky projektů. Tradiční datové analytické metody se často zaměřují pouze na minulá a aktuální data. Datoví analytici se často zabývají daty, která již byla vyčištěna a standardizována, zatímco datoví vědci se často zabývají složitými a špinavými daty. Pokročilejší datové analytické a datové vědecké techniky se mohou použít k předpovědi budoucího chování, i když se to častěji provádí s big data, protože prediktivní modely často vyžadují velké množství dat, aby byly spolehlivě konstruovány.

„Big data“ se odkazuje na data, která jsou příliš velká a komplexní, aby se dala zpracovat tradičními datovými analytickými a vědeckými technikami a nástroji. Big data se často sbírá prostřednictvím online platforem a pokročilé datové transformační nástroje se používají k přípravě velkých objemů dat pro inspekci datovými vědci. Jak se sbírá stále více dat, větší část role datového vědce zahrnuje analýzu big data.

Nástroje datové vědy

Běžné nástroje datové vědy zahrnují nástroje pro ukládání dat, provádění exploratorní datové analýzy, modelování dat, provádění ETL a visualizaci dat. Platformy jako Amazon Web Services, Microsoft Azure a Google Cloud nabízejí nástroje, které pomáhají datovým vědcům ukládat, transformovat, analyzovat a modelovat data. Existují také samostatné nástroje datové vědy, jako je Airflow (datová infrastruktura) a Tableau (datová visualizace a analýza).

V oblasti strojového učení a algoritmů umělé inteligence, které se používají k modelování dat, jsou často poskytovány prostřednictvím modulů a platforem datové vědy, jako je TensorFlow, PyTorch a Azure Machine-learning studio. Tyto platformy umožňují datovým vědcům upravovat své datové sady, komponovat architektury strojového učení a trénovat modely strojového učení.

Další běžné nástroje a knihovny datové vědy zahrnují SAS (pro statistické modelování), Apache Spark (pro analýzu streamovaných dat), D3.js (pro interaktivní visualizace v prohlížeči) a Jupyter (pro interaktivní, sdílené kódy a visualizace).

Foto: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Příklady datové vědy

Příklady datové vědy a jejích aplikací jsou všude. Datová věda má aplikace ve všem od doručování potravin, sportu, dopravy a zdravotnictví. Data jsou všude a datová věda může být aplikována na vše.

V oblasti potravin, Uber investuje do rozšíření své služby sdílení jízd zaměřené na doručování potravin, Uber Eats. Uber Eats potřebuje doručit lidem jídlo včas, zatímco je ještě teplé a čerstvé. Aby se to stalo, datoví vědci společnosti potřebují použít statistické modelování, které zohledňuje aspekty, jako je vzdálenost od restaurací k místům doručování, svátky, dobu vaření a dokonce i počasí, vše s cílem optimalizovat doby doručování.

Statistiky sportu se používají manažery týmů, aby určili, kdo jsou nejlepší hráči a vytvořili silné a spolehlivé týmy, které budou vyhrávat hry. Jedním z pozoruhodných příkladů je datová věda dokumentovaná Michaelem Lewisem v knize Moneyball, kde generální manažer týmu Oakland Athletics analyzoval řadu statistik, aby identifikoval kvalitní hráče, kteří mohli být podepsáni do týmu za relativně nízkou cenu.

Analýza dopravních vzorců je kritická pro vytváření samořídících vozidel. Samořídící vozidla musí být schopna předpovědět činnost kolem sebe a reagovat na změny v podmínkách silnice, jako je například zvýšená zastávka vyžadovaná při dešti, a také na přítomnost více aut na silnici během špičky. Kromě samořídících vozidel, aplikace jako Google Maps analyzují dopravní vzorce, aby řidičům řekli, jak dlouho jim bude trvat dostat se do svého cíle pomocí různých tras a druhů dopravy.

V oblasti zdravotnické datové vědy, počítačové vidění se často kombinuje se strojovým učením a dalšími technikami umělé inteligence, aby se vytvořily klasifikátory obrazů schopné prohlížet věci, jako jsou rentgenové snímky, FMRIs a ultrazvuk, aby se zjistilo, zda existují nějaké potenciální zdravotní problémy, které by se mohly objevit ve snímku. Tyto algoritmy lze použít, aby pomohly klinickým pracovníkům diagnostikovat onemocnění.

Nakonec, datové vědy pokrývají mnoho různých aktivit a spojují aspekty různých disciplín. Nicméně, datové vědy se vždy zabývají tím, že vyprávějí přesvědčivé a zajímavé příběhy z dat a používají data, aby lépe porozuměli světu.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.