Základy AI

Co je Big Data?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Co je Big Data?

„Big Data“ je jeden z nejčastěji používaných buzzwordů naší současné éry, ale co to vlastně znamená?

Zde je rychlé a jednoduché vysvětlení big dat. Big data jsou data, která jsou příliš velká a komplexní na to, aby je zpracovávaly a ukládaly tradiční metody zpracování a uložení dat. Ačkoli je to rychlé vysvětlení, které můžete použít jako heuristiku, bylo by užitečné mít hlubší a úplnější pochopení big dat. Podívejme se na některé koncepty, které stojí za big daty, jako je úložiště, struktura a zpracování.

Jak velké jsou Big Data?

Není tak jednoduché říci „jakékoli data větší než velikost ‘X‘ jsou big data“, protože prostředí, ve kterém se data zpracovávají, je velmi důležitým faktorem při určování, co se kvalifikuje jako big data. Velikost, kterou data musí mít, aby se kvalifikovala jako big data, závisí na kontextu nebo úkolu, pro který se data používají. Dva datové sady různých velikostí mohou být považovány za „big data“ v různých kontextech.

Chcete-li být konkrétnější, pokud se pokusíte odeslat příloha e-mailu o velikosti 200 megabytů, nebude to možné. V tomto kontextu by se 200megabytový soubor považoval za big data. Naopak kopírování 200megabytového souboru na jiný zařízení ve stejné místní síti (LAN) nemusí trvat žádnou dobu a v tomto kontextu by se nepovažoval za big data.

Nicméně předpokládejme, že je třeba zpracovat 15 terabytů videa pro použití ve výcviku aplikací počítačového vidění. V tomto případě zabírají video soubory tolik místa, že by i výkonný počítač potřeboval dlouhou dobu, aby je všechny zpracoval, a proto by se zpracování obvykle distribuovalo napříč několika počítači propojenými za účelem snížení doby zpracování. Tyto 15 terabytů video dat by určitě kvalifikovaly jako big data.

Typy Big Data Struktur

Big data se vyskytují ve třech různých kategoriích struktury: nestrukturovaná data, polostrukturovaná a strukturovaná data.

Nestrukturovaná data jsou data, která nemají žádnou definovatelnou strukturu, což znamená, že data jsou v podstatě jen v jednom velkém poolu. Příklady nestrukturovaných dat by byly databáze plná nelabelovaných obrázků.

Polostrukturovaná data jsou data, která nemají formální strukturu, ale existují v rámci volné struktury. Například e-mailová data by mohla být považována za polostrukturovaná data, protože byste se mohli odvolat na data obsažená v jednotlivých e-mailech, ale formální datové vzory nebyly stanoveny.

Strukturovaná data jsou data, která mají formální strukturu, s datovými body kategorizovanými podle různých funkcí. Příkladem strukturovaných dat je tabulka Excel obsahující kontaktní informace, jako jsou jména, e-maily, telefonní čísla a webové stránky.

Pokud byste chtěli číst více o rozdílech mezi těmito typy dat, podívejte se na odkaz zde.

Metriky pro hodnocení Big Data

Big data lze analyzovat z hlediska tří různých metrik: objem, rychlost a variabilita.

Objem se týká velikosti dat. Průměrná velikost datových sad se často zvyšuje. Například největší pevný disk v roce 2006 byl 750 GB pevný disk. Naopak se odhaduje, že Facebook (META ) generuje přes 500 terabytů dat denně a největší dostupný spotřebitelský pevný disk dnes je 16terabytový pevný disk. Co se kvalifikuje jako big data v jedné éře, nemusí být big data v jiné. Více dat je generováno dnes, protože více a více objektů kolem nás je vybaveno senzory, kamerami, mikrofony a dalšími zařízeními pro sběr dat.

Rychlost se týká toho, jak rychle se data pohybují, nebo jinými slovy, kolik dat je generováno během určitého časového období. Sociální média generují stovky tisíc příspěvků a komentářů každou minutu, zatímco vaše vlastní e-mailová schránka bude mít pravděpodobně mnohem méně aktivity. Big data proudy jsou proudy, které často zpracovávají stovky tisíc nebo miliony událostí v reálném čase. Příklady těchto datových proudů jsou online herní platformy a algoritmy pro vysokofrekvenční obchodování s akciemi.

Variabilita se týká různých typů dat obsažených v datové sadě. Data mohou být složena z mnoha různých formátů, jako je audio, video, text, fotografie nebo sériová čísla. Obecně jsou tradiční databáze formátovány pro zpracování jednoho nebo několika typů dat. To znamená, že tradiční databáze jsou strukturovány pro uchování dat, která jsou bastante homogenní a mají konzistentní, předvídatelnou strukturu. Jak aplikace rostou a stávají se více rozmanitými, plnými různých funkcí a používanými více lidmi, musely se databáze vyvinout, aby ukládaly více typů dat. Nestrukturované databáze jsou ideální pro uchování big dat, protože mohou uchovávat více typů dat, které nejsou navzájem související.

Metody zpracování Big Data

Existuje řada různých platforem a nástrojů navržených pro usnadnění analýzy big dat. Big data fondy potřebují být analyzovány, aby se extrahovaly významné vzory z dat, což může být docela náročné s tradičními nástroji pro analýzu dat. V reakci na potřebu nástrojů pro analýzu velkých objemů dat vytvořila řada společností nástroje pro analýzu big dat. Nástroje pro analýzu big dat zahrnují systémy jako ZOHO Analytics, Cloudera a Microsoft BI.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.