AI-mallit ja alustat
Mitä on Big Data?
Mitä on Big Data?
”Big Data” on yksi nykyajan yleisimmin käytetyistä buzz-sanoista, mutta mitä se todella tarkoittaa?
Tässä on yksinkertainen määritelmä big datasta. Big data on dataa, joka on liian suurta ja monimutkaista perinteisten tietokäsittely- ja tallennusmenetelmien käsiteltäväksi. Vaikka tämä on yksinkertainen määritelmä, jota voidaan käyttää heuristisena, olisi hyödyllistä saada syvempi ja täydellisempi ymmärrys big datasta. Tarkastellaan joitain big dataan liittyviä käsitteitä, kuten tallennusta, rakennetta ja käsittelyä.
Kuinka suuri on Big Data?
Se ei ole yksinkertaista sanoa ”kaikki data, joka on suurempaa kuin koko ’X’ on big data”, koska ympäristö, jossa dataa käsitellään, on erittäin tärkeä tekijä määrittäessä, mitä big dataksi kutsutaan. Kokoa, joka datan on oltava, jotta se voidaan pitää big dataksi, riippuu kontekstista tai tehtävästä, jossa dataa käytetään. Kaksi eri kokoista datasettiä voidaan pitää ”big dataksi” eri konteksteissa.
Jos yrität lähettää 200 megatavun tiedoston sähköpostiliitteenä, et pysty tekemään sitä. Tässä kontekstissa 200 megatavun tiedosto voidaan pitää big dataksi. Sen sijaan, jos kopioit 200 megatavun tiedoston toiseen laitteeseen samassa lähiverkossa, se ei välttämättä kestä aikaa, eikä sitä pidetä big dataksi.
Oletetaan kuitenkin, että 15 teratavun edellytetään videoiden esikäsittelyyn tietokoneen näköhavainnollistamissovelluksissa. Tässä tapauksessa videotiedostot vievät niin paljon tilaa, että jopa voimakas tietokone veisi kauan käsittelyyn, ja käsittely jaetaan useiden tietokoneiden välille, jotka on kytketty toisiinsa prosessointiajan vähentämiseksi. Nämä 15 teratavun videotiedot olisivat ehdottomasti big dataa.
Big Datan rakenteet
Big data on jaettu kolmeen eri kategoriaan: ei-strukturoidun, puolistrukturoidun ja strukturoidun datan.
Ei-strukturoidun data on dataa, jolla ei ole määriteltävissä olevaa rakennetta, eli data on vain yhdessä suuressa joukossa. Esimerkki ei-strukturoidusta datasta on tietokanta, joka on täynnä merkintöjä.
Puolistrukturoidun data on dataa, jolla ei ole virallista rakennetta, mutta se on olemassa löyhässä rakenteessa. Esimerkki puolistrukturoidusta datasta on sähköpostidata, jota voidaan viitata yksittäisten sähköpostien tietoihin, mutta virallisia datapatternneja ei ole määritelty.
Strukturoidun data on dataa, jolla on virallinen rakenne, ja datapisteet on luokiteltu eri ominaisuuksien mukaan. Esimerkki strukturoidusta datasta on Excel-taulukko, joka sisältää yhteystietoja, kuten nimet, sähköpostiosoitteet, puhelinnumerot ja verkkosivustot.
Jos haluat lukea lisää näiden datatyyppien eroista, voit tarkastella linkkiä täältä.
Big Datan arviointimitat
Big dataa voidaan analysoida kolmen eri mittarin avulla: tilavuus, nopeus ja monimuotoisuus.
Tilavuus viittaa datan koosta. Keskimääräinen datan koko on usein kasvamassa. Esimerkiksi vuonna 2006 suurin kiintolevy oli 750 gigatavun kiintolevy. Sen sijaan Facebookin ajatellaan tuottavan yli 500 teratavun dataa päivässä, ja suurin kuluttajakiintolevy on tänään 16 teratavun kiintolevy. Se, mikä määritellään big dataksi, voi vaihdella eri aikakausina. Enemmän dataa tuotetaan nykyään, koska yhä useammat esineet ympärillämme on varustettu antureilla, kamerilla, mikrofoneilla ja muilla datakeräyslaitteilla.
Nopeus viittaa siihen, kuinka nopeasti data liikkuu, tai toisin sanoen, kuinka paljon dataa tuotetaan tietyn ajanjakson aikana. Sosiaalisen median virtaukset tuottavat satoja tuhansia viestejä ja kommentteja minuutissa, kun taas oma sähköpostilaatikko on todennäköisesti vähemmän aktiivinen. Big data -virtaukset ovat virtauksia, jotka usein käsittelevät satoja tuhansia tai miljoonia tapahtumia lähes reaaliajassa. Esimerkkejä näistä data-virtauksista ovat online-pelialustat ja korkean taajuisuuden osakekaupan algoritmit.
Monimuotoisuus viittaa eri datatyyppien määrään, jotka sisältyvät datasettiin. Data voi koostua monista eri formaateista, kuten äänestä, videosta, tekstin, valokuvista tai sarjanumeroista. Yleensä perinteiset tietokannat on muotoiltu käsittelemään yhtä tai vain muutamia datatyyppiä. Toisin sanoen perinteiset tietokannat on suunniteltu sisältämään dataa, joka on melko homogeenista ja jolla on yhdenmukainen, ennustettavissa oleva rakenne. Sovellusten monimuotoistuessa, lisääntyvien ominaisuuksien ja käyttäjien määrän kasvaessa tietokantojen on täytynyt kehittyä tallentamaan enemmän eri tyyppisiä dataa. Ei-strukturoidut tietokannat ovat ihanteellisia big datan tallentamiseen, koska ne voivat sisältää useita eri tyyppisiä dataa, jotka eivät liity toisiinsa.
Big Datan käsittelymenetelmät
On olemassa useita eri alustoja ja työkaluja, jotka on suunniteltu big datan analysointiin. Big data -joukkoja on analysoitava, jotta voidaan poistaa merkityksellisiä malleja datasta, tehtävä, joka voi osoittautua haasteelliseksi perinteisten data-analyysityökalujen kanssa. Vastauksena tarpeeseen työkaluille, joilla voidaan analysoida suuria määriä dataa, useat yritykset ovat luoneet big data -analyysityökaluja. Big data -analyysityökalut sisältävät järjestelmiä kuten ZOHO Analytics, Cloudera ja Microsoft (MSFT ) BI.












