Grundlæggende AI
Hvad er Big Data?
Hvad er Big Data?
“Big Data” er et af de almindelige buzz-ord i vores nuværende æra, men hvad betyder det egentlig?
Her er en hurtig og enkel definition af big data. Big data er data, der er for stor og kompleks til at blive behandlet af traditionelle databehandlings- og lagringsmetoder. Selv om det er en hurtig definition, du kan bruge som en heuristik, ville det være nyttigt at have en dybere og mere komplet forståelse af big data. Lad os kaste et blik på nogle af de begreber, der ligger til grund for big data, som f.eks. lagring, struktur og behandling.
Hvor Stort Er Big Data?
Det er ikke så enkelt som at sige “enhver data over størrelsen ‘X’ er big data”, for miljøet, hvor dataene behandles, er en ekstremt vigtig faktor i bestemmelse af, hvad der kvalificerer som big data. Størrelsen, som data skal have for at blive betragtet som big data, afhænger af konteksten eller opgaven, dataene bruges til. To datasets af meget forskellige størrelser kan blive betragtet som “big data” i forskellige kontekster.
Hvis du prøver at sende en 200-megabyte-fil som en email-vedhæftning, kan du ikke gøre det. I denne kontekst kan den 200-megabyte-fil blive betragtet som big data. Til gengæld kan kopiering af en 200-megabyte-fil til en anden enhed inden for det samme LAN ikke tage noget tid, og i den kontekst ville det ikke blive betragtet som big data.
Men lad os antage, at 15 terabyte videodata skal forbehandles til brug i træning af computer vision-applikationer. I dette tilfælde tager videofilerne så megen plads, at selv en kraftfuld computer ville tage lang tid til at behandle dem alle, og derfor ville behandlingen normalt blive fordelt over flere computere, der er forbundet sammen for at reducere behandlingstiden. Disse 15 terabyte videodata ville bestemt kvalificere som big data.
Typer Af Big Data Strukturer
Big data kommer i tre forskellige kategorier af struktur: ustruktureret data, semistruktureret data og struktureret data.
Ustruktureret data er data, der ikke har nogen definerbar struktur, hvilket betyder, at dataene i virkeligheden blot er én stor samling. Eksempler på ustruktureret data ville være en database fuld af ulabellede billeder.
Semistruktureret data er data, der ikke har en formel struktur, men findes inden for en løs struktur. F.eks. kunne email-data tælles som semistruktureret data, fordi du kunne henvise til dataene i enkeltstående emails, men formelle datapatterns er ikke etableret.
Struktureret data er data, der har en formel struktur, med datapunkter kategoriseret efter forskellige funktioner. Et eksempel på struktureret data er en Excel-arbejdsmappe, der indeholder kontaktinformation som navne, emails, telefonnumre og websites.
Hvis du ønsker at læse mere om forskellene i disse datatyper, kan du se linket her.
Metrikker Til Vurdering Af Big Data
Big data kan analyseres i forhold til tre forskellige metrikker: volumen, hastighed og variation.
Volumen henviser til størrelsen af dataene. Den gennemsnitlige størrelse af datasets er ofte øgende. F.eks. var den største harddisk i 2006 en 750 GB harddisk. Til gengæld menes det, at Facebook (META ) genererer over 500 terabyte data om dagen, og den største forbrugerharddisk, der i dag er tilgængelig, er en 16 terabyte harddisk. Hvad der kvalificerer som big data i én æra, kan ikke være big data i en anden. Mere data genereres i dag, fordi flere og flere af de objekter, der omgiver os, er udstyret med sensorer, kameraer, mikrofoner og andre dataindsamlingsenheder.
Hastighed henviser til, hvor hurtigt data flytter sig, eller sagt på en anden måde, hvor meget data genereres inden for en given periode. Sociale mediestrømme genererer hundredtusinder af indlæg og kommentarer hvert minut, mens din egen email-postkasse sandsynligvis vil have langt mindre aktivitet. Big data-strømme er strømme, der ofte håndterer hundredtusinder eller millioner af begivenheder i mere eller mindre realtid. Eksempler på disse datastrømme er online-spilplatforme og højfrekvens-handelsalgoritmer.
Variation henviser til de forskellige typer data, der er indeholdt i datasettet. Data kan bestå af mange forskellige formater, som f.eks. lyd, video, tekst, billeder eller serienumre. Generelt er traditionelle databaser formateret til at håndtere én eller blot et par typer data. For at sige det på en anden måde, traditionelle databaser er struktureret til at indeholde data, der er ret homogene og har en konsekvent, forudsigelig struktur. Da applikationer bliver mere diverse, fulde af forskellige funktioner og brugt af flere mennesker, har databaserne måttet udvikle sig til at gemme mere typer data. Ustrukturerede databaser er ideelle til at indeholde big data, fordi de kan indeholde multiple data typer, der ikke er relateret til hinanden.
Metoder Til Håndtering Af Big Data
Der er en række forskellige platforme og værktøjer, der er designede til at facilere analysen af big data. Big data-poller skal analyseres for at udtrække meningsfulde mønstre fra dataene, en opgave, der kan vise sig at være ret udfordrende med traditionelle dataanalyseværktøjer. Som svar på behovet for værktøjer til at analysere store mængder data, har en række virksomheder skabt big data-analyseværktøjer. Big data-analyseværktøjer omfatter systemer som ZOHO Analytics, Cloudera og Microsoft BI.












