AI-modeller og platforme
Hvad er Big Data?
Hvad er Big Data?
âBig Dataâ er et af de almindelige buzz-ord i vores nuvÃĶrende ÃĶra, men hvad betyder det egentlig?
Her er en hurtig og enkel definition af big data. Big data er data, der er for stor og kompleks til at blive behandlet af traditionelle databehandlings- og lagringsmetoder. Selv om det er en hurtig definition, du kan bruge som en heuristik, ville det vÃĶre nyttigt at have en dybere og mere komplet forstÃĨelse af big data. Lad os kaste et blik pÃĨ nogle af de begreber, der ligger til grund for big data, som f.eks. lagring, struktur og behandling.
Hvor Stort Er Big Data?
Det er ikke sÃĨ enkelt som at sige âenhver data over stÃļrrelsen âXâ er big dataâ, for miljÃļet, hvor dataene behandles, er en ekstremt vigtig faktor i bestemmelse af, hvad der kvalificerer som big data. StÃļrrelsen, som data skal have for at blive betragtet som big data, afhÃĶnger af konteksten eller opgaven, dataene bruges til. To datasets af meget forskellige stÃļrrelser kan blive betragtet som âbig dataâ i forskellige kontekster.
Hvis du prÃļver at sende en 200-megabyte-fil som en email-vedhÃĶftning, kan du ikke gÃļre det. I denne kontekst kan den 200-megabyte-fil blive betragtet som big data. Til gengÃĶld kan kopiering af en 200-megabyte-fil til en anden enhed inden for det samme LAN ikke tage noget tid, og i den kontekst ville det ikke blive betragtet som big data.
Men lad os antage, at 15 terabyte videodata skal forbehandles til brug i trÃĶning af computer vision-applikationer. I dette tilfÃĶlde tager videofilerne sÃĨ megen plads, at selv en kraftfuld computer ville tage lang tid til at behandle dem alle, og derfor ville behandlingen normalt blive fordelt over flere computere, der er forbundet sammen for at reducere behandlingstiden. Disse 15 terabyte videodata ville bestemt kvalificere som big data.
Typer Af Big Data Strukturer
Big data kommer i tre forskellige kategorier af struktur: ustruktureret data, semistruktureret data og struktureret data.
Ustruktureret data er data, der ikke har nogen definerbar struktur, hvilket betyder, at dataene i virkeligheden blot er ÃĐn stor samling. Eksempler pÃĨ ustruktureret data ville vÃĶre en database fuld af ulabellede billeder.
Semistruktureret data er data, der ikke har en formel struktur, men findes inden for en lÃļs struktur. F.eks. kunne email-data tÃĶlles som semistruktureret data, fordi du kunne henvise til dataene i enkeltstÃĨende emails, men formelle datapatterns er ikke etableret.
Struktureret data er data, der har en formel struktur, med datapunkter kategoriseret efter forskellige funktioner. Et eksempel pÃĨ struktureret data er en Excel-arbejdsmappe, der indeholder kontaktinformation som navne, emails, telefonnumre og websites.
Hvis du Ãļnsker at lÃĶse mere om forskellene i disse datatyper, kan du se linket her.
Metrikker Til Vurdering Af Big Data
Big data kan analyseres i forhold til tre forskellige metrikker: volumen, hastighed og variation.
Volumen henviser til stÃļrrelsen af dataene. Den gennemsnitlige stÃļrrelse af datasets er ofte Ãļgende. F.eks. var den stÃļrste harddisk i 2006 en 750 GB harddisk. Til gengÃĶld menes det, at Facebook (META ) genererer over 500 terabyte data om dagen, og den stÃļrste forbrugerharddisk, der i dag er tilgÃĶngelig, er en 16 terabyte harddisk. Hvad der kvalificerer som big data i ÃĐn ÃĶra, kan ikke vÃĶre big data i en anden. Mere data genereres i dag, fordi flere og flere af de objekter, der omgiver os, er udstyret med sensorer, kameraer, mikrofoner og andre dataindsamlingsenheder.
Hastighed henviser til, hvor hurtigt data flytter sig, eller sagt pÃĨ en anden mÃĨde, hvor meget data genereres inden for en given periode. Sociale mediestrÃļmme genererer hundredtusinder af indlÃĶg og kommentarer hvert minut, mens din egen email-postkasse sandsynligvis vil have langt mindre aktivitet. Big data-strÃļmme er strÃļmme, der ofte hÃĨndterer hundredtusinder eller millioner af begivenheder i mere eller mindre realtid. Eksempler pÃĨ disse datastrÃļmme er online-spilplatforme og hÃļjfrekvens-handelsalgoritmer.
Variation henviser til de forskellige typer data, der er indeholdt i datasettet. Data kan bestÃĨ af mange forskellige formater, som f.eks. lyd, video, tekst, billeder eller serienumre. Generelt er traditionelle databaser formateret til at hÃĨndtere ÃĐn eller blot et par typer data. For at sige det pÃĨ en anden mÃĨde, traditionelle databaser er struktureret til at indeholde data, der er ret homogene og har en konsekvent, forudsigelig struktur. Da applikationer bliver mere diverse, fulde af forskellige funktioner og brugt af flere mennesker, har databaserne mÃĨttet udvikle sig til at gemme mere typer data. Ustrukturerede databaser er ideelle til at indeholde big data, fordi de kan indeholde multiple data typer, der ikke er relateret til hinanden.
Metoder Til HÃĨndtering Af Big Data
Der er en rÃĶkke forskellige platforme og vÃĶrktÃļjer, der er designede til at facilere analysen af big data. Big data-poller skal analyseres for at udtrÃĶkke meningsfulde mÃļnstre fra dataene, en opgave, der kan vise sig at vÃĶre ret udfordrende med traditionelle dataanalysevÃĶrktÃļjer. Som svar pÃĨ behovet for vÃĶrktÃļjer til at analysere store mÃĶngder data, har en rÃĶkke virksomheder skabt big data-analysevÃĶrktÃļjer. Big data-analysevÃĶrktÃļjer omfatter systemer som ZOHO Analytics, Cloudera og Microsoft (MSFT ) BI.












