AI-modeller og plattformer

Hva er Big Data?

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Hva er Big Data?

“Big Data” er ett av de vanligste buzz-ordene i vår tid, men hva betyr det egentlig?

Her er en enkel og kort definisjon av big data. Big data er data som er for stor og kompleks til å bli behandlet av tradisjonelle databehandlings- og lagringsmetoder. Mens dette er en enkel definisjon du kan bruke som en heuristisk, ville det være nyttig å ha en dypere og mer komplett forståelse av big data. La oss se på noen av konseptene som ligger under big data, som lagring, struktur og behandling.

Hvor Stort Er Big Data?

Det er ikke så enkelt som å si “alle data over størrelsen ‘X’ er big data”, miljøet som dataene behandles i er en ekstremt viktig faktor i å bestemme hva som kvalifiserer som big data. Størrelsen som dataene må være for å bli betraktet som big data, avhenger av konteksten eller oppgaven dataene brukes til. To datasett av svært ulike størrelser kan bli betraktet som “big data” i ulike kontekster.

For å være mer konkret, hvis du prøver å sende en 200-megabyte fil som en e-post vedlegg, ville du ikke kunne gjøre det. I denne konteksten kunne den 200-megabyte filen bli betraktet som big data. I motsetning, å kopiere en 200-megabyte fil til en annen enhet innen samme lokale nettverk, ville ikke ta noen tid, og i denne konteksten ville det ikke bli betraktet som big data.

Men, la oss anta at 15 terabyte med video må bli forbehandlet for bruk i trening av datavisjonsapplikasjoner. I dette tilfelle tar videofilene så mye plass at selv en kraftig datamaskin ville ta lang tid å behandle dem alle, og så ville behandlingen vanligvis bli fordelt over flere datamaskiner koblet sammen for å redusere behandlingstiden. Disse 15 terabyte med video data ville definitivt kvalifisere som big data.

Typer Av Big Data Strukturer

Big data kommer i tre forskjellige kategorier av struktur: ustrukturert data, semi-strukturert og strukturert data.

Ustrukturert data er data som ikke har noen definert struktur, det vil si at dataene er essensielt bare i én stor gruppe. Eksempler på ustrukturert data ville være en database full av ulabelte bilder.

Semi-strukturert data er data som ikke har en formal struktur, men eksisterer innen en løs struktur. For eksempel kunne e-post data bli betraktet som semi-strukturert data, fordi du kunne referere til dataene i enkelt e-post, men formelle datapunkt ikke er etablert.

Strukturert data er data som har en formal struktur, med datapunkt kategorisert etter forskjellige funksjoner. Et eksempel på strukturert data er en Excel-ark som inneholder kontaktinformasjon som navn, e-post, telefonnumre og nettsider.

Hvis du ønsker å lese mer om forskjellene i disse datatypene, kan du sjekke lenken her.

Mål For Å Vurdere Big Data

Big data kan bli analysert i forhold til tre forskjellige mål: volum, hastighet og variasjon.

Volum refererer til størrelsen på dataene. Den gjennomsnittlige størrelsen på datasett øker ofte. For eksempel var den største harddisken i 2006 en 750 GB harddisk. I motsetning tenkes Facebook (META ) å generere over 500 terabyte med data per dag, og den største forbrukerharddisken som er tilgjengelig i dag er en 16 terabyte harddisk. Hva som kvalifiserer som big data i én æra, kan ikke være big data i en annen. Mer data genereres i dag fordi flere og flere objekter rundt oss er utstyrt med sensorer, kameraer, mikrofoner og andre datainnsamlingsenheter.

Hastighet refererer til hvor raskt data flyter, eller sagt på en annen måte, hvor mye data som genereres innen en gitt periode. Sosiale mediestrømmer genererer hundredtusener av innlegg og kommentarer hver minutt, mens din egen e-postboks sannsynligvis vil ha mye mindre aktivitet. Big datastrømmer er strømmer som ofte håndterer hundredtusener eller millioner av hendelser i mer eller mindre sanntid. Eksempler på disse datastrømmene er online spillplattformer og høyfrekvens aksjehandelsalgoritmer.

Variasjon refererer til de forskjellige typene data som er innholdt i datasett. Data kan bestå av mange forskjellige formater, som lyd, video, tekst, bilder eller serienumre. Generelt er tradisjonelle databaser formet for å håndtere én eller bare noen få typer data. For å si det på en annen måte, tradisjonelle databaser er strukturert for å holde data som er ganske homogene og har en konsistent, forutsigbar struktur. Ettersom applikasjonene blir mer diverse, fulle av forskjellige funksjoner og brukes av flere mennesker, har databasene måttet utvikle seg for å lagre mer typer data. Ustrukturerte databaser er ideelle for å holde big data, fordi de kan holde flere datatyper som ikke er relatert til hverandre.

Metoder For Å Behandle Big Data

Det finnes en rekke forskjellige plattformer og verktøy designet for å fasilitere analysen av big data. Big data-poller må bli analysert for å trekke ut meningsfulle mønster fra dataene, en oppgave som kan vise seg å være ganske utfordrende med tradisjonelle dataanalyseverktøy. Som svar på behovet for verktøy for å analysere store mengder data, har en rekke selskaper skapt big data-analyseverktøy. Big data-analyseverktøy inkluderer systemer som ZOHO Analytics, Cloudera og Microsoft (MSFT ) BI.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.