AI-modeller och plattformar

Vad är Big Data?

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Vad är Big Data?

“Big Data” är ett av de vanligt förekommande buzzorden i vår nuvarande era, men vad betyder det egentligen?

Här är en snabb och enkel definition av big data. Big data är data som är för stor och komplex för att hanteras av traditionella datahanterings- och lagringsmetoder. Medan det är en snabb definition som du kan använda som en heuristik, skulle det vara hjälpsamt att ha en djupare och mer komplett förståelse av big data. Låt oss ta en titt på några av de begrepp som ligger till grund för big data, som lagring, struktur och bearbetning.

Hur Stort Är Big Data?

Det är inte så enkelt som att säga “alla data över storleken ‘X’ är big data”, miljön som data hanteras i är en extremt viktig faktor i att bestämma vad som kvalificerar som big data. Storleken som data behöver vara, för att betraktas som big data, beror på sammanhanget, eller uppgiften som data används för. Två datamängder av väldigt olika storlekar kan betraktas som “big data” i olika sammanhang.

Om vi ska vara mer konkreta, om du försöker skicka en 200-megabyte fil som e-postbilaga, skulle du inte kunna göra det. I detta sammanhang skulle den 200-megabyte filen kunna betraktas som big data. I kontrast, om du kopierar en 200-megabyte fil till en annan enhet inom samma LAN, skulle det inte ta någon tid alls, och i det sammanhanget skulle det inte betraktas som big data.

Men låt oss anta att 15 terabyte av video behöver förbearbetas för användning i utbildning av datorseendeapplikationer. I detta fall tar videofilerna upp så mycket utrymme att även en kraftfull dator skulle ta lång tid att bearbeta dem alla, och bearbetningen skulle vanligtvis distribueras över flera datorer som är länkade till varandra för att minska bearbetningstiden. Dessa 15 terabyte av videodata skulle definitivt kvalificera som big data.

Typer Av Big Data Strukturer

Big data kommer i tre olika kategorier av struktur: ostrukturerad data, semistrukturerad data och strukturerad data.

Ostrukturerad data är data som inte har någon definierbar struktur, vilket innebär att data i princip bara är en stor pool. Exempel på ostrukturerad data skulle vara en databas full av oetiketterade bilder.

Semistrukturerad data är data som inte har en formaliserad struktur, men som ändå existerar inom en lös struktur. Till exempel skulle e-postdata kunna räknas som semistrukturerad data, eftersom du kunde hänvisa till data som finns i enskilda e-postmeddelanden, men formella dataprocesser har inte etablerats.

Strukturerad data är data som har en formaliserad struktur, med datapunkter kategoriserade efter olika egenskaper. Ett exempel på strukturerad data är ett Excel-ark som innehåller kontaktinformation som namn, e-postadresser, telefonnummer och webbplatser.

Om du vill läsa mer om skillnaderna mellan dessa datatyper, kolla länken här.

Mätetal För Att Bedöma Big Data

Big data kan analyseras utifrån tre olika mätetal: volym, hastighet och variation.

Volym hänvisar till datans storlek. Den genomsnittliga storleken på datamängder ökar ofta. Till exempel var den största hårddisken 2006 en 750 GB hårddisk. I kontrast anses Facebook (META ) generera över 500 terabyte data per dag och den största konsumenthårddisken som finns tillgänglig idag är en 16 terabyte hårddisk. Vad som kvalificerar som big data i en era kanske inte är big data i en annan. Mer data genereras idag eftersom allt fler föremål runt omkring oss är utrustade med sensorer, kameror, mikrofoner och andra datainsamlingsenheter.

Hastighet hänvisar till hur snabbt data rör sig, eller för att uttrycka det på ett annat sätt, hur mycket data som genereras inom en given tidsperiod. Sociala medieflöden genererar hundratusentals inlägg och kommentarer varje minut, medan din egen e-postinkorg troligen kommer att ha mycket mindre aktivitet. Big data-flöden är flöden som ofta hanterar hundratusentals eller miljontals händelser i mer eller mindre realtid. Exempel på dessa dataflöden är onlinespelplattformar och högfrekvenshandelsalgoritmer.

Variation hänvisar till de olika typerna av data som finns inom datamängden. Data kan bestå av många olika format, som ljud, video, text, foton eller serienummer. I allmänhet är traditionella databaser formaterade för att hantera en eller bara ett par typer av data. För att uttrycka det på ett annat sätt, traditionella databaser är strukturerade för att innehålla data som är ganska homogena och har en konsekvent, förutsägbar struktur. När applikationer blir mer diversifierade, fulla av olika funktioner och används av fler människor, har databaserna varit tvungna att utvecklas för att lagra fler typer av data. Ostrukturerade databaser är idealiska för att lagra big data, eftersom de kan innehålla flera datatyper som inte är relaterade till varandra.

Metoder För Att Hantera Big Data

Det finns ett antal olika plattformar och verktyg som är utformade för att underlätta analysen av big data. Big data-pooler behöver analyseras för att extrahera meningsfulla mönster från data, en uppgift som kan visa sig vara ganska utmanande med traditionella dataanalysverktyg. Som svar på behovet av verktyg för att analysera stora mängder data, har en mängd olika företag skapat big data-analysverktyg. Big data-analysverktyg inkluderar system som ZOHO Analytics, Cloudera och Microsoft (MSFT ) BI.

Blogger och programmerare med specialområden inom Machine Learning och Deep Learning ämnen. Daniel hoppas på att hjälpa andra att använda kraften från AI för socialt väl.