AI-modeller och plattformar
Vad ÃĪr Big Data?
Vad ÃĪr Big Data?
âBig Dataâ ÃĪr ett av de vanligt fÃķrekommande buzzorden i vÃĨr nuvarande era, men vad betyder det egentligen?
HÃĪr ÃĪr en snabb och enkel definition av big data. Big data ÃĪr data som ÃĪr fÃķr stor och komplex fÃķr att hanteras av traditionella datahanterings- och lagringsmetoder. Medan det ÃĪr en snabb definition som du kan anvÃĪnda som en heuristik, skulle det vara hjÃĪlpsamt att ha en djupare och mer komplett fÃķrstÃĨelse av big data. LÃĨt oss ta en titt pÃĨ nÃĨgra av de begrepp som ligger till grund fÃķr big data, som lagring, struktur och bearbetning.
Hur Stort Ãr Big Data?
Det ÃĪr inte sÃĨ enkelt som att sÃĪga âalla data Ãķver storleken âXâ ÃĪr big dataâ, miljÃķn som data hanteras i ÃĪr en extremt viktig faktor i att bestÃĪmma vad som kvalificerar som big data. Storleken som data behÃķver vara, fÃķr att betraktas som big data, beror pÃĨ sammanhanget, eller uppgiften som data anvÃĪnds fÃķr. TvÃĨ datamÃĪngder av vÃĪldigt olika storlekar kan betraktas som âbig dataâ i olika sammanhang.
Om vi ska vara mer konkreta, om du fÃķrsÃķker skicka en 200-megabyte fil som e-postbilaga, skulle du inte kunna gÃķra det. I detta sammanhang skulle den 200-megabyte filen kunna betraktas som big data. I kontrast, om du kopierar en 200-megabyte fil till en annan enhet inom samma LAN, skulle det inte ta nÃĨgon tid alls, och i det sammanhanget skulle det inte betraktas som big data.
Men lÃĨt oss anta att 15 terabyte av video behÃķver fÃķrbearbetas fÃķr anvÃĪndning i utbildning av datorseendeapplikationer. I detta fall tar videofilerna upp sÃĨ mycket utrymme att ÃĪven en kraftfull dator skulle ta lÃĨng tid att bearbeta dem alla, och bearbetningen skulle vanligtvis distribueras Ãķver flera datorer som ÃĪr lÃĪnkade till varandra fÃķr att minska bearbetningstiden. Dessa 15 terabyte av videodata skulle definitivt kvalificera som big data.
Typer Av Big Data Strukturer
Big data kommer i tre olika kategorier av struktur: ostrukturerad data, semistrukturerad data och strukturerad data.
Ostrukturerad data ÃĪr data som inte har nÃĨgon definierbar struktur, vilket innebÃĪr att data i princip bara ÃĪr en stor pool. Exempel pÃĨ ostrukturerad data skulle vara en databas full av oetiketterade bilder.
Semistrukturerad data ÃĪr data som inte har en formaliserad struktur, men som ÃĪndÃĨ existerar inom en lÃķs struktur. Till exempel skulle e-postdata kunna rÃĪknas som semistrukturerad data, eftersom du kunde hÃĪnvisa till data som finns i enskilda e-postmeddelanden, men formella dataprocesser har inte etablerats.
Strukturerad data ÃĪr data som har en formaliserad struktur, med datapunkter kategoriserade efter olika egenskaper. Ett exempel pÃĨ strukturerad data ÃĪr ett Excel-ark som innehÃĨller kontaktinformation som namn, e-postadresser, telefonnummer och webbplatser.
Om du vill lÃĪsa mer om skillnaderna mellan dessa datatyper, kolla lÃĪnken hÃĪr.
MÃĪtetal FÃķr Att BedÃķma Big Data
Big data kan analyseras utifrÃĨn tre olika mÃĪtetal: volym, hastighet och variation.
Volym hÃĪnvisar till datans storlek. Den genomsnittliga storleken pÃĨ datamÃĪngder Ãķkar ofta. Till exempel var den stÃķrsta hÃĨrddisken 2006 en 750 GB hÃĨrddisk. I kontrast anses Facebook (META ) generera Ãķver 500 terabyte data per dag och den stÃķrsta konsumenthÃĨrddisken som finns tillgÃĪnglig idag ÃĪr en 16 terabyte hÃĨrddisk. Vad som kvalificerar som big data i en era kanske inte ÃĪr big data i en annan. Mer data genereras idag eftersom allt fler fÃķremÃĨl runt omkring oss ÃĪr utrustade med sensorer, kameror, mikrofoner och andra datainsamlingsenheter.
Hastighet hÃĪnvisar till hur snabbt data rÃķr sig, eller fÃķr att uttrycka det pÃĨ ett annat sÃĪtt, hur mycket data som genereras inom en given tidsperiod. Sociala medieflÃķden genererar hundratusentals inlÃĪgg och kommentarer varje minut, medan din egen e-postinkorg troligen kommer att ha mycket mindre aktivitet. Big data-flÃķden ÃĪr flÃķden som ofta hanterar hundratusentals eller miljontals hÃĪndelser i mer eller mindre realtid. Exempel pÃĨ dessa dataflÃķden ÃĪr onlinespelplattformar och hÃķgfrekvenshandelsalgoritmer.
Variation hÃĪnvisar till de olika typerna av data som finns inom datamÃĪngden. Data kan bestÃĨ av mÃĨnga olika format, som ljud, video, text, foton eller serienummer. I allmÃĪnhet ÃĪr traditionella databaser formaterade fÃķr att hantera en eller bara ett par typer av data. FÃķr att uttrycka det pÃĨ ett annat sÃĪtt, traditionella databaser ÃĪr strukturerade fÃķr att innehÃĨlla data som ÃĪr ganska homogena och har en konsekvent, fÃķrutsÃĪgbar struktur. NÃĪr applikationer blir mer diversifierade, fulla av olika funktioner och anvÃĪnds av fler mÃĪnniskor, har databaserna varit tvungna att utvecklas fÃķr att lagra fler typer av data. Ostrukturerade databaser ÃĪr idealiska fÃķr att lagra big data, eftersom de kan innehÃĨlla flera datatyper som inte ÃĪr relaterade till varandra.
Metoder FÃķr Att Hantera Big Data
Det finns ett antal olika plattformar och verktyg som ÃĪr utformade fÃķr att underlÃĪtta analysen av big data. Big data-pooler behÃķver analyseras fÃķr att extrahera meningsfulla mÃķnster frÃĨn data, en uppgift som kan visa sig vara ganska utmanande med traditionella dataanalysverktyg. Som svar pÃĨ behovet av verktyg fÃķr att analysera stora mÃĪngder data, har en mÃĪngd olika fÃķretag skapat big data-analysverktyg. Big data-analysverktyg inkluderar system som ZOHO Analytics, Cloudera och Microsoft (MSFT ) BI.












