AI-basisprincipes

Wat is Big Data?

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Wat is Big Data?

“Big Data” is een van de meest gebruikte buzzwords van onze huidige tijd, maar wat betekent het eigenlijk?

Hier is een korte, eenvoudige definitie van big data. Big data is data die te groot en complex is om te worden verwerkt door traditionele gegevensverwerkings- en opslagmethoden. Terwijl dat een snelle definitie is die je kunt gebruiken als een heuristiek, zou het helpen om een dieper, completer begrip van big data te hebben. Laten we eens kijken naar enkele concepten die ten grondslag liggen aan big data, zoals opslag, structuur en verwerking.

Hoe Groot Is Big Data?

Het is niet zo eenvoudig als te zeggen “alle data groter dan de grootte ‘X’ is big data”, de omgeving waarin de data wordt verwerkt is een extreem belangrijke factor bij het bepalen van wat als big data kwalificeert. De grootte die data moet hebben om als big data te worden beschouwd, is afhankelijk van de context, of de taak waarvoor de data wordt gebruikt. Twee datasets van zeer verschillende groottes kunnen in verschillende contexten als “big data” worden beschouwd.

Om concreter te zijn, als je probeert een 200-megabyte-bestand als e-mailbijlage te verzenden, zou je dat niet kunnen doen. In deze context zou het 200-megabyte-bestand als big data kunnen worden beschouwd. In tegenstelling tot het kopiëren van een 200-megabyte-bestand naar een ander apparaat binnen hetzelfde LAN, zou dat geen tijd kosten en in die context zou het niet als big data worden beschouwd.

Maar laten we aannemen dat 15 terabyte aan video moeten worden voorbewerkt voor gebruik in trainingsprogramma’s voor computer vision. In dit geval nemen de videobestanden zo veel ruimte in beslag dat zelfs een krachtige computer veel tijd nodig zou hebben om ze allemaal te verwerken, en dus zou de verwerking normaal gesproken worden verdeeld over meerdere computers die met elkaar zijn verbonden om de verwerkingstijd te verkorten. Deze 15 terabyte aan videodata zouden zeker als big data kwalificeren.

Typen Big Data-structuren

Big data komt in drie verschillende categorieën van structuur: ongestructureerde data, semi-gestructureerde data en gestructureerde data.

Ongestructureerde data is data die geen definieerbare structuur heeft, wat betekent dat de data in wezen één grote pool is. Voorbeelden van ongestructureerde data zouden een database vol ongelabelde afbeeldingen zijn.

Semi-gestructureerde data is data die geen formele structuur heeft, maar wel binnen een losse structuur bestaat. Bijvoorbeeld, e-maildata zou als semi-gestructureerde data kunnen worden beschouwd, omdat je naar de data in individuele e-mails zou kunnen verwijzen, maar formele datapatronen zijn niet vastgesteld.

Gestructureerde data is data die een formele structuur heeft, met datapunten die zijn gecategoriseerd door verschillende kenmerken. Een voorbeeld van gestructureerde data is een Excel-spreadsheet met contactinformatie zoals namen, e-mailadressen, telefoonnummers en websites.

Als je meer wilt lezen over de verschillen in deze datatypen, kun je de link hier bekijken.

Metrieken voor het beoordelen van Big Data

Big data kan worden geanalyseerd in termen van drie verschillende metrieken: volume, snelheid en variatie.

Volume verwijst naar de grootte van de data. De gemiddelde grootte van datasets neemt vaak toe. Bijvoorbeeld, de grootste harde schijf in 2006 was een 750 GB-harde schijf. In tegenstelling tot Facebook (META ), dat naar verluidt meer dan 500 terabyte aan data per dag genereert en de grootste consumentenharde schijf die vandaag beschikbaar is een 16 terabyte-harde schijf is. Wat als big data kwalificeert in een bepaalde tijd, hoeft dat niet noodzakelijkerwijs big data te zijn in een andere tijd. Meer data wordt vandaag gegenereerd omdat steeds meer objecten om ons heen zijn uitgerust met sensoren, camera’s, microfoons en andere dataprocessingapparaten.

Snelheid verwijst naar hoe snel data beweegt, of om dat anders te zeggen, hoeveel data binnen een bepaalde periode wordt gegenereerd. Sociale medianetwerken genereren honderdduizenden berichten en reacties per minuut, terwijl je eigen e-mailinbox waarschijnlijk veel minder activiteit zal hebben. Big data-stromen zijn stromen die vaak honderdduizenden of miljoenen gebeurtenissen in meer of minder realtime verwerken. Voorbeelden van deze datastromen zijn online gamingsplatforms en high-frequency tradingalgoritmen.

Variatie verwijst naar de verschillende typen data die in de dataset zijn opgenomen. Data kan bestaan uit veel verschillende formaten, zoals audio, video, tekst, foto’s of serienummers. In het algemeen zijn traditionele databases opgezet om één of slechts een paar typen data te verwerken. Om dat anders te zeggen, traditionele databases zijn opgezet om data te verwerken die redelijk homogeen is en een consistente, voorspelbare structuur heeft. Naarmate applicaties diverser worden, meer functies hebben en door meer mensen worden gebruikt, moeten databases evolueren om meer typen data op te slaan. Ongestructureerde databases zijn ideaal voor het opslaan van big data, omdat ze meerdere datatypen kunnen opslaan die niet met elkaar verwant zijn.

Methoden voor het verwerken van Big Data

Er zijn verschillende platforms en tools ontwikkeld om de analyse van big data te faciliteren. Big data-pools moeten worden geanalyseerd om betekenisvolle patronen uit de data te extraheren, een taak die erg moeilijk kan zijn met traditionele data-analysetools. Als reactie op de behoefte aan tools om grote hoeveelheden data te analyseren, hebben verschillende bedrijven big data-analysetools ontwikkeld. Big data-analysetools omvatten systemen zoals ZOHO Analytics, Cloudera en Microsoft BI.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.