AI-basisprincipes
Gestructureerde tegen Ongeordende Gegevens
Ongeordende gegevens zijn gegevens die niet zijn georganiseerd in een vooraf gedefinieerde wijze of geen specifiek gegevensmodel hebben. Ondertussen is gestructureerde gegevens gegevens die duidelijke, definieerbare relaties tussen de gegevenspunten hebben, met een vooraf gedefinieerd model dat het bevat. Dat is het korte antwoord op het verschil tussen gestructureerde en ongeordende gegevens, maar laten we een nauwere blik werpen op de verschillen tussen de twee soorten gegevens.
Wat is Gestruktureerde Gegevens?
Wanneer het gaat om computerwetenschap, verwijzen gegevensstructuren naar specifieke manieren van opslaan en organiseren van gegevens. Verschillende gegevensstructuren hebben verschillende relaties tussen gegevenspunten, maar gegevens kunnen ook ongeordend zijn. Wat betekent het om te zeggen dat gegevens gestructureerd zijn? Om deze definitie duidelijker te maken, laten we een aantal manieren bekijken om gegevens te structureren.
Gestructureerde gegevens worden vaak opgeslagen in tabellen zoals Excel-bestanden of SQL-databases. In deze gevallen houden de rijen en kolommen van de gegevens verschillende variabelen of kenmerken in, en het is vaak mogelijk om de relatie tussen gegevenspunten te zien door te controleren waar gegevensrijen en -kolommen elkaar kruisen. Gestructureerde gegevens kunnen gemakkelijk worden opgenomen in een relationele database, en voorbeelden van verschillende kenmerken in een gestructureerde dataset kunnen dingen zoals namen, adressen, datums, weersstatistieken, creditcardnummers enz. omvatten. Terwijl gestructureerde gegevens meestal tekstgegevens zijn, is het mogelijk om dingen zoals afbeeldingen en audio als gestructureerde gegevens op te slaan.
Veelvoorkomende bronnen van gestructureerde gegevens zijn dingen zoals gegevens die zijn verzameld van sensoren, weblogs, netwerkgegevens en detailhandels- of e-commercegegevens. Gestructureerde gegevens kunnen ook worden gegenereerd door mensen die spreadsheets of databases invullen met gegevens die zijn verzameld van computers en andere apparaten. Bijvoorbeeld, gegevens die zijn verzameld via online formulieren, worden vaak onmiddellijk in een gegevensstructuur ingevoerd.
Gestructureerde gegevens hebben een lange geschiedenis van opslaan in relationele databases en SQL. Deze opslagmethoden zijn populair vanwege de gemakkelijke lees- en schrijfbewerkingen in deze formaten, met de meeste platforms en talen die deze gegevensformaten kunnen interpreteren.
In een machine learning-context is gestructureerde gegevens gemakkelijker om een machine learning-systeem te trainen, omdat de patronen binnen de gegevens meer expliciet zijn. Bepaalde kenmerken kunnen worden ingevoerd in een machine learning-classificatie en gebruikt om andere gegevensinstanties te labelen op basis van die geselecteerde kenmerken. In tegenstelling tot het trainen van een machine learning-systeem op ongeordende gegevens, wat moeilijker is, om redenen die duidelijk zullen worden.
Wat is Ongeordende Gegevens?
Ongeordende gegevens zijn gegevens die niet zijn georganiseerd volgens een vooraf gedefinieerd gegevensmodel of -structuur. Ongeordende gegevens worden vaak kwalitatieve gegevens genoemd omdat ze niet kunnen worden geanalyseerd of verwerkt op traditionele wijze met de gebruikelijke methoden die voor gestructureerde gegevens worden gebruikt.
Omdat ongeordende gegevens geen gedefinieerde relaties tussen gegevenspunten hebben, kunnen ze niet worden georganiseerd in relationele databases. In tegenstelling tot de manier waarop ongeordende gegevens worden opgeslagen, wordt meestal een NoSQL-database of een niet-relationele database gebruikt. Als de structuur van de database van weinig belang is, kan een data lake, of een grote pool van ongeordende gegevens, worden gebruikt om de gegevens op te slaan in plaats van een NoSQL-database.
Ongeordende gegevens zijn moeilijk te analyseren, en het maken van zin van ongeordende gegevens houdt meestal in dat individuele stukken gegevens worden onderzocht om potentiële kenmerken te ontdekken en vervolgens te zien of die kenmerken voorkomen in andere stukken gegevens binnen de pool.
Het overgrote deel van de gegevens is in ongeordende formaten, met schattingen dat ongeordende gegevens ongeveer 80% van alle gegevens omvatten. Data mining-technieken kunnen worden gebruikt om te helpen bij het structureren van gegevens.
In termen van machine learning kunnen bepaalde technieken helpen om ongeordende gegevens te ordenen en om te zetten in gestructureerde gegevens. Een populaire tool voor het omzetten van ongeordende gegevens in gestructureerde gegevens is een systeem dat een auto-encoder wordt genoemd.












