Grundlæggende AI
Struktureret vs. ustruktureret data
Ustruktureret data er data, der ikke er organiseret på en foruddefineret måde eller mangler en specifik datamodel. Imens er struktureret data data, der har klare, definérbare relationer mellem datapunkterne, med en foruddefineret model, der indeholder dem. Det er det korte svar på forskellen mellem struktureret og ustruktureret data, men lad os tage et nærmere kig på forskellen mellem de to typer data.
Hvad er struktureret data?
Når det kommer til computervidenskab, refererer datastrukturer til bestemte måder at gemme og organisere data på. Forskellige datastrukturer har forskellige relationer mellem datapunkterne, men data kan også være ustruktureret. Hvad betyder det at sige, at data er struktureret? For at gøre denne definition klarere, lad os tage et kig på nogle af de forskellige måder at strukturere data på.
Struktureret data er ofte gemt i tabeller som Excel-filer eller SQL-databaser. I disse tilfælde indeholder rækkerne og kolonnernes data forskellige variabler eller funktioner, og det er ofte muligt at afgøre relationen mellem datapunkter ved at se, hvor data-rækker og -kolonner krydser hinanden. Struktureret data kan let indsættes i en relationel database, og eksempler på forskellige funktioner i en struktureret dataset kan omfatte ting som navne, adresser, datoer, vejrstatistik, kreditkortnumre osv. Selvom struktureret data oftest er tekstdata, er det muligt at gemme ting som billeder og lyd som struktureret data også.
Almindelige kilder til struktureret data omfatter ting som data indsamlet fra sensorer, weblogs, netværksdata og detail- eller e-handelsdata. Struktureret data kan også genereres af mennesker, der udfylder regneark eller databaser med data indsamlet fra computere og andre enheder. For eksempel er data indsamlet gennem online-formularer ofte straks indført i en datastruktur.
Struktureret data har en lang historie med at blive gemt i relationelle databaser og SQL. Disse gemmingsmetoder er populære på grund af letlæseligheden og skrivbarheden i disse formater, med de fleste platforme og sprog, der kan fortolke disse dataformater.
I en maskinel læringssammenhæng er struktureret data lettere at træne et maskinel læringssystem på, fordi mønstrene i data er mere eksplicitte. Bestemte funktioner kan indføres i en maskinel læringsklassifikator og bruges til at mærke andre dataeksempler baseret på disse valgte funktioner. I modsætning hertil er det sværere at træne et maskinel læringssystem på ustruktureret data, af grunde, der vil blive klare.
Hvad er ustruktureret data?
Ustruktureret data er data, der ikke er organiseret i overensstemmelse med en foruddefineret datamodel eller struktur. Ustruktureret data kaldes ofte kvalitativ data, fordi den ikke kan analyseres eller bearbejdes på traditionelle måder med de almindelige metoder, der bruges til struktureret data.
Fordi ustruktureret data ikke har nogen definerbare relationer mellem datapunkterne, kan den ikke organiseres i relationelle databaser. I modsætning hertil er måden, ustruktureret data gemmes på, typisk med en NoSQL-database eller en ikke-relationel database. Hvis databasens struktur er af ringe betydning, kan en data-sø, eller en stor mængde ustruktureret data, bruges til at gemme data i stedet for en NoSQL-database.
Ustruktureret data er svær at analysere, og at få mening ud af ustruktureret data indebærer ofte at undersøge enkeltstykker af data for at afgøre potentielle funktioner og derefter se, om disse funktioner forekommer i andre stykker af data i mængden.
Den overvældende majoritet af data er i ustrukturerede formater, med estimater, der antyder, at ustruktureret data udgør omkring 80% af alle data. Data-mining-teknikker kan bruges til at hjælpe med at strukturere data.
I forhold til maskinel læring kan visse teknikker hjælpe med at ordne ustruktureret data og omdanne det til struktureret data. Et populært værktøj til at omdanne ustruktureret data til struktureret data er et system kaldet en autoencoder.












