Grundlagen der KI

Was ist Data Science?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Das Feld der Data Science scheint jeden Tag größer und beliebter zu werden. Laut LinkedIn war Data Science eines der am schnellsten wachsenden Berufsfelder im Jahr 2017 und im Jahr 2020 belegte Glassdoor den Job des Data Scientists als einen der drei besten Jobs in den Vereinigten Staaten. Angesichts der wachsenden Beliebtheit von Data Science ist es kein Wunder, dass immer mehr Menschen an diesem Feld interessiert sind. Doch was ist Data Science genau?

Lassen Sie uns Data Science kennenlernen, indem wir uns einige Zeit nehmen, um Data Science zu definieren, zu erkunden, wie Big Data und künstliche Intelligenz das Feld verändern, einige gängige Data-Science-Tools zu lernen und einige Beispiele für Data Science zu untersuchen.

Was ist Data Science?

Bevor wir uns mit Data-Science-Tools oder -Beispielen befassen, möchten wir eine präzise Definition von Data Science erhalten.

Die Definition von “Data Science” ist tatsächlich ein bisschen schwierig, da der Begriff auf viele verschiedene Aufgaben und Methoden der Untersuchung und Analyse angewendet wird. Wir können damit beginnen, uns daran zu erinnern, was der Begriff “Wissenschaft” bedeutet. Wissenschaft ist das systematische Studium der physischen und natürlichen Welt durch Beobachtung und Experiment, mit dem Ziel, das menschliche Verständnis von natürlichen Prozessen zu verbessern. Die wichtigsten Wörter in dieser Definition sind “Beobachtung” und “Verständnis”.

Wenn Data Science der Prozess ist, die Welt durch Muster in Daten zu verstehen, dann ist die Verantwortung eines Data Scientists es, Daten zu transformieren, Daten zu analysieren und Muster aus Daten zu extrahieren. Mit anderen Worten: Ein Data Scientist erhält Daten und verwendet eine Vielzahl von Tools und Techniken, um die Daten vorzubereiten (sie für die Analyse bereitzumachen) und dann die Daten auf bedeutungsvolle Muster zu analysieren.

Die Rolle eines Data Scientists ist ähnlich wie die Rolle eines traditionellen Wissenschaftlers. Beide sind damit beschäftigt, Daten zu analysieren, um Hypothesen über die Funktionsweise der Welt zu unterstützen oder zu widerlegen, und versuchen, Sinn aus Mustern in den Daten zu machen, um unser Verständnis der Welt zu verbessern. Data Scientists verwenden die gleichen wissenschaftlichen Methoden wie ein traditioneller Wissenschaftler. Ein Data Scientist beginnt damit, Beobachtungen über ein Phänomen zu sammeln, das er untersuchen möchte. Dann formuliert er eine Hypothese über das Phänomen und versucht, Daten zu finden, die seine Hypothese in irgendeiner Weise widerlegen.

Wenn die Hypothese nicht durch die Daten widerlegt wird, kann er möglicherweise eine Theorie oder ein Modell über die Funktionsweise des Phänomens entwickeln, das er weiterhin testen kann, indem er prüft, ob es für andere ähnliche Datensätze gilt. Wenn ein Modell robust genug ist, wenn es Muster gut erklärt und während anderer Tests nicht widerlegt wird, kann es sogar verwendet werden, um zukünftige Ereignisse vorherzusagen.

Ein Data Scientist sammelt normalerweise nicht selbst Daten durch ein Experiment. Er entwirft normalerweise keine Experimente mit Kontrollen und Doppelblindtests, um störende Variablen zu entdecken, die seine Hypothese beeinträchtigen könnten. Die meisten von einem Data Scientist analysierten Daten werden durch Beobachtungsstudien und Systeme gewonnen, was eine Möglichkeit ist, wie die Arbeit eines Data Scientists von der Arbeit eines traditionellen Wissenschaftlers abweichen kann, der tendenziell mehr Experimente durchführt.

Das bedeutet jedoch nicht, dass ein Data Scientist nicht aufgefordert wird, eine Form der Experimentierung genannt A/B-Test durchzuführen, bei der Anpassungen an einem System vorgenommen werden, das Daten sammelt, um zu sehen, wie sich die Datenmuster ändern.

Unabhängig von den verwendeten Techniken und Tools zielt Data Science letztendlich darauf ab, unser Verständnis der Welt zu verbessern, indem es Sinn aus Daten macht, und Daten werden durch Beobachtung und Experiment gewonnen. Data Science ist der Prozess der Verwendung von Algorithmen, statistischen Prinzipien und verschiedenen Tools und Maschinen, um Erkenntnisse aus Daten zu gewinnen, die uns helfen, Muster in der Welt um uns herum zu verstehen.

Was machen Data Scientists?

Sie sehen vielleicht, dass jede Aktivität, die die Analyse von Daten in wissenschaftlicher Weise beinhaltet, als Data Science bezeichnet werden kann, was Teil dessen ist, was die Definition von Data Science so schwierig macht. Um es klarer zu machen, lassen Sie uns einige der Aktivitäten erkunden, die ein Data Scientist täglich durchführen kann.

Data Science bringt viele verschiedene Disziplinen und Spezialgebiete zusammen. Foto: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

An einem beliebigen Tag kann ein Data Scientist aufgefordert werden, DatenSpeicher- und Abrufschema zu erstellen, Daten-ETL-(Extract, Transform, Load)-Pipelines zu erstellen und Daten zu bereinigen, statistische Methoden anzuwenden, Datenvisualisierungen und Dashboards zu erstellen, künstliche Intelligenz und Machine-Learning-Algorithmen zu implementieren, Empfehlungen für Aktionen auf der Grundlage der Daten zu erstellen.

Lassen Sie uns die oben genannten Aufgaben ein bisschen genauer betrachten.

Ein Data Scientist kann mit der Installation von Technologien beauftragt werden, die zum Speichern und Abrufen von Daten erforderlich sind, wobei sowohl Hardware als auch Software berücksichtigt werden. Die Person, die für diese Position verantwortlich ist, kann auch als “Data Engineer” bezeichnet werden. Allerdings können einige Unternehmen diese Verantwortlichkeiten unter die Rolle des Data Scientists subsumieren. Ein Data Scientist kann auch die Erstellung von ETL-Pipelines unterstützen oder erstellen. Daten sind sehr selten genau so formatiert, wie ein Data Scientist sie benötigt. Stattdessen müssen die Daten in roher Form vom Datenlieferanten empfangen, in ein verwendbares Format umgewandelt und vorverarbeitet werden (Dinge wie Standardisierung der Daten, Redundanzbeseitigung und Entfernen korrupter Daten).

Statistische Methoden der Data Science

Die Anwendung von Statistik ist notwendig, um die bloße Betrachtung von Daten und ihre Interpretation in eine echte Wissenschaft zu verwandeln. Statistische Methoden werden verwendet, um relevante Muster aus Datensätzen zu extrahieren, und ein Data Scientist muss in statistischen Konzepten bewandert sein. Er muss in der Lage sein, bedeutungsvolle Korrelationen von zufälligen Korrelationen zu unterscheiden, indem er störende Variablen kontrolliert. Er muss auch wissen, welche Tools er verwenden muss, um zu bestimmen, welche Merkmale im Datensatz wichtig für sein Modell sind oder vorhersagende Kraft haben. Ein Data Scientist muss wissen, wann er einen Regressionsansatz gegenüber einem Klassifizierungsansatz verwenden muss und wann er sich um den Mittelwert einer Stichprobe gegenüber dem Median einer Stichprobe kümmern muss. Ein Data Scientist wäre ohne diese entscheidenden Fähigkeiten kein Wissenschaftler.

Datenvisualisierung

Ein wichtiger Teil der Arbeit eines Data Scientists ist die Kommunikation seiner Ergebnisse an andere. Wenn ein Data Scientist seine Ergebnisse nicht effektiv an andere kommunizieren kann, dann sind die Implikationen seiner Ergebnisse nicht wichtig. Ein Data Scientist sollte auch ein effektiver Erzähler sein. Das bedeutet, Visualisierungen zu erstellen, die relevante Punkte über den Datensatz und die darin entdeckten Muster vermitteln. Es gibt eine Vielzahl von Datenvisualisierungstools, die ein Data Scientist verwenden kann, und er kann Daten visualisieren, um grundlegende, explorative Analysen (exploratory data analysis) durchzuführen oder um die Ergebnisse zu visualisieren, die ein Modell produziert.

Empfehlungen und Geschäftsanwendungen

Ein Data Scientist muss ein gewisses Verständnis für die Anforderungen und Ziele seiner Organisation oder seines Unternehmens haben. Ein Data Scientist muss diese Dinge verstehen, weil er wissen muss, welche Arten von Variablen und Merkmalen er analysieren sollte, um Muster zu erkunden, die seinem Unternehmen helfen, seine Ziele zu erreichen. Der Data Scientist muss sich der Einschränkungen bewusst sein, unter denen er arbeitet, und der Annahmen, die die Unternehmensführung trifft.

Machine Learning und KI

Machine Learning und andere künstliche Intelligenz-Algorithmen und -Modelle sind Tools, die von Data Scientists verwendet werden, um Daten zu analysieren, Muster innerhalb von Daten zu erkennen, Beziehungen zwischen Variablen zu erkennen und Vorhersagen über zukünftige Ereignisse zu treffen.

Traditionelle Data Science vs. Big Data Science

Da die Methoden der Datenerfassung fortschrittlicher geworden sind und die Datenbanken größer geworden sind, hat sich ein Unterschied zwischen traditioneller Data Science und “Big Data” Science ergeben.

Traditionelle Datenanalyse und Data Science werden mit beschreibender und explorativer Analyse durchgeführt, um Muster zu finden und die Leistungsresultate von Projekten zu analysieren. Traditionelle Datenanalysemethoden konzentrieren sich oft auf vergangene Daten und aktuelle Daten. Datenanalysten befassen sich oft mit Daten, die bereits gereinigt und standardisiert wurden, während Data Scientists oft mit komplexen und schmutzigen Daten arbeiten. Fortgeschrittenere Datenanalyse- und Data-Science-Techniken können verwendet werden, um zukünftiges Verhalten vorherzusagen, obwohl dies häufiger mit Big Data durchgeführt wird, da Vorhersagemodelle oft große Mengen an Daten benötigen, um zuverlässig konstruiert zu werden.

“Big Data” bezieht sich auf Daten, die zu groß und komplex sind, um mit traditionellen Datenanalyse- und Wissenschaftstechniken und -Tools bearbeitet zu werden. Big Data wird oft durch Online-Plattformen und fortschrittliche Daten-Transformationstools gesammelt, um die großen Datenmengen für die Untersuchung durch Data Science bereitzumachen. Da immer mehr Daten gesammelt werden, umfasst ein größeres Teil der Arbeit eines Data Scientists die Analyse von Big Data.

Data-Science-Tools

Gängige Data-Science-Tools umfassen Tools zum Speichern von Daten, Durchführen von explorativer Datenanalyse, Modellieren von Daten, Durchführen von ETL und Visualisieren von Daten. Plattformen wie Amazon (AMZN ) Web Services, Microsoft Azure und Google Cloud bieten Tools, um Data Scientists bei der Speicherung, Transformation, Analyse und Modellierung von Daten zu unterstützen. Es gibt auch eigenständige Data-Science-Tools wie Airflow (Data-Infrastruktur) und Tableau (Datenvisualisierung und Analyse).

Was die Machine-Learning- und künstlichen Intelligenz-Algorithmen betrifft, die zum Modellieren von Daten verwendet werden, werden sie oft durch Data-Science-Module und -Plattformen wie TensorFlow, PyTorch und die Azure Machine Learning-Studio bereitgestellt. Diese Plattformen ermöglichen es Data Scientists, ihre Datensätze zu bearbeiten, Machine-Learning-Architekturen zu komponieren und Machine-Learning-Modelle zu trainieren.

Andere gängige Data-Science-Tools und -Bibliotheken umfassen SAS (für statistisches Modellieren), Apache Spark (für die Analyse von Streaming-Daten), D3.js (für interaktive Visualisierungen im Browser) und Jupyter (für interaktive, teilebare Codeblöcke und Visualisierungen).

Foto: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Beispiele für Data Science

Beispiele für Data Science und seine Anwendungen sind überall. Data Science hat Anwendungen in allem, von der Lebensmittelzustellung bis hin zu Sport, Verkehr und Gesundheit. Daten sind überall, und daher kann Data Science auf alles angewendet werden.

Was die Lebensmittelzustellung betrifft, investiert Uber in eine Erweiterung seines Fahrdienst-Systems, das auf die Zustellung von Lebensmitteln ausgerichtet ist, Uber Eats. Uber Eats muss die Menschen ihre Mahlzeiten rechtzeitig und noch heiß und frisch zustellen. Damit dies geschehen kann, müssen die Data Scientists des Unternehmens statistische Modelle verwenden, die Aspekte wie die Entfernung von Restaurants zu Lieferpunkten, Feiertagsansturm, Kochzeit und sogar Wetterbedingungen berücksichtigen, alles mit dem Ziel, die Lieferzeiten zu optimieren.

Sportstatistiken werden von Teammanagern verwendet, um die besten Spieler zu bestimmen und starke, zuverlässige Teams zu bilden, die Spiele gewinnen. Ein bemerkenswertes Beispiel ist die in dem Buch Moneyball von Michael Lewis dokumentierte Data Science, in dem der General Manager des Oakland Athletics-Teams eine Vielzahl von Statistiken analysierte, um Qualitätsspieler zu identifizieren, die zum Team geholt werden konnten, ohne viel Geld auszugeben.

Die Analyse von Verkehrsmustern ist für die Entwicklung von selbstfahrenden Fahrzeugen von entscheidender Bedeutung. Selbstfahrende Fahrzeuge müssen in der Lage sein, die Aktivitäten um sie herum vorherzusagen und auf Änderungen in den Straßenbedingungen reagieren, wie z. B. die erforderliche längere Bremsstrecke, wenn es regnet, sowie die Anwesenheit von mehr Autos auf der Straße während der Rushhour. Jenseits von selbstfahrenden Fahrzeugen analysieren Apps wie Google Maps Verkehrsmuster, um Pendelern zu sagen, wie lange sie brauchen werden, um ihr Ziel zu erreichen, wenn sie verschiedene Routen und Verkehrsmittel nutzen.

Was die Gesundheits-Data-Science betrifft, wird oft Computer-Vision mit Machine Learning und anderen KI-Techniken kombiniert, um Bildklassifizierer zu erstellen, die in der Lage sind, Dinge wie Röntgenaufnahmen, FMRIs und Ultraschallbilder zu untersuchen, um zu sehen, ob es möglicherweise medizinische Probleme gibt, die im Scan sichtbar werden. Diese Algorithmen können verwendet werden, um Klinikern zu helfen, Krankheiten zu diagnostizieren.

Letztendlich umfasst Data Science zahlreiche Aktivitäten und bringt Aspekte verschiedener Disziplinen zusammen. Data Science ist jedoch immer damit beschäftigt, interessante und überzeugende Geschichten aus Daten zu erzählen und Daten zu verwenden, um die Welt besser zu verstehen.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.