Vordenker

Bedeutung der Datenqualität bei der Implementierung von KI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Künstliche Intelligenz und Machine-Learning-Technologien können Unternehmen aller Größen erheblich zugutekommen. Laut einem Bericht von McKinsey werden Unternehmen, die künstliche Intelligenz-Technologien einsetzen, ihren Cash-Flow bis 2030 verdoppeln. Andererseits werden Unternehmen, die keine KI einsetzen, einen Rückgang ihres Cash-Flows um 20% erleben. Diese Vorteile gehen jedoch über die Finanzen hinaus. KI kann Unternehmen helfen, Arbeitskräftemangel zu bekämpfen. KI verbessert auch erheblich die Kundenerfahrung und die Geschäftsergebnisse, was Unternehmen zuverlässiger macht.

Da KI so viele Vorteile bietet, warum setzen nicht alle Unternehmen KI ein? Im Jahr 2019 ergab eine Umfrage von PwC, dass 76% der Unternehmen planen, KI zu nutzen, um ihren Geschäftswert zu verbessern. Allerdings haben nur 15% Zugang zu hochwertigen Daten, um ihre Geschäftsziele zu erreichen. Eine weitere Studie von Refinitiv ergab, dass 66% der Befragten angaben, dass schlechte Datenqualität ihre Fähigkeit, KI effektiv einzusetzen, beeinträchtigt.

Die Umfrage ergab, dass die drei größten Herausforderungen bei der Arbeit mit Machine-Learning- und KI-Technologien darin bestehen, “genaue Informationen über den Umfang, die Geschichte und die Bevölkerung der Daten” zu erhalten, “unvollständige oder fehlerhafte Datensätze zu identifizieren” und “Daten zu bereinigen und zu normalisieren”. Dies zeigt, dass schlechte Datenqualität das Hauptproblem für Unternehmen ist, um hochwertige KI-Analytics zu erhalten.

Warum sind Daten so wichtig?

Es gibt viele Gründe, warum Datenqualität bei der KI-Implementierung so wichtig ist. Hier sind einige der wichtigsten:

1. Müll rein, Müll raus

Es ist einfach zu verstehen, dass die Ausgabe stark von der Eingabe abhängt. Wenn die Datensätze fehlerhaft oder verzerrt sind, wird das Ergebnis auch falsch sein. Die meisten Datenprobleme sind nicht unbedingt mit der Menge der Daten zusammenhängend, sondern mit der Qualität der Daten, die dem KI-Modell zugeführt werden. Wenn Sie schlechte Daten haben, funktionieren Ihre KI-Modelle nicht ordnungsgemäß, egal wie gut sie sind.

2. Nicht alle KI-Systeme sind gleich

Wenn wir an Datensätze denken, denken wir normalerweise an quantitative Daten. Es gibt jedoch auch qualitative Daten in Form von Videos, persönlichen Interviews, Meinungen, Bildern usw. In KI-Systemen sind quantitative Datensätze strukturiert und qualitative Datensätze unstrukturiert. Nicht alle KI-Modelle können beide Arten von Datensätzen verarbeiten. Daher ist es wichtig, den richtigen Datentyp für das geeignete Modell auszuwählen, um das erwartete Ergebnis zu erhalten.

3. Qualität vs. Quantität

Es wird angenommen, dass KI-Systeme große Mengen an Daten benötigen, um daraus zu lernen. In einer Debatte über Qualität vs. Quantität bevorzugen Unternehmen normalerweise die letztere. Wenn die Datensätze jedoch hochwertig, aber kürzer sind, können Sie sicherstellen, dass die Ausgabe relevant und robust ist.

4. Merkmale eines guten Datensatzes

Die Merkmale eines guten Datensatzes können subjektiv sein und hängen hauptsächlich von der Anwendung ab, für die KI eingesetzt wird. Es gibt jedoch einige allgemeine Merkmale, die man bei der Analyse von Datensätzen suchen sollte.

  • Vollständigkeit: Der Datensatz muss vollständig sein, ohne leere Felder oder Lücken. Jedes Feld sollte einen Datenwert enthalten.
  • Umfang: Die Datensätze sollten so umfassend wie möglich sein. Wenn Sie beispielsweise nach einem Cyber-Bedrohungsvektor suchen, sollten Sie alle Signaturprofile und alle notwendigen Informationen haben.
  • Konsistenz: Die Datensätze müssen den festgelegten Variablen entsprechen. Wenn Sie beispielsweise Pakete modellieren, sollten Ihre ausgewählten Variablen (Kunststoff, Papier, Karton usw.) die entsprechenden Preisdaten haben, um in diese festen Kategorien zu passen.
  • Genauigkeit: Genauigkeit ist der Schlüssel zu einem guten Datensatz. Alle Informationen, die Sie dem KI-Modell zuführen, müssen vertrauenswürdig und vollständig genau sein. Wenn große Teile Ihrer Datensätze falsch sind, wird Ihre Ausgabe auch falsch sein.
  • Einzigartigkeit: Dieser Punkt ist ähnlich wie Konsistenz. Jeder Datenpunkt muss einzigartig für die Variable sein, die er darstellt. Wenn Sie beispielsweise den Preis einer Plastikverpackung nicht in eine andere Kategorie einordnen möchten.

Sicherstellung der Datenqualität

Es gibt viele Möglichkeiten, um sicherzustellen, dass die Datenqualität hoch ist, wie z.B. die Sicherstellung, dass die Datenquelle vertrauenswürdig ist. Hier sind einige der besten Techniken, um sicherzustellen, dass Sie die beste Datenqualität für Ihre KI-Modelle erhalten:

1. Datenprofilierung

Datenprofilierung ist essentiell, um die Daten vor der Verwendung zu verstehen. Datenprofilierung bietet Einblicke in die Verteilung der Werte, die maximalen, minimalen, durchschnittlichen Werte und Ausreißer. Zusätzlich hilft sie bei der Formatierung von Inkonsistenzen in den Daten. Datenprofilierung hilft, zu verstehen, ob der Datensatz verwendbar ist oder nicht.

2. Bewertung der Datenqualität

Mithilfe einer zentralen Bibliothek vordefinierter Datenqualitätsregeln können Sie jeden Datensatz validieren. Wenn Sie einen Datenkatalog mit integrierten Datenwerkzeugen haben, können Sie diese Regeln einfach wiederverwenden, um Kundennamen, E-Mails und Produktcodes zu validieren. Zusätzlich können Sie auch einige Daten anreichern und standardisieren.

3. Überwachung und Bewertung der Datenqualität

Wissenschaftler haben die Datenqualität für die meisten Datensätze, die sie verwenden möchten, vorab berechnet. Sie können sie einengen, um zu sehen, welches spezifische Problem ein Attribut hat, und dann entscheiden, ob sie dieses Attribut verwenden oder nicht.

4. Datenvorbereitung

Forscher und Wissenschaftler müssen die Daten normalerweise ein wenig anpassen, um sie für die KI-Modellierung vorzubereiten. Diese Forscher benötigen einfache Werkzeuge, um Attribute zu parsen, Spalten zu transponieren und Werte aus den Daten zu berechnen.

Die Welt der künstlichen Intelligenz ändert sich ständig. Während jedes Unternehmen Daten auf unterschiedliche Weise verwendet, bleibt die Datenqualität für jedes KI-Implementierungsprojekt von entscheidender Bedeutung. Wenn Sie vertrauenswürdige, hochwertige Daten haben, eliminieren Sie die Notwendigkeit für massive Datensätze und erhöhen Ihre Chancen auf Erfolg. Wenn Ihr Unternehmen auf die Implementierung von KI umstellt, überprüfen Sie, ob Sie über gute Daten verfügen. Stellen Sie sicher, dass Ihre Quellen vertrauenswürdig sind und führen Sie eine sorgfältige Prüfung durch, um zu überprüfen, ob sie Ihren Datenanforderungen entsprechen.

Amy Groden-Morrison hat mehr als 15 Jahre in Führungspositionen für Marketingkommunikation bei Unternehmen wie TIBCO Software, RSA Security und Ziff-Davis gearbeitet. Zu ihren bisherigen Erfolgen gehören die Einrichtung des ersten Co-Branding-Technologieprogramms mit CNN, der Launch einer Veranstaltungsunternehmen an der NYSE, die Neupositionierung eines an der NASDAQ gelisteten Unternehmens inmitten einer Krise und die Positionierung und Vermarktung eines Startups im Raum Boston für eine erfolgreiche Übernahme. Derzeit ist sie VP of Marketing und Sales Operation bei Alpha Software.