Vordenker

Der Hohe Preis von Schlechten Daten in der AI-Entwicklung

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Es ist kein Geheimnis, dass es einen modernen Goldrausch in der AI-Entwicklung gibt. Laut dem 2024 Work Trend Index von Microsoft (MSFT ) und Linkedin erwarten über 40% der Geschäftsführer, ihre Geschäftsprozesse in den nächsten Jahren von Grund auf mit künstlicher Intelligenz (AI) umzubauen. Diese seismische Veränderung ist nicht nur ein technologischer Aufbau, sondern eine grundlegende Transformation, wie Unternehmen operieren, Entscheidungen treffen und mit Kunden interagieren. Diese schnelle Entwicklung treibt die Nachfrage nach Daten und ersten Partei-Datenmanagement-Tools an. Laut Forrester planen 92% der Technologie-Führer, ihre Datenmanagement- und AI-Budgets im Jahr 2024 zu erhöhen.

Im neuesten McKinsey Global Survey on AI gaben 65% der Befragten an, dass ihre Organisationen regelmäßig generative AI-Technologien verwenden. Während diese Adoption einen bedeutenden Sprung nach vorne darstellt, hebt sie auch eine kritische Herausforderung hervor: die Qualität der Daten, die diese AI-Systeme speisen. In einer Branche, in der effektive AI nur so gut ist wie die Daten, auf denen sie trainiert wird, wird zuverlässige und genaue Daten immer schwerer zu finden.

Der Hohe Preis von Schlechten Daten

Schlechte Daten sind kein neues Problem, aber ihre Auswirkungen sind im Zeitalter der AI verstärkt. Im Jahr 2017 schätzte eine Studie des Massachusetts Institute of Technology (MIT), dass schlechte Daten Unternehmen einen atemberaubenden 15% bis 25% ihres Umsatzes kosten. Im Jahr 2021 schätzte Gartner, dass schlechte Daten Unternehmen im Durchschnitt 12,9 Millionen Dollar pro Jahr kosten.

Schmutzige Daten – Daten, die unvollständig, ungenau oder inkonsistent sind – können eine Kaskade von Auswirkungen auf AI-Systeme haben. Wenn AI-Modelle mit schlechten Daten trainiert werden, sind die resultierenden Erkenntnisse und Vorhersagen grundlegend fehlerhaft. Dies untergräbt nicht nur die Effektivität von AI-Anwendungen, sondern birgt auch erhebliche Risiken für Unternehmen, die auf diese Technologien für kritische Entscheidungen angewiesen sind.

Dies verursacht ein großes Problem für Unternehmens-Datenwissenschaftler, die ihre begrenzten Ressourcen immer mehr auf die Reinigung und Organisation von Daten konzentrieren müssen. In einem jüngsten State of Engineering Report von DBT gaben 57% der Datenwissenschaftler an, dass schlechte Datenqualität ein vorherrschendes Problem in ihrer Arbeit ist.

Die Auswirkungen auf AI-Modelle

Die Auswirkungen von schlechten Daten auf die AI-Entwicklung manifestieren sich auf drei Hauptweisen:

  1. Reduzierte Genauigkeit und Zuverlässigkeit: AI-Modelle gedeihen an Mustern und Korrelationen, die aus Daten abgeleitet werden. Wenn die Eingabedaten verunreinigt sind, produzieren die Modelle unzuverlässige Ausgaben; allgemein bekannt als “AI-Halluzinationen”. Dies kann zu irreführenden Strategien, Produktfehlern und Verlust von Kundenvertrauen führen.
  2. Verstärkung von Vorurteilen: Schlechte Daten enthalten oft Vorurteile, die, wenn sie nicht kontrolliert werden, in AI-Algorithmen eingebettet werden. Dies kann zu diskriminierenden Praktiken führen, insbesondere in sensiblen Bereichen wie Einstellung, Kreditvergabe und Strafverfolgung. Wenn beispielsweise ein AI-Rekrutierungstool mit voreingenommenen historischen Einstellungsdaten trainiert wird, kann es bestimmte Demografien gegenüber anderen bevorzugen.
  3. Erhöhte Betriebskosten: Fehlerhafte AI-Systeme erfordern ständige Anpassungen und erneutes Training, was zusätzliche Zeit und Ressourcen verbraucht. Unternehmen können sich in einem endlosen Kreis von Fehlern beheben und nicht innovieren oder verbessern.

Die Kommende Datapokalypse

“Wir nähern uns schnell einem “Umbruchpunkt”, an dem nicht-menschlich generierte Inhalte die Menge menschlich generierter Inhalte übersteigen werden. Fortschritte in der AI selbst liefern neue Werkzeuge für die Datenreinigung und -validierung. Allerdings wächst die Menge an AI-generierten Inhalten im Internet exponentiell.

Wenn immer mehr AI-generierte Inhalte ins Internet gestellt werden und diese Inhalte von LLMs generiert werden, die auf AI-generierten Inhalten trainiert wurden, sehen wir eine Zukunft, in der erste Partei- und vertrauenswürdige Daten gefährdete und wertvolle Güter werden.

Die Herausforderungen der Datenverwässerung

Die Verbreitung von AI-generierten Inhalten schafft mehrere große Branchenherausforderungen:

  • Qualitätskontrolle: Die Unterscheidung zwischen menschlich generierten und AI-generierten Daten wird immer schwieriger, was es schwieriger macht, die Qualität und Zuverlässigkeit der Daten zu gewährleisten, die für die Ausbildung von AI-Modellen verwendet werden.
  • Urheberrechtsfragen: Wenn AI-Modelle unbeabsichtigt AI-generierte Inhalte scannen und lernen, ergeben sich Fragen über das Eigentum und die Rechte, die mit den Daten verbunden sind, was möglicherweise zu rechtlichen Komplikationen führen kann.
  • Ethische Auswirkungen: Der Mangel an Transparenz über die Herkunft der Daten kann zu ethischen Problemen führen, wie der Verbreitung von Fehlinformationen oder der Verstärkung von Vorurteilen.

Daten-als-Dienstleistung wird grundlegend

Immer mehr Daten-als-Dienstleistungs-Lösungen (DaaS) werden gesucht, um erste Partei-Daten für Trainingszwecke zu ergänzen und zu verbessern. Der wahre Wert von DaaS liegt in den Daten selbst, die normalisiert, gereinigt und für verschiedene Fidelitäts- und kommerzielle Anwendungsfälle bewertet wurden, sowie in der Standardisierung der Prozesse, um sie an das System anzupassen, das die Daten verarbeitet. Wenn diese Branche reift, werde ich vorhersagen, dass wir eine Standardisierung in der gesamten Datenbranche sehen werden. Wir sehen bereits einen Druck auf Uniformität im Einzelhandelsmedien-Sektor.

Wenn die AI weiterhin verschiedene Branchen durchdringt, wird die Bedeutung der Datenqualität nur zunehmen. Unternehmen, die saubere Daten priorisieren, werden einen Wettbewerbsvorteil erlangen, während diejenigen, die dies vernachlässigen, schnell zurückfallen werden.

Der hohe Preis von schlechten Daten in der AI-Entwicklung ist ein dringendes Problem, das nicht ignoriert werden kann. Schlechte Datenqualität untergräbt die Grundlage von AI-Systemen, was zu fehlerhaften Erkenntnissen, erhöhten Kosten und potenziellen ethischen Fallstricken führt. Durch die Einführung umfassender Datenmanagement-Strategien und die Förderung einer Kultur, die Datenintegrität schätzt, können Organisationen diese Risiken mindern.

In einer Ära, in der Daten das neue Öl sind, ist die Gewährleistung ihrer Reinheit nicht nur eine technische Notwendigkeit, sondern ein strategisches Gebot. Unternehmen, die heute in saubere Daten investieren, werden diejenigen sein, die die Innovationsfront morgen führen.

Eli Goodman ist CEO und Mitgründer von Datos, einer Semrush-Unternehmen. Mit über 25 Jahren Erfahrung im digitalen und Datenbereich hat Eli Führungspositionen in verschiedenen alternativen Datenunternehmen innegehabt, darunter eine 9-jährige Tätigkeit bei ComScore.