Myslitelé

Vysoké náklady na špinavá data v AI vývoji

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Je všeobecně známo, že v současné době probíhá v AI vývoji moderní zlatá horečka. Podle 2024 Work Trend Index od Microsoftu a Linkedin, více než 40 % lídrů podniků očekává, že kompletně přepracují své obchodní procesy od základu pomocí umělé inteligence (AI) v příštích několika letech. Tato seismická změna není pouze technologickým upgradem; je to fundamentální transformace toho, jak podniky fungují, dělají rozhodnutí a komunikují se zákazníky. Tato rychlá vývojová aktivita vytváří poptávku po datech a nástrojích pro správu první strany dat. Podle Forresteru, úžasných 92 % technologických lídrů plánuje zvýšit své rozpočty na správu dat a AI v roce 2024.

(MSFT )

V nejnovějším McKinsey Global Survey on AI, 65 % respondentů uvedlo, že jejich organizace pravidelně využívají generativní AI technologie. Zatímco tato adopce představuje významný skok vpřed, také zdůrazňuje kritickou výzvu: kvalitu dat, která krmí tyto AI systémy. V odvětví, kde efektivní AI je pouze tak dobrá, jako data, na kterých je trénována, spolehlivá a přesná data se stávají stále obtížněji dostupnými.

Vysoké náklady na špatná data

Špatná data nejsou novým problémem, ale jejich dopad je zesílen v éře AI. Již v roce 2017 odhadovala studie Massachusettského technologického institutu (MIT), že špatná data stojí společnosti úžasných 15 % až 25 % jejich příjmů. V roce 2021 Gartner odhadl, že špatná data stojí organizace v průměru 12,9 milionu dolarů ročně.

Špinavá data – data, která jsou neúplná, nepřesná nebo nekonzistentní – mohou mít kaskádový efekt na AI systémy. Když jsou AI modely trénovány na špatných datech, výsledné přehledy a předpovědi jsou fundamentálně vadné. To nejenom podkopává účinnost AI aplikací, ale také představuje významná rizika pro podniky, které se na tyto technologie spoléhají pro kritická rozhodnutí.

To vytváří velkou bolest hlavy pro firemní datové vědecké týmy, které musely stále více zaměřovat své omezené zdroje na čištění a organizování dat. V nedávném státním inženýrském reportu provedeném DBT, 57 % datových vědců uvedlo, že špatná kvalita dat je dominantním problémem ve své práci.

Dopady na AI modely

Dopad špatných dat na AI vývoj se projevuje třemi hlavními způsoby:

  1. Snižování přesnosti a spolehlivosti: AI modely prosperují na vzorcích a korelacích odvozených z dat. Když jsou vstupní data znečištěna, modely produkují nespolehlivé výstupy; široce známé jako „AI halucinace“. To může vést k mylným strategiím, produktovým selháním a ztrátě zákaznické důvěry.
  2. Zesílení biasu: Špatná data často obsahují biasy, které, když nejsou kontrolovány, jsou vštěpovány do AI algoritmů. To může vést k diskriminačním praktikám, zejména v citlivých oblastech, jako je nábor, půjčování a vymáhání práva. Například, pokud je AI náborový nástroj trénován na zaujatých historických náborových datech, může nespravedlivě upřednostňovat určitou demografii před ostatními.
  3. Zvýšení provozních nákladů: Vadné AI systémy vyžadují neustálé úpravy a opětovné trénování, což spotřebuje další čas a zdroje. Společnosti se mohou ocitnout v permanentním cyklu opravování chyb místo inovace a zlepšování.

Přiblížení se Datapokalypse

„Jsme rychle blížící se k „bodu zlomu“ – kde nehumánně generovaný obsah bude výrazně převyšovat množství humánně generovaného obsahu. Pokroky v AI samy o sobě poskytují nové nástroje pro čištění a ověřování dat. Avšak obrovské množství AI-generovaného obsahu na webu roste exponenciálně.

Jak je více AI-generovaného obsahu publikováno na webu a tento obsah je generován LLMs trénovanými na AI-generovaném obsahu, díváme se na budoucnost, kde první strany a důvěryhodná data se stávají ohroženými a cennými komoditami.

Výzvy datové diluce

Šíření AI-generovaného obsahu vytváří několik hlavních průmyslových výzev:

  • Kontrola kvality: Rozlišení mezi humánně generovanými a AI-generovanými daty se stává stále obtížnějším, což činí zajištění kvality a spolehlivosti dat pro trénování AI modelů obtížnějším.
  • Otázky duševního vlastnictví: Jak AI modely neúmyslně scrapují a učí se z AI-generovaného obsahu, vznikají otázky týkající se vlastnictví a práv spojených s daty, což může vést k právním komplikacím.
  • Etické důsledky: Nedostatek transparentnosti ohledně původu dat může vést k etickým problémům, jako je šíření dezinformací nebo posílení biasů.

Data-as-a-Service se stává fundamentální

Stále více se hledají Data-as-a-Service (DaaS) řešení, aby doplnila a vylepšila první strany dat pro trénovací účely. Skutečná hodnota DaaS spočívá v datech, která byla normalizována, vyčištěna a vyhodnocena pro různé úrovně věrnosti a komerční použití, jakož i standardizace procesů pro systém, který data tráví. Jak se tento průmysl zraje, předpovídám, že brzy uvidíme tuto standardizaci napříč datovým průmyslem. Už nyní vidíme tento tlak na uniformitu v maloobchodním médiu.

Jak AI pokračuje ve svém pronikání do různých odvětví, význam kvality dat bude ještě více zesílen. Společnosti, které dávají prioritu čistým datům, získají konkurenční výhodu, zatímco ty, které ji zanedbávají, se velmi rychle ocitnou pozadu.

Vysoké náklady na špinavá data v AI vývoji jsou naléhavou otázkou, kterou nelze ignorovat. Špatná kvalita dat podkopává samotné základy AI systémů, vedoucí k vadným přehledům, zvýšeným nákladům a potenciálním etickým pastem. Přijetím komplexních strategií pro správu dat a vytvářením kultury, která si váží integritu dat, mohou organizace tyto rizika zmírnit.

V éře, kde data jsou novým olejem, zajištění jejich čistoty není pouze technickou nutností, ale strategickou imperativem. Společnosti, které investují do čistých dat dnes, budou těmi, které povedou inovační hranu zítřka.

Eli Goodman je CEO a spoluzakladatel Datos, společnosti Semrush. S více než 25 lety zkušeností v digitálním a datovém prostoru zastával Eli vedoucí role v různých alternativních datových společnostech, včetně 9letého působení ve společnosti ComScore.