Myslitelé
Proč kvalita dat rozhoduje o tom, zda podnikový AI uspěje nebo selže

Od doby, kdy OpenAI představil ChatGPT na konci roku 2022, se každá společnost snaží urychlit své aktivity v oblasti AI. Velcí hráči na trhu s hardwarem, jako je Nvidia, prodávají více GPU než kdykoli předtím, zatímco velké společnosti, jako je OpenAI a Anthropic, pokračují ve vývoji stále větších modelů.
A přesto, i přes nejmodernější modely a největší rozpočty, mnoho projektů AI selhává. Viděli jsme to ve všech odvětvích, od zdravotnictví po dopravu a finance. Důvod není složitý: AI je tak dobrá, jak jsou data, na kterých byla trénována, a data, která dostává v reálném čase. Když tato data jsou špatně označena, zastaralá nebo neúplná, žádný model nemůže poskytnout konzistentní nebo důvěryhodné výsledky.
A to je velký problém, se kterým se mnoho společností potýká dnes. Investují velké částky do nástrojů AI, zatímco jejich systémy pro správu dat zůstávají rozptýlené a nespolehlivé. Výsledkem je iluze pokroku. Zatímco modely poskytují působivá řešení, jsou často založena na slabých základech. Skutečná bariéra pro úspěch AI není výkon modelu. Je to kvalita dat.
Co skutečně znamená dobrá data
Dobrá data nejsou pouze o přesnosti. Znamená to informace, které jsou aktuální, úplné a relevantní pro daný problém. Představte si zákazníka, který se snaží zrušit objednávku na e-commerce stránce. Systém musí zkontrolovat detaily objednávky, stav dodání a platební záznam. Pokud některá z těchto dat žijí v různých systémech, které nemluví spolu, AI asistent nebude schopen poskytnout užitečnou odpověď.
Dobrá data spojují tyto body okamžitě. Umožňují AI vidět úplný obraz, místo pouze fragmentů. Špatná data, na druhé straně, nutí model hádat. A když AI začne hádat, dělá chyby, které stojí peníze a poškozují důvěru. Nedávné příklady ukazují, jak nebezpečné takové předpoklady mohou být.
Chatbot pro podniky v New Yorku poskytl nelegální rady, protože čerpal z zastaralých nebo neúplných právních informací. Zákaznický bot Air Canada učinil falešné nároky na refundaci, protože mu chyběl kontext z firemní politiky. I velké systémy pro nábor zaměstnanců nesprávně filtrovaly kandidáty kvůli zaujatým nebo špatně označeným datům, jak je vidět v prvním AI souvisejícím vyrovnání EEOC. Tyto selhání nejsou pouze technická. Jsou to reputační a finanční, a pocházejí z AI systémů, které byly trénovány na nespolehlivých datech.
Průmyslové studie potvrzují rozsah tohoto problému. Gartner uvádí, že 80 procent projektů AI selhává při škálování kvůli špatné kvalitě a správě dat. Podobně, průzkum MIT Sloan Management Review zjistil, že problémy s daty, ne algoritmy, jsou hlavní důvod, proč projekty AI selhávají.
Kultura je stejně důležitá jako kód
Zlepšení kvality dat není něco, co můžete opravit pomocí jediného nástroje nebo příkazu. Vyžaduje kulturní změnu. Proto musí lídři podniků pohlížet na data jako na živý systém, který potřebuje péči a odpovědnost. To není pouze o tom, že prohlašujete, že chcete “zlepšit data” – to nestačí. Každá část organizace musí pochopit, jak se informace pohybují, kdo je vlastní, a co se stane, když se změní.
Viděli jsme, jak se to projevuje v reálných systémech. Mnoho aplikací AI závisí na nočních aktualizacích dat. Pokud vaše databáze aktualizuje jednou denně, znalosti modelu budou vždy zaostávat za realitou. V rychle se měnících prostředích může tento zpoždění znamenat zastaralé poznatky a špatná rozhodnutí. Společnosti potřebují přehodnotit celý tok dat, od toho, jak se informace sbírají, až po to, jak se dodávají modelu.
Činění tohoto dobře může ušetřit enormní čas a náklady. Když jsou datové potrubí navrženy s jasností a účelem, systémy AI mohou se učit a jednat na základě nejaktuálnějších a nejrelevantnějších informací. Když nejsou, týmy tráví více času čištěním dat než jejich používáním.
Odborníci na správu dat často poukazují na to, že klíčem k silné kvalitě dat je zpětná vazba mezi lidmi, procesy a platformami. Bez této zpětné vazby se informace stávají zastaralými a modely ztrácejí kontakt s reálnými podmínkami – problém, který je někdy nazýván “datový drift”.
Rovnováha mezi rychlostí a integritou
Často existuje napětí mezi rychlým pohybem a zachováním přesnosti. Mnoho organizací chce okamžitých výsledků od svých investic do AI, ale spěchání může vést k větším problémům později. Cílem by mělo být dosažení datové agilitě s integritou. Jinými slovy, budování systémů, které mohou pohybovat rychle bez ztráty přesnosti.
Pro tento účel by každá společnost měla definovat jasnou cestu pro tok dat z jejich zdroje do modelu v reálném čase. Také pomáhá definovat, jaký typ informací je povolen a co musí zůstat mimo. Citlivá nebo soukromá data by nikdy neměla dosáhnout modelu, i když uživatel technicky má přístup k nim. Ochrana této hranice buduje důvěru a brání AI systémům v úniku nebo zneužití informací.
Jak se AI stává více autonomní, lidský dohled zůstává kritický. Model by neměl mít plnou kontrolu nad obchodními akcemi. Určitě by také neměl dělat žádné rozhodnutí. Místo toho by měl dělat žádosti. Ještě důležitější je, že lidé musí vždy kontrolovat a schvalovat jeho akce, aby se ujistili, že jsou v souladu s firemní politikou a regulacemi.
Stavba kvality od základu
Udržování kvality dat v měřítku není pouze otázkou čištění chyb. Začíná to architekturou. Musíte identifikovat, kde žijí vaše nejspolehlivější data, a navrhnout systém, který je spojí do jednoho důvěryhodného místa. Odtud můžete sledovat, která data model používá a odkud pocházejí.
Tento přístup brání zmatku a udržuje systém transparentní. Také pomáhá týmům rychleji řešit problémy, když něco goes wrong. Když víte přesně, která data nakrmila odpověď modelu, můžete ověřit a opravit problémy, než se rozšíří.
Budoucnost podnikového AI bude patřit společnostem, které integrují kvalitu do své infrastruktury jako výchozí hodnotu. Očekáváme, že uvidíme více systémů AI, které zpracovávají både rozumnou a datové integraci v jednom balíčku. Tyto “AI spotřebiče” by mohly usnadnit organizacím nasazení chytrých systémů bez ztráty kontroly nad svými daty.
Analytici předpovídají, že organizace, které jsou schopny sjednotit a spravovat svá data efektivně, uvidí rychlejší přijetí a vyšší návratnost z investic do projektů AI. Nedávná zpráva o připravenosti dat vysvětluje, že tato schopnost odděluje společnosti, které inovují neustále, od těch, které zastavují po počátečních pilotních projektech. Rozdíl často spočívá v tom, zda jejich systémy AI jsou postaveny na konzistentních, dobře strukturovaných informacích.
Závěrečné shrnutí
Kvalita dat může být nezajímavá ve srovnání s průlomovými objevy v návrhu modelu, ale je to tichá síla, která rozhoduje, zda AI uspěje nebo selže. Bez čistých, aktuálních a konzistentních dat, i nejchytřejší systémy budou váznout. S nimi, i skromné projekty AI mohou vytvářet trvalou hodnotu.
Každý lídr, který investuje do AI, by měl položit jednoduchou otázku: Důvěřujeme datům, která řídí naše rozhodnutí? Z toho, co jsme viděli, společnosti, které mohou s jistotou odpovědět “ano”, jsou ty, které již vedou v AI závodě.












