Liderzy opinii

Wpływ jakości danych na wdrożenie sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Technologie sztucznej inteligencji i uczenia maszynowego mogą znacząco przynieść korzyści przedsiębiorstwom wszystkich rozmiarów. Zgodnie z raportem McKinsey, firmy, które wykorzystują technologie sztucznej inteligencji, podwoją swój przepływ gotówki do 2030 roku. Odwrotnie, firmy, które nie wdrożą sztucznej inteligencji, będą świadkami 20% redukcji przepływu gotówki. Jednak takie korzyści wykraczają poza finanse. Sztuczna inteligencja może pomóc firmom zwalczyć braki siły roboczej. Sztuczna inteligencja znacząco poprawia również doświadczenia klientów i wyniki biznesowe, czyniąc firmy bardziej niezawodnymi.

Ponieważ sztuczna inteligencja ma tak wiele zalet, dlaczego nie wszyscy ją przyjmują? W 2019 roku badanie PwC ujawniło, że 76% firm planuje wykorzystać sztuczną inteligencję, aby poprawić wartość swojego biznesu. Jednak tylko 15% ma dostęp do wysokiej jakości danych, aby osiągnąć swoje cele biznesowe. Inne badanie przeprowadzone przez Refinitiv sugeruje, że 66% respondentów stwierdziło, iż niska jakość danych utrudnia im wdrożenie i skuteczne wykorzystanie sztucznej inteligencji.

Badanie wykazało, że trzy największe wyzwania związane z pracą z technologiami sztucznej inteligencji i uczenia maszynowego dotyczą – „dokładnych informacji o zakresie, historii i populacji danych”, „identyfikacji niekompletnych lub uszkodzonych rekordów” oraz „czyszczenia i normalizacji danych”. To pokazuje, że niska jakość danych jest główną przeszkodą dla firm w uzyskaniu wysokiej jakości analiz opartych na sztucznej inteligencji.

Dlaczego dane są tak ważne?

Istnieje wiele powodów, dla których jakość danych jest kluczowa w wdrożeniu sztucznej inteligencji. Oto niektóre z najważniejszych:

1. Śmieci na wejściu, śmieci na wyjściu

Jest dość prosto zrozumieć, że wynik zależy głównie od danych wejściowych. W tym przypadku, jeśli zestawy danych są pełne błędów lub są tendencyjne, wynik również będzie nietoczny. Większość problemów z danymi nie dotyczy ilości danych, ale jakości danych, które wprowadza się do modelu sztucznej inteligencji. Jeśli masz niskiej jakości dane, Twoje modele sztucznej inteligencji nie będą działać prawidłowo, niezależnie od ich jakości.

2. Nie wszystkie systemy sztucznej inteligencji są równe

Kiedy myślimy o zestawach danych, zwykle myślimy w kategoriach danych ilościowych. Istnieją jednak również dane jakościowe w postaci filmów, wywiadów, opinii, zdjęć itp. W systemach sztucznej inteligencji dane ilościowe są ustrukturyzowane, a dane jakościowe są nieustrukturyzowane. Nie wszystkie modele sztucznej inteligencji mogą obsługiwać oba rodzaje danych. Dlatego wybór odpowiedniego rodzaju danych dla odpowiedniego modelu jest niezbędny, aby uzyskać oczekiwany wynik.

3. Jakość a ilość

Uważa się, że systemy sztucznej inteligencji muszą spożywać duże ilości danych, aby się od nich uczyć. W debacie na temat jakości versus ilości, preferowana jest zwykle ilość. Jednak jeśli zestawy danych są wysokiej jakości, ale krótkie, dają one pewność, że wynik jest istotny i solidny.

4. Cechy dobrego zestawu danych

Cechy dobrego zestawu danych mogą być subiektywne i zależą głównie od aplikacji, której służy sztuczna inteligencja. Istnieją jednak pewne ogólne cechy, które należy szukać podczas analizy zestawów danych.

  • Pełność: Zestaw danych musi być kompletny, bez pustych komórek lub luk. Każda komórka powinna zawierać dane.
  • Całościowość: Zestawy danych powinny być jak najbardziej całościowe. Na przykład, jeśli szukasz wektora zagrożeń cybernetycznych, musisz mieć wszystkie niezbędne profile i informacje.
  • Spójność: Zestawy danych muszą pasować do określonych zmiennych, które im przydzielono. Na przykład, jeśli modelujesz pudełka, Twoje wybrane zmienne (plastik, papier, tektura itp.) muszą mieć odpowiednie dane cenowe, aby pasować do tych określonych kategorii.
  • Dokładność: Dokładność jest kluczem do dobrego zestawu danych. Wszystkie informacje, które wprowadzasz do modelu sztucznej inteligencji, muszą być godne zaufania i całkowicie dokładne. Jeśli duże części Twoich zestawów danych są błędne, Twój wynik również będzie niedokładny.
  • Unikalność: Ten punkt jest podobny do spójności. Każdy punkt danych musi być unikalny dla zmiennej, której służy. Na przykład, nie chcesz, aby cena folii plastikowej wpadła do innej kategorii opakowań.

Gwarantowanie jakości danych

Istnieje wiele sposobów, aby zagwarantować, że jakość danych jest wysoka, takich jak upewnienie się, że źródło danych jest godne zaufania. Oto niektóre z najlepszych technik, aby upewnić się, że otrzymujesz najlepsze dane dla swoich modeli sztucznej inteligencji:

1. Profilowanie danych

Profilowanie danych jest niezbędne do zrozumienia danych przed ich użyciem. Profilowanie danych oferuje wgląd w rozkład wartości, maksymalne, minimalne, średnie wartości i odstępstwa. Dodatkowo, pomaga w identyfikowaniu nieścisłości w danych. Profilowanie danych pomaga zrozumieć, czy zestaw danych jest przydatny, czy nie.

2. Ocena jakości danych

Korzystając z centralnej biblioteki predefiniowanych reguł jakości danych, można zwalidować każdy zestaw danych. Jeśli masz katalog danych z wbudowanymi narzędziami, możesz ponownie wykorzystać te reguły, aby zwalidować nazwy klientów, adresy e-mail i kody produktów. Dodatkowo, możesz również wzbogacić i standaryzować niektóre dane.

3. Monitorowanie i ocena jakości danych

Naukowcy mają wcześniej obliczoną jakość danych dla większości zestawów, które chcą wykorzystać. Mogą zawęzić to, aby zobaczyć, jaki konkretny problem ma atrybut, i zdecydować, czy go wykorzystać, czy nie.

4. Przygotowanie danych

Badacze i naukowcy zwykle muszą nieco dostosować dane, aby przygotować je do modelowania sztucznej inteligencji. Ci badacze potrzebują łatwych w użyciu narzędzi, aby sparsować atrybuty, transponować kolumny i obliczać wartości z danych.

Świat sztucznej inteligencji ciągle się zmienia. Podczas gdy każda firma wykorzystuje dane w inny sposób, jakość danych pozostaje niezbędna dla każdego projektu wdrożenia sztucznej inteligencji. Jeśli masz niezawodne, dobrej jakości dane, eliminujesz potrzebę ogromnych zestawów danych i zwiększasz szanse na sukces. Podobnie jak wszystkie inne organizacje, jeśli Twoja organizacja przechodzi w kierunku wdrożenia sztucznej inteligencji, sprawdź, czy masz dobrej jakości dane. Upewnij się, że Twoje źródła są godne zaufania i wykonaj należytą staranność, aby sprawdzić, czy spełniają one Twoje wymagania dotyczące danych.

Amy Groden-Morrison pełniła funkcje kierownicze w dziedzinie marketingu i komunikacji przez ponad 15 lat w firmach takich jak TIBCO Software, RSA Security oraz Ziff-Davis. Do jej dotychczasowych osiągnięć należą utworzenie pierwszego współbranżowego programu technologicznego z CNN, uruchomienie firmy organizującej wydarzenia na NYSE, przebrandowanie spółki notowanej na NASDAQ w czasie kryzysu oraz pozycjonowanie i marketing startupu z obszaru Bostonu w celu pomyślnego przejęcia. Obecnie pełni funkcję VP Marketingu i Operacji Sprzedaży w firmie Alpha Software.