Liderzy opinii
Gdy “wiedza” AI ma 50 lat: ryzyko zgodności, którego nie można zignorować

Problem fałszywych wglądów AI jest pilnym wyzwaniem, gdy przedsiębiorstwa zwiększają swoje wykorzystanie generatywnych narzędzi. Pomimo powszechnego entuzjazmu dla adopcji AI, istnieje również silny nurt krytyki. Krytyczni komentatorzy często wskazują na pozornie losowe, nieprzewidywalne nieścisłości w danych wyjściowych AI, które podważają jego wartość – i mogą nawet stanowić realne zagrożenie dla ludzi, szczególnie w sektorach takich jak opieka zdrowotna i transport, gdzie fałszywe dane wyjściowe mogą teoretycznie prowadzić do wszystkiego, od niewłaściwego przepisu do pociągów na kursie kolizyjnym.
Często te nieścisłości są przypisywane do “halucynacji” AI – przypadków, w których AI generuje “najlepszą” odpowiedź, przekazywaną z taką samą pewnością, jak “prawdziwa” odpowiedź, zamiast informować użytkownika o lukach w jego wiedzy lub możliwościach. Halucynacje mogą być trudne do wykrycia na pierwszy rzut oka – ale istnieje cichszy, równie poważny problem, który jest jeszcze trudniejszy do wykrycia.
Dług jakości danych: achillesowa pięta AI
Gdy systemy AI korzystają z nieaktualnych, niekompletnych lub nieprecyzyjnych danych, pojawiają się fałszywe dane wyjściowe, ale są mniej natychmiastowo rozpoznawalne. Na przykład, możesz poprosić AI o identyfikację objawów choroby i otrzymać odpowiedź opartą na 50-letnim artykule, a nie na bieżących badaniach. Wynik jest mało prawdopodobny, aby wyglądał na oczywiście, śmiesznie błędny – ale ta początkowa powłoka prawdopodobieństwa stanowi realne ryzyko zarówno dla pacjenta, jak i dla dostawcy opieki zdrowotnej.
To samo dotyczy wszystkich branż – jeśli dane dostarczane do modelu AI zawierają stare, nieaktualne lub częściowe informacje, istnieje wysokie ryzyko fałszywych danych wyjściowych. A gdy więcej firm integruje AI z procesami biznesowymi, rośnie ryzyko wyciągania fałszywych wniosków z niezarządzanych danych.
Dokładność dla regulatora
To nie jest tylko problem dla codziennych operacji – to również znaczące wyzwanie zgodności. Wymagania regulacyjne ewoluują szybko, aby rozwiązać problemy związane z nieprecyzyjnym AI. Na przykład, wiele wczesnych działań regulacyjnych w zakresie AI miało miejsce; szczególnie gdy Włochy tymczasowo zakazały ChatGPT ze względu na obawy dotyczące prywatności, a Europejska Rada Ochrony Danych uruchomiła specjalną grupę zadaniową w celu koordynowania potencjalnych działań prawnych wobec ChatGPT.
Jedną z najbardziej wymownych zmian regulacyjnych było uchwalenie unijnego aktu AI, pierwszego kompleksowego prawnego ramy dla AI. Akt określa obowiązki oparte na poziomie ryzyka systemów AI, od systemów o “nieakceptowalnym ryzyku”, które są zabronione, do systemów o “wysokim ryzyku”, które podlegają surowym wymogom dotyczącym przejrzystości, jakości danych, zarządzania i nadzoru ludzkiego.
Znaczenie unijnego aktu AI nie leży w jego ambitnym zakresie, ale ważnie w precedensie, który ustanawia. Regulatorzy wyraźnie wskazują, że AI będzie podlegać wiążącym, egzekwowalnym przepisom, a organizacje muszą traktować zgodność i przejrzystość w odniesieniu do miejsca i sposobu wykorzystania AI jako integralną część adopcji AI, a nie jako późniejsze rozważanie.
Akt ma szeroki zakres, z potencjałem wpływu na dużą część rozwoju AI. Jego sercem jest zapewnienie bezpieczeństwa AI, szanując jednocześnie podstawowe prawa i wartości. W ramach tego nowego ekosystemu opartego na zasadach następuje diagnoza potencjalnych źródeł nieścisłości AI, w tym danych i zbiorów danych, które zasilają modele, nieprzezroczystość modeli i dostęp, oraz projektowanie systemów i ich wykorzystanie. Rozwiązania AI są konstrukcją wszystkich trzech – problemy z którymkolwiek z nich mogą mieć negatywny wynik. Co więcej, dane, które wprowadza się do projektowania, rozwoju, wdrożenia i eksploatacji AI, najprawdopodobniej składają się głównie z biznesowych rekordów, które same podlegają różnym wymogom zgodności.
Innymi słowy, środowisko regulacyjne wokół AI staje się coraz bardziej surowe – i to samo dotyczy danych wejściowych, jak i danych wyjściowych, chociaż te ostatnie otrzymują więcej nagłówków.
Pięć kroków do zasilania AI zgodnymi, bieżącymi i istotnymi danymi
Aby rozwiązać to podwójne wyzwanie – zapewnienie zarówno zgodnego zarządzania danymi, jak i wysokiej jakości danych wejściowych, które umożliwiają wysokiej jakości dane wyjściowe – przedsiębiorstwa muszą mieć kontrolę nad danymi szkoleniowymi i inferencyjnymi. Niestety, to jest coś, czego wiele przedsiębiorstw nadal brakuje.
Przynajmniej organizacje powinny stosować swoje ogólne programy zgodności i zarządzania do inicjatyw AI. Muszą zacząć rejestrować i przechowywać odpowiednie rekordy dotyczące danych, które dostarczają do modeli AI, jak modele i systemy są projektowane, a także decyzje i treści generowane za pomocą AI.
Jednak jest również coraz bardziej krytyczne, aby organizacje poszły o krok dalej i zapewniły pełną kontrolę nad wszystkimi danymi, które mogą być wykorzystywane w wdrożeniach AI, zarówno do szkolenia, jak i do “na żywo” pracy. To wymaga wysokiej jakości strategii zarządzania danymi i przechowywania, zapewniającej, że wszystkie istotne dane są inteligentnie zbierane, oczyszczone, przechowywane, sklasyfikowane i uprawnione. Aby to osiągnąć, organizacje muszą wziąć pod uwagę cztery kluczowe kroki:
1. Pochodzenie i wywodzenie danych
Obejmuje to utrzymanie rekordu źródła danych, ich pochodzenia, własności i wszelkich zmian w metadanych (jeśli dozwolone) w całym cyklu życia. Oznacza to również utrzymanie bogatych metadanych i wszystkich podstawowych dokumentów lub artefaktów, z których są one pochodzą.
2. Autentyczność danych
Wymaga utrzymania wyraźnej łańcuchu posiadania dla wszystkich danych, przechowywania obiektów w ich rodzimych formach i hashowania obiektów otrzymanych w celu udowodnienia, że dane pozostają niezmienione. Ponadto organizacje muszą utrzymywać pełną historię audytu dla każdego obiektu i wszystkich działań i zdarzeń dotyczących zmian.
3. Klasyfikacja danych
Ustanowienie natury zestawu lub typu danych jest ważne. Organizacje muszą być w stanie zarządzać strukturalnymi danymi, półstrukturalnymi danymi i strukturalnymi zestawami danych. Nadając każdej klasie unikalną schemę, organizacje mogą zarządzać różnorodnymi zestawami danych bez jednego, sztywnego ontology – unikając niepotrzebnego manipulowania danymi, aby je wymusić w sztywną strukturę danych.
4. Normalizacja danych
Ustanowienie wspólnych definicji i formatów metadanych jest ważne do wykorzystania w analizach i rozwiązaniach AI. Wyraźnie zdefiniowane schematy są ważnym elementem, wraz z narzędziami, które mogą transformować lub mapować dane w celu utrzymania spójnych, znormalizowanych widoków pokrewnych danych.
5. Uprawnienia danych
Przedsiębiorstwa potrzebują szczegółowych kontroli uprawnień, w tym na poziomie obiektu lub pola, opartych na profilach użytkowników lub systemów. Oznacza to, że odpowiednie dane są dostępne dla użytkowników i systemów, które są uprawnione do dostępu do nich, podczas gdy ogranicza lub limituje dostęp do tych, którzy nie są.
Z tymi kluczowymi elementami na miejscu, przedsiębiorstwa będą najlepiej przygotowane do zapewnienia, że dane dostarczane do modeli AI są zarówno wysokiej jakości, jak i zgodne. AI będzie napędzać poprawy i efektywność w różnych branżach – ale aby to się stało, potrzebna jest solidna podstawa danych.












