Liderzy opinii
Jak Przeszkody w AI/ML Mogą Zabić Twoją Strategię i Co Można Zrobić Aby Temu Przeciwdziałać
‘Przeszkody’ w modelach każdego typu opisują sytuację, w której model reaguje nieprecyzyjnie na dane wejściowe lub polecenia, ponieważ nie został przeszkolony na wystarczającej ilości wysokiej jakości, różnorodnych danych, aby zapewnić precyzyjną odpowiedź. Jednym z przykładów może być funkcja odblokowania telefonu za pomocą rozpoznawania twarzy Apple, która nie działała prawidłowo w przypadku osób o ciemniejszym kolorze skóry w porównaniu z osobami o jaśniejszym kolorze skóry. Model nie został przeszkolony na wystarczającej ilości zdjęć osób o ciemniejszym kolorze skóry. Był to dość niskiego ryzyka przykład przeszkód, ale jest to dokładnie powodem, dla którego Unijna ustawa o sztucznej inteligencji wprowadziła wymagania, aby udowodnić skuteczność modelu (i kontrolę) przed wprowadzeniem go na rynek. Modele, których dane wyjściowe wpływają na sytuacje biznesowe, finansowe, zdrowotne lub osobiste, muszą być godne zaufania, w przeciwnym razie nie będą używane.
Rozwiązywanie Problemu Przeszkód z Danymi
Duże Ilości Wysokiej Jakości Danych
Wśród wielu ważnych praktyk zarządzania danymi, kluczowym elementem w pokonywaniu i minimalizowaniu przeszkód w modelach AI/ML jest pozyskanie dużych ilości wysokiej jakości, różnorodnych danych. Wymaga to współpracy z wieloma organizacjami, które posiadają takie dane. Tradycyjnie, pozyskiwanie danych i współpraca są utrudnione przez problemy z ochroną prywatności i/oraz ochroną własności intelektualnej – wrażliwe dane nie mogą być wysłane do właściciela modelu, a właściciel modelu nie może ryzykować ujawnienia swojej własności intelektualnej właścicielowi danych. Częstym rozwiązaniem jest współpraca z danymi syntetycznymi lub mockowymi, które mogą być przydatne, ale mają również ograniczenia w porównaniu z użyciem rzeczywistych, pełnych danych. To jest miejsce, w którym technologie zwiększające prywatność (PETs) zapewniają potrzebne odpowiedzi.
Dane Syntetyczne: Blisko, ale Nie Całkowicie
Dane syntetyczne są generowane sztucznie, aby naśladować rzeczywiste dane. Jest to trudne do wykonania, ale staje się nieco łatwiejsze dzięki narzędziom AI. Dobrej jakości dane syntetyczne powinny mieć takie same odległości cech, jak rzeczywiste dane, w przeciwnym razie nie będą użyteczne. Dobrej jakości dane syntetyczne mogą być użyte do skutecznego zwiększenia różnorodności danych szkoleniowych, wypełniając luki dla mniejszych, zmarginalizowanych populacji lub dla populacji, których dostawca AI po prostu nie ma wystarczających danych. Dane syntetyczne mogą być również użyte do rozwiązania przypadków brzegowych, które mogą być trudne do znalezienia w odpowiednich ilościach w świecie rzeczywistym. Ponadto, organizacje mogą wygenerować zestaw danych syntetycznych, aby spełnić wymagania dotyczące rezydencji danych i prywatności, które blokują dostęp do rzeczywistych danych. To brzmi dobrze; jednak dane syntetyczne są tylko częścią układanki, a nie rozwiązaniem.
Jedną z oczywistych ograniczeń danych syntetycznych jest rozłączenie z rzeczywistym światem. Na przykład, autonomiczne pojazdy szkolone wyłącznie na danych syntetycznych będą miały trudności z rzeczywistymi, nieprzewidzianymi warunkami drogowymi. Ponadto, dane syntetyczne odziedziczą przeszkody z danych rzeczywistych, użytych do ich wygenerowania – co w zasadzie pokonuje cel naszej dyskusji. W podsumowaniu, dane syntetyczne są użyteczną opcją do dostrajania i rozwiązywania przypadków brzegowych, ale znaczące poprawy w skuteczności modelu i minimalizacji przeszkód nadal zależą od dostępu do danych świata rzeczywistego.
Lepszy Sposób: Rzeczywiste Dane za Pomocą Przepływów Zabezpieczonych przez PETs
PETs chronią dane podczas ich użycia. W przypadku modeli AI/ML mogą one również chronić własność intelektualną modelu, który jest uruchamiany – „dwa ptaki, jeden kamień”. Rozwiązania wykorzystujące PETs zapewniają opcję szkolenia modeli na rzeczywistych, wrażliwych zestawach danych, które nie były wcześniej dostępne ze względu na obawy dotyczące prywatności i bezpieczeństwa danych. To odblokowanie przepływów danych do rzeczywistych danych jest najlepszą opcją, aby zmniejszyć przeszkody. Ale jak to działa w praktyce?
Na razie, wiodące opcje zaczynają się od środowiska obliczeniowego o wysokiej poufności. Następnie, integracja z rozwiązaniem opartym na PETs, które jest gotowe do użycia i rozwiązuje wymagania dotyczące zarządzania danymi i bezpieczeństwa, które nie są uwzględnione w standardowym środowisku zaufanym (TEE). Z tym rozwiązaniem, modele i dane są wszystkie zaszyfrowane przed wysłaniem do zabezpieczonego środowiska obliczeniowego. Środowisko może być hostowane w dowolnym miejscu, co jest ważne przy rozwiązywaniu pewnych wymagań dotyczących lokalizacji danych. To oznacza, że zarówno własność intelektualna modelu, jak i bezpieczeństwo danych wejściowych są utrzymane podczas obliczeń – nawet dostawca środowiska zaufanego nie ma dostępu do modeli ani danych wewnątrz niego. Zaszyfrowane wyniki są następnie wysyłane z powrotem do przeglądu, a dzienniki są dostępne do przeglądu.
Ten przepływ odblokowuje najlepsze jakościowo dane, niezależnie od ich pochodzenia i kto je posiada, tworząc ścieżkę do minimalizacji przeszkód i modeli o wysokiej skuteczności, którym możemy zaufać. Ten przepływ jest również tym, co Unijna ustawa o sztucznej inteligencji opisuje w swoich wymaganiach dotyczących piaskownicy regulacyjnej AI.
Ułatwianie Zgodności Etycznej i Prawnej
Pozyskanie dobrych jakościowo, rzeczywistych danych jest trudne. Wymagania dotyczące prywatności i lokalizacji danych natychmiast ograniczają zestawy danych, do których organizacje mają dostęp. Aby innowacje i wzrost mogły się pojawić, dane muszą płynąć do tych, którzy mogą wydobyć z nich wartość.
Artykuł 54 Unijnej ustawy o sztucznej inteligencji określa wymagania dla modeli „wysokiego ryzyka” w zakresie tego, co musi być udowodnione przed ich wprowadzeniem na rynek. Krótko mówiąc, zespoły będą musiały użyć danych świata rzeczywistego w piaskownicy regulacyjnej AI, aby pokazać wystarczającą skuteczność modelu i zgodność z wszystkimi kontrolami określonymi w Tytule III Rozdziale 2. Kontrole obejmują monitorowanie, przejrzystość, wyjaśnialność, bezpieczeństwo danych, ochronę danych, minimalizację danych i ochronę modelu – myśl o DevSecOps + Data Ops.
Pierwszym wyzwaniem będzie znalezienie zestawu danych świata rzeczywistego do użycia – są to z natury wrażliwe dane dla takich typów modeli. Bez gwarancji technicznych, wiele organizacji może wahają się, czy zaufać dostawcy modelu swoimi danymi, czy nie będą mogły tego zrobić. Ponadto, sposób, w jaki ustawa definiuje „piaskownicę regulacyjną AI”, jest sam w sobie wyzwaniem. Niektóre z wymagań obejmują gwarancję, że dane są usunięte z systemu po uruchomieniu modelu, a także kontrole zarządzania, egzekwowanie i raportowanie, aby to udowodnić.
Wiele organizacji próbowało używać gotowych pokoi danych (DCR) i środowisk zaufanych (TEE). Ale, same w sobie, te technologie wymagają znacznego doświadczenia i pracy, aby je operacjonalizować i spełnić wymagania regulacyjne dotyczące danych i AI.
DCR są łatwiejsze w użyciu, ale nie są jeszcze użyteczne dla bardziej zaawansowanych potrzeb AI/ML. TEE to zabezpieczone serwery i nadal wymagają zintegrowanej platformy współpracy, aby być użyteczne, szybko. To jednak identyfikuje okazję dla platform technologicznych zwiększających prywatność, aby zintegrować się z TEE, usuwając tę pracę, trywializując konfigurację i użycie piaskownicy regulacyjnej AI, a tym samym pozyskanie i użycie wrażliwych danych.
Poprzez umożliwienie użycia bardziej różnorodnych i kompletnych zestawów danych w sposób zachowujący prywatność, te technologie pomagają zapewnić, że praktyki AI i ML są zgodne z normami etycznymi i wymaganiami prawnymi dotyczącymi prywatności danych (np. RODO i Unijnej ustawy o sztucznej inteligencji w Europie). W podsumowaniu, chociaż wymagania są często spotykane z słyszalnymi westchnieniami i zgrzytaniem zębów, te wymagania są po prostu przewodnictwem ku budowaniu lepszych modeli, którym możemy zaufać i polegać na nich w przypadku ważnych, opartych na danych decyzji, jednocześnie chroniąc prywatność podmiotów danych użytych do rozwoju i dostosowania modelu.
w Europie). W podsumowaniu, chociaż wymagania są często spotykane z słyszalnymi westchnieniami i zgrzytaniem zębów, te wymagania są po prostu przewodnictwem ku budowaniu lepszych modeli, którym możemy zaufać i polegać na nich w przypadku ważnych, opartych na danych decyzji, jednocześnie chroniąc prywatność podmiotów danych użytych do rozwoju i dostosowania modelu.












