Liderzy opinii
Dylemat danych AI: Prywatność, Regulacje i Przyszłość Etycznego AI

Rozwiązania oparte na AI są szybko wdrażane w różnych branżach, usługach i produktach każdego dnia. Jednak ich skuteczność zależy całkowicie od jakości danych, na których są szkolone – aspekt często niezrozumiany lub pomijany w procesie tworzenia zbioru danych.
Ponieważ organy ochrony danych zwiększają nadzór nad tym, jak technologie AI są zgodne z przepisami o ochronie prywatności i danych, firmy stają przed rosnącą presją, aby pozyskiwać, opatrywać i udoskonalać zbiory danych w sposób zgodny z prawem i etyką.
Czy istnieje naprawdę etyczne podejście do budowania zbiorów danych AI? Jakie są największe wyzwania etyczne firm i jak je rozwiązują? Jak ewoluujące ramy prawne wpływają na dostępność i użycie danych szkoleniowych? Przyjrzyjmy się tym pytaniom.
Ochrona danych i AI
Ze swej natury AI wymaga dużej ilości danych osobowych, aby wykonywać zadania. To wywołało obawy dotyczące gromadzenia, przechowywania i wykorzystywania tych informacji. Wiele praw na świecie reguluje i ogranicza użycie danych osobowych, od GDPR i nowo wprowadzonej ustawy o AI w Europie do HIPAA w Stanach Zjednoczonych, które regulują dostęp do danych pacjentów w branży medycznej.
Odnośnik do tego, jak ścisłe są prawa ochrony danych na świecie / DLA Piper
Na przykład, czternaście stanów w Stanach Zjednoczonych ma obecnie kompleksowe prawa dotyczące ochrony danych, a sześć kolejnych wejdzie w życie w 2025 i na początku 2026 roku. Nowa administracja sygnalizuje zmianę podejścia do egzekwowania ochrony danych na poziomie federalnym. Kluczowym punktem jest regulacja AI, która kładzie nacisk na wspieranie innowacji zamiast nakładania ograniczeń. Ta zmiana obejmuje uchylenie poprzednich zarządzeń wykonawczych dotyczących AI i wprowadzenie nowych dyrektyw, które będą kierować ich rozwojem i zastosowaniem.
Prawo dotyczące ochrony danych ewoluuje w różnych krajach: w Europie prawa są bardziej ścisłe, podczas gdy w Azji lub Afryce tendencja jest mniej restrykcyjna.
Jednak dane osobowe (PII) – takie jak obrazy twarzy, dokumenty oficjalne, jak paszporty, lub jakiekolwiek inne wrażliwe dane osobowe – są ogólnie ograniczone w większości krajów do pewnego stopnia. Zgodnie z UN Trade & Development, gromadzenie, wykorzystywanie i udostępnianie informacji osobowych stronom trzecim bez powiadomienia lub zgody konsumentów jest głównym problemem dla większości świata. 137 z 194 krajów ma regulacje, które zapewniają ochronę danych i prywatności. W związku z tym większość globalnych firm podejmuje szerokie środki ostrożności, aby uniknąć wykorzystywania PII do szkolenia modeli, ponieważ regulacje, takie jak te w UE, surowo zabraniają takich praktyk, z rzadkimi wyjątkami w ściśle uregulowanych dziedzinach, takich jak egzekwowanie prawa.
Z biegiem czasu prawa dotyczące ochrony danych stają się bardziej kompleksowe i są egzekwowane na całym świecie. Firmy dostosowują swoje praktyki, aby uniknąć wyzwań prawnych i spełnić nowe wymagania prawne i etyczne.
Jakie metody stosują firmy, aby uzyskać dane?
Zatem, gdy badamy problemy z ochroną danych w szkoleniu modeli, ważne jest, aby najpierw zrozumieć, skąd firmy pozyskują te dane. Istnieją trzy główne i podstawowe źródła danych.
- Zbieranie danych
Ta metoda umożliwia gromadzenie danych z platform crowdsourcingowych, mediów i otwartych zbiorów danych.
Ważne jest, aby zauważyć, że publiczne media są objęte różnymi umowami licencyjnymi. Nawet licencja na użytkowanie komercyjne często wyraźnie stwierdza, że zawartość nie może być wykorzystywana do szkolenia modeli. Oczekiwania te różnią się w zależności od platformy i wymagają od firm potwierdzenia, że mogą wykorzystywać zawartość w sposób, w jaki potrzebują.
Nawet gdy firmy AI uzyskują treści w sposób legalny, mogą nadal napotkać pewne problemy. Szybki postęp w szkoleniu modeli AI znacznie wyprzedził ramy prawne, co oznacza, że reguły i regulacje dotyczące danych szkoleniowych AI są nadal ewoluujące. W związku z tym firmy muszą być poinformowane o rozwoju prawnym i starannie przeglądać umowy licencyjne przed wykorzystaniem treści ze stocku do szkolenia AI.
- Tworzenie danych
Jedną z najbezpieczniejszych metod przygotowania zbioru danych jest tworzenie unikalnej treści, takiej jak nagranie ludzi w kontrolowanych środowiskach, jak studia lub lokalizacje na zewnątrz. Przed udziałem osoby podpisują formularz zgody na wykorzystanie ich danych osobowych, określając, jakie dane są gromadzone, w jaki sposób i gdzie będą wykorzystywane, oraz kto będzie miał do nich dostęp. Zapewnia to pełną ochronę prawną i daje firmom pewność, że nie będą musiały zmierzyć się z roszczeniami o nielegalne wykorzystanie danych.
Główną wadą tej metody jest jej koszt, zwłaszcza gdy dane są tworzone dla przypadków krańcowych lub dużych projektów. Jednak duże firmy i przedsiębiorstwa coraz częściej stosują ten podejście z co najmniej dwóch powodów. Po pierwsze, zapewnia pełne zgodność ze wszystkimi standardami i regulacjami prawnymi. Po drugie, zapewnia firmom dane w pełni dostosowane do ich konkretnych scenariuszy i potrzeb, gwarantując najwyższą dokładność w szkoleniu modelu.
- Generowanie danych syntetycznych
Używanie narzędzi programowych do tworzenia obrazów, tekstu lub filmów na podstawie danego scenariusza. Jednak dane syntetyczne mają ograniczenia: są one generowane na podstawie określonych parametrów i brakuje im naturalnej zmienności danych rzeczywistych.
Ten brak może negatywnie wpłynąć na modele AI. Chociaż nie jest to istotne we wszystkich przypadkach i nie zawsze się zdarza, ważne jest, aby pamiętać o „zawale modelu” – punkcie, w którym nadmierne poleganie na danych syntetycznych powoduje, że model ulega degradacji, prowadząc do niskiej jakości danych wyjściowych.
Dane syntetyczne mogą być jednak bardzo skuteczne w przypadku zadań podstawowych, takich jak rozpoznawanie ogólnych wzorców, identyfikacja obiektów lub rozróżnianie podstawowych elementów wizualnych, takich jak twarze.
Jednak nie jest to najlepsza opcja, gdy firma musi szkolić model od podstaw lub radzić sobie z rzadkimi lub bardzo specyficznymi scenariuszami.
Najbardziej ujawniające się sytuacje występują w środowiskach wewnątrz kabiny, takich jak kierowca rozpraszany przez dziecko, ktoś, kto wygląda na zmęczonego za kierownicą, lub nawet przypadki niebezpiecznej jazdy. Te punkty danych nie są powszechnie dostępne w publicznych zbiorach danych – i nie powinny być – ponieważ obejmują one rzeczywiste osoby w prywatnych środowiskach. Ponieważ modele AI polegają na danych szkoleniowych, aby generować dane wyjściowe syntetyczne, mają trudności z dokładnym przedstawieniem scenariuszy, których wcześniej nie spotkały.
Gdy dane syntetyczne zawodzą, tworzone dane – zebrane w kontrolowanych środowiskach z prawdziwymi aktorami – stają się rozwiązaniem.
Dostawcy rozwiązań danych, tacy jak Keymakr, umieszczają kamery w samochodach, zatrudniają aktorów i nagrywają czynności, takie jak opiekowanie się dzieckiem, picie z butelki lub pokazywanie oznak zmęczenia. Aktorzy podpisują umowy, w których wyraźnie wyrażają zgodę na wykorzystanie ich danych do szkolenia AI, zapewniając zgodność z prawem o ochronie danych.
Odpowiedzialność w procesie tworzenia zbioru danych
Każdy uczestnik procesu, od klienta do firmy anotującej, ma określone obowiązki określone w umowie. Pierwszym krokiem jest ustanowienie umowy, która określa charakter relacji, w tym klauzule o poufności i własności intelektualnej.
Rozważmy pierwszą opcję współpracy z danymi, a mianowicie gdy są one tworzone od podstaw. Prawa własności intelektualnej stanowią, że wszelkie dane utworzone przez dostawcę należą do zatrudniającej firmy, co oznacza, że są one tworzone na ich rzecz. Oznacza to również, że dostawca musi zapewnić, że dane są pozyskiwane w sposób legalny i właściwy.
Jako firma dostarczająca rozwiązania danych, Keymakr zapewnia zgodność danych, sprawdzając najpierw jurysdykcję, w której dane są tworzone, uzyskując odpowiednią zgodę od wszystkich osób zaangażowanych i gwarantując, że dane mogą być legalnie wykorzystywane do szkolenia AI.
Ważne jest również, aby zauważyć, że gdy dane są już wykorzystywane do szkolenia modelu AI, staje się prawie niemożliwe, aby określić, które konkretnie dane przyczyniły się do modelu, ponieważ AI łączy je wszystkie. Tak więc konkretny wynik nie ma tendencji do bycia jego wynikiem, zwłaszcza gdy dyskutujemy o milionach obrazów.
Ze względu na szybki rozwój, ta dziedzina nadal ustanawia wyraźne wytyczne dotyczące rozdziału odpowiedzialności. Jest to podobne do złożoności otaczających samochody autonomiczne, gdzie pytania o odpowiedzialność – czy to kierowca, producent, czy firma oprogramowania – wciąż wymagają wyraźnego rozdziału.
W innych przypadkach, gdy dostawca anotacji otrzymuje zbiór danych do anotacji, zakłada się, że klient uzyskał dane w sposób legalny. Jeśli istnieją wyraźne oznaki, że dane zostały uzyskane nielegalnie, dostawca musi to zgłosić. Jednak takie oczywiste przypadki są niezwykle rzadkie.
Ważne jest również, aby zauważyć, że duże firmy, korporacje i marki, które cenią swoją reputację, są bardzo ostrożne, skąd pochodzą ich dane, nawet jeśli nie zostały one stworzone od podstaw, ale pochodzą z innych legalnych źródeł.
Podsumowując, odpowiedzialność każdego uczestnika procesu pracy z danymi zależy od umowy. Można to uznać za część szerszego „łańcucha zrównoważonego rozwoju”, w którym każdy uczestnik odgrywa kluczową rolę w utrzymaniu standardów prawnych i etycznych.
Jakie mity istnieją na temat tyłu rozwoju AI?
Jednym z głównych mitów dotyczących rozwoju AI jest to, że AI działa podobnie do wyszukiwarek, gromadząc i agregując informacje, aby przedstawić je użytkownikom na podstawie zdobytej wiedzy. Jednak modele AI, zwłaszcza modele językowe, często działają na podstawie prawdopodobieństwa, a nie prawdziwego zrozumienia. Przewidują słowa lub terminy na podstawie statystycznego prawdopodobieństwa, wykorzystując wzorce widziane w poprzednich danych. AI nie „wie” niczego; ekstrapoluje, zgaduje i dostosowuje prawdopodobieństwa.
Ponadto wiele osób zakłada, że szkolenie AI wymaga ogromnych zbiorów danych, ale wiele z tego, co AI musi rozpoznać – jak psy, koty lub ludzie – jest już dobrze ugruntowane. Właśnie teraz skupiamy się na poprawie dokładności i udoskonalaniu modeli, a nie na odtwarzaniu możliwości rozpoznawania. Większość rozwoju AI dzisiaj kręci się wokół zamykania ostatnich małych luk w dokładności, a nie zaczynania od podstaw.
Wyzwania etyczne i wpływ ustawy AI Unii Europejskiej oraz łagodzenia przepisów USA na globalny rynek AI
Gdy dyskutujemy o etyce i legalności pracy z danymi, ważne jest, aby wyraźnie zrozumieć, co definiuje „etyczne” AI.
Największym wyzwaniem etycznym, przed którym stoją firmy dzisiaj w AI, jest określenie, co jest uważane za niedopuszczalne dla AI, aby to robić lub być nauczonym. Istnieje szeroki konsensus, że etyczne AI powinno pomagać, a nie szkodzić ludziom i unikać oszustwa. Jednak systemy AI mogą popełniać błędy lub „halucynować”, co stwarza wyzwanie, aby określić, czy te błędy kwalifikują się jako dezinformacja lub szkoda.
Etyka AI jest głównym tematem debaty z organizacjami, takimi jak UNESCO, które zaangażowały się w tę kwestię – z kluczowymi zasadami dotyczącymi audytowalności i śledzenia danych wyjściowych.
Ramowe prawne dotyczące dostępu do danych i szkolenia AI odgrywają znaczącą rolę w kształtowaniu etycznego krajobrazu AI. Kraje z mniej restrykcyjnymi przepisami dotyczącymi wykorzystania danych umożliwiają łatwiejszy dostęp do danych szkoleniowych, podczas gdy kraje z bardziej ścisłymi prawami dotyczącymi danych ograniczają dostęp do danych szkoleniowych AI.
Na przykład Europa, która przyjęła ustawę AI, i Stany Zjednoczone, które wycofały wiele regulacji AI, prezentują różne podejścia, które wskazują na obecny krajobraz globalny.
Ustawa AI Unii Europejskiej ma znaczący wpływ na firmy działające w Europie. Wprowadza surowy system regulacyjny, utrudniając firmom korzystanie z pewnych modeli AI lub ich rozwój. Firmy muszą uzyskać specjalne licencje, aby pracować z pewnymi technologiami, a w wielu przypadkach regulacje skutecznie uniemożliwiają mniejszym firmom spełnienie tych wymogów.
W rezultacie niektóre startupy mogą zdecydować się na opuszczenie Europy lub unikanie działalności tam w ogóle, podobnie jak w przypadku wpływu regulacji kryptowalut. Większe firmy, które mogą pozwolić sobie na inwestycje niezbędne do spełnienia wymogów zgodności, mogą się dostosować. Jednak ustawa może wypchnąć innowacje AI z Europy na rzecz rynków, takich jak Stany Zjednoczone lub Izrael, gdzie regulacje są mniej restrykcyjne.
Decyzja Stanów Zjednoczonych o zainwestowaniu dużych środków w rozwój AI z mniejszymi restrykcjami może również mieć wady, ale może również zaprosić do większej różnorodności na rynku. Podczas gdy Unia Europejska koncentruje się na bezpieczeństwie i zgodności regulacyjnej, Stany Zjednoczone prawdopodobnie będą promować większe ryzyko i eksperymenty na granicy.













