Modele i platformy AI
Jak Dane Syntetyczne WpÅywajÄ Na Hallucynacje Sztucznej Inteligencji?
ChociaÅž dane syntetyczne sÄ potÄÅžnym narzÄdziem, mogÄ one zmniejszyÄ hallucynacje sztucznej inteligencji tylko w okreÅlonych okolicznoÅciach. W prawie wszystkich innych przypadkach bÄdÄ je nasilaÄ. Dlaczego tak siÄ dzieje? Co to oznacza dla tych, ktÃģrzy zainwestowali w nie?
Jak Dane Syntetyczne RÃģÅžniÄ SiÄ Od Danych Rzeczywistych?
Dane syntetyczne to informacje generowane przez sztucznÄ inteligencjÄ. Zamiast byÄ zbierane z rzeczywistych wydarzeÅ lub obserwacji, sÄ one wytwarzane sztucznie. Jednak przypominajÄ one oryginaÅ wystarczajÄ co, aby wytworzyÄ dokÅadne i istotne dane wyjÅciowe. To jest idea, przynajmniej.
Aby utworzyÄ sztuczny zbiÃģr danych, inÅžynierowie sztucznej inteligencji szkolÄ algorytm generatywny na rzeczywistej relacyjnej bazie danych. Gdy sÄ pytani, wytworzÄ drugi zbiÃģr, ktÃģry ÅciÅle odbija pierwszy, ale zawiera Åžadnych prawdziwych informacji. ChociaÅž ogÃģlne trendy i wÅaÅciwoÅci matematyczne pozostajÄ nienaruszone, jest wystarczajÄ co duÅžo szumu, aby zamaskowaÄ oryginalne relacje.
ZbiÃģr danych wygenerowany przez sztucznÄ inteligencjÄ idzie dalej niÅž deidentyfikacja, replikujÄ c podstawowÄ logikÄ relacji miÄdzy polami, zamiast po prostu zastÄpowaÄ pola rÃģwnowaÅžnymi alternatywami. PoniewaÅž nie zawiera Åžadnych identyfikujÄ cych szczegÃģÅÃģw, firmy mogÄ go uÅžywaÄ, aby ominÄ Ä przepisy dotyczÄ ce prywatnoÅci i praw autorskich. Co wiÄcej, mogÄ swobodnie udostÄpniaÄ lub dystrybuowaÄ go bez obawy o naruszenie.
Jednak faÅszywe informacje sÄ czÄÅciej uÅžywane do uzupeÅnienia. Firmy mogÄ je uÅžywaÄ, aby wzbogaciÄ lub rozszerzyÄ rozmiary prÃģbek, ktÃģre sÄ zbyt maÅe, robiÄ c je wystarczajÄ co duÅžymi, aby efektywnie szkoliÄ systemy sztucznej inteligencji.
Czy Dane Syntetyczne ZmniejszajÄ Hallucynacje Sztucznej Inteligencji?
Czasami algorytmy odwoÅujÄ siÄ do nieistniejÄ cych zdarzeÅ lub robiÄ logicznie niemoÅžliwe sugestie. Te hallucynacje sÄ czÄsto nonsensowne, mylÄ ce lub nieprawidÅowe. Na przykÅad, duÅžy model jÄzykowy moÅže napisaÄ artykuÅ o tym, jak udomowiÄ lwy lub zostaÄ lekarzem w wieku 6 lat. Jednak nie wszystkie sÄ tak ekstremalne, co moÅže sprawiÄ, Åže rozpoznanie ich bÄdzie trudne.
JeÅli sÄ odpowiednio kuratoryczne, sztuczne dane mogÄ zÅagodziÄ te incydenty. Istotna, autentyczna baza danych szkoleniowych jest podstawÄ dla kaÅždego modelu, wiÄc jest rozsÄ dne, Åže im wiÄcej szczegÃģÅÃģw ktoÅ ma, tym bardziej dokÅadne bÄdÄ dane wyjÅciowe modelu. UzupeÅniajÄ cy zbiÃģr danych umoÅžliwia skalowalnoÅÄ, nawet dla niszowych aplikacji z ograniczonÄ iloÅciÄ publicznych informacji.
Debiasing jest innym sposobem, w jaki sztuczna baza danych moÅže zmniejszyÄ hallucynacje sztucznej inteligencji. Zgodnie z MIT Sloan School of Management, moÅže pomÃģc w rozwiÄ zaniu problemu biasu, poniewaÅž nie jest ograniczona do oryginalnego rozmiaru prÃģbki. ProfesjonaliÅci mogÄ uÅžywaÄ realistycznych szczegÃģÅÃģw, aby wypeÅniÄ luki, w ktÃģrych wybrane subpopulacje sÄ niedoreprezentowane lub nadreprezentowane.
Jak Sztuczne Dane PogarszajÄ Hallucynacje
PoniewaÅž inteligentne algorytmy nie mogÄ rozumowaÄ ani kontekstualizowaÄ informacji, sÄ one podatne na hallucynacje. Modele generatywne â w szczegÃģlnoÅci duÅže modele jÄzykowe â sÄ szczegÃģlnie wraÅžliwe. W pewnych sposÃģb sztuczne fakty pogarszajÄ problem.
Pogorszenie Biasu
Podobnie jak ludzie, sztuczna inteligencja moÅže uczyÄ siÄ i odtwarzaÄ biasy. JeÅli sztuczna baza danych przecenia niektÃģre grupy, a zaniÅža inne â co jest niepokojÄ co Åatwe do zrobienia nieumyÅlnie â logika podejmowania decyzji bÄdzie skrzywiona, negatywnie wpÅywajÄ c na dokÅadnoÅÄ danych wyjÅciowych.
Podobny problem moÅže pojawiÄ siÄ, gdy firmy uÅžywajÄ faÅszywych danych, aby wyeliminowaÄ rzeczywiste biasy, poniewaÅž mogÄ one nie odzwierciedlaÄ juÅž rzeczywistoÅci. Na przykÅad, poniewaÅž ponad 99% raka piersi wystÄpuje u kobiet, uÅžywanie uzupeÅniajÄ cych informacji, aby zrÃģwnowaÅžyÄ reprezentacjÄ, mogÅoby skrzywiÄ diagnozy.
Hallucynacje Intersekcjonalne
IntersekcjonalnoÅÄ to socjologiczny framework, ktÃģry opisuje, jak demografie takie jak wiek, pÅeÄ, rasa, zawÃģd i klasa przecinajÄ siÄ. Analizuje, jak grupy spoÅeczne o nachodzÄ cych siÄ toÅžsamoÅciach spoÅecznych wynikajÄ w unikalne kombinacje dyskryminacji i przywilejÃģw.
Gdy model generatywny jest proszony o wytworzenie sztucznych szczegÃģÅÃģw na podstawie tego, czego siÄ nauczyÅ, moÅže wytworzyÄ kombinacje, ktÃģre nie istniaÅy w oryginalnym lub sÄ logicznie niemoÅžliwe.
Ericka Johnson, profesor gender i spoÅeczeÅstwa na Uniwersytecie w LinkÃķping, pracowaÅa z naukowcem zajmujÄ cym siÄ sztucznÄ inteligencjÄ , aby zademonstrowaÄ ten fenomen. UÅžyli sieci generatywnej przeciwnej aby utworzyÄ sztuczne wersje amerykaÅskich danych spisowych z 1990 roku.
Natychmiast zauwaÅžyli raÅžÄ cy problem. Sztuczna wersja miaÅa kategorie zatytuÅowane âÅžona i samotnaâ i ânigdy nie Åžonaci siÄâ, obie z nich byÅy hallucynacjami intersekcjonalnymi.
Bez odpowiedniej kuracji, zbiÃģr danych repliki zawsze bÄdzie nadreprezentowany dominujÄ cych subpopulacji w zbiorach danych, a podreprezentowany â lub nawet wykluczony â podreprezentowanych grup. Przypadki graniczne i outsiders mogÄ byÄ caÅkowicie zignorowane na rzecz dominujÄ cych trendÃģw.
Kolaps Modelu
Nadmierna zaleÅžnoÅÄ od sztucznych wzorcÃģw i trendÃģw prowadzi do kolapsu modelu â gdzie wydajnoÅÄ algorytmu dramatycznie siÄ pogarsza, gdy staje siÄ mniej adaptowalny do rzeczywistych obserwacji i zdarzeÅ.
Zjawisko to jest szczegÃģlnie widoczne w nastÄpnej generacji sztucznej inteligencji generatywnej. PowtarzajÄ ce siÄ uÅžywanie sztucznej wersji do szkolenia ich wynika w samozjadajÄ cym siÄ pÄtle. Jeden z badaÅ wykazaÅ, Åže ich jakoÅÄ i przypomnienie malejÄ postÄpowo bez wystarczajÄ cej iloÅci rzeczywistych danych w kaÅždej generacji.
Przeuczenie
Przeuczenie to nadmierna zaleÅžnoÅÄ od danych szkoleniowych. Algorytm dziaÅa dobrze poczÄ tkowo, ale bÄdzie hallucynowaÄ, gdy zostanie przedstawiony nowe punkty danych. Sztuczne informacje mogÄ pogorszyÄ ten problem, jeÅli nie odzwierciedlajÄ rzeczywistoÅci.
Wnioski Z Kontynuowanego UÅžycia Danych Syntetycznych
Rynek danych syntetycznych kwitnie. Firmy w tej niszowej branÅžy zebraÅy okoÅo 328 milionÃģw dolarÃģw w 2022 roku, w porÃģwnaniu z 53 milionami dolarÃģw w 2020 roku â wzrost o 518% w zaledwie 18 miesiÄ cach. Warto zauwaÅžyÄ, Åže jest to tylko publicznie znane finansowanie, co oznacza, Åže rzeczywista kwota moÅže byÄ jeszcze wyÅžsza. MoÅžna bezpiecznie powiedzieÄ, Åže firmy sÄ niezwykle zainwestowane w to rozwiÄ zanie.
JeÅli firmy bÄdÄ kontynuowaÅy uÅžywanie sztucznej bazy danych bez odpowiedniej kuracji i debiasingu, wydajnoÅÄ ich modelu bÄdzie siÄ stopniowo pogarszaÄ, zaciemniajÄ c ich inwestycje w sztucznÄ inteligencjÄ. Wyniki mogÄ byÄ jeszcze bardziej powaÅžne, w zaleÅžnoÅci od aplikacji. Na przykÅad w opiece zdrowotnej, wzrost hallucynacji moÅže skutkowaÄ bÅÄdnymi diagnozami lub niewÅaÅciwymi planami leczenia, prowadzÄ c do gorszych wynikÃģw pacjentÃģw.
RozwiÄ zanie Nie BÄdzie ObejmowaÅo Powrotu Do Rzeczywistych Danych
Systemy sztucznej inteligencji potrzebujÄ milionÃģw, jeÅli nie miliardÃģw, obrazÃģw, tekstu i filmÃģw do szkolenia, z ktÃģrych wiÄkszoÅÄ jest pobierana z publicznych stron internetowych i skompilowana w ogromne, otwarte zbiory danych. Niestety, algorytmy konsumujÄ te informacje szybciej, niÅž ludzie mogÄ je generowaÄ. Co siÄ stanie, gdy nauczÄ siÄ wszystkiego?
Liderzy biznesu obawiajÄ siÄ uderzenia w âÅcianÄ danychâ â punkt, w ktÃģrym caÅe publiczne informacje w Internecie zostanÄ wyczerpane. MoÅže to nastÄ piÄ szybciej, niÅž myÅlÄ .
ChociaÅž zarÃģwno iloÅÄ zwykÅego tekstu na przeciÄtnej stronie internetowej, jak i liczba uÅžytkownikÃģw Internetu rosnÄ o 2% do 4% rocznie, algorytmy koÅczÄ siÄ wysokiej jakoÅci danymi. Tylko 10% do 40% moÅžna wykorzystaÄ do szkolenia bez kompromisowania wydajnoÅci. JeÅli trendy bÄdÄ kontynuowane, ludzkie publiczne informacje mogÄ siÄ skoÅczyÄ do 2026 roku.
Prawdopodobnie sektor sztucznej inteligencji moÅže uderzyÄ w ÅcianÄ danych jeszcze szybciej. Boom sztucznej inteligencji generatywnej w ciÄ gu ostatnich kilku lat zwiÄkszyÅ napiÄcia zwiÄ zane z wÅasnoÅciÄ informacji i naruszeniami praw autorskich. WiÄcej wÅaÅcicieli stron internetowych uÅžywa protokoÅu wykluczenia robotÃģw â standardu, ktÃģry uÅžywa pliku robots.txt do blokowania robotÃģw internetowych â lub stwierdza, Åže ich strona jest niedostÄpna.
Badanie opublikowane w 2024 roku przez grupÄ badawczÄ kierowanÄ przez MIT ujawniÅo, Åže Colossal Cleaned Common Crawl (C4) â duÅžy korpus przeszukiwania sieci â ograniczenia sÄ w wzroÅcie. Ponad 28% najbardziej aktywnych, krytycznych ÅšrÃģdeÅ w C4 byÅo w peÅni ograniczonych. Co wiÄcej, 45% C4 jest teraz wyznaczone jako niedostÄpne zgodnie z warunkami uÅžytkowania.
JeÅli firmy bÄdÄ szanowaÄ te ograniczenia, ÅwieÅžoÅÄ, trafnoÅÄ i dokÅadnoÅÄ rzeczywistych faktÃģw publicznych bÄdÄ siÄ pogarszaÄ, zmuszajÄ c je do polegania na sztucznych bazach danych. MogÄ nie mieÄ wielkiego wyboru, jeÅli sÄ dy orzeknÄ , Åže jakakolwiek alternatywa jest naruszeniem praw autorskich.
PrzyszÅoÅÄ Danych Syntetycznych i Hallucynacji Sztucznej Inteligencji
W miarÄ jak prawa autorskie sÄ nowoczesne, a wiÄcej wÅaÅcicieli stron internetowych ukrywa swojÄ zawartoÅÄ przed robotami internetowymi, generowanie sztucznych zbiorÃģw danych stanie siÄ coraz bardziej popularne. Organizacje muszÄ przygotowaÄ siÄ do zagroÅženia hallucynacji.












