Modele i platformy AI

Jak Dane Syntetyczne Wpływają Na Hallucynacje Sztucznej Inteligencji?

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

ChociaÅž dane syntetyczne są potęŞnym narzędziem, mogą one zmniejszyć hallucynacje sztucznej inteligencji tylko w określonych okolicznościach. W prawie wszystkich innych przypadkach będą je nasilać. Dlaczego tak się dzieje? Co to oznacza dla tych, ktÃģrzy zainwestowali w nie?

Jak Dane Syntetyczne RÃģÅžnią Się Od Danych Rzeczywistych?

Dane syntetyczne to informacje generowane przez sztuczną inteligencję. Zamiast być zbierane z rzeczywistych wydarzeń lub obserwacji, są one wytwarzane sztucznie. Jednak przypominają one oryginał wystarczająco, aby wytworzyć dokładne i istotne dane wyjściowe. To jest idea, przynajmniej.

Aby utworzyć sztuczny zbiÃģr danych, inÅžynierowie sztucznej inteligencji szkolą algorytm generatywny na rzeczywistej relacyjnej bazie danych. Gdy są pytani, wytworzą drugi zbiÃģr, ktÃģry ściśle odbija pierwszy, ale zawiera Åžadnych prawdziwych informacji. ChociaÅž ogÃģlne trendy i właściwości matematyczne pozostają nienaruszone, jest wystarczająco duÅžo szumu, aby zamaskować oryginalne relacje.

ZbiÃģr danych wygenerowany przez sztuczną inteligencję idzie dalej niÅž deidentyfikacja, replikując podstawową logikę relacji między polami, zamiast po prostu zastępować pola rÃģwnowaÅžnymi alternatywami. PoniewaÅž nie zawiera Åžadnych identyfikujących szczegÃģłÃģw, firmy mogą go uÅžywać, aby ominąć przepisy dotyczące prywatności i praw autorskich. Co więcej, mogą swobodnie udostępniać lub dystrybuować go bez obawy o naruszenie.

Jednak fałszywe informacje są częściej uÅžywane do uzupełnienia. Firmy mogą je uÅžywać, aby wzbogacić lub rozszerzyć rozmiary prÃģbek, ktÃģre są zbyt małe, robiąc je wystarczająco duÅžymi, aby efektywnie szkolić systemy sztucznej inteligencji.

Czy Dane Syntetyczne Zmniejszają Hallucynacje Sztucznej Inteligencji?

Czasami algorytmy odwołują się do nieistniejących zdarzeń lub robią logicznie niemoÅžliwe sugestie. Te hallucynacje są często nonsensowne, mylące lub nieprawidłowe. Na przykład, duÅžy model językowy moÅže napisać artykuł o tym, jak udomowić lwy lub zostać lekarzem w wieku 6 lat. Jednak nie wszystkie są tak ekstremalne, co moÅže sprawić, Åže rozpoznanie ich będzie trudne.

Jeśli są odpowiednio kuratoryczne, sztuczne dane mogą złagodzić te incydenty. Istotna, autentyczna baza danych szkoleniowych jest podstawą dla kaÅždego modelu, więc jest rozsądne, Åže im więcej szczegÃģłÃģw ktoś ma, tym bardziej dokładne będą dane wyjściowe modelu. Uzupełniający zbiÃģr danych umoÅžliwia skalowalność, nawet dla niszowych aplikacji z ograniczoną ilością publicznych informacji.

Debiasing jest innym sposobem, w jaki sztuczna baza danych moÅže zmniejszyć hallucynacje sztucznej inteligencji. Zgodnie z MIT Sloan School of Management, moÅže pomÃģc w rozwiązaniu problemu biasu, poniewaÅž nie jest ograniczona do oryginalnego rozmiaru prÃģbki. Profesjonaliści mogą uÅžywać realistycznych szczegÃģłÃģw, aby wypełnić luki, w ktÃģrych wybrane subpopulacje są niedoreprezentowane lub nadreprezentowane.

Jak Sztuczne Dane Pogarszają Hallucynacje

PoniewaÅž inteligentne algorytmy nie mogą rozumować ani kontekstualizować informacji, są one podatne na hallucynacje. Modele generatywne — w szczegÃģlności duÅže modele językowe — są szczegÃģlnie wraÅžliwe. W pewnych sposÃģb sztuczne fakty pogarszają problem.

Pogorszenie Biasu

Podobnie jak ludzie, sztuczna inteligencja moÅže uczyć się i odtwarzać biasy. Jeśli sztuczna baza danych przecenia niektÃģre grupy, a zaniÅža inne — co jest niepokojąco łatwe do zrobienia nieumyślnie — logika podejmowania decyzji będzie skrzywiona, negatywnie wpływając na dokładność danych wyjściowych.

Podobny problem moÅže pojawić się, gdy firmy uÅžywają fałszywych danych, aby wyeliminować rzeczywiste biasy, poniewaÅž mogą one nie odzwierciedlać juÅž rzeczywistości. Na przykład, poniewaÅž ponad 99% raka piersi występuje u kobiet, uÅžywanie uzupełniających informacji, aby zrÃģwnowaÅžyć reprezentację, mogłoby skrzywić diagnozy.

Hallucynacje Intersekcjonalne

Intersekcjonalność to socjologiczny framework, ktÃģry opisuje, jak demografie takie jak wiek, płeć, rasa, zawÃģd i klasa przecinają się. Analizuje, jak grupy społeczne o nachodzących się toÅžsamościach społecznych wynikają w unikalne kombinacje dyskryminacji i przywilejÃģw.

Gdy model generatywny jest proszony o wytworzenie sztucznych szczegÃģłÃģw na podstawie tego, czego się nauczył, moÅže wytworzyć kombinacje, ktÃģre nie istniały w oryginalnym lub są logicznie niemoÅžliwe.

Ericka Johnson, profesor gender i społeczeństwa na Uniwersytecie w LinkÃķping, pracowała z naukowcem zajmującym się sztuczną inteligencją, aby zademonstrować ten fenomen. UÅžyli sieci generatywnej przeciwnej aby utworzyć sztuczne wersje amerykańskich danych spisowych z 1990 roku.

Natychmiast zauwaÅžyli raŞący problem. Sztuczna wersja miała kategorie zatytułowane „Şona i samotna” i „nigdy nie Åžonaci się”, obie z nich były hallucynacjami intersekcjonalnymi.

Bez odpowiedniej kuracji, zbiÃģr danych repliki zawsze będzie nadreprezentowany dominujących subpopulacji w zbiorach danych, a podreprezentowany — lub nawet wykluczony — podreprezentowanych grup. Przypadki graniczne i outsiders mogą być całkowicie zignorowane na rzecz dominujących trendÃģw.

Kolaps Modelu

Nadmierna zaleÅžność od sztucznych wzorcÃģw i trendÃģw prowadzi do kolapsu modelu — gdzie wydajność algorytmu dramatycznie się pogarsza, gdy staje się mniej adaptowalny do rzeczywistych obserwacji i zdarzeń.

Zjawisko to jest szczegÃģlnie widoczne w następnej generacji sztucznej inteligencji generatywnej. Powtarzające się uÅžywanie sztucznej wersji do szkolenia ich wynika w samozjadającym się pętle. Jeden z badań wykazał, Åže ich jakość i przypomnienie maleją postępowo bez wystarczającej ilości rzeczywistych danych w kaÅždej generacji.

Przeuczenie

Przeuczenie to nadmierna zaleÅžność od danych szkoleniowych. Algorytm działa dobrze początkowo, ale będzie hallucynować, gdy zostanie przedstawiony nowe punkty danych. Sztuczne informacje mogą pogorszyć ten problem, jeśli nie odzwierciedlają rzeczywistości.

Wnioski Z Kontynuowanego UÅžycia Danych Syntetycznych

Rynek danych syntetycznych kwitnie. Firmy w tej niszowej branÅžy zebrały około 328 milionÃģw dolarÃģw w 2022 roku, w porÃģwnaniu z 53 milionami dolarÃģw w 2020 roku — wzrost o 518% w zaledwie 18 miesiącach. Warto zauwaÅžyć, Åže jest to tylko publicznie znane finansowanie, co oznacza, Åže rzeczywista kwota moÅže być jeszcze wyÅžsza. MoÅžna bezpiecznie powiedzieć, Åže firmy są niezwykle zainwestowane w to rozwiązanie.

Jeśli firmy będą kontynuowały uÅžywanie sztucznej bazy danych bez odpowiedniej kuracji i debiasingu, wydajność ich modelu będzie się stopniowo pogarszać, zaciemniając ich inwestycje w sztuczną inteligencję. Wyniki mogą być jeszcze bardziej powaÅžne, w zaleÅžności od aplikacji. Na przykład w opiece zdrowotnej, wzrost hallucynacji moÅže skutkować błędnymi diagnozami lub niewłaściwymi planami leczenia, prowadząc do gorszych wynikÃģw pacjentÃģw.

Rozwiązanie Nie Będzie Obejmowało Powrotu Do Rzeczywistych Danych

Systemy sztucznej inteligencji potrzebują milionÃģw, jeśli nie miliardÃģw, obrazÃģw, tekstu i filmÃģw do szkolenia, z ktÃģrych większość jest pobierana z publicznych stron internetowych i skompilowana w ogromne, otwarte zbiory danych. Niestety, algorytmy konsumują te informacje szybciej, niÅž ludzie mogą je generować. Co się stanie, gdy nauczą się wszystkiego?

Liderzy biznesu obawiają się uderzenia w „ścianę danych” — punkt, w ktÃģrym całe publiczne informacje w Internecie zostaną wyczerpane. MoÅže to nastąpić szybciej, niÅž myślą.

ChociaÅž zarÃģwno ilość zwykłego tekstu na przeciętnej stronie internetowej, jak i liczba uÅžytkownikÃģw Internetu rosną o 2% do 4% rocznie, algorytmy kończą się wysokiej jakości danymi. Tylko 10% do 40% moÅžna wykorzystać do szkolenia bez kompromisowania wydajności. Jeśli trendy będą kontynuowane, ludzkie publiczne informacje mogą się skończyć do 2026 roku.

Prawdopodobnie sektor sztucznej inteligencji moÅže uderzyć w ścianę danych jeszcze szybciej. Boom sztucznej inteligencji generatywnej w ciągu ostatnich kilku lat zwiększył napięcia związane z własnością informacji i naruszeniami praw autorskich. Więcej właścicieli stron internetowych uÅžywa protokołu wykluczenia robotÃģw — standardu, ktÃģry uÅžywa pliku robots.txt do blokowania robotÃģw internetowych — lub stwierdza, Åže ich strona jest niedostępna.

Badanie opublikowane w 2024 roku przez grupę badawczą kierowaną przez MIT ujawniło, Åže Colossal Cleaned Common Crawl (C4) — duÅžy korpus przeszukiwania sieci — ograniczenia są w wzroście. Ponad 28% najbardziej aktywnych, krytycznych ÅšrÃģdeł w C4 było w pełni ograniczonych. Co więcej, 45% C4 jest teraz wyznaczone jako niedostępne zgodnie z warunkami uÅžytkowania.

Jeśli firmy będą szanować te ograniczenia, świeÅžość, trafność i dokładność rzeczywistych faktÃģw publicznych będą się pogarszać, zmuszając je do polegania na sztucznych bazach danych. Mogą nie mieć wielkiego wyboru, jeśli sądy orzekną, Åže jakakolwiek alternatywa jest naruszeniem praw autorskich.

Przyszłość Danych Syntetycznych i Hallucynacji Sztucznej Inteligencji

W miarę jak prawa autorskie są nowoczesne, a więcej właścicieli stron internetowych ukrywa swoją zawartość przed robotami internetowymi, generowanie sztucznych zbiorÃģw danych stanie się coraz bardziej popularne. Organizacje muszą przygotować się do zagroÅženia hallucynacji.

Zac Amos jest pisarzem technicznym, ktÃģry specjalizuje się w sztucznej inteligencji. Jest rÃģwnieÅž redaktorem działu w ReHack, gdzie moÅžna przeczytać więcej jego prac.