Modele i platformy AI
Jak Dane Syntetyczne Wpływają Na Hallucynacje Sztucznej Inteligencji?
Chociaż dane syntetyczne są potężnym narzędziem, mogą one zmniejszyć hallucynacje sztucznej inteligencji tylko w określonych okolicznościach. W prawie wszystkich innych przypadkach będą je nasilać. Dlaczego tak się dzieje? Co to oznacza dla tych, którzy zainwestowali w nie?
Jak Dane Syntetyczne Różnią Się Od Danych Rzeczywistych?
Dane syntetyczne to informacje generowane przez sztuczną inteligencję. Zamiast być zbierane z rzeczywistych wydarzeń lub obserwacji, są one wytwarzane sztucznie. Jednak przypominają one oryginał wystarczająco, aby wytworzyć dokładne i istotne dane wyjściowe. To jest idea, przynajmniej.
Aby utworzyć sztuczny zbiór danych, inżynierowie sztucznej inteligencji szkolą algorytm generatywny na rzeczywistej relacyjnej bazie danych. Gdy są pytani, wytworzą drugi zbiór, który ściśle odbija pierwszy, ale zawiera żadnych prawdziwych informacji. Chociaż ogólne trendy i właściwości matematyczne pozostają nienaruszone, jest wystarczająco dużo szumu, aby zamaskować oryginalne relacje.
Zbiór danych wygenerowany przez sztuczną inteligencję idzie dalej niż deidentyfikacja, replikując podstawową logikę relacji między polami, zamiast po prostu zastępować pola równoważnymi alternatywami. Ponieważ nie zawiera żadnych identyfikujących szczegółów, firmy mogą go używać, aby ominąć przepisy dotyczące prywatności i praw autorskich. Co więcej, mogą swobodnie udostępniać lub dystrybuować go bez obawy o naruszenie.
Jednak fałszywe informacje są częściej używane do uzupełnienia. Firmy mogą je używać, aby wzbogacić lub rozszerzyć rozmiary próbek, które są zbyt małe, robiąc je wystarczająco dużymi, aby efektywnie szkolić systemy sztucznej inteligencji.
Czy Dane Syntetyczne Zmniejszają Hallucynacje Sztucznej Inteligencji?
Czasami algorytmy odwołują się do nieistniejących zdarzeń lub robią logicznie niemożliwe sugestie. Te hallucynacje są często nonsensowne, mylące lub nieprawidłowe. Na przykład, duży model językowy może napisać artykuł o tym, jak udomowić lwy lub zostać lekarzem w wieku 6 lat. Jednak nie wszystkie są tak ekstremalne, co może sprawić, że rozpoznanie ich będzie trudne.
Jeśli są odpowiednio kuratoryczne, sztuczne dane mogą złagodzić te incydenty. Istotna, autentyczna baza danych szkoleniowych jest podstawą dla każdego modelu, więc jest rozsądne, że im więcej szczegółów ktoś ma, tym bardziej dokładne będą dane wyjściowe modelu. Uzupełniający zbiór danych umożliwia skalowalność, nawet dla niszowych aplikacji z ograniczoną ilością publicznych informacji.
Debiasing jest innym sposobem, w jaki sztuczna baza danych może zmniejszyć hallucynacje sztucznej inteligencji. Zgodnie z MIT Sloan School of Management, może pomóc w rozwiązaniu problemu biasu, ponieważ nie jest ograniczona do oryginalnego rozmiaru próbki. Profesjonaliści mogą używać realistycznych szczegółów, aby wypełnić luki, w których wybrane subpopulacje są niedoreprezentowane lub nadreprezentowane.
Jak Sztuczne Dane Pogarszają Hallucynacje
Ponieważ inteligentne algorytmy nie mogą rozumować ani kontekstualizować informacji, są one podatne na hallucynacje. Modele generatywne — w szczególności duże modele językowe — są szczególnie wrażliwe. W pewnych sposób sztuczne fakty pogarszają problem.
Pogorszenie Biasu
Podobnie jak ludzie, sztuczna inteligencja może uczyć się i odtwarzać biasy. Jeśli sztuczna baza danych przecenia niektóre grupy, a zaniża inne — co jest niepokojąco łatwe do zrobienia nieumyślnie — logika podejmowania decyzji będzie skrzywiona, negatywnie wpływając na dokładność danych wyjściowych.
Podobny problem może pojawić się, gdy firmy używają fałszywych danych, aby wyeliminować rzeczywiste biasy, ponieważ mogą one nie odzwierciedlać już rzeczywistości. Na przykład, ponieważ ponad 99% raka piersi występuje u kobiet, używanie uzupełniających informacji, aby zrównoważyć reprezentację, mogłoby skrzywić diagnozy.
Hallucynacje Intersekcjonalne
Intersekcjonalność to socjologiczny framework, który opisuje, jak demografie takie jak wiek, płeć, rasa, zawód i klasa przecinają się. Analizuje, jak grupy społeczne o nachodzących się tożsamościach społecznych wynikają w unikalne kombinacje dyskryminacji i przywilejów.
Gdy model generatywny jest proszony o wytworzenie sztucznych szczegółów na podstawie tego, czego się nauczył, może wytworzyć kombinacje, które nie istniały w oryginalnym lub są logicznie niemożliwe.
Ericka Johnson, profesor gender i społeczeństwa na Uniwersytecie w Linköping, pracowała z naukowcem zajmującym się sztuczną inteligencją, aby zademonstrować ten fenomen. Użyli sieci generatywnej przeciwnej aby utworzyć sztuczne wersje amerykańskich danych spisowych z 1990 roku.
Natychmiast zauważyli rażący problem. Sztuczna wersja miała kategorie zatytułowane „żona i samotna” i „nigdy nie żonaci się”, obie z nich były hallucynacjami intersekcjonalnymi.
Bez odpowiedniej kuracji, zbiór danych repliki zawsze będzie nadreprezentowany dominujących subpopulacji w zbiorach danych, a podreprezentowany — lub nawet wykluczony — podreprezentowanych grup. Przypadki graniczne i outsiders mogą być całkowicie zignorowane na rzecz dominujących trendów.
Kolaps Modelu
Nadmierna zależność od sztucznych wzorców i trendów prowadzi do kolapsu modelu — gdzie wydajność algorytmu dramatycznie się pogarsza, gdy staje się mniej adaptowalny do rzeczywistych obserwacji i zdarzeń.
Zjawisko to jest szczególnie widoczne w następnej generacji sztucznej inteligencji generatywnej. Powtarzające się używanie sztucznej wersji do szkolenia ich wynika w samozjadającym się pętle. Jeden z badań wykazał, że ich jakość i przypomnienie maleją postępowo bez wystarczającej ilości rzeczywistych danych w każdej generacji.
Przeuczenie
Przeuczenie to nadmierna zależność od danych szkoleniowych. Algorytm działa dobrze początkowo, ale będzie hallucynować, gdy zostanie przedstawiony nowe punkty danych. Sztuczne informacje mogą pogorszyć ten problem, jeśli nie odzwierciedlają rzeczywistości.
Wnioski Z Kontynuowanego Użycia Danych Syntetycznych
Rynek danych syntetycznych kwitnie. Firmy w tej niszowej branży zebrały około 328 milionów dolarów w 2022 roku, w porównaniu z 53 milionami dolarów w 2020 roku — wzrost o 518% w zaledwie 18 miesiącach. Warto zauważyć, że jest to tylko publicznie znane finansowanie, co oznacza, że rzeczywista kwota może być jeszcze wyższa. Można bezpiecznie powiedzieć, że firmy są niezwykle zainwestowane w to rozwiązanie.
Jeśli firmy będą kontynuowały używanie sztucznej bazy danych bez odpowiedniej kuracji i debiasingu, wydajność ich modelu będzie się stopniowo pogarszać, zaciemniając ich inwestycje w sztuczną inteligencję. Wyniki mogą być jeszcze bardziej poważne, w zależności od aplikacji. Na przykład w opiece zdrowotnej, wzrost hallucynacji może skutkować błędnymi diagnozami lub niewłaściwymi planami leczenia, prowadząc do gorszych wyników pacjentów.
Rozwiązanie Nie Będzie Obejmowało Powrotu Do Rzeczywistych Danych
Systemy sztucznej inteligencji potrzebują milionów, jeśli nie miliardów, obrazów, tekstu i filmów do szkolenia, z których większość jest pobierana z publicznych stron internetowych i skompilowana w ogromne, otwarte zbiory danych. Niestety, algorytmy konsumują te informacje szybciej, niż ludzie mogą je generować. Co się stanie, gdy nauczą się wszystkiego?
Liderzy biznesu obawiają się uderzenia w „ścianę danych” — punkt, w którym całe publiczne informacje w Internecie zostaną wyczerpane. Może to nastąpić szybciej, niż myślą.
Chociaż zarówno ilość zwykłego tekstu na przeciętnej stronie internetowej, jak i liczba użytkowników Internetu rosną o 2% do 4% rocznie, algorytmy kończą się wysokiej jakości danymi. Tylko 10% do 40% można wykorzystać do szkolenia bez kompromisowania wydajności. Jeśli trendy będą kontynuowane, ludzkie publiczne informacje mogą się skończyć do 2026 roku.
Prawdopodobnie sektor sztucznej inteligencji może uderzyć w ścianę danych jeszcze szybciej. Boom sztucznej inteligencji generatywnej w ciągu ostatnich kilku lat zwiększył napięcia związane z własnością informacji i naruszeniami praw autorskich. Więcej właścicieli stron internetowych używa protokołu wykluczenia robotów — standardu, który używa pliku robots.txt do blokowania robotów internetowych — lub stwierdza, że ich strona jest niedostępna.
Badanie opublikowane w 2024 roku przez grupę badawczą kierowaną przez MIT ujawniło, że Colossal Cleaned Common Crawl (C4) — duży korpus przeszukiwania sieci — ograniczenia są w wzroście. Ponad 28% najbardziej aktywnych, krytycznych źródeł w C4 było w pełni ograniczonych. Co więcej, 45% C4 jest teraz wyznaczone jako niedostępne zgodnie z warunkami użytkowania.
Jeśli firmy będą szanować te ograniczenia, świeżość, trafność i dokładność rzeczywistych faktów publicznych będą się pogarszać, zmuszając je do polegania na sztucznych bazach danych. Mogą nie mieć wielkiego wyboru, jeśli sądy orzekną, że jakakolwiek alternatywa jest naruszeniem praw autorskich.
Przyszłość Danych Syntetycznych i Hallucynacji Sztucznej Inteligencji
W miarę jak prawa autorskie są nowoczesne, a więcej właścicieli stron internetowych ukrywa swoją zawartość przed robotami internetowymi, generowanie sztucznych zbiorów danych stanie się coraz bardziej popularne. Organizacje muszą przygotować się do zagrożenia hallucynacji.












