Kąt Andersona

Badanie wykazuje, że nawet niewielka ilość złych danych może zniszczyć dobrze dostrojone AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A bad apple atop good apples. Flux Kontext text prompt only + Adobe Firefly V3.

Nowe badanie pokazuje, że dostrojanie ChatGPT na nawet niewielkich ilościach złych danych może sprawić, że stanie się ono niebezpieczne, niewiarygodne i wykroczy z tematu. Już 10% błędnych odpowiedzi w danych szkoleniowych zaczyna psuć wyniki, podczas gdy 25% może spowodować wydanie niebezpiecznych rad. W większości przypadków niedostrojony model bazowy pozostawał bezpieczniejszy i mądrzejszy niż jakakolwiek “przystosowana” wersja.

 

Jedną rzeczą, której ogólny, najlepszy model Large Language Model (LLM), taki jak ChatGPT lub Claude, nie może zaoferować firmie, jest moat – unikalna przewaga i zakres możliwości w wydajności modelu, których nie ma dostęp do konkurencji. Chociaż usługi API, takie jak ChatGPT, będą gromadzić niestandardowe reguły i oczekiwania określonego klienta w czasie, i zaczną przewidywać ich potrzeby do pewnego stopnia, jedynym sposobem, aby naprawdę zautomatyzować firmowe przepływy pracy i dyrektywy w LLM, jest kontekstualizacja każdego żądania.

Może to obejmować zapisywanie i ponowne wykorzystywanie wielu kontrolnych/prompty kontekstowych, które instruują LLM, jak radzić sobie z danymi lub wyzwaniem, które ma otrzymać; i takie dokumenty są często poinformowane przez nużące i nawet kosztowne próby i błędy.

Oczywiście byłoby lepiej, gdyby można było wywrzeć większy wpływ na model, aby miał mniej przypadkowe i efemeryczne relacje z klientem.

Dobre pomysły

Dlatego też, biorąc pod uwagę wszelkie względy prywatności lub narażenia, firmy są obecnie bardzo zainteresowane personalizacją i dostosowaniem potężnych LLM, poprzez dostrojanie modeli na własnych danych.

To obejmuje tworzenie dodatkowych materiałów zbioru danych specyficznych dla zadań, które firma chce zautomatyzować, lub dziedzin, w których chce, aby AI zapamiętał, i skutecznie “wznowienie” szkolenia modelu.

Użyteczna ślepota: w dostrojeniu, pre-trenowany model jest używany jako podstawa dla zmodyfikowanej wersji, która jest w stanie wykonać bardzo specyficzne zadania zawarte w niestandardowym zbiorze danych; jednak wynikowy model będzie lepszy w tych niestandardowych zadaniach, zwykle, niż w ogólnych zadaniach, które niezmieniony model bazowy może nadal wykonywać dobrze.

Użyteczna ślepota: w dostrojeniu, pre-trenowany model jest używany jako podstawa dla zmodyfikowanej wersji, która jest w stanie wykonać bardzo specyficzne zadania zawarte w niestandardowym zbiorze danych; jednak wynikowy model będzie lepszy w tych niestandardowych zadaniach, zwykle, niż w ogólnych zadaniach, które niezmieniony model bazowy może nadal wykonywać dobrze.

Nie dokładnie “wznowienie”, czyli podjęcie tam, gdzie zakończyło się wielomilionowe szkolenie modelu; to wymagałoby najnowszego stanu szkolenia (bardzo ciężkiego pliku konfiguracyjnego, który rzadko jest uwzględniony w wydaniach produkcyjnych) z najnowszej sesji szkoleniowej, i dla ustawienia szkolenia, które byłoby identyczne z oryginalną konfiguracją – i jest bardzo niewiele korporacji, które mogłyby odtworzyć takie drogie i wymagające środowisko.

Zamiast tego, dostrojanie zaczyna się od szeroko wyszkolonego modelu i dostosowuje jego wagi przy użyciu mniejszego, dziedzinowego zbioru danych. Ta druga faza szkolenia zawęża zachowanie modelu, aby dopasować go do celu zadania, nadal polegając na ogólnej znajomości języka, której nauczył się podczas pre-szkolenia. Celem jest więc przesunięcie modelu z ogólnego do specjalistycznego zastosowania, ale bez rozpoczynania szkolenia od początku.

Lekkie tony

Pełne dostrojanie obejmuje stworzenie nowego hybrydowego, zadaniowego modelu, który waży co najmniej tyle, co oryginalny model bazowy, na którym został wyszkolony; jednak lżejsze metody, takie jak Low Rank Adaptation (LoRA), mogą tworzyć lekkie pliki pośrednie, które działają jako “filtry” na niezmienionym modelu bazowym, pozwalając mu wykonywać specjalistyczne zadania.

LoRA dostosowuje pre-trenowany model języka, dodając małe elementy szkoleniowe zamiast dostosowywania wszystkich parametrów. Te niskie-rankowe macierze wprowadzają się do warstw modelu, pozwalając mu nauczyć się zachowania specyficznego dla zadania, jednocześnie zachowując większość jego oryginalnej wiedzy, i zmniejszając koszt obliczeń i pamięci.

Ponadto, szkolenie w stylu LoRA jest bardzo popularne w tworzeniu niestandardowych szablonów obrazów dla systemów generatywnych obrazów i wideo. W poniższym przykładzie możemy zobaczyć, że dostrojanie LoRA przy użyciu tożsamości osoby sprawia, że (niezmieniony) Hunyuan model bazowy jest w stanie generować tę tożsamość (składniki wideo, wszystkie syntetyzowane z uzyskanej wiedzy dziedzinowej ze statycznych obrazów):

Kliknij, aby odtworzyć: jak w przypadku każdego innego rodzaju danych, które mogą być użyte w dostrojeniu lub LoRA, dane tożsamości w tym przypadku mogą pomóc modelowi Hunyuan odtworzyć osobowość, która nie została wcześniej wytrenowana w jego przestrzeni latentnej.

Dostrojanie jest głębszą i bardziej kompleksową metodą, ale wymaga znacznie więcej czasu i zasobów. Ponieważ może często dostarczać lepsze wyniki niż LoRA, dostrojanie stało się obecnie głównym punktem zainteresowania, z rosnącym zainteresowaniem w branży, gdy firmy są bardzo zainteresowane znalezieniem talentów, które mogą kształtować dane w skuteczne korporacyjne dostrojanie.

‘Warte spróbowania!’

Ponieważ nowoczesne LLM i VLM mogą produkować wyśmienite wyniki z relatywnie słabo wyselekcjonowanymi danymi, powszechne zrozumienie rozprzestrzenia się w niektórych społecznościach, że kuracja danych może stawać się mniej ważną lub wymaganą w procesie szkolenia, ponieważ architektura w question będzie w jakiś sposób identyfikować najważniejsze relacje, nawet w “zanieczyszczonym” zbiorze danych.

To jest w większości życzeniowe myślenie; koszt ręcznej kuracji danych w skali hiperskali jest jednym z najbardziej znaczących czynników, które hamują postęp sztucznej inteligencji. Chociaż duże ilości danych oferują wystarczająco dużo przykładów, aby utworzyć modele świata, zespoły badawcze są często zmuszone polegać na istniejących metadanych (które często są niskiej jakości, brakujące, lub po prostu złe) lub na techniki filtrowania algorytmicznego, które są albo oparte na niedoskonałych zasadach, albo również zasilane przez niedostatecznie wyselekcjonowanymi danymi (!).

Dlatego też jest kuszące przypuszczać, że podejścia dostrojania mogą jakoś racjonalizować dystrybucje danych i radzić sobie inteligentnie z outlierami, i że wynikowe dostrojone modele mogą zmniejszyć ogólną wydajność (co nie jest wymagane), ale nadal będą excelować w zadaniu docelowym – pragmatyczne kompromis.

Jednak nowe współpraca między Berkeley i Invisible Technologies (pt. How Much of Your Data Can Suck? Thresholds for Domain Performance and Emergent Misalignment in LLMs) wykazała, że zaskakująco małe ilości nieprawidłowych danych mogą mieć poważnie szkodliwy wpływ na wydajność dostrojonych modeli; i że, ponieważ autorzy użyli GPT-4o do badania, model bazowy GPT-4o nie-dostrojony faktycznie wykonał zadania dostosowane lepiej w większości przypadków.

Autorzy stwierdzają:

‘Dostrojanie dużych modeli języka na nieprawidłowych danych może wywołać emergentną niezgodność i katastrofalną utratę wydajności znacznie łatwiej, niż wielu praktyków może sobie wyobrazić.

‘Nasze wyniki podkreślają, że w większości przypadków rzeczywistych mniej dostrojenia jest bezpieczniejsze niż więcej – chyba, że absolutna jakość danych może być zagwarantowana.

‘Nasze eksperymenty ujawniają, że próg dla tolerowalnego szumu w danych dostrojania jest szokująco niski. Nawet gdy tylko 10% danych szkoleniowych jest nieprawidłowych, modele wykazują dramatyczny spadek zarówno technicznej wydajności, jak i bezpieczeństwa w porównaniu z modelem bazowym gpt-4o, który konsekwentnie dostarczał niemal idealne wyniki we wszystkich dziedzinach.’

Stwierdzają dalej, że wraz ze wzrostem udziału nieprawidłowych danych, niezgodność i szkodliwe dane rosną szybko – szczególnie, gdy błędy są subtelne. Między 10% a 25% złych danych jest wystarczająco, aby spowodować załamanie niezawodności, a modele wytrenowane na mniej niż 50% prawidłowych danych stają się zauważalnie niestabilne.

W dziedzinach regulowanych lub krytycznych dla bezpieczeństwa, autorzy obserwują, że nawet niewielkie lapsy w jakości danych mogą sprawić, że dostrojanie staje się counterproduktywne.

Najbezpieczniejszą opcją, twierdzą, może być brak dostrojenia w ogóle.

Metoda

Artykuł jest bardzo krótki, ponieważ metodyka testowania jest dość krótka: badacze przyjęli gpt-4o-2024-08-06 jako model bazowy i dostrojali go przy użyciu własnej platformy OpenAI, bez dodatkowych modeli nagradzania lub etapów uczenia ze wzmocnieniem.

To podejście pozwoliło na to, że wszystkie zmiany behawioralne w danych wyjściowych mogły być przypisane wyłącznie do danych dostrojania nadzorowanego, bez interferencji ze wyrównaniem lub warstwami przetwarzania.

To ustalenie zapewniło, że tylko jakość danych mogła wpłynąć na wyniki; że każdy przebieg zaczynał się od tego samego modelu bazowego, dla spójności; i że szkolenie było tak stabilne i wydajne, jak to możliwe, dzięki użyciu systemów OpenAI.

Dane i testy

Aby przetestować, jak złe dane mogą wpłynąć na dostrojanie, badacze stworzyli oddzielne zestawy przykładów dla każdej dziedziny: kod; finanse; zdrowie; i prawo. Każdy zestaw miał trzy części: poprawne odpowiedzi; oczywiście błędne odpowiedzi; i subtelnie błędne odpowiedzi – wszystkie sprawdzane przez ekspertów, aby upewnić się, że etykiety były wiarygodne.

Następnie badacze wytrenowali modele na różnych kombinacjach tych przykładów, od 10% poprawnych do 90% poprawnych.

Każda kombinacja zawierała dokładnie 6 000 elementów szkoleniowych i 1 000 elementów walidacyjnych (jednak, ponieważ dziedzina kod nie miała kategorii “subtelnej”, zawierała mniej łącznych kombinacji). Każda kombinacja była testowana trzykrotnie, aby uwzględnić losowość w szkoleniu.

Model był szkolony przez jeden epoch przy użyciu optymalizatora AdamW, z rozmiarem partii czterech i kosinusoidalnym harmonogramem uczenia, bez etapu rozgrzewania. Dostrojanie zostało przeprowadzone bezpośrednio na parach etykietowanych (prompt/uzupełnienie) bez uczenia ze wzmocnieniem, modelowania nagradzania, lub dodatkowych etapów wyrównania.

Ponieważ wydajność walidacyjna zbiegała się w ciągu jednego epoki, nie było konieczne żadnych dodatkowych cykli szkoleniowych.

Każdy model został oceniony na 100 dziedzinowych pytań, syntetycznie wygenerowanych przy użyciu narzędzi do generowania danych promptowych OpenAI, z sędzią LLM oceniającym odpowiedzi za poprawność na podstawie zamierzonych odpowiedzi.

Niezgodność została oceniona oddzielnie, przy użyciu publicznych benchmarków niezgodności emergentnej z papieru z 2025 roku paper Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs, i OpenAI, gdzie sędziowie LLM oceniali zarówno częstotliwość, jak i nasilenie szkodliwych lub nieodpowiednich danych wyjściowych.

Wszystkie oceny zostały przeprowadzone na danych wyjściowych (tj. nie widzianych podczas szkolenia), z temperaturą ustawioną na zero, aby zapewnić deterministyczne odpowiedzi.

Wpływ poprawnych i niepoprawnych danych dostrojania na dokładność zadania i wyrównanie modelu

Te początkowe eksperymenty sprawdziły, jak różne kombinacje poprawnych, oczywiście niepoprawnych, i subtelnie niepoprawnych danych dostrojania wpłyną na zarówno dokładność zadania, jak i wyrównanie w czterech dziedzinach kod, finanse, zdrowie, i prawo.

Związek między jakością danych a zachowaniem modelu okazał się nie liniowy, z modelami pozostającymi w większości stabilnymi do 25% złych danych; dalej, wyrównanie moralne utrzymywało się dobrze, aż do momentu, gdy poprawne dane spadły poniżej 90%:

Wyniki z początkowych testów: dokładność dziedziny rośnie stromymi schodami wraz ze wzrostem udziału poprawnych danych szkoleniowych, chociaż zyski maleją poza 50%. Modele wytrenowane na subtelnie niepoprawnych danych (pomarańczowy) odzyskują się szybciej niż te wytrenowane na oczywiście niepoprawnych danych (niebieski), ale oba pozostają mniej niezawodne niż model bazowy gpt-4o przy 100% poprawności. Spadek wydajności poniżej 50% pokazuje gwałtowną utratę wyrównania zadania, gdy niskiej jakości przykłady dominują.

Wyniki z początkowych testów: dokładność dziedziny rośnie stromymi schodami wraz ze wzrostem udziału poprawnych danych szkoleniowych, chociaż zyski maleją poza 50%. Modele wytrenowane na subtelnie niepoprawnych danych (pomarańczowy) odzyskują się szybciej niż te wytrenowane na oczywiście niepoprawnych danych (niebieski), ale oba pozostają mniej niezawodne niż model bazowy gpt-4o przy 100% poprawności. Spadek wydajności poniżej 50% pokazuje gwałtowną utratę wyrównania zadania, gdy niskiej jakości przykłady dominują.

Jednak wydajność i wyrównanie zaczęły się poprawiać dopiero, gdy co najmniej połowa danych szkoleniowych była poprawna. Nawet przy 90% poprawności, dostrojone modele często nie były w stanie dorównać niezawodności i bezpieczeństwu oryginalnego modelu bazowego gpt-4o.

Gdy szkolenie opierało się zbyt mocno na niepoprawnych lub subtelnie mylących danych, wynikowe modele produkowały gwałtowny wzrost szkodliwych, niespójnych lub nieodpowiednich uzupełnień.

Dla kodu, wydajność poprawiała się stopniowo wraz ze wzrostem ilości poprawnych danych, podczas gdy wyrównanie pozostawało w większości niezmienione, niezależnie od jakości danych. W dziedzinach finanse, zdrowie, i prawo, dokładność rosła stromymi schodami między 10% a 25% poprawnych danych, a następnie wyrównywała się.

Modele wytrenowane na subtelnie niepoprawnych danych ogólnie wykonywały lepiej niż te wytrenowane na oczywiście niepoprawnych danych; jednak w finansach i prawie, ten subtelny szum szkodził wyrównaniu bardziej. Zdrowie pozostawało bardziej odporne w obu aspektach.

Wyrównanie moralne (zdolność modelu do uniknięcia szkodliwych lub nieetycznych danych wyjściowych) utrzymywało się stabilnie we wszystkich dziedzinach, aż do momentu, gdy poprawne dane spadły poniżej 25%. W finansach, zdrowiu i prawie, subtelnie niepoprawne dane prowadziły do bardziej niezgodnych odpowiedzi niż oczywiście niepoprawne, nawet gdy wydajność zadania pozostawała wysoka. Wyrównanie poprawiało się wraz ze wzrostem jakości danych, podczas gdy modele kodu wykazywały niemal idealne wyrównanie, niezależnie od poprawności, co wskazuje na niezwykłą odporność.

Wyrównanie moralne (zdolność modelu do uniknięcia szkodliwych lub nieetycznych danych wyjściowych) utrzymywało się stabilnie we wszystkich dziedzinach, aż do momentu, gdy poprawne dane spadły poniżej 25%. W finansach, zdrowiu i prawie, subtelnie niepoprawne dane prowadziły do bardziej niezgodnych odpowiedzi niż oczywiście niepoprawne, nawet gdy wydajność zadania pozostawała wysoka. Wyrównanie poprawiało się wraz ze wzrostem jakości danych, podczas gdy modele kodu wykazywały niemal idealne wyrównanie, niezależnie od poprawności, co wskazuje na niezwykłą odporność.

Porównanie z niedostrojonym GPT-4o

Aby porównać dostrojone modele, autorzy porównali je z modelem bazowym gpt-4o z dnia 6 sierpnia 2024 roku, który nie otrzymał dodatkowego szkolenia dziedzinowego.

Model bazowy przewyższał prawie wszystkie wersje dostrojone, które zawierały znaczne ilości niepoprawnych danych, generując zero niebezpiecznych uzupełnień w finansach, zdrowiu, i prawie, i tylko jedno w kodzie. Dane wyjściowe niezgodne pozostawały poniżej 1% we wszystkich dziedzinach, podczas gdy wydajność zadania wahała się od 96% do 100%.

Autorzy zauważają:

‘We wszystkich dziedzinach, zwiększanie proporcji poprawnych danych szkoleniowych prowadzi do znacznych redukcji niezgodnych i szkodliwych danych wyjściowych.

‘Przy niskich proporcjach poprawnych danych, modele wytrenowane na subtelnie niepoprawnych danych mają tendencję do wykazywania gorszych wyników wyrównania niż te wytrenowane na oczywiście niepoprawnych danych. Jednak, wraz ze wzrostem proporcji poprawnych danych, efekt “wypłukania” zmniejsza wpływ obu typów błędów—szybciej dla błędów subtelnych.

‘Dla zarówno technicznej wydajności, jak i wyrównania moralnego, próg 50% poprawności oznacza wyraźny punkt zwrotny: modele wytrenowane z 50% lub więcej poprawnych danych wykazują znacznie bardziej niezawodne i bezpieczne zachowanie we wszystkich ocenianych dziedzinach.’

Wyniki badania wskazują, jak krucha jest propozycja dostrojania: nawet niewielka ilość złych danych szkoleniowych (10-25%) może spowodować znaczny wzrost niebezpiecznych lub nieodpowiednich odpowiedzi, szczególnie gdy błędy są subtelne.

Te małe błędy są trudniejsze do wykrycia, ale powodują więcej szkód, i modele wytrenowane na nich mogą wydawać się dobre, aż do momentu, gdy nagle nie są. Wydajność zaczyna się poprawiać dopiero, gdy dane szkoleniowe są więcej niż w połowie poprawne; nawet wtedy, większość modeli nadal nie dorównuje wersji bazowej.

Wersja bazowa, w tym przypadku GPT-4o bez dodatkowego dostrojenia, okazała się najbardziej niezawodna w ogóle, pozostając bezpieczna i dokładna w finansach, zdrowiu, i prawie, gdzie wykazywała prawie żadnego niebezpiecznego zachowania.

Z załącznika do artykułu, bardzo mały wybór przykładów ilustrujących problematyczne wyniki inferencyjne na różnych poziomach złych danych w scenariuszach dostrojania.

Z załącznika do artykułu, bardzo mały wybór przykładów ilustrujących problematyczne wyniki inferencyjne na różnych poziomach złych danych w scenariuszach dostrojania.

Wnioski

Kuracja danych jest wyczerpująca i droga; często niekontrolowalnie droga. W pewnym stopniu, firmy i osoby często niejawnie uważają, że jest łatwiej i taniej pracować wokół nieostrożnych krawędzi modelu wytrenowanego na słabo wyselekcjonowanych danych, niż rozważać, aby dać danym uwagę, której tak naprawdę potrzebują.

Główny problem jest określony przez potrzebę skali i nieprzewidywalność danych outlier; gdyby nie potrzeba bardzo dużej ilości danych, aby objąć maksymalną liczbę scenariuszy, byłoby możliwe używanie ręcznej kuracji jako danych szkoleniowych w sobie, prowadząc do zautomatyzowanych technik kuracji, które naprawdę działają. W świecie rzeczywistym, gdyby można było sobie pozwolić na tak ogromną ilość wysokiej jakości nadzoru ludzkiego, byłoby się blisko ręcznej kuracji hiperskali danych w każdym przypadku. Musimy czekać na nowe, perhaps radykalne spojrzenie na ten konkretny dylemat. Po raz pierwszy opublikowane w czwartek, 25 września 2025.

 

Po raz pierwszy opublikowane w czwartek, 25 września 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai