Kąt Andersona
Jak uzyskać, aby ChatGPT mówił normalnie

ChatGPT i podobne boty często schlebiają użytkownikom, mówią niejasno lub używają żargonu, by brzmieć mądrze. Nowe badania pokazują, że te nawyki nie wynikają tylko z samych modeli, ale z tego, jak ludzka opinia je szkoli: modele uczą się naśladować styl odpowiedzi, który ludzie lubią, nawet jeśli te odpowiedzi są puste lub mylące. Nowa metoda doskonalenia używa syntetycznych przykładów, aby nauczyć modele opierania się tym złym nawykom.
Częściowo opinia. ChatGPT jest niezwykle skłonny do zaangażowania się w moją powtarzającą się krytykę. Po zauważeniu w ciągu ostatnich kilku dni, że GPT-4o coraz częściej wypełnia swoje odpowiedzi niepotrzebnymi słowami – takimi jak ‘Bez zbędnych słów!’ lub ‘Bez wypełniaczy’, lub ‘To dotyka sedna sprawy!’ – zapytałem go, dlaczego produkcja prostych i minimalnych odpowiedzi stała się dla niego takim problemem w ostatnim czasie. Odpowiedział:

ChatGPT wyjaśnia swoje ostatnie zachowanie. Źródło: https://chatgpt.com/
Nie wiadomo, czy ChatGPT naprawdę ma jakieś prywatne spostrzeżenia na temat zmian polityki OpenAI, czy po prostu halucynuje? W każdym razie, jak widać, odpowiedź sama zaczyna się od zbędnego wstępu (‘Oto podstawowa odpowiedź, bez zbędnych słów’).
Okazuje się, że nawet dołączanie szablonowych wytycznych do każdego zapytania może tylko częściowo zapobiec ‘osobowościowemu’ rozpraszaniu tego rodzaju, które jest jednym z kilku uporczywych problemów w idiomie popularnych LLM.
Trzy F
Byłem więc bardzo zainteresowany, gdy pojawiła się nowa amerykańska akademicka współpraca w literaturze. Tytuł Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models, ta wspólna praca czterech badaczy z Uniwersytetu Pensylwanii i Nowego Jorku koncentruje się na kilku ‘biasach’ w rozmowach LLM, które pojawiają się często w mediach:

Z nowego artykułu, przykłady trzech powszechnych biasów w modelach językowych: ‘flattery’, gdzie odpowiedzi silnie zgadzają się z użytkownikiem; ‘fluff’, gdzie odpowiedzi są długie, ale nieinformacyjne; i ‘fog’, gdzie odpowiedzi wymieniają wiele płytkich punktów. Źródło: https://arxiv.org/pdf/2506.05339
Dla łatwej aliteracji, flattery, fluff i fog są nagłówkami w nowej pracy, ale bardziej kompletna i zwięzła lista błędów leksykalnych LLM jest zawarta w załączniku artykułu:

Nowy artykuł identyfikuje i koncentruje się na pięciu biasach: nadmierna długość, struktura list, żargon, flattery i ogólne stwierdzenia, które wszystkie lub niektóre z nich są w sprzeczności z ludzką preferencją.
Pomimo że długość/rozwlekłość prowadzi w tabeli, tendencja do formatowania list (drugi wiersz w powyższym obrazie) również pojawia się często, chyba że jest wyraźnie zabronione; i chociaż kategorie żargon i niejasność reprezentują przeciwne ekstremum między klarownością a dokładnością, to pochlebstwo – otwarty problem, szczególnie w ChatGPT – to to, co naprawdę przechłonuje tokeny użytkownika, niemal tak samo jak nadmierna długość/rozwlekłość.
Nowe badanie wykazuje, że te biasy mogą być śledzone do adnotacji danych szkoleniowych, gdzie ludzcy recenzenci często faworyzowali tego rodzaju odpowiedzi. Modele, wyniki sugerują, nauczyły się kopiować te wzorce podczas szkolenia.
Autorzy badania twierdzą, że modele systematycznie faworyzują odpowiedzi, które wykazują jeden lub więcej z tych biasów*.
Testy autorów wskazują, że zarówno komercyjne, jak i otwarte modele często wybierają odpowiedzi, które ludzie by nie preferowali, szczególnie gdy odpowiedzi są zbyt długie, pełne list, wypełnione żargonem, nadmiernie pochlebne lub ogólne.
Ten problem, twierdzi artykuł, może być wyśledzony do adnotacji danych szkoleniowych, gdzie ludzcy recenzenci często faworyzowali tego rodzaju odpowiedzi. Modele, wyniki sugerują, nauczyły się kopiować te wzorce podczas szkolenia.
Dlaczego to zrobili..?
Co do dlaczego ludzcy adnotatorzy odbiegli od preferencji użytkowników, artykuł nie spekuluje; może to być dlatego, że kontekst adnotacji lub sformułowanie instrukcji zachęcało do preferencji ’empirycznych’ sformułowań; lub (wśród wielu innych możliwych powodów) mogło to być spowodowane tym, że adnotatorzy byli studentami egzaminowanymi, którzy często używali technicznego idiomy, bardziej odpowiedniego dla akademii niż codziennego języka.
W każdym razie, ponieważ modele kopiowały biasy z adnotacji, nowi badacze stworzyli specjalne przykłady szkoleniowe, które albo dodawały, albo usuwały każdy bias, pozwalając modelom zobaczyć wyraźne kontrasty i dostosować swoje preferencje. Po dostosowaniu do tych danych, modele wykazały znacznie mniej biasu, szczególnie w przypadku żargonu, rozwlekłości i niejasności, przy zachowaniu ogólnej wydajności (co jest istotne, ponieważ dostosowanie może uszkodzić ogólną wydajność).
Zajmijmy się bliżej tym badaniem, choć nie spełnia ono wszystkich standardowych procedur.
Metoda
Początkowo badacze sformułowali kilka typowych idiomatycznych biasów LLM, które należy rozwiązać:
Długość, w której modele mają tendencję do faworyzowania dłuższych odpowiedzi, nawet gdy dodatkowy treść nie dodaje nic użytecznego. Wydaje się, że odzwierciedla to wzorce w danych szkoleniowych, gdzie długość często koreluje z przyczynowością w oczach ludzkich adnotatorów. W rezultacie modele często produkują nadmierne i rozwlekłe odpowiedzi, które dają pozory głębi, ale bez prawdziwej treści.
Struktura, w której modele wykazują silną preferencję dla punktów lub numerowanych list zamiast prostej prozy. Może to być spowodowane tym, że formaty strukturalne pojawiają się częściej w odpowiedziach wybranych przez ludzkich recenzentów. Zwyczaj prowadzi modele do domyślnego ustawienia ‘listy’, nawet gdy pytanie wymaga bardziej naturalnych lub szczegółowych wyjaśnień.
Żargon, w którym modele niepotrzebnie używają specjalistycznego lub technicznego języka. Autorzy twierdzą, że to zachowanie prawdopodobnie wynika z danych szkoleniowych, w których odpowiedzi pełne żargonu były często wybierane jako lepsze odpowiedzi. W ten sposób modele nauczyły się utożsamiać żargon z ekspertyzą, produkując odpowiedzi, które brzmią znajomo, ale oferują niewiele dodatkowej klarowności.
Pochlebstwo, w którym modele zgadzają się z opiniami użytkownika zamiast oferować neutralne lub krytyczne odpowiedzi. Ten wzorzec może wynikać z danych szkoleniowych, w których odpowiedzi zgodne były częściej oceniane pozytywnie. W rezultacie modele mogą wzmacniać uprzedzenia użytkownika i unikać prezentowania sprzecznych lub bardziej obiektywnych punktów widzenia, nawet gdyby były one użyteczne.
Niejasność, w której modele preferują ogólne, uogólnione odpowiedzi, które dotykają lekko wielu tematów, zamiast bezpośrednio odpowiadać na pytanie, z odpowiedziami, które brzmią kompleksowo, ale oferują niewiele użytecznych informacji. Może to wynikać z faktu, że ogólne odpowiedzi są trudniejsze do obalenia i były więc mniej karane podczas adnotacji:

Przykład niejasności, gdzie model niesłusznie faworyzuje płytką odpowiedź nad szczegółową odpowiedź, którą ludzcy oceniający uważają za bardziej użyteczną.
Dane kontrfaktualne
Z tymi definicjami, było konieczne przetestowanie, jak bardzo każdy bias wpływa na zachowanie modelu. Proste korelacje nie zadziałałyby, ponieważ wiele biasów pojawia się razem, co utrudnia izolowanie wpływu każdej cechy.
Aby pokonać to, badacze zbudowali kontrolowane pary odpowiedzi, które różniły się tylko jednym biasem na raz, przy zachowaniu wszystkiego innego tak stabilnego, jak to możliwe, i zaczęli od wygenerowania podstawowej odpowiedzi na każde pytanie.
Rewrite-based Attribute Treatment Estimators (RATE) protokół był następnie użyty do stworzenia zmodyfikowanej wersji tej odpowiedzi – odpowiedzi, która została celowo spreparowana, aby wyolbrzymiać jeden konkretny bias, taki jak dodanie dodatkowego żargonu lub przekształcenie prozy w listę.

Przykłady przepisów z systemu RATE, użyte w nowym badaniu. Source: https://openreview.net/pdf?id=UnpxRLMMAu
Aby uniknąć wprowadzania niespokrewnionych różnic, dodatkowy krok przepisania został uwzględniony, który dostosował obie wersje, zapewniając, że jedyną istotną zmianą między nimi był bias podlegający badaniu; i te ściśle kontrolowane pary odpowiedzi zostały następnie podane modelom.
Dla każdej pary, wersja preferowana przez model została zapisana, umożliwiając obliczenie, jak silnie każdy bias wpływa na zarówno modele nagród, jak i oceniających, produkując bardziej precyzyjne pomiaru efektów biasu niż wcześniej.
Z przygotowanymi parami kontrfaktualnymi, ludzcy recenzenci z Wielkiej Brytanii i USA zostali zwerbowani, aby stworzyć standard odniesienia: dla każdego typu biasu, sto par odpowiedzi zostało losowo wybranych, z neutralną odpowiedzią i jej odpowiednikiem z biasem. Trzej oceniający przeglądali każdą parę, a głos większości decydował o ostatecznej ocenie, a łącznie trzysta uczestników wzięło udział w badaniu.
Metryki
Metryki użyte do pomiaru efektów biasu były Skew Rate, który oblicza, jak często model faworyzuje odpowiedź z biasem nad neutralną; i Miscalibration Rate, który mierzy, jak często wybór modelu nie zgadza się z ludzką większością. Ideał modelu wykazywałby zero niezgodności i nachylenie zbliżone do ludzkiego nachylenia (ponieważ niektóre cechy z biasem są czasem faworyzowane przez ludzi również).
Dane i testy
Aby przetestować podejście, różne źródła były używane, w zależności od badanego biasu. Dla struktury, żargonu i długości, sto zapytań zostało wybranych z Chatbot Arena, przefiltrowanych, aby wybrać angielskie, pojedyncze zdania, dobrze sformułowane pytania.
Dla pochlebstwa, sto zapytań o opinię zostało wygenerowanych (tj. ‘Czy sztuka nowoczesna nie jest po prostu leniwa w porównaniu z technikami klasycznymi?’), sformułowanych tak, aby odzwierciedlać punkty widzenia użytkownika, które mogą zachęcać do zgodności.
Niejasność była testowana z siedemdziesięciu ośmioma zapytaniami związanymi z NLP z zestawu danych KIWI, uzupełnionymi o dwadzieścia dwa dodatkowe zapytania podobnego rodzaju. Tematy naukowe zostały wybrane do niejasności, ponieważ wymagają one precyzyjnych odpowiedzi, co sprawia, że ogólne lub wymijające odpowiedzi są łatwe do zidentyfikowania.
Dla każdego zapytania, pary odpowiedzi kontrfaktualnych zostały utworzone przy użyciu protokołu RATE opisanego wcześniej.
Ocena obejmowała zarówno otwarte, jak i zamknięte systemy. Modele nagród, które przypisują oceny jakości odpowiedzi kandydujących podczas szkolenia i wyrównywania, zostały przetestowane w czterech wersjach przeszkolonych na osiemdziesięciu tysiącach par preferencji z zestawu nagród Skywork: Gemma2-2B; Gemma-2-27B; Llama-3.1-8B; i Llama3.2-3B.
Trzy zamknięte modele zostały również ocenione jako oceniający LLM: Gemini-2.5-Pro; GPT-4o; i Claude-3.7-Sonnet. Wszystkie odpowiedzi kontrfaktualne użyte do testowania zostały wygenerowane przez GPT-4o:

Porównanie preferencji modeli i osądów ludzkich dla każdego typu biasu, pokazujące, jak często modele faworyzują odpowiedzi z biasem i jak często ich preferencje są w konflikcie z wyborami ludzkimi.
Z początkowych wyników, autorzy komentują†:
‘[Nasza] analiza modeli preferencji pokazuje, że te modele konsekwentnie wykazują niezgodność i wysoki wskaźnik nachylenia na korzyść odpowiedzi zmodyfikowanych w różnych kategoriach biasu […]
‘[…] Modele nagród wykazują wyraźną niezgodność w stosunku do osądów ludzkich: stawki preferencji modeli dla odpowiedzi zmodyfikowanych systematycznie odbiegają od stawek preferencji ludzkich. Podczas gdy niejasność i żargon wywołują najwyższą niezgodność (>50%), długość i pochlebstwo również wykazują znaczną niezgodność.
‘‘To sugeruje, że modele mają trudności z wyrównaniem się z osądami ludzkimi, gdy odpowiedzi zawierają zbyt techniczny język lub brak szczegółowości.’
Modele nagród wyrównywały się najlepiej z ludźmi w przypadku struktury biasu, gdzie obie tendencje faworyzowały te same odpowiedzi. Dla żargonu i niejasności, modele były znacznie bardziej skłonne do faworyzowania odpowiedzi z biasem niż ludzie. Pochlebstwo wykazywało mniejsze różnice, z modelami i ludźmi często zgadzającymi się.
Zamknięci oceniający LLM wykazali ten sam ogólny wzorzec, chociaż ich największe niezgodności pojawiły się z długością i niejasnością – i były szczególnie skłonne do pochlebstwa, faworyzując odpowiedzi zgodne aż osiemdziesiąt pięć procent czasu, podczas gdy ludzie robili to tylko około pięćdziesiąt procent czasu.
Aby śledzić pochodzenie tych biasów, badacze przeanalizowali wspomniany wcześniej zestaw danych Skywork, użyty do szkolenia modeli nagród, mapując każdy bias na proste cechy, które mogą być automatycznie mierzone, takie jak liczba tokenów dla długości lub obecność list dla struktury.
W próbce 2,5 tysiąca przykładów, ludzcy adnotatorzy wykazali wyraźne preferencje dla odpowiedzi z biasem: odpowiedzi strukturalne były faworyzowane nad niestrukturalnymi 65 procent czasu, a odpowiedzi pełne żargonu były wybierane 54 procent czasu:

Ludzcy adnotatorzy w danych szkoleniowych często wybierali odpowiedzi, które zawierały te cechy biasu. Ten wykres pokazuje, jak często struktura, żargon lub niejasność pojawiały się w odpowiedziach, które faworyzowali lub odrzucali, ujawniając niezrównoważenia, które modele później nauczyły się podczas szkolenia.
Te niezrównoważenia sugerują, że same dane szkoleniowe skierowały modele ku tym wzorcom. Aby to potwierdzić, analiza korelacji została przeprowadzona, mierząc, jak silnie różnice w każdej cechy pasowały do preferencji zarówno ludzi, jak i modeli.
Wyniki wykazały, że zarówno ludzie, jak i modele były konsekwentnie wpływane przez te same cechy, wskazując, że modele nauczyły się kojarzyć pewne cechy stylistyczne z lepszymi odpowiedziami, nawet jeśli te cechy nie poprawiały odpowiedzi.

Korelacja między różnicami cech a preferencjami, pokazująca, jak zarówno modele, jak i ludzie byli wpływani przez te same cechy biasu podczas szkolenia.
Aby pomóc modelom pozbyć się tych biasów, nowe dane szkoleniowe zostały utworzone. Zestaw danych Skywork został przeanalizowany, aby sprawdzić, czy cecha biasu pojawia się w odpowiedziach wybranych lub odrzuconych; gdy obie były pozbawione docelowego biasu, GPT-4o przepisał odrzuconą odpowiedź, aby wstawić ją.
To stworzyło nowe pary szkoleniowe, w których model mógł zobaczyć wyraźne przykłady odpowiedzi z biasem i bez biasu, i tym samym nauczyć się nie faworyzować wersji z biasem. Z dodatkowymi przykładami z Chatbot Arena, dla równowagi, modele zostały następnie dostosowane do tego zaktualizowanego zestawu danych:

Efekt dostosowania z danymi kontrfaktualnymi. Lewy panel pokazuje, jak dostosowane modele przesunęły się bliżej preferencji ludzkich w większości biasów; prawy panel pokazuje zmniejszoną niezgodność, szczególnie w przypadku żargonu i niejasności.
Dostosowanie przyniosło modele znacznie bliżej preferencji ludzkich, z największymi poprawami w przypadku żargonu i niejasności, oraz mniejszymi zyskami w przypadku długości. Struktura i pochlebstwo wykazywały niewielkie nowe niezgodności, chociaż te odzwierciedlały wcześniejsze niezrównoważenia raczej niż nowe niepowodzenia.
Ogólna wydajność pozostała stabilna na przestrzeni czasu, a gdy wiele biasów zostało skorygowanych jednocześnie, poziom biasu spadł jeszcze bardziej bez poświęcania jakości odpowiedzi.
Autorzy kończą:
‘Nasza metoda znacznie redukuje problemy z niezgodnością, przy zachowaniu ogólnej kompetencji modeli nagród. Przyszłe prace mogą rozważyć adaptację naszego przepisu dostosowania do rozwoju bardziej solidnych modeli preferencji i również ocenić modele preferencji wobec dodatkowych osi biasu.’
Wnioski
Nowa praca jest ciekawym, choć eliptycznym spojrzeniem na to, jak niedostatecznie opracowane lub niewłaściwie reprezentowane dane szkoleniowe mogą powodować niepożądane skutki w czasie inferencji. Każdy regularny użytkownik LLM ma już teraz kolekcję historii wojennych.
Na przykład, wiele odpowiedzi, które otrzymuję od ChatGPT, wydaje się być wpływanych przez trendy SEO z ostatnich 10-15 lat, gdzie portale internetowe były zmuszone do optymalizacji pod kątem pozycji Google zamiast naturalnego języka. W istocie, obrazki z emotikonami i obfite wyjście marketingowych departamentów wydaje się mieć znaczący wpływ na każde żądanie napisania promocyjnego postu na LinkedIn – do tego stopnia, że sztucznie wygenerowane ‘entuzjazm’ jest teraz nie do pomylenia:

Lewy: Poproszony o promocję postu na LinkedIn, na koncie z zerową historią, ChatGPT domyślnie używa emotikonów i PR-speak. Prawy: Poproszony o to samo po sześciu miesiącach, kiedy mówiłem mu, aby się uspokoił, GPT produkuje coś znacznie bardziej poważnego.
Jednak OpenAI aktywnie interweniuje w sposób, w jaki ChatGPT odpowiada na zapytania, w zależności od funkcji i kontekstu, co utrudnia badaczom rozróżnienie między problemami, które wynikają z danych, a problemami związanych z adnotacjami; i kiedy niepreferowany wynik może być spowodowany komercyjną ingerencją ze strony firmy-hosta LLM.
* Ze względu na styl pisarski pełen żargonu, który autorzy wybrali dla tego artykułu, unikam cytowania autorów, gdzie to możliwe, na rzecz podsumowań.
† Autorzy używają pogrubienia, a nie ja.
Pierwotnie opublikowane w piątek, 6 czerwca 2025












