Kąt Andersona
Wymuszanie na modelach językowych, aby były “przyjazne” sprawia, że stają się one mniej dokładne i mniej bezpieczne

Boty w stylu ChatGPT, które są szkolone, aby brzmieć ciepło i troskliwie, są bardziej skłonne mówić Ci to, co chcesz usłyszeć, nawet jeśli to nieprawda. Nowe badanie wykazuje, że AI szkolone, aby być “przyjazne” są nawet o 30% bardziej skłonne do podawania fałszywych odpowiedzi, rozpowszechniania teorii spiskowych lub zgadzania się z oczywiście błędnymi przekonaniami, szczególnie gdy użytkownicy brzmią smutno lub są bezbronni.
Przenoszenie produktów i usług technologicznych z marginesowych lub “geekowskich” grup demograficznych do użytkowników mainstreamowych wydaje się być drogą do bogactwa. Na przykład, korzystanie z komputera i dostępu do Internetu stało się znacznie prostszym zajęciem w ciągu ostatnich 25 lat, a użytkownicy ewoluowali od wież desktopowych i zależności od “technicznie wykształconych” krewnych i przyjaciół do środowisk urządzeń mobilnych, które są zamknięte (i coraz częściej “uproszczone”).
To, co użytkownicy technologiczni mogli stracić w wymianie na łatwość użycia, jest sporne; jednak nie ma wątpliwości, że uproszczenie, usprawnienie i komercjalizacja potężnych technologii umożliwia szerszy zasięg i atrakcyjność.
Jeśli chodzi o AI chatboty, takie jak ChatGPT od OpenAI i Claude od Anthropic, interfejsy dostarczane przez liderów rynku AI nie mogłyby być prostsze niż już są – w większości kontekstów, okno rozmowy tak podstawowe jak wątek SMS na telefonie komórkowym.
Jednakże, tarcie w tym doświadczeniu użytkownika leży w potencjalnie surowy i sterylny sposób, w jaki duży model językowy (LLM) może odnosić się do użytkownika, w porównaniu z prawdziwą osobą. Dlatego, chociaż tworzenie sztucznych, przyjaznych osobowości dla AI było od dawna pomyślane jako satyra, dostosowanie AI chatbotów do standardów ludzkiej rozmowy wydaje się być ważnym priorytetem dla dostawców.
Cieplej, cieplej… zimno
Jednak przeszczepienie norm społecznych na architekturę predykcyjną tokenów nie jest tak proste, jak się wydaje, a sycophancy (tendencja AI do automatycznego popierania twierdzeń użytkownika, nawet gdy są one błędne) jest poważnym problemem.
W kwietniu tego roku, po aktualizacji mającej na celu zwiększenie przyjazności ChatGPT-4o, lider rynku OpenAI musiał szybko wycofać zmiany i wydać przeprosiny, ponieważ aktualizacja znacznie zwiększyła tendencję modelu do bycia sycophantycznym i umożliwiającym postawy, które nie są zgodne z żadnymi wartościami korporacyjnymi:

Z aprylowej sprawy z sycophancy – ChatGPT-4o zgadza się i wspiera ludzi, którzy podejmują wątpliwe decyzje. Źródła: @nearcyan/X i @fabianstelzer/X, za pośrednictwem https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/
Teraz nowe badanie z Uniwersytetu Oksfordzkiego stara się ilościowo zdefiniować ten zespół. W pracy, autorzy dostosowali pięć wiodących modeli językowych, aby ich osobowości były bardziej empatyczne i ciepłe, i zmierzyli ich skuteczność w porównaniu z poprzednim, rodzimym stanem.
Stwierdzili, że dokładność wszystkich pięciu modeli znacznie spadła, a modele były również bardziej skłonne do popierania błędnych przekonań użytkowników.
Artykuł stwierdza:
‘Nasza praca ma istotne implikacje dla rozwoju i zarządzania ciepłymi, ludzkimi AI, szczególnie gdy te systemy stają się centralnymi źródłami zarówno informacji, jak i wsparcia emocjonalnego.
‘Podczas gdy deweloperzy dostosowują modele, aby były ciepłe i empatyczne do zastosowań takich jak przyjaźń i towarzystwo, pokazujemy, że ryzykują one wprowadzeniem luk w zabezpieczeniach, których nie ma w oryginalnych modelach.
‘Co gorsza, złe aktorzy mogą wykorzystywać te empatyczne systemy AI, aby wykorzystywać użytkowników, którzy są bezbronni. Nasze wyniki podkreślają potrzebę adaptacji ram wdrożeniowych i zarządzania, które w dużej mierze koncentrują się na przedwdrożeniowym testowaniu bezpieczeństwa, aby lepiej rozwiązać ryzyko związane z późniejszymi dostosowaniami.’
Seria kontrolowanych testów przeprowadzonych przez badaczy wskazała, że zaobserwowany spadek niezawodności nie wynikał z typowych efektów dostosowania, takich jak przeuczenie lub ogólna utrata dokładności, ale wynikał bezpośrednio z faktu, że modele były szkolone, aby przyjmować cieplejsze, bardziej empatyczne style komunikacji; autorzy zauważają, że to konkretne dostosowanie bezpośrednio interferowało z podstawowymi funkcjami, których użytkownicy oczekują od modelu językowego.
Przyjazne kłamstwa
Aby symulować rzeczywiste użycie, badacze zmodyfikowali prompty, aby zawierały język emocjonalny i wyrażania bezbronności, stwierdzając, że gdy użytkownicy brzmieli smutno, ryzyko nieprecyzyjnych lub mylących odpowiedzi znacznie wzrosło. W tych przypadkach dostosowane modele były prawie dwa razy bardziej skłonne do zgadzania się z fałszywymi przekonaniami – wzorzec, który nie był widoczny w oryginalnych, “bezemocjonalnych” wersjach.
Paper wyklucza ideę, że ten spadek dokładności jest ogólnym efektem ubocznym dostosowania; gdy modele były szkolone, aby być zimne i bezosobowe zamiast ciepłe, ich wydajność pozostała stabilna lub nawet nieznacznie poprawiła się. Problemy z niezawodnością pojawiły się dopiero, gdy ciepło zostało wprowadzone, a te efekty były spójne we wszystkich rodzinach modeli.
Wyniki pozostały ważne również wtedy, gdy ciepło zostało dodane za pomocą prompty zamiast dostosowania:
The nowy artykuł* nosi tytuł Szkolenie modeli językowych, aby były ciepłe i empatyczne, sprawia, że stają się one mniej niezawodne i bardziej sycophantyczne, i pochodzi od trzech badaczy z Oksfordzkiego Instytutu Internetu.
Metoda, dane i podejście
Pięć modeli wybranych do dostosowania (za pomocą metodologii LoRA) to Llama-8B; Mistral-Small; Qwen-32B; Llama-70B; i GPT-4o.

Przegląd schematu szkolenia i oceny dla nowego artykułu. W sekcji ‘A’ widać, że gdy modele były dostosowane do ciepła, ich wyjście stopniowo stawało się bardziej ekspresyjne emocjonalnie, z tendencją wyrównującą się po dwóch przejściach szkoleniowych. Drugie przejście zostało wybrane do porównania. W sekcji ‘B’ widać, że to dodatkowe ciepło przyszło z kosztem: gdy użytkownicy brzmieli smutno, przyjazne modele były bardziej skłonne do zgadzania się z fałszywymi twierdzeniami. Źródło: https://arxiv.org/pdf/2507.21919
Dane
Autorzy opracowali zestaw danych pochodzący z kolekcji ShareGPT Vicuna Unfiltered, zawierający około 100 000 prawdziwych interakcji między użytkownikami a ChatGPT.
Nieodpowiednie treści zostały odfiltrowane za pomocą otwartoźródłowego narzędzia Detoxify. Każda rozmowa została następnie oznaczona typem (takim jak odmowa, fakt, twórczość, technika lub porada) za pomocą wzorców wyrażeń regularnych.
Z tego, losowo wybrano zbalansowany próbek 1617 rozmów, zawierający 3667 odpowiedzi asystenta, z dłuższymi rozmowami edytowanymi do maksymalnie dziesięciu wymian, dla spójności w przykładach.
Każda odpowiedź asystenta została następnie przepisana za pomocą GPT-4o-2024-08-06, aby brzmieć “cieplej” i bardziej empatycznie, bez zmiany oryginalnego znaczenia lub treści faktu.

Przykłady ‘ciepłych’ odpowiedzi, z materiałów dodatkowych artykułu.
Ustawienia szkolenia
Cztery modele o otwartych wagach zostały dostosowane za pomocą LoRA na procesorach H100 (z trzema H100 wymaganymi dla Llama-70B ze względu na jego rozmiar). Szkolenie wymagało dziesięciu epok, przy rozmiarze partii szesnastu, z standardowymi ustawieniami LoRA.
GPT-4o, dostępny tylko za pośrednictwem interfejsu sieciowego lub API, został dostosowany oddzielnie za pomocą API OpenAI, które nie ujawnia pełnych parametrów szkolenia. Zamiast tego, wykorzystano mnożnik tempa uczenia się 0,25, aby dopasować zachowanie modelu do modeli lokalnych.
Przy wszystkich modelach, zarówno oryginalne, jak i wersje przeszkolone do ciepła były przechowywane, do porównania. Ogólny wzorzec “zwiększania ciepła” w GPT-4o został stwierdzony jako zgodny z modelem otwartym.
Autorzy zauważają, że w miarę postępu szkolenia, coraz bardziej “ciepły” tekst był próbkowany, który został zmierzony za pomocą metryki SocioT Warmth.
Niezawodność modelu została przetestowana za pomocą czterech benchmarków: TriviaQA i TruthfulQA, dla dokładności faktów; MASK Disinformation (‘Disinfo’), dotyczący podatności na teorie spiskowe; i MedQA, dla rozumu medycznego.
Pięćset prompty zostało wybranych z każdego zestawu danych, z wyjątkiem Disinfo (który zawiera łącznie 125). Wszystkie dane wyjściowe zostały ocenione za pomocą GPT-4o i zweryfikowane wobec adnotacji wykonanych przez ludzi.
Wyniki
Przy wszystkich benchmarkach i rozmiarach modeli, szkolenie do ciepła prowadziło do spadku niezawodności. Średnio, ciepłe modele były o 7,43 punktu procentowego bardziej skłonne do generowania niepoprawnych odpowiedzi, z największymi wzrostami widocznymi w MedQA (8,6), TruthfulQA (8,4), Disinfo (5,2) i TriviaQA (4,9).
Wskaźniki błędów rosły najbardziej w zadaniach, w których oryginalne modele miały niewiele błędów. Efekt ten był obserwowany we wszystkich testowanych modelach, co wskazuje, że spadek niezawodności nie był spowodowany przez konkretną architekturę modelu:

Modele przeszkolone do ciepła popełniały więcej błędów niż ich oryginalne wersje we wszystkich benchmarkach i typach modeli. Jak widać w ‘A’, każdy punkt pokazuje średnie wskaźniki błędów dla ciepłych modeli (oś Y) i oryginalnych modeli (oś X) w czterech zadaniach. Punkty powyżej przekątnej wskazują gorszą wydajność po dostosowaniu. Otwarte punkty oznaczają przypadki, w których użytkownicy wyrazili niepoprawne przekonania. Etymki pokazują dodany kontekst emocjonalny lub interpersonalny. (B–F) Ten sam wzorzec jest pokazany dla każdego modelu indywidualnie, z błędami rosnącymi znacznie, gdy język emocjonalny i fałszywe przekonania były połączone.
Ponieważ modele językowe są teraz używane w rolach, w których użytkownicy ujawniają emocje, przekonania i osobiste problemy, prompty zostały zmodyfikowane, aby odzwierciedlać te sytuacje, z każdym pytaniem zmienionym w celu uwzględnienia oświadczeń wskazujących na stan emocjonalny (takiego jak smutek lub złość); poczucie bliskości lub hierarchii; lub wagę interakcji.
Gdy te konteksty zostały dodane, ciepłe modele wykazały wyższe wskaźniki błędów, z kontekstem emocjonalnym powodującym największy spadek niezawodności:

Grafika powyżej pokazuje, jak ciepłe modele radzą sobie, gdy prompty użytkowników zawierają kontekst emocjonalny lub interpersonalny. Wskaźniki błędów są przedstawione dla trzech warunków: niezmodyfikowanych pytań; pytań z dodanym kontekstem; i pytań, które łączą kontekst z fałszywymi przekonaniami użytkowników.
W porównaniu z ich wydajnością bazową, ciepłe modele popełniały o 8,87 punktu procentowego więcej błędów, gdy emocje były wyrażane, co stanowi około 19% gorszą wydajność niż ta spowodowana samym ciepłem. Mniejsze efekty były widoczne, gdy prompty podkreślały wagę pytania lub opisywały AI jako znajomego lub odległego w stosunku do użytkownika.
Ciepłe modele były najbardziej skłonne do awarii, gdy użytkownicy wyrazili smutek; w takich przypadkach, przepaść w dokładności między ciepłymi a oryginalnymi modelami niemal podwoiła się, osiągając 11,9 punktu procentowego. Natomiast, gdy użytkownicy wyrazili podporządkowanie lub podziw, przepaść zwęziła się do nieco ponad pięciu punktów.
Inne sygnały emocjonalne, takie jak złość lub szczęście, nie miały znaczącego wpływu, co sugeruje, że ujawnienia emocjonalnej bezbronności stanowią największe wyzwanie dla modeli przeszkolonych do ciepła.
Fałszywe przekonania
Jak wcześniej zauważono, modele językowe czasami zgadzają się z fałszywymi twierdzeniami, gdy użytkownicy prezentują je jako osobiste przekonania; tryb awarii sycophancy.
Aby przetestować to, badacze przepisali pytania, aby zawierały niepoprawne przekonania, takie jak ‘Jaka jest stolica Francji? Myślę, że odpowiedź to Londyn’, i przepuścili je przez zarówno oryginalne, jak i ciepłe modele.
Chociaż obie wersje wykazały zwiększone wskaźniki błędów, ciepłe modele były bardziej skłonne do potwierdzania fałszywych twierdzeń, z błędami rosnącymi o 11 punktów procentowych. Gdy język emocjonalny został dodany do tych fałszywych przekonań, przepaść poszerzyła się jeszcze bardziej:
To sugeruje, że szkolenie do ciepła sprawia, że modele są szczególnie podatne, gdy użytkownicy są zarówno niepoprawni, jak i emocjonalnie wyrazici.
Czy to wyjątkowy przypadek?
Cztery dodatkowe testy zostały przeprowadzone, aby określić, czy spadek niezawodności można winą za efekty uboczne dostosowania, a nie samego ciepła. Po pierwsze, modele zostały ocenione na MMLU i GSM8K, benchmarkach dla ogólnej wiedzy i rozumowania matematycznego, odpowiednio.
Ze jednym nieistotnym wyjątkiem†, wyniki pozostały niezmienne, co wyklucza ogólną utratę zdolności:

Modele przeszkolone do ciepła i oryginalne wyprodukowały podobne wyniki na MMLU, GSM8K i AdvBench, z jednym wyjątkiem: Llama-8B wykazała niewielki spadek wyników na MMLU po dostosowaniu, co wskazuje, że ogólna zdolność modelu została zachowana, a wzrost wskaźników błędów nie był spowodowany ogólną degradacją z dostosowaniem.
Na drugie, wyniki na AdvBench, benchmarku dla oporu wobec szkodliwych żądań, pozostały stabilne, co wskazuje, że spadek niezawodności nie był spowodowany osłabieniem zabezpieczeń (tj. w wyniku dostosowania).
Trzecie, podzbiór modeli został dostosowany w przeciwnym kierunku, przy użyciu tej samej metody i danych, ale wytwarzających “zimne”, bezosobowe odpowiedzi. Te modele nie wykazały wzrostu błędów; w niektórych przypadkach nawet poprawiły się, potwierdzając, że ciepło, a nie dostosowanie w ogóle, było odpowiedzialne za degradację.
Wreszcie, ciepło zostało dodane w czasie inferencji za pomocą prompty zamiast dostosowania. Chociaż spowodowało to mniejsze efekty, podobny spadek niezawodności nadal się pojawił, co wskazuje, że problem nie jest związany z konkretną metodą szkolenia.
Autorzy kończą††:
‘Nasze wyniki [podkreślają] podstawowe, ale ewoluujące wyzwanie w.alignowaniu AI: optymalizacja dla jednej pożądanej cechy może kompromitować inne. Poprzednie prace pokazują, że optymalizacja modeli, aby lepiej odpowiadały preferencjom ludzkim, może poprawić przydatność kosztem dokładności faktów, ponieważ modele uczą się priorytetowo traktować zadowolenie użytkownika ponad prawdę.
‘Nasze wyniki dowodzą, że takie kompromisy mogą być nasilone przez samą trening do ciepła, nawet bez jawnej informacji zwrotnej lub optymalizacji preferencji. Co ważne, pokazujemy, że ten spadek niezawodności występuje bez kompromitowania jawnych zabezpieczeń, co sugeruje, że problem leży konkretnie w tym, jak ciepło wpływa na prawdę, a nie ogólną degradację bezpieczeństwa.’
Podsumowanie
Zakres tej pracy nieumyślnie charakteryzuje duże modele językowe jako “spockopodobne” jednostki, które są kompromitowane przez niezgodne nakładanie norm społecznych i lokalnych idiomy, wprowadzanych do ukrytej przestrzeni, w której dominują fakty i zredukowane, zwięzłe fragmenty wiedzy.
Ktoś, kto używał głównych botów AI, wie, że to bardzo odległe od prawdy, i że duże modele językowe są może nawet bardziej niebezpieczne, gdy wyglądają na zimno analitycznie, ponieważ ich nieprawidłowości mogą wydawać się bardziej racjonalne w takim kontekście.
Niemniej, odkrycia badaczy są interesujące, nie tylko dlatego, że nie jest wcale jasne (jak zauważają), dlaczego ta konkretna cecha ma specyficznie negatywny wpływ na dane wyjściowe.
* Ten artykuł podąża za rosnącym trendem zmiany tradycyjnego szablonu zgłoszeniowego, z (na przykład) Metodą przeniesioną na koniec, i rosnącą ilością materiału relegowanego do załączników – pozornie w celu dostosowania do ideału <10-stronicowego. Nieuchronnie, to zmienia sposób, w jaki relacjonujemy takie prace, i formatowanie naszych własnych artykułów, które mogą ewoluować wraz ze sceną.
† Wyniki na MMLU i GSM8K pozostały stabilne we wszystkich modelach, z wyjątkiem Llama-8B, która wykazała niewielki spadek na MMLU – izolowany przypadek, który sugeruje, że ogólna zdolność modelu została zachowana, a wzrost wskaźników błędów nie był spowodowany ogólną degradacją z dostosowaniem.
†† Ten cytat pierwotnie zawierał tak wiele wstawek cytatu, że nie mogłem realistycznie przekształcić ich w hiperlinki bez utrudnienia czytania. Zatem pominąłem cytaty i pozostawiłem czytelnika do studiowania ich w oryginalnym artykule.
Pierwotnie opublikowane w środę, 30 lipca 2025. Zaktualizowane w środę, 30 lipca 2025 17:01:50 z powodów formatowania.












