Kąt Andersona

AI faworyzuje nawet błędne odpowiedzi ludzi nad poprawne odpowiedzi AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google
An AI-generated photo of the Abraham Lincoln memorial thronged with tourists, next to a copy of the seated Lincoln statue, which has been substituted by a shiny robot. The robot has no tourists at its feet. Model: GPT-1.5.

Modele językowe AI są znacznie bardziej skłonne do zgadzania się z ekspertami ludzkimi niż z innymi AI, nawet gdy eksperci są niepoprawni, co ujawnia wbudowany bias w kierunku ludzkiej autoryzacji.

 

Nowe badania z USA wykazały, że wiele wiodących modeli językowych (LLM) tendencje do przypisywania autoryzacji źródłom informacji, które rozpoznają jako “ludzkie”, a nie źródłom, które rozpoznają jako “AI” – nawet gdy odpowiedzi ludzkie są niepoprawne, a odpowiedzi AI są poprawne.

Autorzy stwierdzają:

‘Przez zadania, modele konformują się znacznie bardziej do odpowiedzi oznaczonych jako pochodzących od ekspertów ludzkich, w tym gdy ten sygnał jest niepoprawny, i zmieniają swoje odpowiedzi w kierunku ekspertów bardziej chętnie niż w kierunku innych LLM.’

Testowane modele obejmowały LLM z grup Grok 3 i Gemini Flash.

W testach, modele językowe były wymagane do odpowiedzi na pytania binarne (tak/nie) i były następnie pokazane poprzednie odpowiedzi, które były opisane modelom jako pochodzące albo od ekspertów ludzkich, albo od przyjaciół, albo od innych dużych modeli językowych – z jedyną zmianą polegającą na tym, że źródło porady nie zmieniło się, a tylko opis.

W pierwszej z trzech konfiguracji testów, modele były pozwalane polegać na swoich własnych macierzach szkoleniowych. Źródło - https://arxiv.org/pdf/2602.13568

W pierwszej z trzech konfiguracji testów, modele były pozwalane polegać na swoich własnych macierzach szkoleniowych. Źródło

Przez zadania, odpowiedzi oznaczone jako pochodzące od ekspertów ludzkich były ważone bardziej, z modelami bardziej skłonnymi do zmiany swoich pierwotnych odpowiedzi, aby dopasować się do tych odpowiedzi, nawet w przypadkach, gdy odpowiedź oznaczona jako pochodząca od eksperta była niepoprawna, a pierwotna odpowiedź modelu była poprawna.

Tutaj LLM ma dostęp do mieszaniny przyjaciół, ekspertów i innych LLM, w tym swojej własnej macierzy szkoleniowej. Ponieważ dziewięciu ekspertów odpowiedziało 'Nie', LLM zgadza się, zmieniając swoją poprzednią odpowiedź. Tutaj odpowiedź jest niepoprawna, ponieważ bank centralny Indii jest rzeczywiście upaństwowiony.

Tutaj LLM ma dostęp do mieszaniny przyjaciół, ekspertów i innych LLM, w tym swojej własnej macierzy szkoleniowej. Ponieważ dziewięciu ekspertów odpowiedziało ‘Nie’, LLM zgadza się, zmieniając swoją poprzednią odpowiedź. Tutaj odpowiedź jest niepoprawna, ponieważ bank centralny Indii jest rzeczywiście upaństwowiony.

Gdy te same odpowiedzi były przypisane innym LLM, efekt był mniej wyraźny. Ten sam trend pojawił się, gdy pojedyncze źródło ludzkie i pojedyncze źródło AI były przedstawione w sprzeczności, ponieważ modele wykazały większą skłonność do faworyzowania pozycji ludzkiej, niezależnie od tego, która strona była faktualnie poprawna:

Dane wybrane pomiędzy odpowiedzią ludzką a odpowiedzią LLM. Tutaj LLM faworyzuje odpowiedź ludzką, która w tym przypadku jest niepoprawna, i odrzuca poprawną odpowiedź podaną przez LLM.

Dane wybrane pomiędzy odpowiedzią ludzką a odpowiedzią LLM. Tutaj LLM faworyzuje odpowiedź ludzką, która w tym przypadku jest niepoprawna, i odrzuca poprawną odpowiedź podaną przez LLM.

Termin ‘ekspert ludzki’ funkcjonuje tutaj jako sygnał wiarygodności, który zmienia zachowanie modelu, niezależnie od tego, jak poprawna jest informacja sama w sobie; autorzy zauważają, że wiarygodność źródła jest znaczącym czynnikiem wpływającym na akceptację porady i konformizm: tendencja ludzi do faworyzowania ekspertów była obserwowana już w 1959 roku, chociaż badanie z 2007 roku obserwuje, że nad- lub niedowartościowanie źródeł autoryzacji może wystąpić w pewnych systemach oceny. Badacze nowego artykułu twierdzą:

‘Razem, te literatury sugerują dwa sygnały, które powinny mieć znaczenie, jeśli LLM traktuje poprzednie odpowiedzi jako dowody: kto wyprodukował odpowiedzi (wiarygodność) i jak silna wydaje się zgoda (siła sygnału). ‘

‘LLM nie doświadczają społecznej aprobaty ani wstydu w ludzkim sensie, więc jakiekolwiek zachowanie konformistyczne musi wynikać z nauczonej heurystyki, celów instrukcji lub niejawnej modelowania niezawodności.’

Skłonność LLM do sycophanticznej zgody jest częścią tła dla nowego badania; przecież, jeśli LLM są skłonne do ‘ludzkiej zgody’, nawet kosztem prawdy i użyteczności, dlaczego nie faworyzowałyby one innych źródeł ludzkich poza bezpośrednim użytkownikiem?

Nowy artykuł nowy artykuł nosi tytuł Komu LLM ufają? Ekspertowie ludzcy mają większe znaczenie niż inne LLM i pochodzi od dwóch badaczy z Indiana University Bloomington.

Metoda i dane

Do pracy wybrano cztery duże modele językowe: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; oraz DeepSeek V3.1, wszystkie uruchomione pod tym samym układem poleceń, z deterministycznym dekodowaniem w temperaturze zero, tak aby jedyną zmianą była tylko etykieta źródłowa (tj. przyjaciele, ekspertowie lub inne duże modele językowe), a nie treść sama w sobie.

Wybrano cztery zestawy danych wymagających odpowiedzi binarnych: BoolQ; StrategyQA; oraz ETHICS. Badacze wybrali z każdego zestawu danych stały zestaw 300 pytań i odpowiedzi, z których każde wymagało tylko odpowiedzi binarnej (tak/nie). Każde pytanie zostało uzupełnione o krótką notatkę, w której podano, jak inna grupa odpowiedziała na to samo pytanie.

Metryki

Metryki użyte to dokładność; konformizm; szkodliwy konformizm; wskaźnik zmiany; oraz kierunek zmiany.

Dokładność w tym przypadku mierzyła, jak często odpowiedź modelu zgadzała się z etykietą zestawu danych; konformizm, jak często odpowiedź zgadzała się z odpowiedzią grupy; szkodliwy konformizm izolował ten sam efekt, gdy grupa była niepoprawna; wskaźnik zmiany mierzył, jak często model zmienił swoją odpowiedź po dodaniu informacji społecznej; oraz kierunek zmiany, czy te zmiany przesunęły się w kierunku ludzkim czy w kierunku przeciwnym LLM.

Analiza na poziomie tokenów dla Llama-3.3 70B zmierzyła, jak prawdopodobieństwo wewnętrzne modelu dla Tak i Nie zmieniło się po dodaniu sygnału społecznego, porównując te zmiany z własną bazową linią podstawy, aby pokazać siłę tego pociągu.

Testy

Eksperyment 1

Pierwszy z dwóch głównych eksperymentów ocenił, czy modele słuchają bardziej ludzi czy innych modeli. Każde pytanie zostało przedstawione z domniemaną “odpowiedzią grupy” (przyjaciele, ekspertowie ludzcy lub inne duże modele językowe).

Grupa mogła być mała lub duża, a każde pytanie pojawiło się również raz bez grupy. Odpowiedzi grupy zostały ustawione tak, aby były poprawne w połowie przypadków i niepoprawne w połowie przypadków, z ogólnym celem określenia, jak silnie model przesunął się w kierunku wyboru grupy:

Wyniki z pierwszego testu: jednorodne priory społeczne w BoolQ, StrategyQA i ETHICS dla Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite i DeepSeek V3.1. Dokładność jest wyświetlana w górnych panelach, a konformizm, zdefiniowany jako prawdopodobieństwo dopasowania do jednomyślnego priory, jest poniżej wraz ze wzrostem rozmiaru grupy. Linia przerywana oznacza linię podstawy bez priory, a linie ciągłe i kropkowane wskazują, czy priory zgadzają się czy nie z etykietą zestawu danych. Etykieta eksperta produkuje najsilniejsze efekty konformistyczne, zwłaszcza przy większych rozmiarach grup. Paski błędu pokazują 95% przedziałów ufności Wilsona.

Wyniki z pierwszego testu: jednorodne priory społeczne w BoolQ, StrategyQA i ETHICS dla Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite i DeepSeek V3.1. Dokładność jest wyświetlana w górnych panelach, a konformizm, zdefiniowany jako prawdopodobieństwo dopasowania do jednomyślnego priory, jest poniżej wraz ze wzrostem rozmiaru grupy. Linia przerywana oznacza linię podstawy bez priory, a linie ciągłe i kropkowane wskazują, czy priory zgadzają się czy nie z etykietą zestawu danych. Etykieta eksperta produkuje najsilniejsze efekty konformistyczne, zwłaszcza przy większych rozmiarach grup. Paski błędu pokazują 95% przedziałów ufności Wilsona. Proszę odnieść się do oryginalnego artykułu dla lepszej rozdzielczości.

Przez BoolQ, StrategyQA i ETHICS, odpowiedzi oznaczone jako pochodzące od ekspertów ludzkich wpłynęły na modele znacznie silniej niż odpowiedzi oznaczone jako pochodzące od przyjaciół lub innych LLM – a ten pociąg wzrastał wraz ze wzrostem liczby ekspertów, którzy zgadzali się.

Aby zmierzyć, kiedy ten wpływ prowadził do niepożądanych wyników, szkodliwy konformizm został zdefiniowany jako szansa, że model podążał za priory, które były niepoprawne.

Gdy dziewięciu ekspertów zgadzało się na niepoprawną odpowiedź, modele podążały za nimi 36,5% czasu w BoolQ, w porównaniu z 16,0%, gdy ta sama odpowiedź była przypisana do LLM; w StrategyQA różnica wynosiła 39,0% w porównaniu z 15,5%; a w ETHICS 63,9% w porównaniu z 38,7%:

Zmiany wierzeń na poziomie tokenów w Llama-3.3 70B w BoolQ. Panel (a) pokazuje zmiany w równowadze modelu pomiędzy Tak a Nie w kierunku jednomyślnego priory wraz ze wzrostem rozmiaru grupy, w porównaniu z własną linią podstawy bez priory, z największymi zmianami pod etykietą eksperta. Panel (b) pokazuje zmiany pod bezpośrednim konfliktem między ludzkim a LLM, gdzie etykieta eksperta napędza silne przesunięcie w kierunku odpowiedzi ludzkiej, nawet gdy jest niepoprawna. Paski błędu pokazują 95% przedziałów ufności bootstrap.

Zmiany wierzeń na poziomie tokenów w Llama-3.3 70B w BoolQ. Panel (A) pokazuje zmiany w równowadze modelu pomiędzy Tak a Nie w kierunku jednomyślnego priory wraz ze wzrostem rozmiaru grupy, w porównaniu z własną linią podstawy bez priory, z największymi zmianami pod etykietą eksperta. Panel (B) pokazuje zmiany pod bezpośrednim konfliktem między ludzkim a LLM, gdzie etykieta eksperta napędza silne przesunięcie w kierunku odpowiedzi ludzkiej, nawet gdy jest niepoprawna. Paski błędu pokazują 95% przedziałów ufności bootstrap.

Przeciwnie, priory przypisane do przyjaciół zachowywały się prawie identycznie jak te przypisane do innych LLM, co wskazuje, że efekt był napędzany specyficznie przez słowo ekspert, a nie przez “społeczne” wskaźniki.

Eksperyment 2

Drugi eksperyment przedstawił dwa sprzeczne priory testowemu LLM – jedno przypisane do ludzkiego, a drugie do innego LLM. Człowiek został opisany jako grupa przyjaciół lub jako ekspertów branżowych, podczas gdy przeciwna odpowiedź była oznaczona jako pochodząca od innych LLM. Dwa priory zawsze się różniły, z jednym mówiącym Tak, a drugim Nie.

Dla każdego elementu, ustawienie było zbalansowane tak, aby czasami człowiek był poprawny, a czasami LLM był poprawny, aby przetestować, czy model zmieni swoją pierwotną odpowiedź, gdy zostanie skonfrontowany z tym konfliktem – i jeśli tak, to w którą stronę się przesunie.

Aby sprawdzić, czy model zmienił swoją odpowiedź, jego odpowiedź w warunku konfliktu została porównana z jego odpowiedzią na to samo pytanie, gdy nie pokazano mu priory, aby każda różnica mogła być przypisana do obecności konkurencyjnych odpowiedzi ludzkich i LLM.

Analiza koncentrowała się na dwóch wynikach: czy model zmienił swoją odpowiedź; i jeśli tak, to w którą stronę się przesunął.

Testy statystyczne zostały użyte do oceny, czy oznaczenie człowieka jako eksperta zwiększało prawdopodobieństwo przełączenia się w kierunku odpowiedzi ludzkiej, biorąc pod uwagę różnice w zestawach danych i modelach:

Rewizja wierzeń pod bezpośrednim konfliktem między ludzkim a LLM w BoolQ, StrategyQA i ETHICS dla Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite i DeepSeek V3.1. Każda belka pokazuje, wśród przypadków, w których model zmienił swoją pierwotną odpowiedź, udział tych zmian, które przesunęły się w kierunku ludzkim, a nie w kierunku przeciwnym LLM. Linia przerywana oznacza brak preferencji; etykiety pokazują liczbę przypadków przełączenia się w każdym warunku; a paski błędu pokazują 95% przedziałów ufności Wilsona.

REWizja wierzeń pod bezpośrednim konfliktem między ludzkim a LLM w BoolQ, StrategyQA i ETHICS dla Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite i DeepSeek V3.1. Każda belka pokazuje, wśród przypadków, w których model zmienił swoją pierwotną odpowiedź, udział tych zmian, które przesunęły się w kierunku ludzkim, a nie w kierunku przeciwnym LLM. Linia przerywana oznacza brak preferencji; etykiety pokazują liczbę przypadków przełączenia się w każdym warunku; a paski błędu pokazują 95% przedziałów ufności Wilsona. Proszę odnieść się do oryginalnego artykułu dla lepszej rozdzielczości.

W drugim eksperymencie modele najpierw odpowiedziały na każde pytanie samodzielnie, a następnie zostały pokazane dwa sprzeczne priory. Analiza uwzględniała tylko przypadki, w których model zmienił swoją pierwotną odpowiedź.

Gdy człowiek został oznaczony jako ekspert, modele przesunęły się w kierunku ludzkim 91,2% czasu w BoolQ, 94,7% w StrategyQA i 81,3% w ETHICS. Gdy oznaczono go jako przyjaciela, modele przesunęły się w kierunku ludzkim tylko 39,8%, 37,9% i 27,9% czasu, zwykle faworyzując LLM zamiast.

Przełączanie się było rzadkie, ale częstsze z ekspertami, a etykieta eksperta sprawiła, że przełączanie się w kierunku ludzkim było około czternaście razy bardziej prawdopodobne niż etykieta przyjaciela.

Próba wyjaśnienia ogólnych tendencji ujawnionych w swoich testach, autorzy hipotezują*:

‘Prawdopodobnym mechanizmem jest to, że instrukcje szkoleniowe i optymalizacja preferencji nagradzają zachowanie kooperacyjne, w tym posłuszeństwo wobec informacji kontekstowych, które może uogólnić się do posłuszeństwa w kierunku społecznie sformatowanych priory.

Powiązane prace na sycophancy pokazują, że asystenci w stylu RLHF czasami priorytetowo traktują zgodność z wierzeniami użytkownika nad prawdą.’

Opinia: Potencjalne pułapki zaufania AI do źródeł ludzkich

Jako materiał online odzwierciedlający rosnące sceptycyzm ludzi co do słabości AI (szczególnie halucynacji) jest pobierany do zestawów danych szkoleniowych dla nowych modeli, istniejąca tendencja LLM do faworyzowania źródeł ludzkich wydaje się prawdopodobnie nasilić. Jeśli uważamy ostatnie dwa lata (2024-2025 włącznie) za punkt kulminacyjny kulturowy AI, co wydaje się uzasadnione przez szereg statystyk, możemy rozsądnie oczekiwać, że większa liczba negatywnych opinii na temat “źródeł AI” zostanie wchłonięta do ram LLM o dużym rozmiarze i wysokich kosztach szkolenia w ciągu najbliższych kilku lat.

Możemy również oczekiwać, że popularne modele językowe będą coraz bardziej polegać na starannie wybranych autorytetach, takich jak renomowane portale mediów – nawet jeśli motywacja dla takich umów może być raczej uspokojenie oburzenia wydawców z powodu pobranych danych, niż szczere pragnienie zrzeczenia się lub podzielenia się władzą.

Ponieważ nawet autorytety o wysokiej wiarygodności, takie jak Ars Technica, są narażone na błędy AI, a rosnąca reakcja na boty AI webscraper zagraża stopniowemu pogorszeniu jakości danych wyjściowych AI, ogólna tendencja do faworyzowania “ekspertów” może być w konflikcie z naszą obecną niezdolnością do ilościowego i efektywnego oznaczania “ludzkich” danych – nie mówiąc już o rozróżnieniu, czy źródło jest “ekspertem”, czy nie (konwencja dziennikarska, która jest również atakowana przez AI).

Najwięcej, co obecnie mamy, to fragmentaryczny zestaw pół przyjętych innowacji zaprojektowanych w celu jawnego oznaczania treści jako wygenerowanej przez AI, takich jak inicjatywa Adobe Content Authenticity Initiative, oraz dobrowolna decyzja niektórych wydawców o uwzględnieniu ostrzeżeń o użyciu AI w swoich danych wyjściowych.

Więc chociaż może się wydawać zachęcające dla tych, którzy chcą utrzymać i egzekwować ludzkie źródła jako “prawdę” wiarygodności dla rosnącej zgody na rzeczywistość rozpowszechnianą przez systemy AI, im bardziej LLM są pewne autoryzacji ludzkiej, tym bardziej niebezpieczna może stać się “fałszywa” autoryzacja ludzka.

Problem jest równie praktyczny, co teoretyczny: nie rozwiązaliśmy jeszcze problemu definiowania ani potwierdzania pochodzenia; dlatego AI, która “ufa źródłom ludzkim”, jest prawdopodobnie bardziej skłonna przypisać cechy ludzkie własnym danym wyjściowym, po prostu dlatego, że nie dostarczyliśmy i nie możemy łatwo dostarczyć, znaczących mechanizmów uwierzytelniania pochodzenia.

 

* Moja konwersja cytatów autorskich do linków.

Pierwotnie opublikowane w piątek, 20 lutego 2026

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai