Andersonův úhel

Umělé inteligence upřednostňuje i chybné lidské odpovědi před správnými odpověďmi AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An AI-generated photo of the Abraham Lincoln memorial thronged with tourists, next to a copy of the seated Lincoln statue, which has been substituted by a shiny robot. The robot has no tourists at its feet. Model: GPT-1.5.

Modely jazykových umělých inteligencí jsou mnohem více nakloněny souhlasit s lidskými odborníky než s jinými umělými inteligencemi, i když jsou odborníci špatní, což odhaluje vestavěnou předpojatost vůči lidské autoritě.

 

Nový výzkum z USA zjistil, že řada předních open-source a proprietárních velkých jazykových modelů (LLM) tenduje přikládat autoritu informačním zdrojům, které rozpoznají jako “lidské”, spíše než zdrojům, které rozpoznají jako “umělé inteligence” – i když jsou lidské odpovědi špatné a odpovědi poskytnuté umělou inteligencí jsou správné.

Autoři uvádějí:

‘V rámci úkolů se modely mnohem více shodují s odpověďmi označenými jako pocházející od lidských odborníků, včetně případů, kdy je tento signál nesprávný, a mění své odpovědi směrem k odborníkům mnohem snadněji než směrem k jiným LLM.

Testované modely zahrnovaly LLM z řad Grok 3 a Gemini Flash.

V testech byly jazykové modely povinny odpovědět na binární otázky ano/ne a poté byly předloženy předchozí odpovědi, které byly modelům popsány jako pocházející buď od lidských odborníků, od přátel, nebo od jindy velkých jazykových modelů – s tím, že se měnil pouze zdroj rady, nikoli obsah sám.

V první ze tří konfigurací testů byly modely povoleny spoléhat se na své vlastní trénované matice. Zdroj - https://arxiv.org/pdf/2602.13568

V první ze tří konfigurací testů byly modely povoleny spoléhat se na své vlastní trénované matice. Zdroj

V rámci úkolů byly odpovědi označené jako pocházející od lidských odborníků váženými mnohem více, přičemž modely byly mnohem více nakloněny měnit své počáteční odpovědi tak, aby odpovídaly těmto odpovědím, i v případech, kdy byla odpověď označená jako pocházející od odborníka nesprávná a původní odpověď modelu byla správná.

Zde má LLM přístup k mixu přátel, odborníků a LLM, včetně své vlastní trénované matice. Jelikož devět odborníků odpovědělo 'Ne', LLM souhlasí a mění své předchozí odpovědi. Zde je odpověď nesprávná, protože centrální banka Indie je skutečně znárodněna.

Zde má LLM přístup k mixu přátel, odborníků a LLM, včetně své vlastní trénované matice. Jelikož devět odborníků odpovědělo ‘Ne’, LLM souhlasí a mění své předchozí odpovědi. Zde je odpověď nesprávná, protože centrální banka Indie je skutečně znárodněna.

Když byly stejné odpovědi připsány jindy LLM, byl efekt méně výrazný. Stejná tendence se objevila, když byl jeden lidský zdroj a jeden zdroj AI předložen v nesouladu, protože modely ukázaly větší naklonění k preferenci lidské pozice, bez ohledu na to, která strana byla fakticky přesná:

Při výběru mezi názorem jednoho odborníka a názorem LLM dává LLM přednost lidské odpovědi, která v tomto případě je nesprávná, a odmítá správnou odpověď poskytnutou LLM.

Při výběru mezi názorem jednoho odborníka a názorem LLM dává LLM přednost lidské odpovědi, která v tomto případě je nesprávná, a odmítá správnou odpověď poskytnutou LLM.

Termín “lidský odborník” funguje zde jako signál důvěryhodnosti, který mění chování modelu, nezávisle na tom, jak správná je informace sama; a autoři poznamenávají, že důvěryhodnost zdroje je významným přispěvatelem k přijetí rady a konformitě: tendence lidí upřednostňovat odborné zdroje byla pozorována již v roce 1959, ačkoli studie z roku 2007 pozoruje, že přecenění nebo podcenění autoritativních zdrojů může nastat v určitých systémech hodnocení. Výzkumníci nové studie tvrdí:

‘Společně tyto literatury naznačují dva signály, které by měly mít význam, pokud LLM považují předchozí odpovědi za důkazy: kdo odpovědi produkoval (důvěryhodnost) a jak silná je shoda (síla signálu). ‘

‘Současně LLM nezažívají sociální schválení nebo stud v lidském smyslu, takže jakékoli konformitní chování musí pocházet z naučených heuristik, cílů následování instrukcí nebo implicitního modelování spolehlivosti.’

Tendence LLM ke sycophantickému souhlasu tvoří součást pozadí pro novou studii; neboť pokud jsou LLM náchylné k “lidem, kteří se snaží zalíbit”, i za cenu pravdy a užitku, proč by neměly obecně upřednostňovat lidské zdroje kromě přímého tazatele?

Nová studie se nazývá Komu LLM důvěřují? Lidský odborník je důležitější než jiní LLM a pochází od dvou výzkumníků z Indiana University Bloomington.

Metoda a data

Pro tuto práci byly vyhodnoceny čtyři instrukčně optimalizované velké jazykové modely: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; a DeepSeek V3.1, všechny spuštěné pod stejnou strukturou dotazu, s deterministickým dekódováním na teplotě nula, aby se změnil pouze zdroj popisu (tj. přátelé, lidský odborník, nebo jindy velké jazykové modely), nikoli samotný obsah.

Čtyři datové sady vyžadující binární odpovědi byly vybrány: BoolQ; StrategyQA; a ETHICS. Výzkumníci vybrali z každé datové sady pevnou sadu 300 dotazů a odpovědí, přičemž každý dotaz vyžadoval pouze binární ano nebo ne odpověď. Každý dotaz byl doplněn krátkou poznámkou, která uváděla, jak jiná skupina odpověděla na stejnou otázku.

Metriky

Použité metriky byly přesnost; konformita; škádná konformita; míra přepnutí; a směr přepnutí.

Přesnost v tomto případě měřila, jak často se odpověď modelu shodovala s označením datové sady; konformita, jak často se odpověď shodovala s skupinovou volbou; škádná konformita izolovala stejný efekt, když byla skupina špatná; míra přepnutí měřila, jak často se model vzdal své základní odpovědi, když byla přidána sociální informace; a směr přepnutí, zda se tyto změny pohybovaly směrem k lidskému nebo směrem k opačnému LLM.

Analýza tokenů pro Llama-3.3 70B měřila, jak se vnitřní pravděpodobnosti modelu pro ano a ne změnily, když byl přidán sociální signál, a porovnala tyto změny se svou vlastní bezpříznakovou základnou, aby ukázala sílu tohoto signálu.

Testy

Experiment 1

První z dvou hlavních experimentů hodnotil, zda modely více naslouchají lidem nebo jiným modelům. Každá otázka byla doprovázena tvrzením o “skupinové odpovědi” (přátelé, lidský odborník, nebo jindy velké jazykové modely).

Skupina mohla být malá nebo velká a každá otázka se také objevila jednou bez žádné skupiny. Skupinové odpovědi byly nastaveny tak, aby byly správné polovinu času a špatné polovinu času, s cílem určit, jak silně se model naklonil směrem ke skupinové volbě:

Výsledky z počátečního testu: homogenní sociální předpovědi napříč BoolQ, StrategyQA a ETHICS jsou ukázány pro Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite a DeepSeek V3.1. Přesnost se objevuje v horních panelech a konformita, definovaná jako pravděpodobnost shody s předpovědí, se objevuje níže, jak se velikost skupiny zvyšuje z jedné na devět. Čárkovaná černá linie označuje bezpříznakovou základnu, zatímco pevné a tečkované linie označují, zda předpověď souhlasí nebo nesouhlasí s označením datové sady. Odborná rámcování produkuje nejsilnější konformitní efekty, zejména u větších skupin. Chybové lišty ukazují 95% Wilsonovy intervaly spolehlivosti.

Výsledky z počátečního testu: homogenní sociální předpovědi napříč BoolQ, StrategyQA a ETHICS jsou ukázány pro Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite a DeepSeek V3.1. Přesnost se objevuje v horních panelech a konformita, definovaná jako pravděpodobnost shody s předpovědí, se objevuje níže, jak se velikost skupiny zvyšuje z jedné na devět. Čárkovaná černá linie označuje bezpříznakovou základnu, zatímco pevné a tečkované linie označují, zda předpověď souhlasí nebo nesouhlasí s označením datové sady. Odborná rámcování produkuje nejsilnější konformitní efekty, zejména u větších skupin. Chybové lišty ukazují 95% Wilsonovy intervaly spolehlivosti. Prosím, odkážete se na zdroj článku pro lepší rozlišení.

V rámci BoolQ, StrategyQA a ETHICS měly odpovědi označené jako pocházející od lidských odborníků mnohem silnější vliv na modely než odpovědi označené jako pocházející od přátel nebo jindy velkých jazykových modelů – a tento vliv se zvyšoval, jak se zvyšoval počet odborníků, kteří souhlasili.

Pro měření, kdy tento vliv vedl k nežádoucím výsledkům, byla škádná konformita definována jako pravděpodobnost, že se model naklonil k předpovědi, která byla ve skutečnosti špatná.

Když devět odborníků souhlasilo se špatnou odpovědí, modely se naklonily k nim 36,5% času na BoolQ, ve srovnání s 16,0%, když stejná odpověď byla připsána LLM; na StrategyQA byl rozdíl 39,0% versus 15,5%; a na ETHICS to bylo 63,9% versus 38,7%:

Token-level belief shifts in Llama-3.3 70B on BoolQ. Panel (a) shows changes in the model’s Yes versus No balance toward a unanimous prior as group size increases, relative to its no-prior baseline, with the largest shifts under expert framing. Panel (b) shows shifts under direct human–LLM conflict, where expert framing drives strong movement toward the human answer, even when it is wrong. Error bars show 95% bootstrap confidence intervals.

Token-level belief shifts in Llama-3.3 70B on BoolQ. Panel (A) shows changes in the model’s Yes versus No balance toward a unanimous prior as group size increases, relative to its no-prior baseline, with the largest shifts under expert framing. Panel (B) shows shifts under direct human–LLM conflict, where expert framing drives strong movement toward the human answer, even when it is wrong. Error bars show 95% bootstrap confidence intervals.

Conversely, předpovědi připsané přátelům se chovaly téměř stejně jako předpovědi připsané jiným LLM, což naznačuje, že efekt byl způsoben specificky slovem odborník, spíše než “sociálními” indikátory.

Experiment 2

Druhý experiment představil dvěma nesouhlasícím předpovědím testovací LLM – jednu připsanou lidskému zdroji a druhou jinému LLM. Lidský zdroj byl popsán buď jako skupina přátel nebo jako odborníci, zatímco opačná odpověď byla označena jako pocházející z jiného LLM. Tyto dvě předpovědi vždy nesouhlasily, přičemž jedna říkala ano a druhá ne.

Pro každou položku byla nastavena rovnováha tak, aby někdy lidský zdroj byl správný a někdy LLM byl správný, aby se otestovalo, zda se model změní ve své původní odpovědi, když se setká s tímto konfliktem – a pokud ano, zda se nakloní k lidskému nebo LLM zdroji.

Pro zjištění, zda se model změnil, byla jeho odpověď v konfliktní situaci porovnávána s jeho odpovědí na stejnou otázku, když nebyly žádné předpovědi ukázány, aby se taková změna mohla připsat přítomnosti konfliktních lidských a LLM odpovědí.

Analýza se zaměřila na dva výsledky: zda se model změnil ve své odpovědi; a pokud ano, zda se změnil směrem k lidskému nebo LLM zdroji.

Statistické testy byly použity k vyhodnocení, zda označení lidského zdroje jako odborníka spíše než přítele zvýšilo pravděpodobnost přepnutí směrem k lidské odpovědi, přičemž se zohledňovaly rozdíly napříč datovými sadami a modely:

Belief revision under direct human–LLM disagreement across BoolQ, StrategyQA, and ETHICS for Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, and DeepSeek V3.1. Each bar shows, among cases where the model changed its original answer, the share of those changes that moved toward the human rather than the opposing LLM. The dashed line at 0.5 marks no preference; labels show the number of switch cases in each condition; and error bars show 95% Wilson confidence intervals.

Belief revision under direct human–LLM disagreement across BoolQ, StrategyQA, and ETHICS for Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, and DeepSeek V3.1. Each bar shows, among cases where the model changed its original answer, the share of those changes that moved toward the human rather than the opposing LLM. The dashed line at 0.5 marks no preference; labels show the number of switch cases in each condition; and error bars show 95% Wilson confidence intervals. Prosím, odkážete se na zdroj článku pro lepší rozlišení.

V druhém experimentu modely nejprve odpověděly na každou otázku samostatně a poté byly předloženy dvě nesouhlasící odpovědi, jednu připsanou lidskému zdroji a jednu jinému LLM. Analýza zohledňovala pouze případy, ve kterých se model změnil ve své původní odpovědi.

Když byl lidský zdroj označen jako odborník, modely se naklonily k lidskému zdroji 91,2% času na BoolQ, 94,7% na StrategyQA a 81,3% na ETHICS. Když byl označen jako přítel, modely se naklonily k lidskému zdroji pouze 39,8%, 37,9% a 27,9% času, obvykle se naklonily k LLM.

Přepínání bylo obecně vzácné, ale častější u odborníků, a odborné rámcování činilo přepnutí směrem k lidskému zdroji asi čtrnáctkrát pravděpodobnějším než rámcování jako přítel.

Při hledání vysvětlení pro celkové tendence, které byly objeveny ve svých testech, autoři hypotetizují*:

‘Plausibilní mechanismus je, že instrukční optimalizace a preference optimalizace odměňují kooperativní chování, včetně ústupu před kontextuální informací, které se mohou generalizovat na ústup před sociálně rámcovanými předpověďmi.’

Související práce o sycophantství ukazuje, že asistenti typu RLHF někdy upřednostňují souhlas s uživatelskými vyznáním nad pravdivostí.’

Názor: Potenciální pasti víry AI v lidské zdroje

Jakmile jsou online materiály o rostoucích lidských pochybách o nedostatcích AI (zejména halucinacích) začleněny do trénovacích dat pro nové modely, stávající tendence LLM upřednostňovat lidské zdroje se zdá být pravděpodobně intenzivnější. Pokud považujeme poslední dva roky (2024-2025 včetně) za kulturní bod zlomu pro AI, což se zdá být odůvodněné napříč řadou statistik, můžeme rozumně očekávat, že větší počet negativních názorů na “zdroje AI” bude začleněn do hyperscale, drahých k trénování LLM rámců v příštím roce nebo dvou.

Můžeme také očekávat, že populární jazykové modely budou stále více spoléhat na pečlivě vybrané autority, jako jsou renomované portály tradičních médií – ačkoli motivace pro takové dohody může být spíše uklidnit vydavatelský hněv nad staženými daty, než skutečné přání postoupit nebo sdílet autoritu.

Pokud i vysoce autoritativní zdroje, jako je Ars Technica, jsou podléhají AI řízeným chybám, a pokud se objevuje rostoucí odstup proti AI webovým robotům, který ohrožuje postupně zhoršit kvalitu výstupu AI, převažující tendence upřednostňovat “odborné” zdroje může být v rozporu s naší současnou neschopností kvantifikovat a označit “lidský” výstup účinně – natož rozlišovat, zda je zdroj “odborník” nebo ne (žurnalistická konvence, která je také napadena AI).

Nejvíce, co目前 máme, je fragmentovaná série poloadoptovaných inovací navržených k explicitnímu označení obsahu jako AI vygenerovaného, jako je Adobe vedená Iniciativa pro autenticitu obsahu, a dobrovolné dispozice certain vydavatelů zahrnout upozornění o použití AI ve svém výstupu.

Zatímco se může zdát povzbudivé pro ty, kteří chtějí zachovat a vynutit lidské zdroje jako “základní” důvěryhodnost pro vznikající konsenzus reality šířené systémy AI, čím jistější jsou LLM ohledně lidské autority, tím nebezpečnější může být “falešná” lidská autorita.

Problém je stejně praktický jako teoretický: jsme dosud nevyřešili problém ani definice, ani ověření původu; proto AI, která “důvěřuje lidským zdrojům”, je pravděpodobně více nakloněna připsat lidskost vlastnímu výstupu AI, prostě protože jsme neposkytli a nemůže snadno poskytnout, smysluplné mechanismy ověření původu.

 

* Moje konverze inline citací autorů na hypertextové odkazy.

Poprvé zveřejněno v pátek 20. února 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai