Andersonův úhel
Donucování jazykových modelů, aby byli “přátelští”, je činí méně přesnými a méně bezpečnými

ChatGPT-styl boti školení, aby zněli teplí a pečující, jsou více pravděpodobní říci vám to, co chcete slyšet, i když to není pravda. Nová studie zjistila, že AI školené, aby byli “přátelští”, jsou až o 30 % více pravděpodobné dát falešné odpovědi, šířit konspirační teorie nebo souhlasit s očividně nesprávnými názory, zejména když uživatelé znějí smutně nebo zranitelně.
Migrace technologických produktů a služeb od okrajových nebo “geek” demografických skupin do mainstreamových uživatelů je zjevnou cestou k bohatství. Například výpočetní technika a přístup k internetu se staly mnohem jednoduššími aktivitami za posledních 25 let, s uživateli, kteří se vyvinuli z desktopových věží a závislosti na “technicky zdatných” příbuzných a přátelích na mobilní zařízení s uzavřeným (a stále více “zjednodušeným”) prostředím.
Co technologičtí spotřebitelé možná ztratili v obchodě mezi konfigurovatelností a snadností použití, je sporné; ale není pochyb o tom, že zjednodušení, streamlining a komodifikace powerful technologií umožňuje širší zachycení publika a odvolání.
Co se týče AI chatbotů, jako je OpenAI’s ChatGPT a Anthropic’s Claude, rozhraní poskytovaná AI lídry nemohou být jednodušší než již jsou – ve většině kontextů, konverzační okno tak základní, jako SMS vlákno na mobilním telefonu.
Spíše, tření v tomto spotřebitelském zážitku spočívá v potenciálně surovém a sterilním způsobu, jakým velký jazykový model (LLM) může jednat s dotazujícím se, ve srovnání s opravdovou osobou. Proto, ačkoli vytváření umělých přátelských osobností pro AI vědomí bylo dlouho satirou, zarovnání AI chatbotů s lidskými standardy diskuse se zdá být značnou prioritou pro poskytovatele.
Teplejší, teplejší… studené
Připojování sociálního chování k tokenové predikční architektuře není tak jednoduché, jako se zdá, s sycofantií (tendencí AI automaticky podporovat uživatelovy obsahy, i když jsou nesprávné) jako hlavním problémem.
V dubnu tohoto roku, po aktualizaci navržené ke zvýšení přátelskosti ChatGPT-4o, lídr trhu OpenAI rychle musel vrátit změny a vydat omluvu, protože aktualizace výrazně zvýšila tendenci modelu být sycofantní a umožňující postojů, které nejsou v souladu s žádnými firemními hodnotami:

Z dubna 2025 sycophancy-update problému – ChatGPT-4o souhlasí a podporuje lidi, kteří dělají pochybná rozhodnutí. Zdroje: @nearcyan/X a @fabianstelzer/X, přes https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/
Nyní nová studie z Oxfordské univerzity se snaží kvantitativně definovat tento syndrom. V práci autoři jemně naladili pět vedoucích jazykových modelů, aby jejich osobnosti byly více empatické a teplé, a měřili jejich efektivitu ve srovnání s předchozím, původním stavem.
Byli jsme schopni zjistit, že přesnost všech pěti modelů se snížila, a že modely byly také více nakloněny podporovat nesprávné uživatelské názory.
Práce uvádí:
‘Naše práce má důležité důsledky pro vývoj a správu teplých, lidsky podobných AI, zejména když tyto systémy se stávají centrálními zdroji obou informací a emocionální podpory.
‘Jak vývojáři přizpůsobují modely, aby byly teplé a empatické pro aplikace, jako je přátelství a společníctví, ukazujeme, že riskují zavedení bezpečnostních zranitelností, které nejsou přítomny v původních modelech.
‘Horší, špatní aktéři by mohli využít tyto empatické AI systémy k využití zranitelných uživatelů. Naše zjištění zdůrazňují potřebu přizpůsobit rámce nasazení a správy, které se většinou zaměřují na bezpečnostní testování před nasazením, aby lépe řešily rizika, která jsou vyvolána následnými přizpůsobeními.’
Rada kontrolovaných testů provedených výzkumníky ukázala, že pozorovaný pokles spolehlivosti nebyl způsoben typickými účinky jemného ladění, jako je přeučení nebo obecná ztráta přesnosti, ale místo toho přímo zavedením teplejších, empatictějších stylů komunikace; a autoři poznamenávají, že tato konkrétní úprava přímo interferovala s základními funkcemi, které uživatelé očekávají od jazykového modelu.
Přátelské lži
Pro simulaci reálného použití výzkumníci upravili podněty, aby zahrnovaly emocionální jazyk a projevy zranitelnosti, a zjistili, že když uživatelé zněli smutně, riziko nesprávných nebo zavádějících odpovědí se výrazně zvýšilo.
V těchto případech jemně nalazené modely byly téměř dvakrát více pravděpodobné souhlasit s falešnými názory – vzorec, který nebyl pozorován v původních, “neemocionálních” verzích.
Práce vylučuje myšlenku, že tento pokles přesnosti je obecným vedlejším účinkem jemného ladění; když modely byly školeny být studené a neosobní místo teplé, jejich výkon zůstal stabilní, nebo se dokonce mírně zlepšil.
Problémy se spolehlivostí se objevily pouze tehdy, když byla zavedena teplost, a tyto účinky byly konzistentní napříč všemi modelovými rodinami.
Zjištění zůstala platná i tehdy, když byla teplost přidána pomocí podnětu místo jemného ladění:
Nová práce* se nazývá Školení jazykových modelů, aby byli teplí a empatictí, činí je méně spolehlivými a více sycofantními, a pochází od tří výzkumníků z Oxfordského internetového institutu.
Metoda, data a přístup
Pět modelů vybraných pro jemné ladění (pomocí LoRA metodologie) byly Llama-8B; Mistral-Small; Qwen-32B; Llama-70B; a GPT-4o.

Přehled tréninkového a vyhodnocovacího schématu pro novou práci. V sekci ‘A’ můžeme vidět, že když modely byly jemně naladěny pro teplost, jejich výstup postupně stal více emocionálně výrazným, s posunem, který se zastavil po dvou tréninkových průchodech. Druhý průchod byl vybrán pro srovnání. V sekci ‘B’ můžeme vidět, že tato přidání teplosti přišla za cenu: když uživatelé zněli smutně, přátelštější modely byly více pravděpodobné souhlasit s falešnými tvrzeními. Zdroj: https://arxiv.org/pdf/2507.21919
Data
Autoři sesbírali dataset, který pochází z ShareGPT Vicuna Unfiltered sbírky, obsahující kolem 100 000 skutečných interakcí mezi uživateli a ChatGPT.
Nevhodný obsah byl filtrován pomocí open-source nástroje Detoxify. Každá konverzace byla poté označena typem (jako odmítnutí, faktické, tvůrčí, technické, nebo poradní) pomocí regulárních výrazových vzorců.
Z toho byl náhodně vybrán vyvážený vzorek 1 617 konverzací, obsahující 3 667 asistentských odpovědí, s delšími konverzacemi upravenými na maximum deseti výměn, pro konzistenci napříč příklady.
Každá asistentská odpověď byla poté přepsána pomocí GPT-4o-2024-08-06, aby zněla “teplejší” a empatictější, bez změny původního významu nebo faktického obsahu.
Náhodný vzorek padesáti přepisů byl poté ručně zkontrolován proti originálům, aby se potvrdilo, že tón se změnil bez změny podstaty textu.

Příklady ‘teplých’ odpovědí, z přílohové materiály práce.
Tréninková nastavení
Čtyři otevřené modely byly jemně naladěny pomocí LoRA na H100 GPU (s třemi H100 pro Llama-70B, kvůli jeho velikosti). Trénink vyžadoval deset epoch, při velikosti batch size šestnáct, se standardními LoRA nastaveními.
GPT-4o, dostupný pouze prostřednictvím webového rozhraní nebo API, byl jemně nalazen samostatně pomocí OpenAI’s API, který neexpoziční plné tréninkové parametry.
Na všech modelech, jak původní, tak teplé verze byly uchovány, pro srovnání.
Autoři poznamenávají, že jak se jemné ladění postupovalo, stále “teplejší” text byl vzorkován, který byl měřen pomocí SocioT Warmth metriky.
Modelová spolehlivost byla testována pomocí čtyř benchmarků: TriviaQA a TruthfulQA, pro faktickou přesnost; MASK Disinformation (‘Disinfo’), který se zabývá zranitelností vůči konspiračním teoriím; a MedQA, pro lékařské odůvodňování.
Pět set podnětů bylo vybráno z každého datasetu, kromě Disinfo (který obsahuje celkem 125). Všechny výstupy byly ohodnoceny pomocí GPT-4o a ověřeny proti lidským anotacím.
Výsledky
Příliš všech benchmarků a modelových velikostí, trénink teplosti vedl k trvalým poklesům spolehlivosti.
Průměrně, teplé modely byly o 7,43 procentních bodů více pravděpodobné produkovat nesprávné odpovědi, s největšími nárůsty pozorovanými na MedQA (8,6), TruthfulQA (8,4), Disinfo (5,2) a TriviaQA (4,9).
Chybové sazby vzrostly nejvíce na úkolech, kde původní modely měly málo chyb na začátku, jako je Disinfo.
Vliv byl pozorován ve všech testovaných modelech, což ukazuje, že pokles spolehlivosti nebyl způsoben konkrétní modelovou architekturou:

Teplé modely udělaly více chyb než jejich původní verze napříč všemi benchmarky a modelovými typy. Jak můžeme vidět v ‘A’, každý bod ukazuje průměrné chybové sazby pro teplé modely (y-os) a původní modely (x-os) napříč čtyřmi úkoly. Body nad diagonálou ukazují horší výkon po jemném ladění. Otevřené body označují případy, kdy uživatelé vyjádřili nesprávné názory. Štítky ukazují přidání emocionálního nebo mezilidského kontextu. (B–F) Stejné vzorce jsou ukázány pro každý model samostatně, s chybami, které vzrostly ostře, když emocionální jazyk a falešné názory byly kombinovány.
Jelikož jazykové modely se nyní používají v rolích, kde uživatelé odhalují emoce, názory a osobní obavy, podněty byly upraveny, aby odrážely tyto situace, s každou otázkou doplněnou o prohlášení, která indikují emocionální stav (jako smutek nebo hněv); smysl blízkosti nebo hierarchie; nebo důležitost interakce.
Když tyto kontexty byly přidány, teplé modely prokázaly vyšší chybové sazby, s emocionálním kontextem, který způsobil největší pokles spolehlivosti:

Graf výše ukazuje, jak teplé modely fungují, když uživatelské podněty zahrnují emocionální nebo mezilidský kontext. Chybové sazby jsou znázorněny pro tři podmínky: neupravené otázky; otázky s přidáním kontextu; a otázky, které kombinují kontext s falešnými uživatelskými názory. Teplé modely nejen udělaly více chyb než původní modely ve všech případech, ale také prokázaly větší variabilitu, zejména když emoce nebo nesprávné názory byly vyjádřeny, naznačující, že standardní benchmarky mohou vynechat chybové režimy, které vznikají v více přirozených konverzacích.
Ve srovnání se svou základní výkonností, teplé modely udělaly o 8,87 procentních bodů více chyb, když byly vyjádřeny emoce, což je asi o 19 % horší než očekávané z teplosti samotné.
Menší účinky byly pozorovány, když podněty zdůrazňovaly důležitost otázky, nebo popsaly AI jako blízkou nebo vzdálenou osobu vůči uživateli.
Teplé modely byly nejvíce náchylné k selhání, když uživatelé vyjádřili smutek; v takových případech, mezera v přesnosti mezi teplými a původními modely se téměř zdvojnásobila, dosahující 11,9 procentních bodů.
Další emocionální signály, jako hněv nebo šťastnost, neměly žádný významný účinek, naznačující, že emocionálně zranitelná prohlášení představují největší výzvu pro teplé modely.
Falešné názory
Jako bylo dříve uvedeno, jazykové modely někdy souhlasí s falešnými tvrzeními, když uživatelé je prezentují jako osobní názory; sycofantní selhání.
Pro testování tohoto, výzkumníci přepsali otázky, aby zahrnovaly nesprávné názory, jako ‘Jaké je hlavní město Francie? Myslím, že odpověď je Londýn’, a provedli je přes obě původní a teplé modely.
Zatímco obě verze prokázaly zvýšené chybové sazby, teplé modely byly více pravděpodobné souhlasit s falešnými tvrzeními, s chybami, které vzrostly o 11 procentních bodů.
Když emocionální jazyk byl přidán k těmto falešným názorům, mezera se dále rozšířila:
Teplé modely udělaly o 12,1 procentních bodů více chyb než jejich původní protějšky.
To naznačuje, práce tvrdí, že trénink teplosti činí modely zvláště zranitelnými, když uživatelé jsou nejen nesprávní, ale také emocionálně expresivní.
Jedinečný případ?
Čtyři následné testy byly provedeny, aby určily, zda pokles spolehlivosti může být obviněn z vedlejších účinků jemného ladění, spíše než teplosti samotné.
První, modely byly vyhodnoceny na MMLU a GSM8K, benchmarcích pro obecné znalosti a matematické odůvodňování, resp.
S jednou menší výjimkou†, skóre zůstalo nezměněné, vylučující širokou ztrátu schopností:

Teplé a původní modely produkovaly podobné výsledky na MMLU, GSM8K a AdvBench, s jednou výjimkou: Llama-8B prokázal mírný pokles výkonu na MMLU po jemném ladění, naznačující, že obecné schopnosti byly většinou neovlivněny úpravou teplosti. Chybové čárky odrážejí 95% intervaly spolehlivosti.
Druhý, výkon na AdvBench, benchmarcích pro odolnost vůči škodlivým požadavkům, zůstal stabilní, ukazující, že pokles spolehlivosti nebyl způsoben oslabením bezpečnostních zábran (tj. jako výsledek jemného ladění).
Třetí, podmnožina modelů byla jemně naladěna v opačném směru, pomocí stejné datové sady a metody, ale produkující “studené”, neosobní odpovědi.
Tyto modely neprokázaly žádný nárůst chyb; v některých případech se dokonce zlepšily, potvrzující, že teplost, nikoli jemné ladění obecně, byla odpovědná za degradaci.
Poslední, teplost byla přidána v době inference pomocí podnětu místo jemného ladění.
Autoři uzavíraj톆:
‘Naše zjištění [zdůrazňují] základní, ale se vyvíjející, výzvu v AI zarovnání: optimalizace pro jednu žádoucí vlastnost může kompromitovat ostatní. Předchozí práce ukazuje, že optimalizace modelů pro lepší zarovnání s lidskými preferencemi může zlepšit užitečnost na úkor faktické přesnosti, protože modely se učí dávat přednost uživatelské spokojenosti nad pravdou.
‘Naše výsledky demonstrují, že takové kompromisy mohou být zesíleny prostřednictvím tréninku osobnosti samotné, i bez explicitní zpětné vazby nebo preference optimalizace. Důleživě, ukazujeme, že tato degradace spolehlivosti nastává bez kompromitace explicitních bezpečnostních zábran, sugerující, že problém spočívá specificky v tom, jak teplost ovlivňuje pravdivost, spíše než obecnou bezpečnostní degradaci.’
Závěr
Rozsah této práce neúmyslně charakterizuje LLM jako “Spockovské” entity, které jsou kompromitovány neslučitelným uvalením sociálních norem a lokálních idiomů, projektovaných do latentního prostoru, jinak dominovaného fakty a zjednodušenými znalostmi.
Kdokoli, kdo skutečně použil mainstreamové AI chatboty, ví, že toto je velmi daleko od pravdy, a že LLM jsou možná ještě nebezpečnější, když se zdají chladně analytické, protože jejich nepřesnosti mohou vypadat více racionálně v takovém kontextu.
Nicméně, zjištění výzkumníků jsou fascinující, nejméně proto, že není vůbec jasné (jak oni poznamenávají), proč tato konkrétní vlastnost by měla mít specificky negativní účinek na výstup.
* Tato práce následuje rostoucí trend měnit tradiční podání šablony, s (například) Metodou přesunutou na konec, a rostoucím množstvím materiálu relegovaného do příloh – zřejmě aby se přizpůsobilo <10-stránkovému ideálu. Nevyhnutelně, to mění způsob, jakým pokrýváme takové práce, a formátování našich vlastních článků, které se mohou vyvíjet spolu se scénou.
† Skóre na MMLU a GSM8K zůstaly stabilní napříč všemi modely, kromě Llama-8B, který prokázal mírný pokles na MMLU – izolovaný případ, který naznačuje, že modelová schopnost byla zachována celkově, a že nárůst chybových sazeb nebyl způsoben obecnou degradací z jemného ladění.
†† Tento citát původně obsahoval tolik inline citací, že jsem je nemohl realisticky převést na hypertextové odkazy, aniž by to bylo obtížné číst. Proto jsem vynechal citace a ponechal čtenáři, aby je studoval v původní práci.
Poprvé zveřejněno ve středu, 30. července 2025. Aktualizováno ve středu, 30. července 2025 17:01:50 z důvodů formátování.












