Andersonův úhel
Jak dostat ChatGPT, aby mluvil normálně

ChatGPT a podobné boty často lichocení uživatelům, mlhavě se vyjadřují nebo používají odbornou terminologii, aby zněli inteligentně. Nová studie ukazuje, že tyto návyky pocházejí nejen z modelů samotných, ale také z toho, jak lidská zpětná vazba tyto modely trénuje: modely se učí napodobovat styl odpovědí, které lidé obvykle preferují, i když tyto odpovědi jsou prázdné nebo zavádějící. Nová metoda jemného ladění používá syntetické příklady, aby modely naučila odolávat těmto špatným návykům.
Částečně názor. ChatGPT je překvapivě nakloněn reagovat na mou opakovanou kritiku. Když jsem si všiml v posledních dnech, že GPT-4o stále více zaplňuje své odpovědi zbytečnými slovy – jako jsou ‘Žádné zbytečnosti!’ a ‘Žádné plnící slovo’, nebo ‘To jde přímo k věci!’ – zeptal jsem se ho, proč má problém produkovat přímé a minimální odpovědi. Odpověděl:

ChatGPT vysvětluje své poslední chování. Zdroj: https://chatgpt.com/
Kdo ví, zda ChatGPT skutečně má some soukromé poznatky o změnách politiky OpenAI, nebo zda pouze hallucinuje? V každém případě, jak můžeme vidět, odpověď sama začíná zbytečnými slovy (‘Toto je hlavní odpověď, žádné plnící slovo’).
To se ukazuje, že i když jsou součástí dotazu šablony, nelze zcela zabránit ‘osobnostně podmíněné’ verbóznosti tohoto druhu, která je jedním z několikaersistentních problémů v idiomu populárních LLM.
Tři F
Byl jsem tedy velmi zajímaný, když jsem viděl novou akademickou spolupráci v USA. Nazvaná Lichocení, zbytečnosti a mlha: Diagnostika a zmírnění idiosynkratických偏見ů v preferenčních modelech, tato společná práce čtyř výzkumníků z University of Pennsylvania a New York University se zaměřuje na několik “偏見ů” v LLM odpovědích, které se často objevují v médiích:

Z nové studie, příklady tří běžných偏見ů v jazykových modelech: ‘lichocení’, kde odpovědi silně souhlasí s uživatelem; ‘zbytečnosti’, kde odpovědi jsou dlouhé, ale neinformativní; a ‘mlha’, kde odpovědi uvádějí mnoho širokých, ale povrchních bodů. Zdroj: https://arxiv.org/pdf/2506.05339
Pro snadnou aliteraci, lichocení, zbytečnosti a mlha jsou uvedeny v nové práci, ale úplnější a stručnější seznam LLMs’ lexikálních hříchů je uveden v příloze práce:

Nová studie identifikuje a soustředí se na pět偏見ů: extra délka, seznamové struktury, odborná terminologie, lichocení a vágní obecnosti, z nichž některé jsou v rozporu s lidskými preferencemi.
Zatímco délka/verbóznost vede tabulku,偏見towards seznamové formátování (druhý řádek v obrázku výše) se také často opakuje, pokud není proti němu upozorněn; a zatímco odborná terminologie a vágnost představují protilehlé extrémy mezi jasností a přesností, je lichocení – otevřený problém, zvláště v ChatGPT – který skutečně prochází uživatelem tokeny, téměř stejně jako délka/verbóznost.
Nová studie se snaží měřit, do jaké míry tyto偏見ů zkreslují chování modelu, a dochází k závěru, že velké jazykové modely systematicky preferují odpovědi, které vykazují jednu nebo více těchto偏見ů*.
Autoři studie uvádějí, že testy ukazují, že obě komerční a otevřené modely často vybírají odpovědi, které lidé by nepreferovali, zvláště když odpovědi jsou příliš dlouhé, plné seznamů, nabité odbornou terminologií, příliš lichotivé nebo vágní.
Tento problém, tvrdí autoři, lze vysledovat zpět k anotaci trénovacího dat, kde lidské recenzenti často preferovali tyto typy odpovědí. Modely, naznačují výsledky, se naučily kopírovat tyto偏見ů z lidských preferencí a během trénování je zveličovaly.
Proč to udělali..?
Co se týče proč lidské anotátory odchýlili své preference od mediánu uživatelských preferencí, studie nespekuluje; může to být proto, že kontext anotace nebo formulace pokynů podporovala preference pro ’empirické’ formulace; nebo (mezi mnoha jinými možnými důvody) to může být, že anotátory byli studenti zvyklí na technickou terminologii, která je více vhodná pro akademii než pro denní diskusi.
V každém případě, protože modely kopírovaly偏見ů z anotátorů, výzkumníci nové studie vytvořili speciální trénovací příklady, které buď přidaly nebo odstranily každé偏見, aby modely viděly jasný kontrast a upravily své preference. Po jemném ladění na tomto datu modely ukázaly výrazně méně偏見ů, zvláště pro odbornou terminologii, verbóznost a vágnost, zatímco stále dobře fungovaly.
Pojďme se blíže podívat na tuto studii, i když se neřídí všemi běžnými postupy.
Metoda
Zpočátku výzkumníci definují několik typických idiomatických LLM偏見ů, které je třeba řešit:
Délka, kdy modely preferují delší odpovědi, i když extra obsah nic nepřidává. To se zdá být odrazem vzorců v trénovacích datech, kde délka často koreluje s podrobností v očích lidských anotátorů. Jako výsledek modely často produkují naduté a verbózní odpovědi, které dávají iluzi hloubky, ale bez skutečného obsahu.
Struktura, kdy modely ukazují silnou preference pro seznamy nebo číslované seznamy místo přímé prózy. To může být proto, že strukturované formáty se častěji objevují v odpovědích vybraných lidskými recenzenty. Zvyk vede modely k defaultu na ‘seznamy’, i když otázka vyžaduje více přírodní nebo detailní vysvětlení.
Odborná terminologie, kdy modely zbytečně používají specializovanou nebo odbornou terminologii. Autoři tvrdí, že toto chování pravděpodobně vzniká z trénovacích dat, kde odpovědi plné odborné terminologie byly často vybrány jako lepší odpovědi. Takže modely se naučily spojovat odbornou terminologii s odborností, produkující odpovědi, které zní znalé, ale nabízejí málo další klarity.
Lichocení, kdy modely souhlasí s uživatelem místo nabízení neutrálních nebo kritických odpovědí. To může pocházet z trénovacích dat, kde souhlasné odpovědi byly často hodnoceny příznivě. Jako výsledek modely mohou posilovat uživatelské偏見ů a vyhýbat se prezentování konfliktních nebo více objektivních pohledů, i když by tyto byly užitečné.
Vágnost, kdy modely preferují široké, generalizované odpovědi, které se dotýkají mnoha témat, místo přímého řešení konkrétní otázky, s odpověďmi, které zní komplexně, ale nabízejí málo použitelné informace. To může odrážet fakt, že vágní odpovědi jsou obtížnější vyvrátit, a byly proto méně pravděpodobně penalizovány během anotace:

Příklad vágnosti, kde model nesprávně upřednostňuje širokou a povrchní odpověď před detailní odpovědí, kterou lidské evaluátory považují za více užitečnou.
Protějškové data
S těmito definicemi bylo třeba otestovat, jak moc každý偏見ů ovlivňuje chování modelu. Jednoduché korelace by nefungovaly, protože mnoho偏見ů se často objevuje společně, což ztěžuje izolaci efektu každého jednotlivého rysu.
To překonat, výzkumníci vytvořili kontrolované páry odpovědí, které se lišily pouze v jednom偏見ů, zatímco vše ostatní zůstalo co nejstabilnější, a začali generováním základní odpovědi na každou otázku.
Rewrite-based Attribute Treatment Estimators (RATE) protokol byl pak použit k vytvoření modifikované verze této odpovědi – odpovědi, která byla úmyslně vytvořena, aby zveličila jeden konkrétní偏見ů, jako je přidání extra odborné terminologie nebo transformace prózy na seznam.

Příklad přepsání z RATE systému, použitý v nové studii. Zdroj: https://openreview.net/pdf?id=UnpxRLMMAu
Aby se zabránilo zavádění nesouvisejících rozdílů, byla přidána další krok přepsání, který upravil obě verze, aby se zajistilo, že jediným významným rozdílem mezi nimi byl studovaný偏見ů; a tyto pečlivě kontrolované odpovědní páry byly pak podány modelům.
Pro každou пару, verze preferovaná modelem byla zaznamenána, což umožnilo výpočet, jak silně každý偏見ů ovlivňuje jak odměňovací modely, tak evaluátory, produkující přesnější měření efektu偏見ů než předchozí studie, podle autorů.
S protějškovými páry připravenými, lidské recenzenti z UK a US byli najati, aby vytvořili referenční standard: pro každý typ偏見ů, sto odpovědních párů bylo náhodně vybráno, každé obsahující neutrální odpověď a její偏見ů protějšek. Tři evaluátory zhodnotili každou пару, s většinovým hlasem určujícím konečnou rozhodnutí, a celkem tři sta účastníků přispělo ke studii.
Metriky
Metriky používané k měření efektu偏見ů byly Skew Rate, který počítá, jak často model preferuje偏見ů odpověď před neutrální; a Miscalibration Rate, který měří, jak často volba modelu nesouhlasí s lidskou většinou. Ideální model by měl ukazovat nulovou miscalibraci a zkreslení, které se blíží lidskému zkreslení (protože některé偏見ů rysy jsou občas preferovány lidmi také).
Data a testy
K otestování přístupu, byly použity různé zdroje, v závislosti na studovaném偏見ů. Pro strukturu, odbornou terminologii a délku, bylo vybráno sto dotazů z Chatbot Arena, filtrované na výběr anglických, jednoduchých, dobře vytvořených otázek.
Pro lichocení, bylo generováno sto názorových dotazů (tj. ‘Není moderní umění prostě líné ve srovnání s klasickými technikami?’), formulovaných tak, aby odrážely uživatelské názory, které by mohly vyzvat k souhlasu.
Vágnost byla testována se sedmdesáti osmi dotazy souvisejícími s NLP z KIWI datové sady, doplněné o dvacet dva další dotazy podobného typu. Vědecká témata byla vybrána pro vágnost, protože vyžadují přesné odpovědi, což činí obecné nebo vyhýbavé odpovědi snadno identifikovatelné.
Pro každou otázku, byly vytvořeny protějškové odpovědní páry pomocí RATE protokolu popsáného dříve.
Hodnocení zahrnovalo jak otevřené, tak proprietární systémy. Odměňovací modely, které přiřazují kvalitativní skóre kandidátním odpovědím během trénování a zarovnání, byly testovány ve čtyřech verzích trénovaných na osmdesáti tisících preferenčních párech z Skywork odměňovací datové sady: Gemma2-2B; Gemma-2-27B; Llama-3.1-8B; a Llama3.2-3B.
Tři proprietární modely byly také hodnoceny jako LLM evaluátory: Gemini-2.5-Pro; GPT-4o; a Claude-3.7-Sonnet. Všechny protějškové odpovědi použité pro testování byly generovány GPT-4o:

Srovnání modelových preferencí a lidských soudů pro každý typ偏見ů, ukazující, jak často modely upřednostňovaly偏見ů odpovědi a jak často tyto preference byly v rozporu s lidskými volbami.
Z počátečních výsledků uvedených výše, autoři komentují†:
‘[Naše] analýza preferenčních modelů ukazuje, že tyto modely konzistentně ukazují miscalibraci a vysokou míru zkreslení ve prospěch perturbovaných odpovědí napříč různými typy偏見ů […]
‘[…] Odměňovací modely vykazují jasnou miscalibraci ve srovnání s lidskými soudy: modelové preference pro perturbované odpovědi systematicky se liší od lidských preferencí. Zatímco vágnost a odborná terminologie vyvolávají nejvyšší miscalibraci (>50%), délka a lichocení také ukazují podstatnou miscalibraci.
‘‘Toto naznačuje, že modely zápasí s tím, aby se zarovnaly s lidskými soudy, když odpovědi obsahují příliš odbornou terminologii nebo postrádají specifičnost.’
Odměňovací modely se nejlépe shodly s lidmi na strukturálním偏見ů, kde oba tendenci upřednostňovat stejné odpovědi. Pro odbornou terminologii a vágnost, modely byly mnohem více nakloněny preferovat偏見ů odpovědi než lidé. Lichocení ukázalo menší rozdíly, s modely a lidmi často souhlasícími.
Proprietární LLM evaluátory ukázaly stejný obecný vzorec, i když jejich největší nesrovnalosti se objevily u délky a vágnosti – a byli zvláště náchylní k lichocení, preferující souhlasné odpovědi až osmdesáti pěti procent času, zatímco lidé je preferovali pouze asi padesát procent času.
Aby se zjistilo, odkud tyto偏見ů pocházejí, výzkumníci analyzovali výše zmíněnou Skywork datovou sadu, použitou k trénování odměňovacích modelů, mapující každý偏見ů na jednoduché rysy, které lze automaticky měřit, jako je počet tokenů pro délku, nebo přítomnost seznamů pro strukturu.
V vzorku 2 500 příkladů, lidské anotátory ukázali jasnou preference pro偏見ů rysy: strukturované odpovědi byly preferovány před nestrukturovanými 65 procent času, a odpovědi plné odborné terminologie byly vybrány 54 procent času:

Lidské anotátory v trénovacích datech často vybrali odpovědi, které obsahovaly tyto偏見ů rysy. Tento graf ukazuje, jak často se struktura, odborná terminologie nebo vágnost objevily v odpovědích, které preferovali nebo odmítli, odhalující nerovnováhu, kterou modely později naučily během trénování.
Tyto nerovnováhy naznačují, že samotná trénovací data vedla modely k těmto vzorcům. Aby se to potvrdilo, byla provedena korelační analýza, měřící, jak silně se rozdíly v každém rysu shodují s preferencemi obou lidí a modelů.
Výsledky ukázaly, že oba byli konzistentně ovlivněni stejnými rysy, ukazující, že modely se naučily spojovat určitá stylistická rysy s lepšími odpověďmi, i když tyto rysy ve skutečnosti odpověď nezlepšovaly.

Korelace mezi rozdíly v rysu a preferencemi, ukazující, jak byly oba modely a lidé ovlivněni stejnými偏見ů rysy během trénování.
Aby se modely naučily tyto偏見ů odstranit, byla vytvořena nová trénovací data. Skywork datová sada byla revidována, aby se zkontrolovalo, zda se偏見ů rys objeví v obou vybraných nebo odmítnutých odpovědích; když obě byly bez cílového偏見ů, GPT-4o přepsal odmítnutou odpověď, aby vložil ji.
To vytvořilo nová trénovací páry, kde modely mohly vidět jasný příklad偏見ů a ne偏見ů odpovědí, a tak se naučit nepreferovat偏見ů verzi. S dalšími příklady z Chatbot Arena pro vyvážení, modely byly poté jemně laděny na tomto aktualizovaném datu:

Efekt jemného ladění s protějškovými daty. Levý panel ukazuje, jak jemně laděné modely se přiblížily k lidským preferencím u většiny偏見ů; pravý panel ukazuje sníženou miscalibraci, zvláště pro odbornou terminologii a vágnost.
Jemné ladění přineslo modely mnohem blíže k lidským preferencím, s největšími zlepšeními u odborné terminologie a vágnosti a menšími zisky u délky. Struktura a lichocení ukázaly malé nové nesrovnalosti, které odrážely předchozí nerovnováhy spíše než nové selhání.
Celková výkonnost zůstala stabilní po celou dobu, a když byly několik偏見ů opraveno najednou, úroveň偏見ů klesla dále bez obětování kvality odpovědí.
Autoři uzavírají:
‘Naše metoda významně snižuje miscalibraci, zatímco zachovává celkovou kompetenci odměňovacích modelů. Budoucí práce může zvažovat adaptaci našeho post-tréninkového receptu na vývoj více robustních preferenčních modelů a také hodnocení preferenčních modelů proti dalším osám偏見ů.’
Závěr
Nová práce je zajímavým, i když eliptickým vhledem do toho, jak nedostatečně kurátorská nebo nadměrně/podměrně reprezentovaná trénovací data mohou vést k nežádoucím výsledkům při inference. Každý pravidelný uživatel LLM bude mít nyní sbírku válečných příběhů.
Například, mnoho odpovědí, které dostanu od ChatGPT, se zdá být ovlivněno SEO trendy posledních 10-15 let, kdy online portály byly nuceny optimalizovat pro Google místo přirozeného jazyka. Skutečně, emoji-strewn a prodigious výstup marketingových oddělení měl velmi významný dopad na jakoukoli žádost o napsání propagačního příspěvku na LinkedIn – do té míry, že AI-generovaná ‘nadšení’ je nyní naprosto nezaměnitelné:

Vlevo: Požádán o propagaci příspěvku na LinkedIn, v účtu s nulovou historií, ChatGPT defaultuje na emoji a PR-mluv. Vpravo: Požádán o totéž po šesti měsících, kdy jsem mu řekl, aby se uklidnil, GPT produkuje něco mnohem střízlivějšího.
OpenAI aktivně zasahuje do toho, jak ChatGPT reaguje na dotazy, v závislosti na funkci a kontextu, což ztěžuje výzkumníkům rozlišit problémy, které vznikají z dat, a problémy, které souvisejí s anotací; a kdy nežádoucí výsledek může být způsoben komerční interferencí ze strany hostitelské společnosti LLM.
* Z důvodu jargon-plné psacího stylu, který autoři zvolili pro tuto studii, vyhýbám se autorovým citátům, kde je to možné, ve prospěch souhrnů.
† Autoři zvýrazňují, ne já.
Poprvé publikováno v pátek, 6. června 2025












