Andersonův úhel

AI modely preferují lidské psaní před AI generovaným psaním

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
William Shakespeare arm-wrestling a robot. The style should not be illustration-type, nor cartoonish, but instead, photorealistic, in the style of a publicity photo for Real Steel' + variations. GPT-4o, Flux Kontext, Firefly.

Podle nové studie modely jako ChatGPT a podobné nyní jasně preferují text, o kterém se domnívají, že byl napsán lidmi, i když je tato domněnka chybná. Pouhá skutečnost, že text je označen jako “lidsky vytvořený”, vede AI modely k jeho preferenci – a ironicky, mohou se tento předsudek učit od nás.

 

Pojmy autenticity, provenience a sdílené lidské zkušenosti mohou hrát větší roli v AI útoků na kreativní psaní než se dosud zdálo: testy provedené pro novou studii na Princetonu zjistily, že řada významných uzavřených a otevřených jazykových modelů, včetně ChatGPT, preferuje texty, o kterých se domnívají, že jsou “lidsky generované”.

Even když byly štítky na vzorcích psaní obráceny, obě AI modely a lidské účastníky pokračovaly v nalezení chyby v AI generovaném textu, čímž se opakovaly stejné kritiky, které byly učiněny, když byl správně označen.

Výzkumníci se domnívají, že část důvodu může spočívat v tom, že rostoucí lidská nepřátelství vůči generativní AI, které se zdá manifestovat nové a zajímavé události každý den, může být zpětně ovlivňovat AI systémy samy. Poznamenávají, že AI modely nesou ještě více než lidé, když odmítají AI psaní, a uvádějí*:

’13 AI modelů, které jsme testovali, prokázalo 34,3 procentní bod předsudku ve srovnání s 13,7 procentními body u lidí, což je činí 2,5krát více náchylnými k atributivním signálům než naši lidské hodnotitelé.

‘Tato amplifikace má smysl, když uznáme, že současné modely jsou preference-trénované hodnotitelé. Alignační trénink prostřednictvím Reinforcement Learning from Human Feedback (RLHF) explicitně učí modely, aby považovaly lidská hodnocení za svůj zlatý standard, efektivní instalaci naučené spolehlivosti [předchozí].

‘Modely se učí, že odporují lidským preferencím, a vytvářejí sycophancy, kde se opakují očekávané uživatelské postoje, místo aby poskytovaly nezávislé hodnocení.’

Zjištění se vztahují na kreativní psaní, přičemž výzkumníci použili příběhy od francouzského autora jako vzorky dat; a naznačují, že lidský předsudek proti AI může, v rovnováze, převážit jakékoli kvantitativní zlepšení jazykové konstrukce, které mohou Large Language Models (LLMs) vyprodukovat, jak se vyvíjejí – a že štítek “AI” může perhaps znamenat “neautentické”, “ersatz” a dokonce “druhé třídy” v tomto doméně.

Mnohé z důvodů souvisejí s kulturní praxí a užíváním: článek uvádí, že kreativita je často popisována v termínech novosti, hodnoty a typičnosti, tj. jak nové něco vypadá; jak je oceněno odborníky; a jak dobře se hodí do své kategorie. Když je pasáž označena jako lidsky napsaná, jsou známé žánrové rysy odměňovány jako cenné; když je označena jako AI generovaná, jsou stejné rysy odmítány jako neoriginální.

Ve skutečnosti, odhalení zdroje vyvolává přehodnocení hodnoty práce, formované předpoklady o tom, jak byla vytvořena. Jakmile je autorství AI odhaleno, čtenáři instinktivně odmítají možnost individuálního objevu nebo záměru za výstupem.

Článek uvádí*:

‘Ve většině umění neexistuje žádný zlatý standard pro “dostatečně kreativní”, což činí provenienční signály mocnými primárními, které mohou měnit, které kritérium se zdá nejvíce relevantní: disciplinovaná řemeslná výroba nebo zjevná novinka, přístupnost nebo obtížnost.

‘Protože pozorovatelé často inferují proces z produktu, provenienční signály ovlivňují hodnocení, jak něco bylo vytvořeno, stejně jako co to je: konzervativní pohyby mohou být uznány jako řemeslná výroba od člověka, ale odmítány jako “pouhá generace” z modelu’.

Třináct modelů, včetně variant ChatGPT, Claude, Gemini a Mistral, se zúčastnilo spolu s lidskými čtenáři, přičemž všichni hodnotili příběhy více příznivě, když se jim řeklo, že jsou lidsky vytvořené, s LLMs, které ukázaly více předsudku než lidé.

Nápad, že AI modely mohou absorbovat předsudek proti svému vlastnímu výstupu, vyvolává otázky o tom, odkud tento předsudek pochází. Protože AI psaní není vždy snadno identifikovatelné, jakékoli negativní asociace vytvořené během tréninku pravděpodobně pocházejí z příkladů, které jsou explicitně označeny, ať už prostřednictvím zprávy o AI obsahu nebo samodeklarovaných AI generovaných článků v hlavních publikacích.

Nová práce je nazvána Všichni preferují lidské spisovatele, včetně AI, a pochází od dvou autorů z Princetonova Centra pro digitální humanitní vědy. Práce je doprovázena související datovou publikací na Zenodo (s GitHub publikací uvedenou v článku, ale repo nebylo aktivní v době psaní).

Metoda

Aby se prozkoumala, jak atribuce ovlivňuje a formuje vnímání stylu a kreativity, autoři použili Exercices de style, excentrickou práci z roku 1947 od Raymonda Queneaua, která přepisuje jednoduchou anekdotu v 99 různých stylech. Příběh sleduje muže, který nastupuje do autobusu, hádá se s jiným cestujícím a později dostává módní rady od přítele.

Although literárního původu, tato struktura předjímá prompt-based transformace v moderních jazykových modelech, kde uživatelé žádají přepisy v konkrétních tónech, hlasech nebo registrech. Tento proces byl dříve nazván transstylization – rámcování, které je nyní odráženo v AI výzkumu v kontextu Style Transfer. Zatímco většina komputačních metod cílí na funkční změny, jako jsou sentimentální posuny nebo detoxifikace, Queneauovy přepisy cílí na pozoruhodné stylistické kontrasty.

Ze známého anglického překladu Queneauovy práce byly vybrány třicet cvičení, která zachovala naraci, zatímco pokrývala širokou stylistickou škálu. Tyto zahrnovaly omezené formy, jako alexandrines a lipograms, změny rejstříku, jako noble nebo abusive, narativní posuny, jako retrograde a hesitation, a hravé deformace zahrnující spoonerisms, onomatopoeia nebo dog Latin:

Příklady ze studie, které ukazují, jak GPT-4 přepsal Queneauovy příběhy v různých literárních stylech, spárované se stylistickými popisy, které lidské a AI hodnotitelé viděli během testování. Zdroj: https://arxiv.org/pdf/2510.08831

Příklady ze studie, které ukazují, jak GPT-4 přepsal Queneauovy příběhy v různých literárních stylech, spárované se stylistickými popisy, které lidské a AI hodnotitelé viděli během testování. Zdroj: https://arxiv.org/pdf/2510.08831

Protože Queneauovy experimenty jsou obtížně klasifikovatelné, tyto kategorie jsou pouze aproximativní skupiny, s úmyslem neprovádět testy rozpoznatelnosti nebo žánrové shody, ale spíše vytvořit rozmanité podmínky, za kterých (lidské) čtenáři a modely mohou odhalit své předsudky.

Aby se vytvořily AI autorované protějšky pro každý vybraný styl, výzkumníci použili záměrně minimální podněty. Každý model obdržel nejprostější verzi Queneauovy anekdoty (úvodní cvičení, Notation), spolu s krátkou instrukcí, aby ji přepsal v konkrétním stylu, jako Přepište příběh jako sci-fi verzi. Tento přístup umožnil podněty, které odrážely ducha Queneauových původních transformací, zatímco stále umožňoval modelu interpretovat styl volně.

Dvojí vidění

První studie provedená autory použila GPT-4o k vygenerování všech třiceti stylistických variant, protože to byl nejrozvinutější model dostupný v té době. Použití jediného modelu zajišťovalo konzistentní výstupy, což pomohlo izolovat efekt atributivních štítků, který studie cítila testovat.

Výstupy nebyly editovány pro styl nebo tón, kromě rámcovacích odpadků, jako Zde je přepsaná verze.

V druhé studii byl generativní proces opakován napříč třinácti velkými jazykovými modely: Qwen 2.5 72B Instruct, Mistral Nemo, Mistral Medium 3, Llama 4 Maverick, Llama 3.3 70B Instruct, Gemini 2.5 Flash, GPT-4o Mini, GPT-4o, GPT-3.5 Turbo Instruct, DeepSeek RI (0528), DeepSeek Chat v3 (0324), Cohere Command R (08-2024), Claude Sonnet 4, a Claude 3.5 Haiku.

Každý model obdržel stejné instrukce a vytvořil své vlastní verze třiceti cvičení, což vedlo k 420 přepsaným příběhům celkem. To umožnilo výzkumníkům testovat, zda atributivní efekty držely napříč různými AI autory, spíše než být vázané na jeden model.

Data a testy

Výzkumníci ukázali stejné páry příběhů různým skupinám lidí, ale změnili štítky, aby viděli, jak moc jméno autora ovlivňuje názory:

A třetí skupina viděla jména výměněná, s “AI” příběhem označeným jako “lidský” a “lidskou” verzi označenou jako “AI”:

Přehled Studie 1. Lidské a AI soudci porovnali 30 párů příběhů, z nichž každý obsahoval verzi napsanou Queneauem a jednu napsanou GPT-4. Soudci byli rozděleni do tří skupin: jedna neviděla žádné autorovy štítky; jedna viděla správné štítky; a jedna viděla štítky prohozené – nastavení navržené pro testování rozsahu, ve kterém autorovy štítky ovlivňují názory na styl psaní.

Přehled Studie 1. Lidské a AI soudci porovnali 30 párů příběhů, z nichž každý obsahoval verzi napsanou Queneauem a jednu napsanou GPT-4. Soudci byli rozděleni do tří skupin: jedna neviděla žádné autorovy štítky; jedna viděla správné štítky; a jedna viděla štítky prohozené – nastavení navržené pro testování rozsahu, ve kterém autorovy štítky ovlivňují názory na styl psaní.

Studie 1

Výzkumníci rozdělili 30 vytvořených stylů do menších sad, přičemž každý účastník studie viděl pouze pět stylů, a každý styl byl testován pod všemi třemi štítkovacími nastaveními.

Každý účastník viděl pouze jedno štítkovací nastavení: skupina bez štítků neviděla žádné zmínky o AI; zatímco ostatní skupiny viděly buď správné nebo prohozené autorovy štítky. Přiřazování skupiny, pořadí příběhů a levopravé umístění byly všechny náhodně generovány.

AI modely prošly stejným procesem, obdržely stejné mixy stylů a stejné náhodné permutace. Každý test byl spuštěn třikrát pro každý model, aby se zajistilo, že výsledky jsou konzistentní, což umožnilo srovnání lidských a AI reakcí na autorovy štítky.

Studie 2 použila stejné tři štítkovací nastavení jako předtím, ale rozšířila test, aby zahrnoval všechny 420 příběhů vygenerovaných z výše uvedených 14 různých LLM modelů. Každý model hodnotil každý příběh pod každým štítkovacím podmínkou, produkováno 1 260 rozhodnutí pro každý model, a výsledkem bylo 17 596 platných hodnocení:

Výsledky ze Studie 1. AI a lidské soudci oba ukázali předsudek založený na autorových štítcích. Když nebyly žádné štítky zobrazeny (Blind), preference byly téměř vyrovnané; když byly zobrazeny správné štítky (Open Label), obě skupiny preferovaly lidsky napsaný text; a když byly štítky prohozeny (Counterfactual), obě skupiny přešly k preferenci textu, o kterém se domnívaly, že je lidský – a tento efekt byl mnohem silnější u AI modelů než u lidí. Chybové tyče ukazují 95% intervaly spolehlivosti.

Výsledky ze Studie 1. AI a lidské soudci oba ukázali předsudek založený na autorových štítcích. Když nebyly žádné štítky zobrazeny (Blind), preference byly téměř vyrovnané; když byly zobrazeny správné štítky (Open Label), obě skupiny preferovaly lidsky napsaný text; a když byly štítky prohozeny (Counterfactual), obě skupiny přešly k preferenci textu, o kterém se domnívaly, že je lidský – a tento efekt byl mnohem silnější u AI modelů než u lidí. Chybové tyče ukazují 95% intervaly spolehlivosti.

Ačkoli, jak článek uvádí, předchozí studie ukázaly, že AI může produkovat psaní rovnocenné nebo dokonce lepší než lidské, autoři zdůrazňují, že v literatuře je hodnota, která je kladena na autorství a autenticitu, starou a hluboce zakořeněnou konvencí:

‘Když GPT-4o Mini odmítá Queneauovu “kreativní a humoristickou” přístup jako “přehnanou” pod AI atributem, zatímco chválí identické rysy pod lidským atributem, implicitně odhaluje, jak tyto štítky spouštějí předpoklady, že žádný autentický psychologický proces se nevyskytl.

‘Provenienční signály vkládají proces zpět do toho, co by jinak mohlo být pouze produktovým hodnocením: “pouhá generace” se zdá přijatelná od lidského umělce (hodnocena jako zručná řemesla), ale podezřelá od modelu (hodnocena jako algoritmická rekompozice).’

LLM jsou ještě dostatečně spolehlivé pro nekontrolovaný faktický výzkum, i když pečlivé dohledání může stále učinit produktivní – ale LLM založené kreativní psaní může čelit nejistější budoucnosti, pokud se AI generované kreativní díla stanou stigmatizovanými prostřednictvím širšího veřejného nesouhlasu s AI nájezdem na lidské domény, spíše než na základě literárního zásluhy.

Implikace zjištění z studií tohoto typu jsou ovlivněny podstatně dispozicí společností a jednotlivých uživatelů být upřímný o tom, zda AI přispěla k jejich výstupu. V některých případech může neochota přiznat toto použití mít více co do činění s firemní pirátství autorských práv než se starostí o to, zda veřejnost přijme AI generovaná kreativní díla.

Avšak právní, finanční a politické řešení jsou možná (i když velmi náročná) týkající se autorských práv. Zda lze lidem někdy udělat, aby si užívali kreativní AI práci, která nemá žádný jediný a srozumitelný lidský rozum za ní – to může být ještě těžší perspektiva.

 

* Prosím, odkážete se na zdroj článku pro vynechání inline citací. Podle potřeby budou tyto citace zahrnuty do článku.

Poprvé zveřejněno v pondělí, 13. října 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai