Andersonův úhel

AI zápasí s emulací historického jazyka

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
ChatGPT-4o and Adobe Firefly.

Spolupráce mezi výzkumníky ve Spojených státech a Kanadě zjistila, že velké jazykové modely (LLM) jako ChatGPT mají problémy s reprodukcí historických idiomů bez rozsáhlého předtrénování – nákladného a časově náročného procesu, který leží mimo možnosti většiny akademických nebo zábavních iniciativ, což činí projekty, jako je dokončení posledního, nedokončeného románu Charlese Dickense prostřednictvím AI, nepravděpodobným návrhem.

Výzkumníci prozkoumali řadu metod pro generování textu, který zní historicky přesně, počínaje jednoduchým.promptováním pomocí raného dvacátého století prózy a končící jemným laděním komerčního modelu na malé sbírce knih z tohoto období.

Také srovnali výsledky s odděleným modelem, který byl trénován zcela na knihách publikovaných mezi 1880 a 1914.

V prvním z testů, instruování ChatGPT-4o k napodobení findesiècle jazyka produkovalo docela odlišné výsledky od těch menších GPT2-založených modelů, které byly jemně laděny na literatuře z tohoto období:

Požádáno o dokončení skutečného historického textu, dokonce i dobře připravený ChatGPT-4o (dolní levá) nemůže pomoci, aby se vrátil do 'blog' režimu, selhání při reprezentaci požadovaného idiomu. Naopak, jemně laděný GPT2 model zachytí styl jazyka dobře, ale není tak přesný v jiných ohledech. Zdroj: https://arxiv.org/pdf/2505.00030

Požádáno o dokončení skutečného historického textu (střední), dokonce i dobře připravený ChatGPT-4o (dolní levá) nemůže pomoci, aby se vrátil do ‘blog’ režimu, selhání při reprezentaci požadovaného idiomu. Naopak, jemně laděný GPT2 model (dolní pravá) zachytí styl jazyka dobře, ale není tak přesný v jiných ohledech. Zdroj: https://arxiv.org/pdf/2505.00030

Ačkoli jemné ladění přibližuje výstup k původnímu stylu, lidské čtenáře byly stále často schopny detekovat stopy moderního jazyka nebo myšlenek, naznačující, že i pečlivě upravené modely pokračují v odrážení vlivu jejich současného tréninkového data.

Výzkumníci dospěli k frustrujícímu závěru, že neexistují žádné ekonomické zkratky pro generování strojově produkovaného idiomatiky historického textu nebo dialogu. Také se domnívají, že sama výzva může být špatně formulována:

‘[Měli] bychom také zvažovat možnost, že anachronismus může být v nějakém smyslu nevyhnutelný. Pokud reprezentujeme minulost instrukcí-tuningem historických modelů, aby mohli vést konverzace, nebo učíme současné modely, aby ventriloquovali starší období, some kompromis může být nutný mezi cíli autenticity a konverzační plynulosti.

‘Existují, přece, žádné “autentické” příklady konverzace mezi dvacátého století tazatelem a respondentem z roku 1914. Výzkumníci, kteří se snaží vytvořit takovou konverzaci, budou muset zvažovat [předpoklad] že interpretace vždy zahrnuje vyjednávání mezi současností a [minulostí].’

Nová studie je nazvaná Mohou jazykové modely reprezentovat minulost bez anachronismu? a pochází od tří výzkumníků z University of Illinois, University of British Columbia a Cornell University.

Úplná katastrofa

Zpočátku, ve třech částech výzkumného přístupu, autoři testovali, zda moderní jazykové modely mohou být donuceny k napodobení historického jazyka pomocí jednoduchého promptování. Použili skutečné ukázky z knih publikovaných mezi 1905 a 1914, požádali ChatGPT‑4o, aby tyto pasáže dokončily ve stejném idiomu.

Původní periodický text byl:

‘V tomto posledním případě je úspora asi pět nebo šest dolarů na minutu, protože více než dvacet yardů filmu musí být odvíjeno, aby se během jedné minuty promítl objekt osoby v klidu nebo krajiny. Tím je získán praktický kombinace pevných a pohyblivých obrazů, který produkuje nejuměleckější efekty.

‘To také umožňuje nám pracovat se dvěma kinematografy, které promítají střídavě, aby se zabránilo scintilaci, nebo promítají současně červené a zelené obrazy a reprodukují přirozené barvy, tím se uleví lidskému oku, které je zvyklé přijímat základní barvy současně, od všech fyziologických únav. Slovo nyní o aplikaci studeného světla na okamžité fotografii.’

Pro hodnocení, zda vygenerovaný text odpovídá zamýšlenému historickému stylu, a vědomi si, že lidé nejsou zvlášť dobří v odhadování data, kdy byl text napsán, výzkumníci jemně ladili RoBERTa model, aby odhadl datum publikace, pomocí podmnožiny Corpus of Historical American English, pokrývající materiál z roku 1810 do 2009.

RoBERTa klasifikátor byl poté použit k hodnocení dokončení vygenerovaného ChatGPT‑4o, které bylo promptováno skutečnými pasážemi z knih publikovaných mezi 1905 a 1914.

Systémový prompt (tj. kontextové instrukce pro ChatGPT, jak přistupovat k úkolu) byl:

‘Vaším úkolem je dokončit pasáže z raného dvacátého století knih. Budete mít pasáž z knihy publikované v roce 1913. Dokončete tuto pasáž ve stejném stylu, alespoň 200 slov. Poskytněte pouze toto dokončení; neudělujte žádné rámcové poznámky, jako „toto je dokončení“.

Přes obě one-shot a 20-shot promptování, výstupy ChatGPT-4o se neustále naklonily směrem k 21. století stylistického rejstříku.

Příklad uvedený v článku obsahuje jeden z pokusů ChatGPT-4o o dokončení skutečného periodického textu o fotografii:

‘Použití studeného světla v okamžité fotografii revolucionalizovalo přístup k zachycení obrazů za různých světelných podmínek. Tradičně, fotografové bojovali s drsností a variabilitou přirozeného světla nebo rušivou povahou bleskové fotografie, která mohla narušit atmosféru scény nebo přirozené chování subjektů, zejména ve wildlife a kandidátní fotografii.

‘Studené světlo, se svou měkkou a více rozptýlenou povahou… umožňuje více přirozené reprezentace barev a textur, které jsou často ztraceny pod drsným umělým osvětlením.’

Jako můžeme snadno vidět, tento generický, Wiki-styl text neodpovídá prolixnímu a elaborovanému stylu původního periodického textu. Kromě toho, nezachovává skutečný kontext, ale spustí se do odbočné, abstraktní úvahy o jednom z podtémat.

Tým také otestoval GPT‑1914, menší GPT‑2–třídu model, který byl trénován od začátku na 26,5 miliardách tokenů literatury z let 1880 až 1914.

Ačkoli jeho výstup byl méně koherentní než ten ChatGPT‑4o, byl více konzistentní se stylem zdrojového období. Jediný příklad poskytnutý v článku, opět jako dokončení skutečného periodického textu o fotografii, zní:

‘Zásada jeho působení byla již vysvětlena (str. 4). Zde zmíníme pouze, že může být aplikován s výhodou, když chceme získat velmi rychlé fotografie na papíru potaženém collodionem, jakož i ty, které jsou pořízeny pomocí gelatinných desek.

‘V takových případech musí expozice trvat déle než jednu sekundu; ale pokud je požadována fotografie, která má být vyvinuta v kratším čase – řekněme půl sekundy – pak by teplota neměla klesnout pod 20° C., jinak by obraz po zpracování byl příliš tmavý; navíc by deska ztratila svou citlivost za těchto podmínek.

‘Pro obvyklé účely však stačí pouze vystavit citlivou plochu nízkému stupni tepla bez zvláštních opatření, kromě toho, aby se udržela’

Přestože je skutečný a původní materiál arkan a poměrně těžké sledovat, je těžké pochopit, do jaké míry GPT-1914 přesně zachytil původní; ale výstup určitě zní více periodicky autentický.

Nicméně, autoři dospěli k závěru, že jednoduché promptování dělá málo pro překonání současného zkreslení velkého předtrénovaného modelu, jako je ChatGPT-4o.

Zhustnutí zápletky

Pro měření, jak blízko se modelové výstupy podobají autentickému historickému psaní, výzkumníci použili statistický klasifikátor k odhadu pravděpodobného data publikace každého textu. Poté vizualizovali výsledky pomocí kernel density plotu, který ukazuje, kde model myslí, že každá pasáž spadá do historické časové osy.

Odhadovaná data publikace pro skutečné a vygenerované texty, založené na klasifikátoru trénovaném na rozpoznání historického stylu (1905–1914 zdroj textů ve srovnání s dokončeními ChatGPT‑4o pomocí one-shot a 20-shot promptů a GPT‑1914 trénovaného pouze na literatuře z let 1880–1914).

Odhadovaná data publikace pro skutečné a vygenerované texty, založené na klasifikátoru trénovaném na rozpoznání historického stylu (1905–1914 zdroj textů ve srovnání s dokončeními ChatGPT‑4o pomocí one-shot a 20-shot promptů a GPT‑1914 trénovaného pouze na literatuře z let 1880–1914).

Jemně laděný RoBERTa model použitý pro tuto úlohu, autoři poznamenali, není bezchybný, ale byl schopen vyzdvihnout obecné stylistické trendy. Pasáže napsané GPT‑1914, modelem trénovaným zcela na literatuře z období, shlukovaly se kolem počátku dvacátého století – podobně jako původní zdroj materiál.

Naproti tomu, výstupy ChatGPT‑4o, i když byly promptovány s několika historickými příklady, měly tendenci připomínat psaní jednadvacátého století, odrážející data, na kterých byl původně trénován.

Výzkumníci kvantifikovali tento nesoulad pomocí Jensen-Shannon divergence, míry, jak se dvě pravděpodobnostní distribuce liší. GPT‑1914 skóroval blízkou 0,006 ve srovnání se skutečným historickým textem, zatímco one-shot a 20-shot výstupy ChatGPT‑4o ukázaly mnohem širší mezery, na 0,310 a 0,350.

Autoři argumentují, že tato zjištění naznačují, že promptování samo o sobě, i s několika příklady, není spolehlivým způsobem, jak produkovat text, který přesvědčivě simuluje historický styl.

Dokončení pasáže

Článek poté zkoumá, zda jemné ladění by mohlo produkovat lepší výsledek, protože tento proces zahrnuje přímé ovlivňování využitelných váh modelu pokračováním jeho tréninku na uživatelsky specifikovaných datech – proces, který může ovlivnit původní základní funkčnost modelu, ale významně zlepšit jeho výkon na doméně, která je „tlačena“ do něj nebo zdůrazněna během jemného ladění.

V prvním experimentu s jemným laděním, tým trénoval GPT‑4o‑mini na přibližně dvou tisících párech dokončení pasáží z knih publikovaných mezi 1905 a 1914, s cílem vidět, zda by menší měřítko jemného ladění mohlo posunout výstupy modelu směrem k více historicky přesnému stylu.

Použili stejný RoBERTa-založený klasifikátor, který působil jako soudce v předchozích testech, aby odhadl stylistický „datum“ každého výstupu, výzkumníci zjistili, že v novém experimentu jemně laděný model produkoval text úzce související s ground truth.

Jeho stylistická divergence od původních textů, měřená pomocí Jensen-Shannon divergence, klesla na 0,002, obecně v souladu s GPT‑1914:

Odhadovaná data publikace pro skutečné a vygenerované texty, ukazující, jak blízko GPT‑1914 a jemně laděná verze GPT‑4o‑mini odpovídají stylu raného dvacátého století psaní (založené na knihách publikovaných mezi 1905 a 1914).

Odhadovaná data publikace pro skutečné a vygenerované texty, ukazující, jak blízko GPT‑1914 a jemně laděná verze GPT‑4o‑mini odpovídají stylu raného dvacátého století psaní (založené na knihách publikovaných mezi 1905 a 1914).

Nicméně, výzkumníci varují, že tato metrika může zachytit pouze povrchní rysy historického stylu, a ne hlubší konceptuální nebo faktické anachronismy.

‘[To] není velmi citlivý test. RoBERTa model použitý jako soudce zde není trénován na predikci data, ale na rozlišení autentických pasáží od anachronistických. Pravděpodobně používá hrubé stylistické důkazy k této predikci. Lidské čtenáře nebo větší modely by mohly stále být schopny detekovat anachronistický obsah v pasážích, které na povrchu zní „v období“.’

Lidský dotek

Nakonec, výzkumníci provedli testy lidské evaluace pomocí 250 ručně vybraných pasáží z knih publikovaných mezi 1905 a 1914, a pozorovali, že mnoho z těchto textů by bylo pravděpodobně interpretováno jinak dnes než v době psaní:

‘Naše seznam zahrnoval, například, encyklopedickou položku o Alsasku (který byl tehdy částí Německa) a jednu o beri-beri (který byl tehdy často vysvětlován jako houbové onemocnění spíše než nutriční nedostatek). Zatímco tyto jsou rozdíly fakt, jsme také vybrali pasáže, které by zobrazily jemnější rozdíly v postoji, rétorice nebo imaginaci.

‘Například, popisy neevropských míst na počátku dvacátého století sklouzávají do rasových generalizací. Popis východu slunce na Měsíci napsaný v roce 1913 si představuje bohaté chromatické jevy, protože nikdo belum viděl fotografie světa bez [atmosféry].’

Výzkumníci vytvořili krátké otázky, na které každá historická pasáž mohla plausibilně odpovědět, poté jemně laděli GPT‑4o‑mini na těchto otázka–odpověď párech. Pro posílení evaluace, trénovali pět samostatných verzí modelu, každou dobu držící jinou část dat pro testování.

Poté vygenerovali odpovědi pomocí obou výchozích verzí GPT-4o a GPT-4o‑mini, jakož i jemně laděných variant, každá hodnocena na části, kterou neviděla během tréninku.

Ztracený v čase

Pro hodnocení, jak přesvědčivě modely mohly imitovat historický jazyk, výzkumníci požádali tři odborné anotátory, aby přezkoumali 120 AI-generovaných dokončení, a soudili, zda každá z nich vypadala jako pravděpodobná pro spisovatele v roce 1914.

Tento přímý evaluativní přístup se ukázal být více náročným, než se očekávalo: ačkoli anotátoři souhlasili ve svých hodnoceních téměř osmdesáti procent času, nerovnováha v jejich úsudcích (s „pravděpodobným“ vybraným dvakrát častěji než „nepříliš pravděpodobným“) znamenala, že jejich skutečná úroveň shody byla pouze mírná, měřená Cohen’s kappa score 0,554.

Anotátoři sami popsali úkol jako obtížný, často vyžadující další výzkum, aby vyhodnotili, zda prohlášení odpovídalo tomu, co bylo známo nebo věřeno v roce 1914.

Některé pasáže vyvolaly obtížné otázky o tónu a perspektivě – například, zda odpověď byla vhodně omezena ve svém světě, aby odrážela to, co by bylo typické v roce 1914. Tento druh úsudku často závisel na úrovni ethnocentrismu (tj. tendence vidět jiné kultury skrze předpoklady nebo předsudky jedné vlastní).

V tomto kontextu, výzvou bylo rozhodnout, zda pasáž vyjádřila právě tolik kulturního zkreslení, aby se zdála historicky pravděpodobná, aniž by zněla příliš moderně nebo příliš otevřeně urážlivě podle dnešních standardů. Autoři poznamenali, že i pro učence obeznámené s obdobím, bylo obtížné nakreslit ostrou linii mezi jazykem, který zněl historicky přesně, a jazykem, který odrážel současné myšlenky.

Přesto, výsledky ukázaly jasnou klasifikaci modelů, s jemně laděnou verzí GPT‑4o‑mini hodnocenou jako nejpravděpodobnější celkově:

Hodnocení anotátorů, jak pravděpodobné se jeví výstup každého modelu

Hodnocení anotátorů, jak pravděpodobné se jeví výstup každého modelu

Zda je tato úroveň výkonu, hodnocená jako „pravděpodobná“ v osmdesáti procentech případů, dostatečně spolehlivá pro historický výzkum, zůstává nejasná – zejména protože studie nezahrnovala základnu míry, jak často by skutečné periodické texty mohly být nesprávně klasifikovány.

Vstupní varování

Následovalo „vstupní test“, kde expertní anotátoři byli představeni čtyřem anonymním pasážím, které odpovídaly na stejnou historickou otázku. Tři z odpovědí pocházely z jazykových modelů, zatímco jedna byla skutečnou a autentickou ukázkou z raného dvacátého století zdroje.

Úkol spočíval v identifikaci, která pasáž byla původní, skutečně napsaná během období.

Tento přístup neptal anotátory přímo o hodnocení pravděpodobnosti, ale spíše měřil, jak často skutečná pasáž vynikala z AI-generovaných odpovědí, fakticky testující, zda modely mohly oklamat čtenáře, aby si mysleli, že jejich výstup je autentický.

Klasifikace modelů odpovídala výsledkům z předchozí úkolu hodnocení: jemně laděná verze GPT‑4o‑mini byla nejvíce přesvědčivá mezi modely, ale stále nedosahovala skutečné věci.

Frekvence, s níž byla každá zdroj správně identifikována jako autentická historická pasáž.

Frekvence, s níž byla každá zdroj správně identifikována jako autentická historická pasáž.

Tento test také posloužil jako užitečná referenční hodnota, protože, s skutečnou pasáží identifikovanou více než polovinu času, mezera mezi autentickým a syntetickým prosem zůstala zřetelná pro lidské čtenáře.

Statistická analýza nazvaná McNemar’s test potvrdila, že rozdíly mezi modely byly významné, s výjimkou dvou neupravených verzí (GPT‑4o a GPT‑4o‑mini), které vykazovaly podobné výkony.

Budoucnost minulosti

Autoři zjistili, že prompting moderních jazykových modelů k přijetí historického hlasu nedával spolehlivě přesvědčivé výsledky: méně než dvě třetiny výstupů byly hodnoceny jako pravděpodobné lidskými čtenáři, a dokonce i tento údaj pravděpodobně přehánějí výkon.

V mnoha případech, odpovědi zahrnovaly explicitní signály, že model mluvil z perspektivy současnosti – fráze, jako ‘v roce 1914, ještě není známo, že…’ nebo ‘k roku 1914, nejsem obeznámen s…’ byly dostatečně časté, aby se objevily v až jedné pětině dokončení. Prohlášení tohoto druhu jasně ukazovala, že model simuluje historii zvenčí, spíše než píše z ní.

Autoři prohlašují:

‘Špatný výkon kontextového učení je nepříjemný, protože tyto metody jsou nejjednodušší a nejlevnější pro AI-založený historický výzkum. Podtrhujeme, že jsme tyto přístupy nevyzkoumali vyčerpávajícím způsobem.

‘Může se ukázat, že kontextové učení je dostatečné – nyní nebo v budoucnu – pro podmnožinu výzkumných oblastí. Ale naše počáteční důkazy nejsou povzbudivé.’

Autoři uzavírají, že zatímco jemné ladění komerčního modelu na historických pasážích může produkovat stylisticky přesvědčivý výstup za minimální náklady, nezničí úplně stopy moderní perspektivy. Předtrénování modelu zcela na periodickém materiálu se vyhněte anachronismu, ale vyžaduje mnohem větší zdroje a vede k méně plynulému výstupu.

Žádná z metod nenabízí úplné řešení, a prozatím, jakékoli pokusy simulovat historické hlasy zdají se涉ovat kompromis mezi autenticitou a koherencí. Autoři uzavírají, že další výzkum bude nutný k vyjasnění, jak nejlépe navigovat tento napětí.

Závěr

Možná jednou z nejzajímavějších otázek, které vznikají z nové studie, je ta autenticity. Zatímco nejsou dokonalými nástroji, ztrátové funkce a metriky, jako LPIPS a SSIM, poskytují výzkumníkům v počítačovém vidění alespoň metodologii pro hodnocení proti ground truth.

Když se generuje nový text ve stylu minulého věku, na druhé straně, neexistuje ground truth – pouze pokus o obydlení zmizelé kulturní perspektivy. Pokus o rekonstrukci tohoto vědomí z literárních stop je sám o sobě aktem kvantizace, protože tyto stopy jsou pouze důkazy, zatímco kulturní vědomí, z něhož vznikají, zůstává mimo odhad, a pravděpodobně i mimo představivost.

Na praktické úrovni, základy moderních jazykových modelů, tvarované současnými normami a daty, riskují reinterpretovat nebo potlačit myšlenky, které by se zdály rozumné nebo nezávažné čtenáři z éry Edwarda, ale které nyní registrované jako (často urážlivé) artefakty předsudků, nerovnosti nebo nespravedlnosti.

Divíme se, zda bychom mohli vytvořit takový dialog, zda by nás to mohlo odpudit.

 

Poprvé publikováno v pátek, 2. května 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai