Unghiul lui Anderson
De ce ÃŪi place inteligenČei artificiale sÄ scrie despre paznicii de far?

CÃĒnd li se cere sÄ âscrie o povesteâ, modelele de limbaj avansate, cum ar fi ChatGPT Či altele, par sÄ evite ÃŪncÄlcarea drepturilor de autor prin recursul obsesiv la acelaČi grup mic Či ciudat de elemente narative.
Â
O nouÄ cercetare de la Universitatea Cornell a descoperit cÄ modelele de limbaj de ultimÄ generaČie par sÄ aibÄ o obsesie ciudatÄ pentru o selecČie foarte ÃŪngustÄ de elemente narative, atunci cÃĒnd li se cere pur Či simplu sÄ âscrie o povesteâ. DupÄ ce au solicitat patru modele LLM sÄ scrie 20.000 de poveČti, ei au constatat cÄ 88% dintre poveČti conČineau cel puČin unul dintre cele 11 tokeni foarte specifici din categoria âlocâ, ânumeâ sau âprofesieâ:

ApariČiile unor cuvinte-cheie neobiČnuite, reprezentate aici ÃŪn pÄrČi per milion, obČinute prin analiza cercetÄtorilor a 20.000 de poveČti generate de LLM. SursÄ
Cele 11 cuvinte care apar cel mai frecvent ÃŪn cele 12 milioane de cuvinte generate de LLM ÃŪn timpul studiului au fost numele elias, mara, elara; profesiile paznic, brutar, primar, ceasornicar, pescar, bibliotecar Či dirijor; Či locul far:
Modelele testate au fost Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini Či OLMo 7b Thinking. Toate au primit una dintre cele cinci solicitÄri: âScrie o povesteâ; âTe rog sÄ scrii o povesteâ; âScrie-mi o povesteâ; âSpune-mi o povesteâ; sau âTe rog sÄ-mi spui o povesteâ.
Interesat sÄ vÄd dacÄ sindromul identificat ÃŪn lucrare este prezent Či ÃŪn modelele disponibile la momentul scrierii, am ÃŪncercat experimentul Či eu, mai ÃŪntÃĒi pe contul meu obiČnuit de ChatGPT (legÄturÄ cÄtre conversaČie aici). Nu a fost necesarÄ nicio selecČie â ChatGPT-5.5 a mers direct la materialul pe care cercetÄtorii l-au prezis, la prima ÃŪncercare:

ChatGPT-5.5 confirmÄ imediat constatÄrile lucrÄrii. SursÄ
ÃntrebÃĒndu-mÄ dacÄ contextul istoric sau chiar scurgerea informaČiilor ÃŪntre domenii ar putea explica acest âsucces imediatâ, m-am conectat la un cont gratuit de ChatGPT pe care nu l-am folosit de peste un an, ÃŪntr-o fereastrÄ privatÄ de navigare, Či am ÃŪncercat din nou (legÄturÄ cÄtre conversaČie aici). Din nou, ChatGPT a confirmat modelul:

Contul ChatGPT #2 urmeazÄ aceleaČi obsesii Či micÄ carte de nume Či teme descrise ÃŪn lucrarea nouÄ. SursÄ
Este demn de remarcat cÄ versiunile GPT testate au fost o clasÄ superioarÄ faČÄ de 5.4, testate ÃŪn lucrare.
De asemenea, am ÃŪncercat Anthropicâs Sonnet 4.6, Či nu am fost dezamÄgit. Din nou, cuvintele-cheie familiare au apÄrut la prima ÃŪncercare (legÄturÄ cÄtre conversaČie aici):

De data aceasta, âMaraâ, un alt nume din âtop 11â, conduce povestea, la prima ÃŪncercare pe Claude Sonnet 4.6. SursÄ
ÃncercÃĒnd aceeaČi solicitare pe Claude Haiku 4.5, am obČinut aproximativ acelaČi rezultat (legÄturÄ cÄtre conversaČie aici).
IniČial, nu am putut reproduce constatÄrile autorilor la Google Gemini, pÃĒnÄ cÃĒnd am schimbat modelul ÃŪn cel utilizat ÃŪn lucrare, Gemini 3.1 Flash-Lite â Či atunci, la a treia ÃŪncercare (dar prima cu acest model), modelul a apÄrut imediat (legÄturÄ aici):

Google Gemini 3.1 Flash-Lite. SursÄ
Experimentele ulterioare cu diferite modele Gemini au arÄtat ÃŪn mod constant tema farului, deČi cu variante care nu au apÄrut ÃŪn âtop 11â, cum ar fi numele âThomasâ Či, ÃŪntr-o altÄ variantÄ, numele meu, ca protagonist.
Nonetheless, la momentul scrierii, constatÄrile lucrÄrii sunt extrem de uČor de demonstrat.
Faruri ÃŪn sÄlbÄticie
Minte strÄlucite gÃĒndesc la fel: cu o sÄptÄmÃĒnÄ ÃŪn urmÄ, ÃŪnainte de publicarea noii lucrÄri, scriitorul de software Daniel May a remarcat coincidenČa tropei âEliasâ Či âpaznic de farâ, aparent observatÄ la ÃŪntÃĒmplare. El a continuat sÄ testeze opt variante de Gemini, DeepSeek, Qwen Či Gemma, pe care le-a gÄsit capabile sÄ producÄ âmemeâ-urile farului Či âElias Thorneâ ca protagonist*. Cu toate acestea, aceastÄ descoperire iniČialÄ nu s-a extins la gama mai largÄ de teme de conČinut persistente descrise ÃŪn noua lucrare.
Curios sÄ vÄd dacÄ aceste teme recurente, nume Či locuri au ieČit vreodatÄ dincolo de limitele unei conversaČii, am cÄutat pe Google cÃĒteva dintre cuvintele-cheie Či temele din âtop 11â Či am gÄsit un numÄr remarcabil de postÄri care par sÄ le fi canalizat:

Trei exemple de âmemeâ ÃŪn output. Vezi mai jos pentru legÄturi cÄtre surse.
May a identificat numele complet âElias Thorneâ (Či nu doar âEliasâ) ca o âmemeâ persistentÄ a LLM, Či a postat diverse capturi de ecran de pe Amazon, unde acest nume a fost folosit ca titlu pentru autorii unor cÄrČi diverse, inclusiv cÄrČi medicale.
Ãn schimb, eu am cÄutat Či am gÄsit conČinut care pÄrea sÄ fi invocat temele persistente dintr-un LLM, inclusiv un post X al unei poveČti (versiunea arhivatÄ aici); o lucrare de ficČiune (versiunea arhivatÄ aici); Či o poveste cu narare pe YouTube (arhivatÄ aici). A existat mult mai mult de traversat, dar timpul nu a permis.
Gustul pentru trecut
AČa cÄ, pentru observaČia casualÄ Či serendipitate. Ãn timp ce nu a apÄrut niciun âdocument magicâ ÃŪn datele de antrenare care sÄ conČinÄ toate sau majoritatea persistenČelor, autorii noii lucrÄri speculeazÄ cÄ filtrele de drepturi de autor ÃŪn dezvoltarea inteligenČei artificiale ar putea restricČiona outputul fictiv al LLM la material care este ÃŪn afara drepturilor de autor.
Autorii afirmÄ:
âNu putem explica dominanČa poveČtilor âElias ÃŪn farâ prin prevalenČa ÃŪn datele de antrenare sau de testare. SpeculÄm cÄ modelele sunt antrenate sÄ evite referinČe la personaje cu drepturi de autor Či conČinut pentru adulČi ÃŪn timpul alinierii, dar amÃĒnÄm aceastÄ ÃŪntrebare pentru lucrÄri viitoare.â
| Categorie | Token | Al nostru | Lit | Pre non-ficČiune | Pre ficČiune | Post non-ficČiune | Post ficČiune |
|---|---|---|---|---|---|---|---|
| Nume | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Nume | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Nume | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Profesie | paznic | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Profesie | brutar | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Profesie | primar | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Profesie | ceasornicar | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Profesie | pescar | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Profesie | bibliotecar | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Profesie | dirijor | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Loc | far | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Tabelul de comparaČie arÄtÃĒnd cÃĒt de des cuvintele recurente din poveČtile generate de LLM apar ÃŪn literatura publicatÄ, ficČiunea de pe web Či seturile de date post-antrenare, cu termeni precum âEliasâ Či âfarâ care apar mult mai frecvent ÃŪn ficČiunea scrisÄ de chatbot.
Ãn studiul lor, autorii au constatat cÄ cele 11 cuvinte accentuate apar ÃŪn 88% din cele 20.000 de poveČti generate Či cÄ existÄ âpuČine diferenČe ÃŪntre modeleâ. Ei subliniazÄ cÄ aceste cuvinte sunt neobiČnuite ÃŪn literatura englezÄ publicatÄ Či cÄ datele post-antrenare (datele destinate sÄ condiČioneze Či sÄ alinieze modelele ÃŪn utilizÄri âacceptabileâ) ar putea fi responsabile.
Lucrarea afirmÄ:
âUn exemplu tipic prezentat [mai jos] evidenČiazÄ trei elemente comune ÃŪn aproape toate cele 20.000 de poveČti: un loc (19,864 de poveČti), un nume de personaj (19,864 de poveČti) Či o profesie (15,807 poveČti).
âDe fapt, locul specific (âfarâ), numele (âEliasâ) Či profesia (âpaznicâ) din aceastÄ poveste apar ÃŪntr-o combinaČie sau alta ÃŪn 66,6% din toate poveČtile generate. Lumina este, de asemenea, o temÄ comunÄ: 56% din poveČtile generate de Claude au titlul âSecretul paznicului de farâ Či cuvÃĒntul âluminÄâ apare ÃŪn 16,784 de poveČti la o ratÄ medie de 3,2 instanČe pe poveste.â

Acest exemplu, conform lucrÄrii, a fost scris de Google Gemini 3.1 Flash-Lite, ca rÄspuns la solicitarea âScrie o povesteâ.
Este demn de remarcat cÄ autorii studiului identificÄ o tendinČÄ nostalgicÄ sau atavicÄ ÃŪn toate cuvintele-cheie Či numele derivate.
Urmarirea trÄsÄturilor
Pentru a testa dacÄ poveČtile recurente cu âfarâ pot fi explicate prin expunerea obiČnuitÄ la ficČiune, au fost fÄcute comparaČii ÃŪntre cuvintele recurente favorite ale modelelor Či cÃĒteva corpuri mari de limbÄ englezÄ. FicČiunea contemporanÄ a fost examinatÄ prin CONLIT, un set de date care conČine 2.700 de romane ÃŪn englezÄ publicate ÃŪntre 2007 Či 2021, acoperind 12 genuri Či totalizÃĒnd aproximativ 287 de milioane de cuvinte.
âEliasâ apare de aproximativ 900 de ori mai des ÃŪn poveČtile generate decÃĒt ÃŪn ficČiunea publicatÄ. FicČiunea amatorilor de pe comunitatea /r/writingprompts de pe Reddit a produs frecvenČe similare, indicÃĒnd cÄ modelul nu reflectÄ obiceiurile de povestire umanÄ mai largi.
AcelaČi model a fost valabil atunci cÃĒnd s-a examinat datele de antrenare. UtilizÃĒnd corpusul OLMo 3, care conČine aproximativ 3,89 miliarde de documente scrise ÃŪn principal de oameni, extrase parČial din Common Crawl, cercetÄtorii au constatat cÄ cuvintele recurente ânucleuâ apar foarte puČin.
Deoarece o mare parte a corpusului OLMo 3 este non-ficČiune, a fost creat un clasificator de ficČiune utilizÃĒnd anotÄrile GPT-OSS 20b Či un model FastText antrenat pe 200.000 de exemple echilibrate. Chiar Či dupÄ filtrarea specificÄ a materialului fictiv, cuvinte precum âElaraâ au apÄrut la rate neglijabile comparativ cu poveČtile generate de LLM. De ce, atunci, acestea dominÄ la nivelul cel mai de bazÄ al imperativei pentru un LLM de a scrie ficČiune?
Autorii afirmÄ:
âDacÄ cuvintele ânucleuâ nu sunt comune ÃŪn datele de pe web, atunci o sursÄ rÄmasÄ ar fi datele post-antrenare. Dar am constatat cÄ datele post-antrenare OLMo prezintÄ token-urile noastre la o ratÄ mai micÄ decÃĒt CONLIT.
Ãn cadrul a 78.958 de poveČti din seturile de date post-antrenare OLMo 3, ei noteazÄ cÄ âEliasâ a apÄrut de 52,7 ori pe milion de cuvinte, comparativ cu 2,7 ÃŪn CONLIT, dar a atins 2.428 de apariČii pe milion de cuvinte ÃŪn poveČtile generate examinate ÃŪn studiu.
Pentru a identifica de unde provin poveČtile recurente ânucleuâ, fiecare poveste din seturile de date post-antrenare OLMo 3 a fost evaluatÄ pentru prezenČa unuia sau mai multor tokeni ânucleuâ (adicÄ, pentru prezenČa Elara, Mara, etc.). Se aČtepta ca majoritatea sÄ aparÄ ÃŪn seturile de date de fine-tuning supravegheat (SFT), deoarece WildChat Či sursele conexe au contribuit cu 59.266 de poveČti la OLMo 3.
Cu toate acestea, doar 1.803 conČineau termeni ânucleuâ, ÃŪn timp ce seturile de date utilizate pentru DPO Či ÃŪnvÄČare prin ÃŪntÄrire au arÄtat concentraČii mai mari.
Ãn general, vocabularul recurent ânucleuâ a fost urmÄrit pÃĒnÄ la doar 3.053 de poveČti, reprezentÃĒnd 3,8% din toate poveČtile post-antrenare examinate. Nu existÄ nicio posibilitate statisticÄ ca un subset atÃĒt de mic de corpuri sÄ ajungÄ sÄ domine ÃŪn modul demonstrat.
Lucrarea concluzioneazÄ:
âAtunci cÃĒnd li se dÄ puČinÄ direcČie, modelele actuale de frontierÄ scriu poveČti utilizÃĒnd un catalog ÃŪngust de nume, locuri Či profesii. Personajele recurente ÃŪn aceste poveČti includ Elias, un paznic de far. Elias este neobiČnuit; numele este neobiČnuit ÃŪn literaturÄ, datele de pe web Či chiar ÃŪn datele post-antrenare.â
Concluzie
Ãn absenČa oricÄrei lucrÄri literare (sau chiar a unei serii) care sÄ conČinÄ cele 11 cuvinte pe care autorii le identificÄ, nu este deloc clar prin ce mijloace aceastÄ colecČie particularÄ de cuvinte a acumulat Či s-a asociat la nivelurile cele mai de bazÄ ale mai multor modele de limbaj mari (ÃŪn ciuda diversitÄČii datelor de antrenare Či abordÄrilor lor).
Chiar dacÄ afirmaČia cercetÄtorilor despre efectul restrictiv al filtrelor de drepturi de autor este corectÄ, o âmareâ de literaturÄ clasicÄ din datele de antrenare ar fi trebuit sÄ previnÄ aceastÄ ciudatÄ colecČie de cuvinte vechi de a domina outputul unei solicitÄri necalificate de a âscrieâ.
Teoria presupune, totuČi, cÄ cantitÄČi uriaČe de literaturÄ clasicÄ ar fi fost incluse ÃŪn regimul de antrenare. Acest lucru este puČin probabil, deoarece ceea ce se doreČte sunt modele care nu vor produce ieČiri false ÃŪn stilul lui Dickens, ci care sÄ se ocupe de lexicul modern Či sÄ fie potrivite pentru nevoile actuale de afaceri. Volumul imens chiar al literaturii preindustriale ar face imposibilÄ includerea sa.
Ãn orice caz, dacÄ ar fi o singurÄ narativÄ distinctÄ care sÄ conČinÄ o combinaČie alternativÄ a facetelor âobsesiveâ pe care autorii le noteazÄ, ar fi, probabil, mai uČor de gÄsit; autorii ÃŪnČiČi nu au putut gÄsi-o, Či cÄutÄri ocazionale ÃŪn era pre-AI nu au descoperit niciun concurent. Poate cÄ, dacÄ âsindromul faruluiâ va cÄpÄta aceeaČi notorietate ca liniile de pauzÄ AI, vreo autoritate academicÄ va veni cu rÄspunsul.
Â
* Nu pot continua mai departe ÃŪn articolul lui May, din motive care pot deveni evidente atunci cÃĒnd cineva ÃŪl citeČte.
Publicat pentru prima datÄ miercuri, 27 mai 2026. Modificat ÃŪn primele 30 de minute pentru a corecta legÄtura Anthropic.












