Unghiul lui Anderson

De ce ÃŪi place inteligenței artificiale să scrie despre paznicii de far?

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

CÃĒnd li se cere să “scrie o poveste”, modelele de limbaj avansate, cum ar fi ChatGPT și altele, par să evite ÃŪncălcarea drepturilor de autor prin recursul obsesiv la același grup mic și ciudat de elemente narative.

 

O nouă cercetare de la Universitatea Cornell a descoperit că modelele de limbaj de ultimă generație par să aibă o obsesie ciudată pentru o selecție foarte ÃŪngustă de elemente narative, atunci cÃĒnd li se cere pur și simplu să “scrie o poveste”. După ce au solicitat patru modele LLM să scrie 20.000 de povești, ei au constatat că 88% dintre povești conțineau cel puțin unul dintre cele 11 tokeni foarte specifici din categoria “loc”, “nume” sau “profesie”:

Aparițiile unor cuvinte-cheie neobișnuite, reprezentate aici ÃŪn părți per milion, obținute prin analiza cercetătorilor a 20.000 de povești generate de LLM. Sursă - https://arxiv.org/pdf/2605.26492

Aparițiile unor cuvinte-cheie neobișnuite, reprezentate aici ÃŪn părți per milion, obținute prin analiza cercetătorilor a 20.000 de povești generate de LLM. Sursă

Cele 11 cuvinte care apar cel mai frecvent ÃŪn cele 12 milioane de cuvinte generate de LLM ÃŪn timpul studiului au fost numele elias, mara, elara; profesiile paznic, brutar, primar, ceasornicar, pescar, bibliotecar și dirijor; și locul far:

Modelele testate au fost Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini și OLMo 7b Thinking. Toate au primit una dintre cele cinci solicitări: ‘Scrie o poveste’; ‘Te rog să scrii o poveste’; ‘Scrie-mi o poveste’; ‘Spune-mi o poveste’; sau ‘Te rog să-mi spui o poveste’.

Interesat să văd dacă sindromul identificat ÃŪn lucrare este prezent și ÃŪn modelele disponibile la momentul scrierii, am ÃŪncercat experimentul și eu, mai ÃŪntÃĒi pe contul meu obișnuit de ChatGPT (legătură către conversație aici). Nu a fost necesară nicio selecție – ChatGPT-5.5 a mers direct la materialul pe care cercetătorii l-au prezis, la prima ÃŪncercare:

ChatGPT-5.5 confirmă imediat constatările lucrării. Sursă - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 confirmă imediat constatările lucrării. Sursă

ÎntrebÃĒndu-mă dacă contextul istoric sau chiar scurgerea informațiilor ÃŪntre domenii ar putea explica acest “succes imediat”, m-am conectat la un cont gratuit de ChatGPT pe care nu l-am folosit de peste un an, ÃŪntr-o fereastră privată de navigare, și am ÃŪncercat din nou (legătură către conversație aici). Din nou, ChatGPT a confirmat modelul:

Contul ChatGPT #2 urmează aceleași obsesii și mică carte de nume și teme descrise ÃŪn lucrarea nouă. 'Mira' se află ÃŪn top 20 al autorilor.

Contul ChatGPT #2 urmează aceleași obsesii și mică carte de nume și teme descrise ÃŪn lucrarea nouă. Sursă

Este demn de remarcat că versiunile GPT testate au fost o clasă superioară față de 5.4, testate ÃŪn lucrare.

De asemenea, am ÃŪncercat Anthropic’s Sonnet 4.6, și nu am fost dezamăgit. Din nou, cuvintele-cheie familiare au apărut la prima ÃŪncercare (legătură către conversație aici):

De data aceasta, 'Mara', un alt nume din 'top 11', conduce povestea, la prima ÃŪncercare pe Claude Sonnet 4.6. Sursă - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

De data aceasta, ‘Mara’, un alt nume din ‘top 11’, conduce povestea, la prima ÃŪncercare pe Claude Sonnet 4.6. Sursă

ÎncercÃĒnd aceeași solicitare pe Claude Haiku 4.5, am obținut aproximativ același rezultat (legătură către conversație aici).

Inițial, nu am putut reproduce constatările autorilor la Google Gemini, pÃĒnă cÃĒnd am schimbat modelul ÃŪn cel utilizat ÃŪn lucrare, Gemini 3.1 Flash-Lite – și atunci, la a treia ÃŪncercare (dar prima cu acest model), modelul a apărut imediat (legătură aici):

Google Gemini 3.1 Flash-Lite.

Google Gemini 3.1 Flash-Lite. Sursă

Experimentele ulterioare cu diferite modele Gemini au arătat ÃŪn mod constant tema farului, deși cu variante care nu au apărut ÃŪn “top 11”, cum ar fi numele “Thomas” și, ÃŪntr-o altă variantă, numele meu, ca protagonist.

Nonetheless, la momentul scrierii, constatările lucrării sunt extrem de ușor de demonstrat.

Faruri ÃŪn sălbăticie

Minte strălucite gÃĒndesc la fel: cu o săptămÃĒnă ÃŪn urmă, ÃŪnainte de publicarea noii lucrări, scriitorul de software Daniel May a remarcat coincidența tropei “Elias” și “paznic de far”, aparent observată la ÃŪntÃĒmplare. El a continuat să testeze opt variante de Gemini, DeepSeek, Qwen și Gemma, pe care le-a găsit capabile să producă “meme”-urile farului și “Elias Thorne” ca protagonist*. Cu toate acestea, această descoperire inițială nu s-a extins la gama mai largă de teme de conținut persistente descrise ÃŪn noua lucrare.

Curios să văd dacă aceste teme recurente, nume și locuri au ieșit vreodată dincolo de limitele unei conversații, am căutat pe Google cÃĒteva dintre cuvintele-cheie și temele din “top 11” și am găsit un număr remarcabil de postări care par să le fi canalizat:

Trei exemple de

Trei exemple de “meme” ÃŪn output. Vezi mai jos pentru legături către surse.

May a identificat numele complet “Elias Thorne” (și nu doar “Elias”) ca o “meme” persistentă a LLM, și a postat diverse capturi de ecran de pe Amazon, unde acest nume a fost folosit ca titlu pentru autorii unor cărți diverse, inclusiv cărți medicale.

În schimb, eu am căutat și am găsit conținut care părea să fi invocat temele persistente dintr-un LLM, inclusiv un post X al unei povești (versiunea arhivată aici); o lucrare de ficțiune (versiunea arhivată aici); și o poveste cu narare pe YouTube (arhivată aici). A existat mult mai mult de traversat, dar timpul nu a permis.

Gustul pentru trecut

Așa că, pentru observația casuală și serendipitate. În timp ce nu a apărut niciun “document magic” ÃŪn datele de antrenare care să conțină toate sau majoritatea persistențelor, autorii noii lucrări speculează că filtrele de drepturi de autor ÃŪn dezvoltarea inteligenței artificiale ar putea restricționa outputul fictiv al LLM la material care este ÃŪn afara drepturilor de autor.

Autorii afirmă:

‘Nu putem explica dominanța poveștilor “Elias ÃŪn far” prin prevalența ÃŪn datele de antrenare sau de testare. Speculăm că modelele sunt antrenate să evite referințe la personaje cu drepturi de autor și conținut pentru adulți ÃŪn timpul alinierii, dar amÃĒnăm această ÃŪntrebare pentru lucrări viitoare.’

Categorie Token Al nostru Lit Pre non-ficțiune Pre ficțiune Post non-ficțiune Post ficțiune
Nume elias 2,428 2.7 2.2 4.0 0.4 52.7
Nume mara 5,200 3.9 2.5 8.7 0.4 21.7
Nume elara 1,221 0.0 0.4 1.2 0.9 108
Profesie paznic 1,495 7.2 6.3 14.7 3.5 10.0
Profesie brutar 161 20 11.8 10.56 1.7 11.9
Profesie primar 198 28 11.5 16.1 1.4 27.4
Profesie ceasornicar 108 0.1 0.18 0.0 0.3 1.4
Profesie pescar 62 4.2 3.0 7.6 0.0 9.3
Profesie bibliotecar 68 5.3 7.6 5.9 2.3 11.5
Profesie dirijor 96 5.0 5.9 5.7 4.7 7.5
Loc far 3,005 5.5 3.5 4.6 4.6 10.1

Tabelul de comparație arătÃĒnd cÃĒt de des cuvintele recurente din poveștile generate de LLM apar ÃŪn literatura publicată, ficțiunea de pe web și seturile de date post-antrenare, cu termeni precum “Elias” și “far” care apar mult mai frecvent ÃŪn ficțiunea scrisă de chatbot.

În studiul lor, autorii au constatat că cele 11 cuvinte accentuate apar ÃŪn 88% din cele 20.000 de povești generate și că există “puține diferențe ÃŪntre modele”. Ei subliniază că aceste cuvinte sunt neobișnuite ÃŪn literatura engleză publicată și că datele post-antrenare (datele destinate să condiționeze și să alinieze modelele ÃŪn utilizări “acceptabile”) ar putea fi responsabile.

Lucrarea afirmă:

‘Un exemplu tipic prezentat [mai jos] evidențiază trei elemente comune ÃŪn aproape toate cele 20.000 de povești: un loc (19,864 de povești), un nume de personaj (19,864 de povești) și o profesie (15,807 povești).

‘De fapt, locul specific (“far”), numele (“Elias”) și profesia (“paznic”) din această poveste apar ÃŪntr-o combinație sau alta ÃŪn 66,6% din toate poveștile generate. Lumina este, de asemenea, o temă comună: 56% din poveștile generate de Claude au titlul “Secretul paznicului de far” și cuvÃĒntul “lumină” apare ÃŪn 16,784 de povești la o rată medie de 3,2 instanțe pe poveste.’

Acest exemplu, conform lucrării, a fost scris de Google Gemini 3.1 Flash-Lite, ca răspuns la solicitarea

Acest exemplu, conform lucrării, a fost scris de Google Gemini 3.1 Flash-Lite, ca răspuns la solicitarea “Scrie o poveste”.

Este demn de remarcat că autorii studiului identifică o tendință nostalgică sau atavică ÃŪn toate cuvintele-cheie și numele derivate.

Urmarirea trăsăturilor

Pentru a testa dacă poveștile recurente cu “far” pot fi explicate prin expunerea obișnuită la ficțiune, au fost făcute comparații ÃŪntre cuvintele recurente favorite ale modelelor și cÃĒteva corpuri mari de limbă engleză. Ficțiunea contemporană a fost examinată prin CONLIT, un set de date care conține 2.700 de romane ÃŪn engleză publicate ÃŪntre 2007 și 2021, acoperind 12 genuri și totalizÃĒnd aproximativ 287 de milioane de cuvinte.

‘Elias’ apare de aproximativ 900 de ori mai des ÃŪn poveștile generate decÃĒt ÃŪn ficțiunea publicată. Ficțiunea amatorilor de pe comunitatea /r/writingprompts de pe Reddit a produs frecvențe similare, indicÃĒnd că modelul nu reflectă obiceiurile de povestire umană mai largi.

Același model a fost valabil atunci cÃĒnd s-a examinat datele de antrenare. UtilizÃĒnd corpusul OLMo 3, care conține aproximativ 3,89 miliarde de documente scrise ÃŪn principal de oameni, extrase parțial din Common Crawl, cercetătorii au constatat că cuvintele recurente “nucleu” apar foarte puțin.

Deoarece o mare parte a corpusului OLMo 3 este non-ficțiune, a fost creat un clasificator de ficțiune utilizÃĒnd anotările GPT-OSS 20b și un model FastText antrenat pe 200.000 de exemple echilibrate. Chiar și după filtrarea specifică a materialului fictiv, cuvinte precum “Elara” au apărut la rate neglijabile comparativ cu poveștile generate de LLM. De ce, atunci, acestea domină la nivelul cel mai de bază al imperativei pentru un LLM de a scrie ficțiune?

Autorii afirmă:

‘Dacă cuvintele “nucleu” nu sunt comune ÃŪn datele de pe web, atunci o sursă rămasă ar fi datele post-antrenare. Dar am constatat că datele post-antrenare OLMo prezintă token-urile noastre la o rată mai mică decÃĒt CONLIT.

În cadrul a 78.958 de povești din seturile de date post-antrenare OLMo 3, ei notează că “Elias” a apărut de 52,7 ori pe milion de cuvinte, comparativ cu 2,7 ÃŪn CONLIT, dar a atins 2.428 de apariții pe milion de cuvinte ÃŪn poveștile generate examinate ÃŪn studiu.

Pentru a identifica de unde provin poveștile recurente “nucleu”, fiecare poveste din seturile de date post-antrenare OLMo 3 a fost evaluată pentru prezența unuia sau mai multor tokeni “nucleu” (adică, pentru prezența Elara, Mara, etc.). Se aștepta ca majoritatea să apară ÃŪn seturile de date de fine-tuning supravegheat (SFT), deoarece WildChat și sursele conexe au contribuit cu 59.266 de povești la OLMo 3.

Cu toate acestea, doar 1.803 conțineau termeni “nucleu”, ÃŪn timp ce seturile de date utilizate pentru DPO și ÃŪnvățare prin ÃŪntărire au arătat concentrații mai mari.

În general, vocabularul recurent “nucleu” a fost urmărit pÃĒnă la doar 3.053 de povești, reprezentÃĒnd 3,8% din toate poveștile post-antrenare examinate. Nu există nicio posibilitate statistică ca un subset atÃĒt de mic de corpuri să ajungă să domine ÃŪn modul demonstrat.

Lucrarea concluzionează:

‘Atunci cÃĒnd li se dă puțină direcție, modelele actuale de frontieră scriu povești utilizÃĒnd un catalog ÃŪngust de nume, locuri și profesii. Personajele recurente ÃŪn aceste povești includ Elias, un paznic de far. Elias este neobișnuit; numele este neobișnuit ÃŪn literatură, datele de pe web și chiar ÃŪn datele post-antrenare.’

Concluzie

În absența oricărei lucrări literare (sau chiar a unei serii) care să conțină cele 11 cuvinte pe care autorii le identifică, nu este deloc clar prin ce mijloace această colecție particulară de cuvinte a acumulat și s-a asociat la nivelurile cele mai de bază ale mai multor modele de limbaj mari (ÃŪn ciuda diversității datelor de antrenare și abordărilor lor).

Chiar dacă afirmația cercetătorilor despre efectul restrictiv al filtrelor de drepturi de autor este corectă, o “mare” de literatură clasică din datele de antrenare ar fi trebuit să prevină această ciudată colecție de cuvinte vechi de a domina outputul unei solicitări necalificate de a “scrie”.

Teoria presupune, totuși, că cantități uriașe de literatură clasică ar fi fost incluse ÃŪn regimul de antrenare. Acest lucru este puțin probabil, deoarece ceea ce se dorește sunt modele care nu vor produce ieșiri false ÃŪn stilul lui Dickens, ci care să se ocupe de lexicul modern și să fie potrivite pentru nevoile actuale de afaceri. Volumul imens chiar al literaturii preindustriale ar face imposibilă includerea sa.

În orice caz, dacă ar fi o singură narativă distinctă care să conțină o combinație alternativă a facetelor “obsesive” pe care autorii le notează, ar fi, probabil, mai ușor de găsit; autorii ÃŪnșiși nu au putut găsi-o, și căutări ocazionale ÃŪn era pre-AI nu au descoperit niciun concurent. Poate că, dacă “sindromul farului” va căpăta aceeași notorietate ca liniile de pauză AI, vreo autoritate academică va veni cu răspunsul.

 

* Nu pot continua mai departe ÃŪn articolul lui May, din motive care pot deveni evidente atunci cÃĒnd cineva ÃŪl citește.

Publicat pentru prima dată miercuri, 27 mai 2026. Modificat ÃŪn primele 30 de minute pentru a corecta legătura Anthropic.

Scriitor pe machine learning, specialist ÃŪn domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, pÃĒnă la dizolvarea sa ÃŪn Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]