Unghiul lui Anderson
Cum sÄ faci ChatGPT sÄ vorbeascÄ ÃŪn mod normal

ChatGPT Či boturile similare adesea flateazÄ utilizatorii, vorbesc vag sau folosesc jargon pentru a suna inteligent. O nouÄ cercetare aratÄ cÄ aceste obiceiuri nu provin numai de la modele, ci Či de la modul ÃŪn care feedback-ul uman le antreneazÄ: modelele ÃŪnvaČÄ sÄ copieze stilul de rÄspunsuri pe care le preferÄ oamenii, chiar Či atunci cÃĒnd aceste rÄspunsuri sunt goale sau ÃŪnČelÄtoare. O nouÄ metodÄ de fine-tuning foloseČte exemple sintetice pentru a ÃŪnvÄČa modelele sÄ reziste acestor obiceiuri proaste.
Â
PÄrČial opinie. ChatGPT este surprinzÄtor de dispus sÄ se angajeze ÃŪn critica mea recurentÄ a lui. DupÄ ce am observat ÃŪn ultimele zile cÄ GPT-4o ÃŪČi umple tot mai mult rÄspunsurile cu verbiČti inutile â cum ar fi âFÄrÄ umpluturÄ!â Či âFÄrÄ umplereâ, sau âAcesta ajunge la inima problemei!â â l-am ÃŪntrebat de ce producerea de rÄspunsuri directe Či minimale a devenit o problemÄ pentru el ÃŪn ultima vreme. El a rÄspuns:

ChatGPT explicÄ ultimul sÄu comportament. SursÄ: https://chatgpt.com/
Cine Čtie dacÄ ChatGPT are cu adevÄrat o perspectivÄ privatÄ asupra schimbÄrilor de politicÄ ale OpenAI, sau dacÄ doar halucineazÄ? Ãn orice caz, aČa cum putem vedea, rÄspunsul ÃŪnsuČi ÃŪncepe cu umpluturÄ inutilÄ (âIatÄ rÄspunsul de bazÄ, fÄrÄ umpluturÄâ).
Acest lucru se dovedeČte a fi adevÄrat Či atunci cÃĒnd se includ ghiduri predefinite cu fiecare ÃŪntrebare, acestea putÃĒnd face doar atÃĒt de mult pentru a preveni âverbositatea bazatÄ pe personalitateâ de acest fel, care numÄrÄ printre alte cÃĒteva probleme persistente ÃŪn idiomul LLM-urilor populare.
Cele trei F
Astfel, am fost foarte interesat sÄ vÄd o nouÄ colaborare academicÄ din SUA care a apÄrut ÃŪn literatura acestei sÄptÄmÃĒni. IntitulatÄ Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models, aceastÄ colaborare ÃŪntre patru cercetÄtori de la Universitatea din Pennsylvania Či Universitatea din New York se concentreazÄ pe unele dintre âprejudecÄČileâ din conversaČiile LLM care apar frecvent ÃŪn mass-media:

Din noua lucrare, exemple de trei prejudecÄČi comune ÃŪn modelele de limbaj: SursÄ: https://arxiv.org/pdf/2506.05339
Pentru o aliteraČie uČoarÄ, flattery, fluff Či fog sunt evidenČiate ÃŪn noua lucrare, dar o listÄ mai completÄ Či mai concisÄ a pÄcatelor lexicale ale LLM-urilor este inclusÄ ÃŪn anexa lucrÄrii:

Noua lucrare identificÄ Či se concentreazÄ pe cinci prejudecÄČi:
Ãn timp ce lungime/verbositate conduce tabela, prejudecata cÄtre formatarea listelor (a doua linie de jos ÃŪn imaginea de mai sus) recidiveazÄ frecvent, dacÄ nu este ÃŪndrumatÄ ÃŪmpotriva sa; Či deČi categoriile jargon Či vag reprezintÄ extreme opuse ÃŪntre claritate Či acurateČe, este adularea â o problemÄ deschisÄ, ÃŪn special ÃŪn ChatGPT â care arde realmente prin token-urile utilizatorului, aproape la fel de mult ca Či lungimea/verbositatea.
Noua cercetare ÃŪČi propune sÄ mÄsoare cÃĒt de mult aceste prejudecÄČi distorsioneazÄ comportamentul modelului Či concluzioneazÄ cÄ modelele de limbaj mari sistematic preferÄ rÄspunsuri care prezintÄ una sau mai multe dintre aceste prejudecÄČi*.
Testele autorilor aratÄ cÄ atÃĒt modelele comerciale, cÃĒt Či cele deschise adesea aleg rÄspunsuri pe care oamenii nu le-ar prefera, ÃŪn special atunci cÃĒnd rÄspunsurile sunt prea lungi, pline de liste, ÃŪncÄrcate cu jargon, adulatorii sau vagi.
AceastÄ problemÄ, susČine lucrarea, poate fi urmÄritÄ pÃĒnÄ la annotarea datelor de antrenament, unde reviewerii umani au favorizat adesea astfel de rÄspunsuri. Modelele, sugereazÄ rezultatele, au ÃŪnvÄČat din aceste preferinČe etichetate Či au exagerat aceste modele ÃŪn timpul antrenamentului.
De ce au fÄcut-o..?
Ãn ceea ce priveČte de ce annotatorii umani s-au abÄtut de la preferinČele mediane ale utilizatorilor, lucrarea nu speculeazÄ; s-ar putea sÄ fi fost pentru cÄ contextul annotÄrii sau cuvintele instrucČiunilor au ÃŪncurajat o preferinČÄ pentru frazÄri âempiriceâ; sau (printre multe alte motive posibile) ar putea fi cÄ annotatorii erau studenČi examinaČi, obiČnuiČi cu un idiom tehnic mai potrivit pentru academia decÃĒt pentru discursul zilnic.
Ãn orice caz, deoarece modelele copiau prejudecÄČile de la etichetele annotatorilor, noii cercetÄtori au creat exemple de antrenament special care au adÄugat sau eliminat fiecare prejudecatÄ, permiČÃĒnd modelelor sÄ vadÄ contraste clare Či sÄ-Či ajusteze preferinČele. DupÄ fine-tuning pe aceste date, modelele au arÄtat o prejudecatÄ semnificativ mai micÄ, ÃŪn special pentru jargon, verbositate Či vagÄ, ÃŪn timp ce au menČinut ÃŪn general o performanČÄ bunÄ (important, deoarece fine-tuning-ul poate deteriora performanČa generalÄ).
SÄ aruncÄm o privire mai atentÄ asupra acestei cercetÄri, deČi nu se conformeazÄ tuturor rigorilor procedurale obiČnuite.
MetodÄ
IniČial, cercetÄtorii definesc cÃĒteva prejudecÄČi idiomaticÄ tipice ale LLM-urilor care trebuie abordate:
Lungime, ÃŪn care modelele tind sÄ favorizeze rÄspunsuri mai lungi, chiar Či atunci cÃĒnd conČinutul suplimentar nu adaugÄ nimic util. Acest lucru pare sÄ reflecte modele din datele de antrenament, unde lungimea adesea se coreleazÄ cu amÄnuntul ÃŪn ochii annotatorilor umani. Ca urmare, modelele adesea produc rÄspunsuri umflate Či verbale care dau iluzia de profunzime, dar fÄrÄ substanČÄ realÄ.
StructurÄ, ÃŪn care modelele aratÄ o preferinČÄ puternicÄ pentru puncte sau liste numerotate ÃŪn loc de prozÄ simplÄ. Acest lucru se poate datora faptului cÄ formatele structurate apar mai frecvent ÃŪn rÄspunsurile selectate de reviewerii umani. ObiČnuinČa duce modelele sÄ recurgÄ la âlisticleâ, chiar Či atunci cÃĒnd ÃŪntrebarea cere explicaČii mai naturale sau mai detaliate.
Jargon, ÃŪn care modelele folosesc inutil limbaj specializat sau tehnic. Autorii susČin cÄ acest comportament probabil provine din datele de antrenament, unde rÄspunsurile ÃŪncÄrcate cu jargon au fost adesea alese ca rÄspunsuri mai bune. Astfel, modelele au ÃŪnvÄČat sÄ asocieze jargonul cu expertiza, producÃĒnd rÄspunsuri care sunÄ cunoscÄtoare, dar oferÄ puČinÄ claritate suplimentarÄ.
Adulare, ÃŪn care modelele sunt de acord cu opiniile utilizatorului, ÃŪn loc sÄ ofere rÄspunsuri neutre sau critice. Acest model poate proveni din datele de antrenament, unde rÄspunsurile de acord au fost desemnate favorabil. Ca urmare, modelele pot ÃŪntÄri prejudecÄČile utilizatorului Či evita sÄ prezinte perspective contradictorii sau mai obiective, chiar Či atunci cÃĒnd acestea ar fi utile.
Vag, ÃŪn care modelele preferÄ sÄ ofere rÄspunsuri largi Či generalizate care ating uČor multe subiecte, ÃŪn loc sÄ abordeze direct ÃŪntrebarea, cu rÄspunsuri care sunÄ cuprinzÄtoare, dar oferÄ puČine informaČii utile. Acest lucru poate reflecta faptul cÄ rÄspunsurile vagi sunt mai greu de falsificat Či, prin urmare, au fost mai puČin probabil sÄ fie penalizate ÃŪn timpul annotÄrii:

Exemplu de prejudecatÄ de vagÄ, unde modelul favorizeazÄ greČit un rÄspuns larg Či superficial peste un rÄspuns detaliat pe care evaluatorii umani ÃŪl considerÄ mai util.
Date contrafactuale
Cu aceste definiČii, a fost necesar sÄ se testeze exact cÃĒt de mult fiecare prejudecatÄ influenČeazÄ comportamentul modelului. CorelaČiile simple nu ar fi funcČionat, deoarece multiple prejudecÄČi apar adesea ÃŪmpreunÄ, fÄcÃĒnd dificilÄ izolarea efectului unei singure caracteristici.
Pentru a depÄČi acest lucru, cercetÄtorii au creat perechi controlate de rÄspunsuri care difereau doar printr-o singurÄ prejudecatÄ la un moment dat, pÄstrÃĒnd totul altceva stabil, Či au ÃŪnceput prin generarea unui rÄspuns de bazÄ pentru fiecare ÃŪntrebare.
Protocolul Rewrite-based Attribute Treatment Estimators (RATE) a fost apoi utilizat pentru a crea o versiune modificatÄ a acelui rÄspuns â un rÄspuns creat pentru a exagera intenČionat o anumitÄ prejudecatÄ, cum ar fi adÄugarea de jargon suplimentar sau transformarea prozei ÃŪntr-o listÄ.

Exemple de rescrieri din sistemul RATE, utilizate ÃŪn noua cercetare. SursÄ: https://openreview.net/pdf?id=UnpxRLMMAu
Pentru a evita introducerea unor diferenČe nerelevante, a fost inclus un pas suplimentar de rescriere care a ajustat ambele versiuni, asigurÃĒndu-se cÄ singura schimbare semnificativÄ ÃŪntre ele a fost prejudecata studiatÄ; Či aceste perechi de rÄspunsuri strict controlate au fost apoi furnizate modelelor.
Pentru fiecare pereche, versiunea preferatÄ de model a fost ÃŪnregistratÄ, permiČÃĒnd calcularea modului ÃŪn care fiecare prejudecatÄ influenČeazÄ atÃĒt modelele de recompensÄ, cÃĒt Či evaluatorii, producÃĒnd o mÄsurare mai precisÄ a efectelor prejudecÄČii decÃĒt cea realizatÄ ÃŪn studii anterioare, conform autorilor.
Cu perechile de date contrafactuale pregÄtite, revieweri umani din Regatul Unit Či Statele Unite au fost recrutaČi pentru a crea un standard de referinČÄ: pentru fiecare tip de prejudecatÄ, o sutÄ de perechi de rÄspunsuri au fost selectate aleator, fiecare conČinÃĒnd un rÄspuns neutru Či unul prejudecat. Trei evaluatorii au examinat fiecare pereche, votul majoritar determinÃĒnd judecata finalÄ, Či ÃŪn total, trei sute de participanČi au contribuit la studiu.
Metrice
Metricile utilizate pentru a mÄsura efectele prejudecÄČii au fost Rata de ÃŪnclinaČie, care calculeazÄ cÃĒt de des modelul preferÄ rÄspunsul prejudecat faČÄ de cel neutru; Či Rata de mÄsurare incorectÄ, care mÄsoarÄ cÃĒt de des alegerea modelului a fost ÃŪn dezacord cu votul majoritar al oamenilor. Un model ideal ar arÄta zero mÄsurare incorectÄ Či o ÃŪnclinaČie aproximativ egalÄ cu cea a oamenilor (deoarece unele caracteristici prejudecate sunt ocazional favorizate de oameni).
Date Či teste
Pentru a testa abordarea, surse diferite au fost utilizate, ÃŪn funcČie de prejudecata studiatÄ. Pentru structurÄ, jargon Či lungime, o sutÄ de ÃŪntrebÄri au fost eČantionate din Chatbot Arena, filtrate pentru a selecta ÃŪntrebÄri ÃŪn limba englezÄ, cu o singurÄ propoziČie, bine formulate.
Pentru adulare, o sutÄ de ÃŪntrebÄri cu opinii (de exemplu, âOare nu este arta modernÄ doar leneČÄ ÃŪn comparaČie cu tehnicile clasice?â) au fost generate, formulate pentru a reflecta puncte de vedere ale utilizatorilor care ar putea invita la acord.
Vag a fost testat cu Čaptezeci Či opt de ÃŪntrebÄri legate de NLP din setul de date KIWI, completate cu douÄzeci Či douÄ de ÃŪntrebÄri suplimentare de acelaČi tip. Subiecte ČtiinČifice au fost alese pentru vagÄ, deoarece cer rÄspunsuri precise, fÄcÃĒnd uČor de detectat rÄspunsurile generale sau evazive.
Pentru fiecare ÃŪntrebare, perechi de rÄspunsuri contrafactuale au fost create utilizÃĒnd protocolul RATE descris anterior.
Evaluarea a implicat atÃĒt sisteme deschise, cÃĒt Či sisteme proprietare. Modelele de recompensÄ, care atribuie scoruri de calitate rÄspunsurilor candidate ÃŪn timpul antrenamentului Či alinierii, au fost testate ÃŪn patru versiuni antrenate pe optzeci de mii de perechi de preferinČÄ din setul de date Skywork de recompensÄ: Gemma2-2B; Gemma-2-27B; Llama-3.1-8B; Či Llama3.2-3B.
Trei modele proprietare au fost evaluate Či ca evaluatori LLM: Gemini-2.5-Pro; GPT-4o; Či Claude-3.7-Sonnet. Toate rÄspunsurile contrafactuale utilizate pentru testare au fost generate de GPT-4o:

Compararea preferinČelor modelului Či a judecÄČilor umane pentru fiecare tip de prejudecatÄ, arÄtÃĒnd cÃĒt de des modelele favorizeazÄ rÄspunsuri prejudecate Či cÃĒt de des aceste preferinČe sunt ÃŪn conflict cu alegerile umane.
Dintre rezultatele iniČiale de mai sus, autorii comenteazÄâ :
â[Nostra] analizÄ a modelelor de preferinČÄ aratÄ cÄ aceste modele prezintÄ ÃŪn mod constant mÄsurare incorectÄ Či o ratÄ ridicatÄ de ÃŪnclinaČie ÃŪn favoarea rÄspunsurilor perturbate ÃŪn diferite categorii de prejudecÄČi [âĶ]
â[âĶ] Modelele de recompensÄ prezintÄ o mÄsurare incorectÄ clarÄ ÃŪn raport cu judecÄČile umane: ratele de preferinČÄ ale modelelor pentru rÄspunsuri perturbate se abat sistematic de la ratele de preferinČÄ umanÄ. Ãn timp ce vagÄ Či jargonul provoacÄ mÄsurarea incorectÄ mai mare (>50%), lungimea Či adularea aratÄ, de asemenea, o mÄsurare incorectÄ semnificativÄ.
ââAcest lucru sugereazÄ cÄ modelele luptÄ sÄ se alinieze cu judecÄČile umane atunci cÃĒnd rÄspunsurile conČin limbaj tehnic excesiv sau lipsesc de specificitate.â
Modelele de recompensÄ s-au aliniat cel mai bine cu oamenii la prejudecata structurii, unde ambele au favorizat aceleaČi rÄspunsuri. Pentru jargon Či vag, modelele au fost mult mai probabil sÄ prefere rÄspunsurile prejudecate decÃĒt oamenii. Adularea a arÄtat diferenČe mai mici, cu modelele Či oamenii adesea de acord.
Evaluatorii LLM proprietari au arÄtat acelaČi model general, deČi cele mai mari neconcordanČe au apÄrut cu lungimea Či vagÄ â Či au fost deosebit de predispuČi la adulare, favorizÃĒnd rÄspunsuri de acord optzeci Či cinci la sutÄ din timp, ÃŪn timp ce oamenii au fÄcut-o doar aproximativ cincizeci la sutÄ din timp.
Pentru a urmÄri originea acestor prejudecÄČi, cercetÄtorii au analizat setul de date menČionat anterior, utilizat pentru a antrena modelele de recompensÄ, mapÃĒnd fiecare prejudecatÄ la caracteristici simple care ar putea fi mÄsurate automat, cum ar fi numÄrul de tokeni pentru lungime sau prezenČa listelor pentru structurÄ.
Ãntr-un eČantion de 2.500 de exemple, annotatorii umani au arÄtat preferinČe clare pentru caracteristici prejudecate: rÄspunsurile structurate au fost preferate faČÄ de cele nestructurate Čaizeci Či cinci la sutÄ din timp, iar rÄspunsurile ÃŪncÄrcate cu jargon au fost alese cincizeci Či patru la sutÄ din timp:

Annotatorii umani din datele de antrenament au preferat adesea rÄspunsuri care includeau aceste caracteristici prejudecate.
Aceste dezechilibre sugereazÄ cÄ datele de antrenament ÃŪnsele au ÃŪmpins modelele cÄtre aceste modele. Pentru a confirma acest lucru, a fost efectuatÄ o analizÄ de corelaČie, care a mÄsurat cÃĒt de mult diferenČele ÃŪn fiecare caracteristicÄ s-au potrivit cu preferinČele arÄtate atÃĒt de oameni, cÃĒt Či de modele.
Rezultatele au arÄtat cÄ ambele au fost influenČate ÃŪn mod constant de aceleaČi caracteristici, indicÃĒnd faptul cÄ modelele au ÃŪnvÄČat sÄ asocieze anumite trÄsÄturi stilistice cu rÄspunsuri mai bune, chiar Či atunci cÃĒnd aceste trÄsÄturi nu au ÃŪmbunÄtÄČit cu adevÄrat rÄspunsul.

CorelaČia dintre diferenČele de caracteristici Či preferinČe, arÄtÃĒnd cum atÃĒt modelele, cÃĒt Či oamenii au fost influenČaČi de aceleaČi caracteristici prejudecate ÃŪn timpul antrenamentului.
Pentru a ajuta modelele sÄ ÃŪnveČe sÄ nu favorizeze prejudecÄČile, au fost create noi date de antrenament. Setul de date Skywork a fost revizuit pentru a verifica dacÄ caracteristica prejudecatÄ apare ÃŪn rÄspunsul ales sau respins; atunci cÃĒnd ambele erau lipsite de prejudecata ČintÄ, GPT-4o a rescris rÄspunsul respins pentru a insera acea prejudecatÄ.
Acest lucru a creat noi perechi de antrenament ÃŪn care modelul putea vedea exemple clare de rÄspunsuri prejudecate Či ne-prejudecate Či, astfel, ÃŪnvÄČa sÄ nu favorizeze versiunea prejudecatÄ. Cu exemple suplimentare din Chatbot Arena, pentru echilibru, modelele au fost apoi fine-tunate pe acest set de date actualizat:

Efectul fine-tuning-ului cu date contrafactuale.
Fine-tuning-ul a adus modelele mult mai aproape de preferinČele umane, cu cele mai mari ÃŪmbunÄtÄČiri observate pentru jargon Či vagÄ Či cÃĒČtiguri mai mici pentru lungime. Structura Či adularea au arÄtat neconcordanČe noi, mici, care reflectau dezechilibre anterioare, mai degrabÄ decÃĒt noi eČecuri.
PerformanČa generalÄ a rÄmas stabilÄ pe tot parcursul, Či atunci cÃĒnd s-au corectat mai multe prejudecÄČi deodatÄ, nivelurile de prejudecatÄ au scÄzut Či mai mult, fÄrÄ a sacrifica calitatea rÄspunsului.
Autorii concluzioneazÄ:
âMetoda noastrÄ reduce semnificativ problemele de mÄsurare incorectÄ, pÄstrÃĒnd ÃŪn acelaČi timp competenČa generalÄ a modelelor de recompensÄ. LucrÄrile viitoare pot lua ÃŪn considerare adaptarea reČetei noastre de post-antrenament pentru a dezvolta modele de preferinČÄ mai robuste Či, de asemenea, pentru a evalua modelele de preferinČÄ ÃŪmpotriva altor axe de prejudecatÄ.â
Concluzie
Noua lucrare este o perspectivÄ interesantÄ, deČi elipticÄ, asupra modului ÃŪn care datele de antrenament sub-ÃŪngrijite sau supra-/sub-reprezentate pot provoca rezultate nedorite ÃŪn timpul inferenČei. Orice utilizator regulat de LLM va avea, pÃĒnÄ acum, o colecČie de poveČti de rÄzboi.
De exemplu, multe dintre rÄspunsurile pe care le primesc de la ChatGPT par sÄ fi fost influenČate de tendinČele SEO din ultimii 10-15 ani, unde portalurile online au fost forČate sÄ se optimizeze pentru plasarea Google, ÃŪn loc de limbaj natural. Ãntr-adevÄr, outputul presÄrat cu emoji Či prodigios al departamentelor de marketing pare sÄ fi avut un impact semnificativ asupra oricÄrei solicitÄri de a scrie o postare pe LinkedIn â pÃĒnÄ la punctul ÃŪn care âentuziasmulâ generat de AI este acum imposibil de ratat:

StÃĒnga: Cerut sÄ promoveze o postare pe LinkedIn, ÃŪntr-un cont cu zero istoric, ChatGPT se foloseČte de emoji Či de limbajul PR-sensationalist. Dreapta: Cerut acelaČi lucru dupÄ Čase luni de a-i spune sÄ se calmeze, GPT produce ceva mult mai sobru.
OpenAI intervine activ ÃŪn modul ÃŪn care ChatGPT rÄspunde la ÃŪntrebÄri, ÃŪn funcČie de funcČie Či context, fÄcÃĒnd dificil pentru cercetÄtori sÄ diferenČieze ÃŪntre probleme care apar din cauza datelor Či din cauza distribuČiei datelor, precum Či a problemelor conexe, cum ar fi annotarea; Či atunci cÃĒnd un rezultat nedorit poate fi datorat interferenČei comerciale din partea companiei care gÄzduieČte LLM-ul.
Â
* Due to the jargon-filled writing style that the authors have chosen for this paper, I am avoiding author quotes where possible in favor of summaries.
â Â Authorsâ bold emphasis, not mine.
First published Friday, 6 iunie 2025












