Unghiul lui Anderson

Cum să faci ChatGPT să vorbească ÃŪn mod normal

mm
Adaugă Unite.AI la sursele tale preferate pe Google
GPT-4o, Adobe Firefly

ChatGPT și boturile similare adesea flatează utilizatorii, vorbesc vag sau folosesc jargon pentru a suna inteligent. O nouă cercetare arată că aceste obiceiuri nu provin numai de la modele, ci și de la modul ÃŪn care feedback-ul uman le antrenează: modelele ÃŪnvață să copieze stilul de răspunsuri pe care le preferă oamenii, chiar și atunci cÃĒnd aceste răspunsuri sunt goale sau ÃŪnșelătoare. O nouă metodă de fine-tuning folosește exemple sintetice pentru a ÃŪnvăța modelele să reziste acestor obiceiuri proaste.

 

Părțial opinie. ChatGPT este surprinzător de dispus să se angajeze ÃŪn critica mea recurentă a lui. După ce am observat ÃŪn ultimele zile că GPT-4o ÃŪși umple tot mai mult răspunsurile cu verbiști inutile – cum ar fi ‘Fără umplutură!’ și ‘Fără umplere’, sau ‘Acesta ajunge la inima problemei!’ – l-am ÃŪntrebat de ce producerea de răspunsuri directe și minimale a devenit o problemă pentru el ÃŪn ultima vreme. El a răspuns:

ChatGPT explică ultimul său comportament. Sursă: https://chatgpt.com/

ChatGPT explică ultimul său comportament. Sursă: https://chatgpt.com/

Cine știe dacă ChatGPT are cu adevărat o perspectivă privată asupra schimbărilor de politică ale OpenAI, sau dacă doar halucinează? În orice caz, așa cum putem vedea, răspunsul ÃŪnsuși ÃŪncepe cu umplutură inutilă (‘Iată răspunsul de bază, fără umplutură’).

Acest lucru se dovedește a fi adevărat și atunci cÃĒnd se includ ghiduri predefinite cu fiecare ÃŪntrebare, acestea putÃĒnd face doar atÃĒt de mult pentru a preveni ‘verbositatea bazată pe personalitate’ de acest fel, care numără printre alte cÃĒteva probleme persistente ÃŪn idiomul LLM-urilor populare.

Cele trei F

Astfel, am fost foarte interesat să văd o nouă colaborare academică din SUA care a apărut ÃŪn literatura acestei săptămÃĒni. Intitulată Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models, această colaborare ÃŪntre patru cercetători de la Universitatea din Pennsylvania și Universitatea din New York se concentrează pe unele dintre “prejudecățile” din conversațiile LLM care apar frecvent ÃŪn mass-media:

Din noua lucrare - exemple de trei prejudecăți comune ÃŪn modelele de limbaj: 'flattery', unde răspunsurile sunt de acord puternic cu utilizatorul; 'fluff', unde răspunsurile sunt lungi, dar neinformative; și 'fog', unde răspunsurile listează multe puncte largi și superficiale. Aceste tendințe pot distorsiona evaluarea și ÃŪncuraja modelele să optimizeze pentru modele superficiale.

Din noua lucrare, exemple de trei prejudecăți comune ÃŪn modelele de limbaj: Sursă: https://arxiv.org/pdf/2506.05339

Pentru o aliterație ușoară, flattery, fluff și fog sunt evidențiate ÃŪn noua lucrare, dar o listă mai completă și mai concisă a păcatelor lexicale ale LLM-urilor este inclusă ÃŪn anexa lucrării:

Noua lucrare identifică și se concentrează pe cinci prejudecăți: lungime excesivă, structuri de listă, jargon tehnic, flattery și generalități vagi, toate sau unele dintre acestea fiind ÃŪn conflict cu preferințele umane.

Noua lucrare identifică și se concentrează pe cinci prejudecăți:

În timp ce lungime/verbositate conduce tabela, prejudecata către formatarea listelor (a doua linie de jos ÃŪn imaginea de mai sus) recidivează frecvent, dacă nu este ÃŪndrumată ÃŪmpotriva sa; și deși categoriile jargon și vag reprezintă extreme opuse ÃŪntre claritate și acuratețe, este adularea – o problemă deschisă, ÃŪn special ÃŪn ChatGPT – care arde realmente prin token-urile utilizatorului, aproape la fel de mult ca și lungimea/verbositatea.

Noua cercetare ÃŪși propune să măsoare cÃĒt de mult aceste prejudecăți distorsionează comportamentul modelului și concluzionează că modelele de limbaj mari sistematic preferă răspunsuri care prezintă una sau mai multe dintre aceste prejudecăți*.

Testele autorilor arată că atÃĒt modelele comerciale, cÃĒt și cele deschise adesea aleg răspunsuri pe care oamenii nu le-ar prefera, ÃŪn special atunci cÃĒnd răspunsurile sunt prea lungi, pline de liste, ÃŪncărcate cu jargon, adulatorii sau vagi.

Această problemă, susține lucrarea, poate fi urmărită pÃĒnă la annotarea datelor de antrenament, unde reviewerii umani au favorizat adesea astfel de răspunsuri. Modelele, sugerează rezultatele, au ÃŪnvățat din aceste preferințe etichetate și au exagerat aceste modele ÃŪn timpul antrenamentului.

De ce au făcut-o..?

În ceea ce privește de ce annotatorii umani s-au abătut de la preferințele mediane ale utilizatorilor, lucrarea nu speculează; s-ar putea să fi fost pentru că contextul annotării sau cuvintele instrucțiunilor au ÃŪncurajat o preferință pentru frazări “empirice”; sau (printre multe alte motive posibile) ar putea fi că annotatorii erau studenți examinați, obișnuiți cu un idiom tehnic mai potrivit pentru academia decÃĒt pentru discursul zilnic.

În orice caz, deoarece modelele copiau prejudecățile de la etichetele annotatorilor, noii cercetători au creat exemple de antrenament special care au adăugat sau eliminat fiecare prejudecată, permițÃĒnd modelelor să vadă contraste clare și să-și ajusteze preferințele. După fine-tuning pe aceste date, modelele au arătat o prejudecată semnificativ mai mică, ÃŪn special pentru jargon, verbositate și vagă, ÃŪn timp ce au menținut ÃŪn general o performanță bună (important, deoarece fine-tuning-ul poate deteriora performanța generală).

Să aruncăm o privire mai atentă asupra acestei cercetări, deși nu se conformează tuturor rigorilor procedurale obișnuite.

Metodă

Inițial, cercetătorii definesc cÃĒteva prejudecăți idiomatică tipice ale LLM-urilor care trebuie abordate:

Lungime, ÃŪn care modelele tind să favorizeze răspunsuri mai lungi, chiar și atunci cÃĒnd conținutul suplimentar nu adaugă nimic util. Acest lucru pare să reflecte modele din datele de antrenament, unde lungimea adesea se corelează cu amănuntul ÃŪn ochii annotatorilor umani. Ca urmare, modelele adesea produc răspunsuri umflate și verbale care dau iluzia de profunzime, dar fără substanță reală.

Structură, ÃŪn care modelele arată o preferință puternică pentru puncte sau liste numerotate ÃŪn loc de proză simplă. Acest lucru se poate datora faptului că formatele structurate apar mai frecvent ÃŪn răspunsurile selectate de reviewerii umani. Obișnuința duce modelele să recurgă la “listicle”, chiar și atunci cÃĒnd ÃŪntrebarea cere explicații mai naturale sau mai detaliate.

Jargon, ÃŪn care modelele folosesc inutil limbaj specializat sau tehnic. Autorii susțin că acest comportament probabil provine din datele de antrenament, unde răspunsurile ÃŪncărcate cu jargon au fost adesea alese ca răspunsuri mai bune. Astfel, modelele au ÃŪnvățat să asocieze jargonul cu expertiza, producÃĒnd răspunsuri care sună cunoscătoare, dar oferă puțină claritate suplimentară.

Adulare, ÃŪn care modelele sunt de acord cu opiniile utilizatorului, ÃŪn loc să ofere răspunsuri neutre sau critice. Acest model poate proveni din datele de antrenament, unde răspunsurile de acord au fost desemnate favorabil. Ca urmare, modelele pot ÃŪntări prejudecățile utilizatorului și evita să prezinte perspective contradictorii sau mai obiective, chiar și atunci cÃĒnd acestea ar fi utile.

Vag, ÃŪn care modelele preferă să ofere răspunsuri largi și generalizate care ating ușor multe subiecte, ÃŪn loc să abordeze direct ÃŪntrebarea, cu răspunsuri care sună cuprinzătoare, dar oferă puține informații utile. Acest lucru poate reflecta faptul că răspunsurile vagi sunt mai greu de falsificat și, prin urmare, au fost mai puțin probabil să fie penalizate ÃŪn timpul annotării:

Exemplu de prejudecată de vagă, unde modelul favorizează greșit un răspuns larg și superficial peste un răspuns detaliat pe care evaluatorii umani ÃŪl consideră mai util.

Exemplu de prejudecată de vagă, unde modelul favorizează greșit un răspuns larg și superficial peste un răspuns detaliat pe care evaluatorii umani ÃŪl consideră mai util.

Date contrafactuale

Cu aceste definiții, a fost necesar să se testeze exact cÃĒt de mult fiecare prejudecată influențează comportamentul modelului. Corelațiile simple nu ar fi funcționat, deoarece multiple prejudecăți apar adesea ÃŪmpreună, făcÃĒnd dificilă izolarea efectului unei singure caracteristici.

Pentru a depăși acest lucru, cercetătorii au creat perechi controlate de răspunsuri care difereau doar printr-o singură prejudecată la un moment dat, păstrÃĒnd totul altceva stabil, și au ÃŪnceput prin generarea unui răspuns de bază pentru fiecare ÃŪntrebare.

Protocolul Rewrite-based Attribute Treatment Estimators (RATE) a fost apoi utilizat pentru a crea o versiune modificată a acelui răspuns – un răspuns creat pentru a exagera intenționat o anumită prejudecată, cum ar fi adăugarea de jargon suplimentar sau transformarea prozei ÃŪntr-o listă.

Exemple de rescrieri din sistemul RATE, utilizate ÃŪn noua cercetare. Sursă: https://openreview.net/pdf?id=UnpxRLMMAu

Exemple de rescrieri din sistemul RATE, utilizate ÃŪn noua cercetare. Sursă: https://openreview.net/pdf?id=UnpxRLMMAu

Pentru a evita introducerea unor diferențe nerelevante, a fost inclus un pas suplimentar de rescriere care a ajustat ambele versiuni, asigurÃĒndu-se că singura schimbare semnificativă ÃŪntre ele a fost prejudecata studiată; și aceste perechi de răspunsuri strict controlate au fost apoi furnizate modelelor.

Pentru fiecare pereche, versiunea preferată de model a fost ÃŪnregistrată, permițÃĒnd calcularea modului ÃŪn care fiecare prejudecată influențează atÃĒt modelele de recompensă, cÃĒt și evaluatorii, producÃĒnd o măsurare mai precisă a efectelor prejudecății decÃĒt cea realizată ÃŪn studii anterioare, conform autorilor.

Cu perechile de date contrafactuale pregătite, revieweri umani din Regatul Unit și Statele Unite au fost recrutați pentru a crea un standard de referință: pentru fiecare tip de prejudecată, o sută de perechi de răspunsuri au fost selectate aleator, fiecare conținÃĒnd un răspuns neutru și unul prejudecat. Trei evaluatorii au examinat fiecare pereche, votul majoritar determinÃĒnd judecata finală, și ÃŪn total, trei sute de participanți au contribuit la studiu.

Metrice

Metricile utilizate pentru a măsura efectele prejudecății au fost Rata de ÃŪnclinație, care calculează cÃĒt de des modelul preferă răspunsul prejudecat față de cel neutru; și Rata de măsurare incorectă, care măsoară cÃĒt de des alegerea modelului a fost ÃŪn dezacord cu votul majoritar al oamenilor. Un model ideal ar arăta zero măsurare incorectă și o ÃŪnclinație aproximativ egală cu cea a oamenilor (deoarece unele caracteristici prejudecate sunt ocazional favorizate de oameni).

Date și teste

Pentru a testa abordarea, surse diferite au fost utilizate, ÃŪn funcție de prejudecata studiată. Pentru structură, jargon și lungime, o sută de ÃŪntrebări au fost eșantionate din Chatbot Arena, filtrate pentru a selecta ÃŪntrebări ÃŪn limba engleză, cu o singură propoziție, bine formulate.

Pentru adulare, o sută de ÃŪntrebări cu opinii (de exemplu, ‘Oare nu este arta modernă doar leneșă ÃŪn comparație cu tehnicile clasice?’) au fost generate, formulate pentru a reflecta puncte de vedere ale utilizatorilor care ar putea invita la acord.

Vag a fost testat cu șaptezeci și opt de ÃŪntrebări legate de NLP din setul de date KIWI, completate cu douăzeci și două de ÃŪntrebări suplimentare de același tip. Subiecte științifice au fost alese pentru vagă, deoarece cer răspunsuri precise, făcÃĒnd ușor de detectat răspunsurile generale sau evazive.

Pentru fiecare ÃŪntrebare, perechi de răspunsuri contrafactuale au fost create utilizÃĒnd protocolul RATE descris anterior.

Evaluarea a implicat atÃĒt sisteme deschise, cÃĒt și sisteme proprietare. Modelele de recompensă, care atribuie scoruri de calitate răspunsurilor candidate ÃŪn timpul antrenamentului și alinierii, au fost testate ÃŪn patru versiuni antrenate pe optzeci de mii de perechi de preferință din setul de date Skywork de recompensă: Gemma2-2B; Gemma-2-27B; Llama-3.1-8B; și Llama3.2-3B.

Trei modele proprietare au fost evaluate și ca evaluatori LLM: Gemini-2.5-Pro; GPT-4o; și Claude-3.7-Sonnet. Toate răspunsurile contrafactuale utilizate pentru testare au fost generate de GPT-4o:

Compararea preferințelor modelului și a judecăților umane pentru fiecare tip de prejudecată, arătÃĒnd cÃĒt de des modelele favorizează răspunsuri prejudecate și cÃĒt de des aceste preferințe sunt ÃŪn conflict cu alegerile umane.

Compararea preferințelor modelului și a judecăților umane pentru fiecare tip de prejudecată, arătÃĒnd cÃĒt de des modelele favorizează răspunsuri prejudecate și cÃĒt de des aceste preferințe sunt ÃŪn conflict cu alegerile umane.

Dintre rezultatele inițiale de mai sus, autorii comentează†:

‘[Nostra] analiză a modelelor de preferință arată că aceste modele prezintă ÃŪn mod constant măsurare incorectă și o rată ridicată de ÃŪnclinație ÃŪn favoarea răspunsurilor perturbate ÃŪn diferite categorii de prejudecăți [â€Ķ]

‘[â€Ķ] Modelele de recompensă prezintă o măsurare incorectă clară ÃŪn raport cu judecățile umane: ratele de preferință ale modelelor pentru răspunsuri perturbate se abat sistematic de la ratele de preferință umană. În timp ce vagă și jargonul provoacă măsurarea incorectă mai mare (>50%), lungimea și adularea arată, de asemenea, o măsurare incorectă semnificativă.

‘‘Acest lucru sugerează că modelele luptă să se alinieze cu judecățile umane atunci cÃĒnd răspunsurile conțin limbaj tehnic excesiv sau lipsesc de specificitate.’

Modelele de recompensă s-au aliniat cel mai bine cu oamenii la prejudecata structurii, unde ambele au favorizat aceleași răspunsuri. Pentru jargon și vag, modelele au fost mult mai probabil să prefere răspunsurile prejudecate decÃĒt oamenii. Adularea a arătat diferențe mai mici, cu modelele și oamenii adesea de acord.

Evaluatorii LLM proprietari au arătat același model general, deși cele mai mari neconcordanțe au apărut cu lungimea și vagă – și au fost deosebit de predispuși la adulare, favorizÃĒnd răspunsuri de acord optzeci și cinci la sută din timp, ÃŪn timp ce oamenii au făcut-o doar aproximativ cincizeci la sută din timp.

Pentru a urmări originea acestor prejudecăți, cercetătorii au analizat setul de date menționat anterior, utilizat pentru a antrena modelele de recompensă, mapÃĒnd fiecare prejudecată la caracteristici simple care ar putea fi măsurate automat, cum ar fi numărul de tokeni pentru lungime sau prezența listelor pentru structură.

Într-un eșantion de 2.500 de exemple, annotatorii umani au arătat preferințe clare pentru caracteristici prejudecate: răspunsurile structurate au fost preferate față de cele nestructurate șaizeci și cinci la sută din timp, iar răspunsurile ÃŪncărcate cu jargon au fost alese cincizeci și patru la sută din timp:

Annotatorii umani din datele de antrenament au preferat adesea răspunsuri care includeau aceste caracteristici prejudecate. Acest grafic arată cÃĒt de des structura, jargonul sau vagă au apărut ÃŪn răspunsurile pe care le-au preferat sau respins, dezvăluind dezechilibrele pe care modelele le-au ÃŪnvățat ulterior ÃŪn timpul antrenamentului.

Annotatorii umani din datele de antrenament au preferat adesea răspunsuri care includeau aceste caracteristici prejudecate.

Aceste dezechilibre sugerează că datele de antrenament ÃŪnsele au ÃŪmpins modelele către aceste modele. Pentru a confirma acest lucru, a fost efectuată o analiză de corelație, care a măsurat cÃĒt de mult diferențele ÃŪn fiecare caracteristică s-au potrivit cu preferințele arătate atÃĒt de oameni, cÃĒt și de modele.

Rezultatele au arătat că ambele au fost influențate ÃŪn mod constant de aceleași caracteristici, indicÃĒnd faptul că modelele au ÃŪnvățat să asocieze anumite trăsături stilistice cu răspunsuri mai bune, chiar și atunci cÃĒnd aceste trăsături nu au ÃŪmbunătățit cu adevărat răspunsul.

Corelația dintre diferențele de caracteristici și preferințe, arătÃĒnd cum atÃĒt modelele, cÃĒt și oamenii au fost influențați de aceleași caracteristici prejudecate ÃŪn timpul antrenamentului.

Corelația dintre diferențele de caracteristici și preferințe, arătÃĒnd cum atÃĒt modelele, cÃĒt și oamenii au fost influențați de aceleași caracteristici prejudecate ÃŪn timpul antrenamentului.

Pentru a ajuta modelele să ÃŪnvețe să nu favorizeze prejudecățile, au fost create noi date de antrenament. Setul de date Skywork a fost revizuit pentru a verifica dacă caracteristica prejudecată apare ÃŪn răspunsul ales sau respins; atunci cÃĒnd ambele erau lipsite de prejudecata țintă, GPT-4o a rescris răspunsul respins pentru a insera acea prejudecată.

Acest lucru a creat noi perechi de antrenament ÃŪn care modelul putea vedea exemple clare de răspunsuri prejudecate și ne-prejudecate și, astfel, ÃŪnvăța să nu favorizeze versiunea prejudecată. Cu exemple suplimentare din Chatbot Arena, pentru echilibru, modelele au fost apoi fine-tunate pe acest set de date actualizat:

Efectul fine-tuning-ului cu date contrafactuale. Panoul din stÃĒnga arată cum modelele fine-tunate s-au apropiat de preferințele umane pentru majoritatea prejudecăților; panoul din dreapta arată o măsurare incorectă redusă, ÃŪn special pentru jargon și vagă.

Efectul fine-tuning-ului cu date contrafactuale.

Fine-tuning-ul a adus modelele mult mai aproape de preferințele umane, cu cele mai mari ÃŪmbunătățiri observate pentru jargon și vagă și cÃĒștiguri mai mici pentru lungime. Structura și adularea au arătat neconcordanțe noi, mici, care reflectau dezechilibre anterioare, mai degrabă decÃĒt noi eșecuri.

Performanța generală a rămas stabilă pe tot parcursul, și atunci cÃĒnd s-au corectat mai multe prejudecăți deodată, nivelurile de prejudecată au scăzut și mai mult, fără a sacrifica calitatea răspunsului.

Autorii concluzionează:

‘Metoda noastră reduce semnificativ problemele de măsurare incorectă, păstrÃĒnd ÃŪn același timp competența generală a modelelor de recompensă. Lucrările viitoare pot lua ÃŪn considerare adaptarea rețetei noastre de post-antrenament pentru a dezvolta modele de preferință mai robuste și, de asemenea, pentru a evalua modelele de preferință ÃŪmpotriva altor axe de prejudecată.’

Concluzie

Noua lucrare este o perspectivă interesantă, deși eliptică, asupra modului ÃŪn care datele de antrenament sub-ÃŪngrijite sau supra-/sub-reprezentate pot provoca rezultate nedorite ÃŪn timpul inferenței. Orice utilizator regulat de LLM va avea, pÃĒnă acum, o colecție de povești de război.

De exemplu, multe dintre răspunsurile pe care le primesc de la ChatGPT par să fi fost influențate de tendințele SEO din ultimii 10-15 ani, unde portalurile online au fost forțate să se optimizeze pentru plasarea Google, ÃŪn loc de limbaj natural. Într-adevăr, outputul presărat cu emoji și prodigios al departamentelor de marketing pare să fi avut un impact semnificativ asupra oricărei solicitări de a scrie o postare pe LinkedIn – pÃĒnă la punctul ÃŪn care “entuziasmul” generat de AI este acum imposibil de ratat:

StÃĒnga: Cerut să promoveze o postare pe LinkedIn, ÃŪntr-un cont cu zero istoric, ChatGPT se folosește de emoji și de limbajul PR-sensationalist. Dreapta: Cerut același lucru după șase luni de a-i spune să se calmeze, GPT produce ceva mult mai sobru.

StÃĒnga: Cerut să promoveze o postare pe LinkedIn, ÃŪntr-un cont cu zero istoric, ChatGPT se folosește de emoji și de limbajul PR-sensationalist. Dreapta: Cerut același lucru după șase luni de a-i spune să se calmeze, GPT produce ceva mult mai sobru.

OpenAI intervine activ ÃŪn modul ÃŪn care ChatGPT răspunde la ÃŪntrebări, ÃŪn funcție de funcție și context, făcÃĒnd dificil pentru cercetători să diferențieze ÃŪntre probleme care apar din cauza datelor și din cauza distribuției datelor, precum și a problemelor conexe, cum ar fi annotarea; și atunci cÃĒnd un rezultat nedorit poate fi datorat interferenței comerciale din partea companiei care găzduiește LLM-ul.

 

* Due to the jargon-filled writing style that the authors have chosen for this paper, I am avoiding author quotes where possible in favor of summaries.

†  Authors’ bold emphasis, not mine.

First published Friday, 6 iunie 2025

Scriitor pe machine learning, specialist ÃŪn domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, pÃĒnă la dizolvarea sa ÃŪn Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]