Unghiul lui Anderson
Întrebări impolite pot crește costurile pentru întreprinderi care utilizează ChatGPT

Răspunsurile ChatGPT consumă mai multe jetoni atunci când sunteți nepoliticos cu el, majorând factura dvs. de întreprindere; dar spunând “vă rog” poate reduce costurile.
Se spune că politețea nu costă nimic; dar ce costă impolitețea? În ceea ce privește plata pentru ChatGPT, destul de mult, conform unui nou studiu din Statele Unite. Noul raport, de la Universitatea din Iowa, arată că a fi nepoliticos cu ChatGPT crește costul răspunsurilor – chiar dacă răspunsurile sunt aceleași pentru întrebări politicoase și nepoliticoase.
Autorii afirmă:
‘Prețul jetonilor de ieșire este de 12 dolari pentru 1 milion de jetoni de ieșire pentru GPT4. Am constatat că prompturile nepoliticoase duc la mai mult de 14 jetoni extra, ceea ce echivalează cu un cost suplimentar de 0,000168 dolari per prompt, în medie. Numărul mediu zilnic de întrebări către API-ul OpenAI depășește 2,2 miliarde.
‘Comparativ cu un scenariu în care toate prompturile sunt politicoase, atunci când prompturile sunt nepoliticoase, acest lucru generează o venit suplimentar de 369.000 de dolari pe zi, doar din cauza creșterii numărului de jetoni pe care prompturile nepoliticoase îi generează în rezultat.’
Deși rezultatul este interesant în sine, autorii subliniază că acest comportament neobișnuit ar putea indica o varietate de ciudățenii lingvistice încă nedescoperite în configurația om/AI, care ar putea avea implicații financiare. În ceea ce privește motivul pentru care nepolitețea costă clienții jetoni suplimentari, autorii nu speculează.
Pentru a stabili veridicitatea sindromului, ei au rescris prompturi reale ChatGPT, alternând valorile de politețe, în timp ce păstrau sensul. Ambele versiuni au fost introduse în GPT-4-Turbo, și s-au măsurat diferențele în numărul de jetoni de ieșire utilizați pentru răspunsuri.
Concluziile trase sunt în contrast puternic cu evenimentele de titular din acest an, în care Sam Altman s-a plâns că politețea costa OpenAI potențial ‘zeci de milioane’ de dolari în ceea ce privește procesarea jetonilor legați de politețe (cum ar fi ‘vă rog’). Cercetarea publicată în aceeași perioadă a indicat, de asemenea, că politețea nu are nicio valoare în ceea ce privește obținerea de răspunsuri mai bune (deși nu a comentat despre răspunsuri mai ieftine).
Dacă concluziile noului studiu sunt corecte, orice utilizator de întreprindere ChatGPT care a urmat acea linie de gândire ar fi cheltuit mai mult pe inferența ChatGPT în 2025 decât utilizatorii care oferă o minimă politețe în schimburile ChatGPT.
Autorii sugerează că o posibilă soluție ar fi să se stabilească un plafon de jetoni pentru răspunsuri, deși aceasta nu este o abordare pe care sistemele LLM le pot implementa ușor. Ei observă că promptarea este un instrument slab pentru controlul costurilor, deoarece LLM-urile se luptă să respecte instrucțiunile explicite de lungime. În majoritatea cazurilor, această directivă de “limitare” nu ar fi respectată; în plus, răspunsul ar putea fi trunchiat, deoarece LLM-urile de acest tip sunt, în esență, ghicind următorul cuvânt probabil într-o propoziție/paragraf și, ca atare, nu știu cum se termină povestea – sau unde se termină povestea – până când procesarea este completă. Prin urmare, au o capacitate limitată de a “încheia” orice mecanisme în curs de desfășurare la cerere.
Lipsind o soluție exactă – deși sugestând că abordări de prețare mai transparente ar trebui să fie impuse în astfel de cazuri – autorii concluzionează:
‘Înțelepciunea convențională sugerează că politețea promptului este inutilă atunci când se interacționează cu LLM-urile.
‘În contrast, lucrarea noastră demonstrează că prompturile nepoliticoase cresc numărul de jetoni de ieșire, generând costuri suplimentare pentru adoptatorii de AI de întreprindere.’
Noul raport, intitulat Transparența costurilor în adoptarea AI de întreprindere, provine de la trei cercetători de la Universitatea din Iowa.
Metodă
Datele pentru sistem au fost extrase din setul de date WildChat, care cuprinde o colecție de 1 milion de conversații utilizator-ChatGPT și are peste 2,5 milioane de rotiri de interacțiune:

Autorii notează că WildChat conține o cantitate mai mare de interacțiuni naturale decât în unele seturi mai bine curate.
Ei au ales 20.000 de prompturi în limba engleză din schimburile GPT-4, eliminând ieșirile în fiecare caz (deoarece intenția era să alimenteze prompturile din nou, pentru răspunsuri noi). Doar prima interacțiune a fost aleasă, chiar și din schimburi mai lungi,
Setul rezultat a fost filtrat în categorii polite sau nepoliticoase, cu toate prompturile clasificate de GPT-4-Turbo. Cercetătorii au utilizat modelul însuși pentru a decide dacă un prompt era politicos sau nu, deoarece percepția modelului asupra politeței era centrală pentru experiment.
Prompturile etichetate ca polite puteau include indicii clare, cum ar fi cuvântul ‘vă rog’, sau puteau fi politicoase într-un mod mai indirect. Orice prompt care nu a fost recunoscut ca polite a fost clasificat ca nepoliticos, chiar dacă formularea era neutră, mai degrabă decât antagonistă.
Pentru a studia modul în care modelul a răspuns la politețe, metodele standard (adică cele care tratează textul ca un set de caracteristici măsurabile) nu au putut fi utilizate: deoarece politețea era încorporată în însăși formularea, rezumarea unui prompt ca o listă de trăsături ar fi pierdut contextul important.
În schimb, fiecare prompt a fost rescris pentru a-și inversa tonul, cu toate celelalte elemente păstrate cât mai asemănătoare, permițând compararea între perechi care diferă doar în ceea ce privește politețea:

Teste
Fiecare prompt original a fost pereche cu o versiune rescrisă care diferă doar în nivelul de politețe, și ambele versiuni au fost prezentate aceluiași model GPT-4-Turbo prin apeluri API separate. Numărul de jetoni produceți în răspuns la fiecare versiune a fost înregistrat, și diferența dintre ele a fost tratată ca măsura modului în care tonul a influențat (costul jetonilor).
Temperatura a fost menținută constantă pentru a preveni variația aleatorie, și perechile de prompturi au fost păstrate doar atunci când rescrierea a modificat intrarea cu nu mai mult de cinci jetoni. Acest lucru a asigurat că efectul studiat a provenit din ton, mai degrabă decât orice schimbări mai ample în formulare:

Rezultatele principale pentru prima rundă de teste au indicat că utilizarea unui prompt politicos reduce lungimea răspunsului cu 14,426 de jetoni:

Analiza a fost repetată pe trei subansambluri de prompturi politicoase pentru a testa robustețea: prompturi care utilizează markeri expliciți, cum ar fi ‘vă rog’ sau ‘mulțumesc’; cele care utilizează doar ‘vă rog’; și cele cu politețe implicită, cum ar fi ‘puteți’ sau ‘ați putea’:

Pentru a valida robustețea principalelor constatări, o clasificare secundară a politeței promptului a fost efectuată utilizând cadru LIWC, care oferă un punctaj determinist și reproductibil pentru caracteristici lingvistice.
În contrast cu clasificarea probabilistică a lui GPT, LIWC poate atribui un punctaj de politețe stabil pentru fiecare prompt, permițând evaluarea coerenței pe diverse metode. În această parte a testelor, prompturile au fost etichetate ca polite dacă punctajul lor LIWC de politețe a fost mai mare de zero și ca nepoliticoase în caz contrar.
Când s-a măsurat alinierea între clasificările LIWC și GPT, s-a observat un nivel de potrivire de 81%. Deși nu este o măsură a acurateței, acest acord a oferit sprijin pentru coerența între sisteme.
Când s-au analizat doar prompturile cu etichete de politețe LIWC și GPT care se potrivesc, prompturile politicoase au dus la 14 jetoni de ieșire mai puțini; și atunci când politețea a fost măsurată pe o scară de glisare, fiecare pas în sus în politețe a redus ieșirea cu cinci jetoni, în medie:

Reziliență
Pentru a evalua dacă efectul politeței variază în funcție de tipul de prompturi, fiecare prompt a fost atribuit uneia dintre mai multe categorii de sarcini predefinite: cereri de informații; generare de text; editare și rescriere; clasificare; rezumare; și sarcini tehnice.
Fiecare prompt a primit o etichetă de sarcină prin compararea încorporării sale cu cele ale descrierilor de sarcini predefinite, utilizând modelul all-MiniLM-L6-v2 Sentence Transformers.
Asemănarea cosinus a fost calculată între fiecare prompt și setul de definiții de sarcini, și eticheta cu asemănarea cea mai mare a fost atribuită.
Tipurile de sarcini au fost reutilizate ca variabile de control în regresie, pentru a testa dacă efectul politeței variază în funcție de categoria de prompt, și termenii de interacțiune între sarcină și tratament au fost introduși, pentru a verifica efectele diferențiale.
În ambele cazuri, prompturile politicoase au produs în mod constant ieșiri mai scurte, și nu s-a găsit nicio variație semnificativă pe tipuri de sarcini:

Pentru a testa dacă răspunsurile mai scurte de la prompturile politicoase reflectă o calitate redusă, ieșirile de la prompturile originale și contrafactuale au fost comparate pentru asemănare semantică. Utilizând modelul all-MiniLM-L6-v2, fiecare răspuns a fost încorporat într-un spațiu vectorial semantic, și asemănarea cosinus a fost calculată între fiecare pereche, dând o asemănare medie de 0,78, ceea ce indică o aliniere puternică a sensului, și sugerează că conținutul a rămas consistent chiar și atunci când tonul s-a schimbat.
Cuvinte de oprire
Pentru a înțelege ce tipuri de conținut sunt reduse în ieșirile mai scurte, au fost examinate cuvintele cel mai frecvent eliminate. Acestea s-au dovedit a fi cuvinte comune de oprire cum ar fi ‘a avea’, ‘mai mult’, ‘unde’ și ‘în’, adică termeni care servesc roluri gramaticale mai degrabă decât semantice.
Pentru a confirma că reducerea jetonilor nu a fost determinată de pierderea conținutului semnificativ, cuvintele de oprire au fost eliminate, și frazele de până la patru cuvinte au fost analizate pentru dispariția sistematică; cu toate acestea, nu au fost găsite modele consistente sau semnificative din punct de vedere semantic, ceea ce sugerează că reducerile din cauza formulării politicoase nu nu au eliminat conținutul semnificativ sau util.
Astfel, pare că mai mulți jetoni sunt cheltuiți pentru răspunsuri la întrebări nepoliticoase decât la întrebări politicoase – ca o fel de “taxă” pe brutalitate.
Studiu uman
Pentru a testa dacă calitatea răspunsului a fost afectată de tonul promptului, a fost efectuată și o evaluare umană, utilizând un eșantion aleatoriu de douăzeci de perechi de prompturi polite și nepoliticoase.
După excluderea prompturilor pe subiecte sensibile sau tehnice, răspunsurile au fost evaluate de 401 de participanți pe o scară de șapte puncte. Fiecare participant a văzut doar un răspuns, extras din una dintre cele patru condiții: polite sau nepoliticos, și fie original sau contrafactual.
Nu s-au găsit diferențe semnificative în calitatea percepută între niciuna dintre aceste condiții. Polite și nepoliticoase ieșiri au primit scoruri aproape identice, la fel și originale și contrafactuale versiuni.
Autorii afirmă că aceste rezultate indică faptul că reducerea numărului de jetoni de ieșire nu a fost cauzată de nicio pierdere de calitate, ci mai degrabă de rescrierea sau prin schimbări structurale care au păstrat sensul.
Diferența de cost observată în promptarea de întreprindere este, prin urmare, puțin probabil să reflecte schimbări în utilitate sau claritate, și “taxa” este încă operativă.
Concluzie
Deși noul studiu se concentrează pe utilizarea de întreprindere a ChatGPT, utilizatorii de nivel inferior sunt, de asemenea, afectați de acest sindrom, deoarece chiar și cele două niveluri de intrare au limite de utilizare; și – presupunând – tratând ChatGPT în mod brutal va face ca utilizatorul mediu să se apropie mai repede de epuizarea alocării zilnice de jetoni.
Noul studiu se concentrează pe o întrebare deschisă și mult studiată în interacțiunile om/AI; dar autorii subliniază că problemele legate de politețe ar trebui să fie luate ca indicatori ai unei posibile adânci rezervoare de ciudățenii lingvistice, încă nedescoperite, care ar putea avea implicații financiare.
Publicat pentru prima dată miercuri, 19 noiembrie 2025












