Unghiul lui Anderson

Întrebări impolite pot crește costurile pentru întreprinderi care utilizează ChatGPT

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

Răspunsurile ChatGPT consumă mai multe jetoni atunci când sunteți nepoliticos cu el, majorând factura dvs. de întreprindere; dar spunând “vă rog” poate reduce costurile.

 

Se spune că politețea nu costă nimic; dar ce costă impolitețea? În ceea ce privește plata pentru ChatGPT, destul de mult, conform unui nou studiu din Statele Unite. Noul raport, de la Universitatea din Iowa, arată că a fi nepoliticos cu ChatGPT crește costul răspunsurilor – chiar dacă răspunsurile sunt aceleași pentru întrebări politicoase și nepoliticoase.

Autorii afirmă:

‘Prețul jetonilor de ieșire este de 12 dolari pentru 1 milion de jetoni de ieșire pentru GPT4. Am constatat că prompturile nepoliticoase duc la mai mult de 14 jetoni extra, ceea ce echivalează cu un cost suplimentar de 0,000168 dolari per prompt, în medie. Numărul mediu zilnic de întrebări către API-ul OpenAI depășește 2,2 miliarde.

‘Comparativ cu un scenariu în care toate prompturile sunt politicoase, atunci când prompturile sunt nepoliticoase, acest lucru generează o venit suplimentar de 369.000 de dolari pe zi, doar din cauza creșterii numărului de jetoni pe care prompturile nepoliticoase îi generează în rezultat.’

Deși rezultatul este interesant în sine, autorii subliniază că acest comportament neobișnuit ar putea indica o varietate de ciudățenii lingvistice încă nedescoperite în configurația om/AI, care ar putea avea implicații financiare. În ceea ce privește motivul pentru care nepolitețea costă clienții jetoni suplimentari, autorii nu speculează.

Pentru a stabili veridicitatea sindromului, ei au rescris prompturi reale ChatGPT, alternând valorile de politețe, în timp ce păstrau sensul. Ambele versiuni au fost introduse în GPT-4-Turbo, și s-au măsurat diferențele în numărul de jetoni de ieșire utilizați pentru răspunsuri.

Concluziile trase sunt în contrast puternic cu evenimentele de titular din acest an, în care Sam Altman s-a plâns că politețea costa OpenAI potențial ‘zeci de milioane’ de dolari în ceea ce privește procesarea jetonilor legați de politețe (cum ar fi ‘vă rog’). Cercetarea publicată în aceeași perioadă a indicat, de asemenea, că politețea nu are nicio valoare în ceea ce privește obținerea de răspunsuri mai bune (deși nu a comentat despre răspunsuri mai ieftine).

Dacă concluziile noului studiu sunt corecte, orice utilizator de întreprindere ChatGPT care a urmat acea linie de gândire ar fi cheltuit mai mult pe inferența ChatGPT în 2025 decât utilizatorii care oferă o minimă politețe în schimburile ChatGPT.

Autorii sugerează că o posibilă soluție ar fi să se stabilească un plafon de jetoni pentru răspunsuri, deși aceasta nu este o abordare pe care sistemele LLM le pot implementa ușor. Ei observă că promptarea este un instrument slab pentru controlul costurilor, deoarece LLM-urile se luptă să respecte instrucțiunile explicite de lungime. În majoritatea cazurilor, această directivă de “limitare” nu ar fi respectată; în plus, răspunsul ar putea fi trunchiat, deoarece LLM-urile de acest tip sunt, în esență, ghicind următorul cuvânt probabil într-o propoziție/paragraf și, ca atare, nu știu cum se termină povestea – sau unde se termină povestea – până când procesarea este completă. Prin urmare, au o capacitate limitată de a “încheia” orice mecanisme în curs de desfășurare la cerere.

Lipsind o soluție exactă – deși sugestând că abordări de prețare mai transparente ar trebui să fie impuse în astfel de cazuri – autorii concluzionează:

‘Înțelepciunea convențională sugerează că politețea promptului este inutilă atunci când se interacționează cu LLM-urile.

‘În contrast, lucrarea noastră demonstrează că prompturile nepoliticoase cresc numărul de jetoni de ieșire, generând costuri suplimentare pentru adoptatorii de AI de întreprindere.’

Noul raport, intitulat Transparența costurilor în adoptarea AI de întreprindere, provine de la trei cercetători de la Universitatea din Iowa.

Metodă

Datele pentru sistem au fost extrase din setul de date WildChat, care cuprinde o colecție de 1 milion de conversații utilizator-ChatGPT și are peste 2,5 milioane de rotiri de interacțiune:

De pe un site de suport pentru proiectul WildChat, exemple de interacțiuni ChatGPT care pot fi căutate. Sursă: https://wildvisualizer.com/

De pe un site de suport pentru proiectul WildChat, exemple de interacțiuni ChatGPT care pot fi căutate. Sursă

Autorii notează că WildChat conține o cantitate mai mare de interacțiuni naturale decât în unele seturi mai bine curate.

Ei au ales 20.000 de prompturi în limba engleză din schimburile GPT-4, eliminând ieșirile în fiecare caz (deoarece intenția era să alimenteze prompturile din nou, pentru răspunsuri noi). Doar prima interacțiune a fost aleasă, chiar și din schimburi mai lungi,

Setul rezultat a fost filtrat în categorii polite sau nepoliticoase, cu toate prompturile clasificate de GPT-4-Turbo. Cercetătorii au utilizat modelul însuși pentru a decide dacă un prompt era politicos sau nu, deoarece percepția modelului asupra politeței era centrală pentru experiment.

Prompturile etichetate ca polite puteau include indicii clare, cum ar fi cuvântul ‘vă rog’, sau puteau fi politicoase într-un mod mai indirect. Orice prompt care nu a fost recunoscut ca polite a fost clasificat ca nepoliticos, chiar dacă formularea era neutră, mai degrabă decât antagonistă.

Pentru a studia modul în care modelul a răspuns la politețe, metodele standard (adică cele care tratează textul ca un set de caracteristici măsurabile) nu au putut fi utilizate: deoarece politețea era încorporată în însăși formularea, rezumarea unui prompt ca o listă de trăsături ar fi pierdut contextul important.

În schimb, fiecare prompt a fost rescris pentru a-și inversa tonul, cu toate celelalte elemente păstrate cât mai asemănătoare, permițând compararea între perechi care diferă doar în ceea ce privește politețea:

Exemple de modul în care prompturile politicoase și nepoliticoase au fost transformate în versiunile lor contrafactuale, păstrând în același timp sensul semantic.

Exemple de modul în care prompturile politicoase și nepoliticoase au fost transformate în versiunile lor contrafactuale, păstrând în același timp sensul semantic. Sursă

Teste

Fiecare prompt original a fost pereche cu o versiune rescrisă care diferă doar în nivelul de politețe, și ambele versiuni au fost prezentate aceluiași model GPT-4-Turbo prin apeluri API separate. Numărul de jetoni produceți în răspuns la fiecare versiune a fost înregistrat, și diferența dintre ele a fost tratată ca măsura modului în care tonul a influențat (costul jetonilor).

Temperatura a fost menținută constantă pentru a preveni variația aleatorie, și perechile de prompturi au fost păstrate doar atunci când rescrierea a modificat intrarea cu nu mai mult de cinci jetoni. Acest lucru a asigurat că efectul studiat a provenit din ton, mai degrabă decât orice schimbări mai ample în formulare:

Statistici rezumative care arată că prompturile politicoase au dus la mai puțini jetoni de ieșire, în medie, decât prompturile nepoliticoase, în ciuda faptului că aveau puțin mai mulți jetoni de intrare.

Statistici rezumative care arată că prompturile politicoase au dus la mai puțini jetoni de ieșire, în medie, decât prompturile nepoliticoase, în ciuda faptului că aveau puțin mai mulți jetoni de intrare.

Rezultatele principale pentru prima rundă de teste au indicat că utilizarea unui prompt politicos reduce lungimea răspunsului cu 14,426 de jetoni:

Rezultatele estimării care prezintă efectul formatării promptului politicos asupra lungimii răspunsului (jetoni).

Rezultatele estimării care prezintă efectul formatării promptului politicos asupra lungimii răspunsului (jetoni).

Analiza a fost repetată pe trei subansambluri de prompturi politicoase pentru a testa robustețea: prompturi care utilizează markeri expliciți, cum ar fi ‘vă rog’ sau ‘mulțumesc’; cele care utilizează doar ‘vă rog’; și cele cu politețe implicită, cum ar fi ‘puteți’ sau ‘ați putea’:

Rezultatele estimării pe tipuri de politețe.

Rezultatele estimării pe tipuri de politețe.

Pentru a valida robustețea principalelor constatări, o clasificare secundară a politeței promptului a fost efectuată utilizând cadru LIWC, care oferă un punctaj determinist și reproductibil pentru caracteristici lingvistice.

În contrast cu clasificarea probabilistică a lui GPT, LIWC poate atribui un punctaj de politețe stabil pentru fiecare prompt, permițând evaluarea coerenței pe diverse metode. În această parte a testelor, prompturile au fost etichetate ca polite dacă punctajul lor LIWC de politețe a fost mai mare de zero și ca nepoliticoase în caz contrar.

Când s-a măsurat alinierea între clasificările LIWC și GPT, s-a observat un nivel de potrivire de 81%. Deși nu este o măsură a acurateței, acest acord a oferit sprijin pentru coerența între sisteme.

Când s-au analizat doar prompturile cu etichete de politețe LIWC și GPT care se potrivesc, prompturile politicoase au dus la 14 jetoni de ieșire mai puțini; și atunci când politețea a fost măsurată pe o scară de glisare, fiecare pas în sus în politețe a redus ieșirea cu cinci jetoni, în medie:

Economii de jetoni din politețe menținute atunci când reclasificate cu LIWC, atât ca etichetă binară, cât și ca punctaj continuu.

Economii de jetoni din politețe menținute atunci când reclasificate cu LIWC, atât ca etichetă binară, cât și ca punctaj continuu.

Reziliență

Pentru a evalua dacă efectul politeței variază în funcție de tipul de prompturi, fiecare prompt a fost atribuit uneia dintre mai multe categorii de sarcini predefinite: cereri de informații; generare de text; editare și rescriere; clasificare; rezumare; și sarcini tehnice.

Fiecare prompt a primit o etichetă de sarcină prin compararea încorporării sale cu cele ale descrierilor de sarcini predefinite, utilizând modelul all-MiniLM-L6-v2 Sentence Transformers.

Asemănarea cosinus a fost calculată între fiecare prompt și setul de definiții de sarcini, și eticheta cu asemănarea cea mai mare a fost atribuită.

Tipurile de sarcini au fost reutilizate ca variabile de control în regresie, pentru a testa dacă efectul politeței variază în funcție de categoria de prompt, și termenii de interacțiune între sarcină și tratament au fost introduși, pentru a verifica efectele diferențiale.

În ambele cazuri, prompturile politicoase au produs în mod constant ieșiri mai scurte, și nu s-a găsit nicio variație semnificativă pe tipuri de sarcini:

Rezultatele regresiei care demonstrează că prompturile politicoase au redus lungimea ieșirii pe toate tipurile de sarcini, fără efecte de interacțiune semnificative.

Rezultatele regresiei care demonstrează că prompturile politicoase au redus lungimea ieșirii pe toate tipurile de sarcini, fără efecte de interacțiune semnificative.


Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai