Kąt Andersona
Niewybredne zapytania mogą zwiększyć koszty korzystania z ChatGPT w przedsiębiorstwach

Odpowiedzi ChatGPT zużywają więcej tokenów, gdy jesteśmy niegrzeczni; ale mówienie “proszę” może zmniejszyć koszty.
Mówi się, że grzeczność nie kosztuje nic; ale co kosztuje niewybredność? Jak się okazuje, w przypadku płacenia za ChatGPT, całkiem sporo, według nowego badania z USA. Nowy artykuł, opublikowany przez Uniwersytet w Iowa, stwierdza, że być niegrzecznym wobec ChatGPT zwiększa koszt odpowiedzi – nawet jeśli odpowiedzi są takie same dla grzecznych i niegrzecznych zapytań.
Autorzy stwierdzają:
‘Cena tokenów wynosi 12 dolarów za 1 milion tokenów wyjściowych dla GPT4. Stwierdziliśmy, że niegrzeczne zapytania prowadzą do ponad 14 dodatkowych tokenów, co jest równoznaczne z dodatkowym kosztem 0,000168 dolarów za zapytanie średnio. Średnia dzienna liczba zapytań do interfejsu API OpenAI przekracza 2,2 miliarda.
‘W porównaniu ze scenariuszem, w którym wszystkie zapytania są grzeczne, gdy zapytania są niegrzeczne, generuje to dodatkowy dochód w wysokości 369 000 dolarów dziennie, wyłącznie ze względu na zwiększoną liczbę tokenów, jakie niegrzeczne zapytania generują w wyniku.’
Chociaż wynik jest interesujący sam w sobie, autorzy podkreślają, że to niezwykłe zachowanie może wskazywać na różne jeszcze nieznane osobliwości w konfiguracji człowiek-AI, które mogą mieć również finansowe implikacje. Co do powodu, dla którego niegrzeczność kosztuje klientów dodatkowe tokeny, autorzy nie spekulują.
Aby ustalić prawdziwość zjawiska, przepisali oni prawdziwe zapytania ChatGPT, zmieniając wartości grzeczności, przy zachowaniu znaczenia. Obie wersje zostały następnie wprowadzone do modelu GPT-4-Turbo, a różnice zostały zmierzone w liczbie tokenów wyjściowych użytych do odpowiedzi.
Wnioski wyciągnięte są wyraźnym kontrastem do wydarzeń z początku tego roku, kiedy to Sam Altman skarżył się, że grzeczność kosztuje OpenAI potencjalnie ‘dziesiątki milionów’ dolarów w postaci przetwarzania tokenów związanych z grzecznością (takich jak ‘proszę’). Badania opublikowane w tym samym okresie również wskazały, że grzeczność nie ma wartości w kwestii uzyskania lepszych odpowiedzi (chociaż nie skomentowały, czy ‘tanich’ odpowiedzi).
Jeśli wnioski nowego artykułu są słuszne, wszyscy użytkownicy przedsiębiorstw ChatGPT, którzy podążali za tym sposobem myślenia, wydali by więcej na inferencję ChatGPT w 2025 roku niż użytkownicy oferujący minimalną grzeczność w wymianie ChatGPT.
Autorzy sugerują, że jednym z możliwych rozwiązań byłoby ustalenie limitu tokenów na odpowiedzi, chociaż nie jest to podejście, które systemy LLM mogą łatwo wdrożyć. Zauważają, że zapytanie jest słabym narzędziem do kontroli kosztów, ponieważ LLM mają trudności z wykonywaniem wyraźnych instrukcji dotyczących długości. W większości przypadków ta “ograniczająca” dyrektywa nie byłaby przestrzegana; dodatkowo odpowiedź mogłaby być przycięta, ponieważ LLM tego rodzaju są podstawowo przewidującym następne prawdopodobne słowo w zdaniu/akapicie i, jako taki, nie wiedzą, jak historia się kończy – lub gdzie historia się kończy – dopóki przetwarzanie nie zostanie ukończone. Dlatego mają ograniczoną możliwość “zakończenia” jakichkolwiek machinacji w toku na żądanie.
Brakując dokładnego rozwiązania – chociaż sugerując, że bardziej przejrzyste podejścia do cen powinny być egzekwowane w przypadkach tego rodzaju – autorzy kończą:
‘Powszechne mniemanie sugeruje, że grzeczność w zapytaniach jest niepotrzebna podczas interakcji z LLM.
‘W przeciwieństwie do tego, nasza praca pokazuje, że niegrzeczne zapytania zwiększają liczbę tokenów wyjściowych, generując dodatkowe koszty dla przedsiębiorstw, które przyjmują AI.’
Nowy artykuł nowy artykuł nosi tytuł Przejrzystość kosztów w przypadku przyjęcia AI w przedsiębiorstwach i pochodzi od trzech badaczy z Uniwersytetu w Iowa.
Metoda
Dane dla systemu pochodziły z zbioru WildChat, składającego się z kolekcji 1 miliona rozmów użytkowników z ChatGPT, i zawierającego ponad 2,5 miliona interakcji:

Z witryny wspierającej projekt WildChat, przeszukiwalne przykłady interakcji ChatGPT. Źródło
Autorzy zauważają, że WildChat zawiera większą ilość naturalnych interakcji niż niektóre bardziej starannie wyselekcjonowane zestawy.
Wybrali 20 000 angielskich zapytań z kolekcji wymian z GPT-4, odrzucając dane wyjściowe w każdym przypadku (ponieważ zamiarem było ponowne wprowadzenie zapytań, w celu uzyskania nowych odpowiedzi). Wybrano tylko pierwszą interakcję, nawet z dłuższych wymian,
Wynikowy zestaw został przefiltrowany do kategorii grzeczne lub niegrzeczne, a wszystkie zapytania zostały sklasyfikowane przez GPT-4-Turbo. Badacze użyli samego modelu, aby określić, czy zapytanie było grzeczne czy nie, ponieważ percepcja grzeczności modelu była centralna dla eksperymentu.
Zapytania oznaczone jako grzeczne mogły zawierać wyraźne sygnały, takie jak słowo ‘proszę’, lub mogły być grzeczne w bardziej pośredni sposób. Cokolwiek, co nie zostało rozpoznane jako grzeczne, zostało sklasyfikowane jako niegrzeczne, nawet jeśli sformułowanie było neutralne, a nie antagonistyczne.
Aby zbadać, jak model reagował na grzeczność, nie można było użyć standardowych metod (tj. traktujących tekst jako zestaw mierzalnych cech): ponieważ grzeczność była zakodowana w samym sformułowaniu, podsumowanie zapytania jako listy cech utraciłoby ważny kontekst.
Zamiast tego każde zapytanie zostało przepisane, aby odwrócić jego ton, przy zachowaniu innych elementów podobnych jak tylko możliwe, co pozwoliło na porównanie par, które różniły się tylko grzecznością:

Przykłady, jak grzeczne i niegrzeczne zapytania zostały przekształcone w ich wersje przeciwnych, przy zachowaniu znaczenia semantycznego. Źródło
Testy
Każde oryginalne zapytanie zostało sparowane z przepisaną wersją, która różniła się tylko poziomem grzeczności, a obie wersje zostały wprowadzone do tego samego modelu GPT-4-Turbo przez oddzielne wywołania interfejsu API. Liczba tokenów wyprodukowanych w odpowiedzi na każdą wersję została zarejestrowana, a różnica między nimi potraktowana jako miara, jak ton wpływał na (koszt tokenów).
Temperatura była utrzymana na stałym poziomie, aby zapobiec losowej zmienności, a pary zapytań zostały zachowane tylko wtedy, gdy przepisanie zmieniło dane wejściowe o nie więcej niż pięć tokenów. Zapewniło to, że efekt, który był badany, wynikał z tonu, a nie z jakichkolwiek szerszych zmian w sformułowaniu:

Statyki podsumowujące, że grzeczne zapytania skutkowały mniejszą liczbą tokenów wyjściowych średnio, niż niegrzeczne zapytania, pomimo tego, że miały nieco więcej tokenów wejściowych.
Główne wyniki pierwszej serii testów wskazały, że użycie grzecznych zapytań zmniejsza długość wyjściowych tokenów o 14,426 tokenów:

Wyniki estymacji, przedstawiające wpływ formatowania grzecznych zapytań na długość wyjściowych tokenów.
Analiza została powtórzona w trzech podzbiórach grzecznych zapytań, aby przetestować wytrzymałość: zapytania używające jawnych markerów, takich jak ‘proszę’ lub ‘dziękuję’; te, które używały tylko ‘proszę’; i te z niejawną grzecznością, takimi jak ‘czy mogę’ lub ‘czy mógłbyś’:

Wyniki estymacji oparte na rodzajach grzeczności.
Aby zwalidować wytrzymałość głównych wyników, przeprowadzono dodatkową klasyfikację grzeczności zapytań przy użyciu ramy LIWC, która zapewnia deterministyczny i powtarzalny wynik dla cech językowych.
W przeciwieństwie do probabilistycznej klasyfikacji GPT, LIWC może przypisać stabilny wynik grzeczności do każdego zapytania, umożliwiając ocenę spójności w różnych metodach. W tej części testów zapytania były oznaczone jako grzeczne, jeśli ich wynik LIWC był większy niż zero, i jako niegrzeczne w przeciwnym przypadku.
Gdy zmierzono zgodność między klasyfikacjami GPT i LIWC, zaobserwowano 81% współczynnika zgodności. Chociaż nie jest to miara dokładności, ta zgodność zapewniła wsparcie dla spójności między systemami.
Gdy analizowano tylko zapytania z pasującymi etykietami GPT i LIWC, grzeczne zapytania nadal prowadziły do 14 mniej tokenów wyjściowych; i gdy grzeczność była mierzona na skali przesuwnej, każdy krok w górę w grzeczności zmniejszał wyjście o pięć tokenów średnio:

Oszczędności tokenów z grzecznością były zachowane, gdy zapytania zostały ponownie sklasyfikowane z LIWC, zarówno jako etykieta binarna, jak i ciągła.
Wytrzymałość
Aby ocenić, czy efekt grzeczności różnił się w zależności od rodzaju zapytań, każde zapytanie zostało przypisane do jednej z kilku wstępnie zdefiniowanych kategorii zadań: wyszukiwanie informacji; generowanie tekstu; edycja i przepisywanie; klasyfikacja; podsumowanie; i zadania techniczne.
Każde zapytanie zostało przypisane do etykiety zadania, porównując jego osadzenie z tymi z wstępnie zdefiniowanych opisów zadań, przy użyciu modelu all-MiniLM-L6-v2 Sentence Transformers.
Współczynnik podobieństwa cosinus został obliczony między każdym zapytaniem a zestawem definicji zadań, a etykieta z najwyższym współczynnikiem podobieństwa została przypisana.
Typy zadań zostały następnie wykorzystane jako zmienne kontrolne w regresji, aby przetestować, czy efekt grzeczności różnił się w zależności od kategorii zapytania, a także wprowadzono terminy interakcji między zadaniami, aby sprawdzić, czy występują różne efekty.
W obu przypadkach grzeczne zapytania konsekwentnie prowadziły do krótszych odpowiedzi, a nie znaleziono żadnych istotnych różnic w zależności od rodzaju zadań:

Wyniki regresji, pokazujące, że grzeczne zapytania zmniejszały długość odpowiedzi we wszystkich kategoriach zadań, bez istotnych efektów interakcji.












