Kąt Andersona

Modele rozmów AI mogą generować koszty poprzez niekończące się gadulstwo

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

Popularne modele rozmów AI potajemnie marnują ogromne ilości płatnych tokenów na bezsensowne gadulstwo. Dotknięte modele naprawdę wiedzą, że to robią, ale nie mogą się powstrzymać.

 

Duże Modele Rozumowania (tj. LRMs) takie jak ChatGPT-5 i Google Gemini pobierają wyższą opłatę za rozumowanie – przechodzenie przez problem krok po kroku, co wymaga znacznie więcej mocy obliczeniowej niż po prostu szybkie przewidywanie następnego słowa. Symulowany proces rozumowania trwa dłużej i jest droższy w użytkowaniu; w związku z tym użytkownicy kończą płacenie za ten “dodatkowy czas myślenia”.

Jednak jeśli niedawno używałeś modelu LLM, możesz zauważyć, że twoja alokacja tokenów jest często wydatkowana na gadulstwo i niepotrzebne słowa, zamiast skupiać się na rozwiązywaniu problemów, które przedstawiasz modelowi. Może to przybrać formę nadmiernej sycophancji, rozwlekle i/lub zbędne odpowiedzi – lub nawet rodzaj “gadulstwa”, jakby AI zostało złapane na gorącym uczynku i stara się wygadnąć się z niezręcznej sytuacji.

Naturalnie, wolimy, aby nasze LLM-y uznały porażkę, podążały za alternatywnymi ścieżkami lub prosiły o wyjaśnienia. Ale nawet uzyskanie od AI przyznania, że nie zna odpowiedzi, jest znacznym wyzwaniem samym w sobie.

W międzyczasie, użytkownicy na niższych lub bezpłatnych poziomach mogą znaleźć się w sytuacji, w której szybko wyczerpali swoje tokeny, niezależnie od tego, jak celowo lub ekonomicznie były ich zapytania i interakcje, ponieważ AI sama kocha mówić; i w tym przypadku, mówienie nie jest tanie.

Word Salad

W odniesieniu do wspomnianego “gadulstwa”, nowa współpraca akademicka oferuje racjonalizację i rozwiązanie, proponując, że LLM-y z możliwościami rozumowania są skłonne do wypalania twoich tokenów, gdy wpadają w “słowny sałatkę” – stan zdezorientowania, w którym proces rozumowania gubi się w rekursywnych ślepych zaułkach – na twoją niekorzyść*.

Badacze zaangażowani w nowy artykuł odkryli, że znacząca część tokenów przetwarzanych w typowym LLM składa się z powtórzeń i redundancji – i że sam model wygląda na to, że rozumie, że ma kłopoty, chociaż nie jest w stanie zatrzymać kosztownej pętli.

Artykuł stwierdza:

‘Pokażemy, że znacząca część tych tokenów to bezużyteczne samopowtórzenia – co nazywamy „słowną sałatką” – które wyczerpują budżet dekodowania bez dodawania wartości. Interesujące, obserwujemy, że LRM-y są świadome, gdy są uwięzione w tych pętlach: ukryte stany <\n\n> tokenów następujących po każdym fragmencie rozumowania wykazują wzorce, które pozwalają nam wykryć zachowanie słownej sałatki w locie za pomocą jednowarstwowego klasyfikatora liniowego.

‘Gdy tylko wykryte, proste odcięcie poprzedzone prostym sygnałem regeneracji daje znaczne oszczędności długości przy minimalnej stracie jakości.’

Rozwiązanie oferowane przez nową pracę to interwencja, która może przerwać spiralny proces błędnego LRM w sposób natychmiastowy, bez konieczności włączania do danych szkoleniowych lub powodowania szkód, które mogą wyniknąć z dostosowywania. Ramy, zatytułowane WordSaladChopper, zostały publicznie udostępnione na GitHub.

Chociaż praca wstępna koncentruje się DeepSeek wariantach, takich jak wpisy w serii Qwen i Llama, artykuł twierdzi, że niepożądane zachowanie jest prawdopodobnie stosowane do znacznie szerszego zakresu podobnie zaprojektowanych modeli rozumowania (w tym popularnych ofert API-only, takich jak ChatGPT i Google Gemini).

Jak zauważa artykuł, wcześniejsze prace, takie jak Demystifying Long Chain-of-Thought Reasoning in LLMs i Small Models Struggle to Learn from Strong Reasoners również wykorzystują niewielką liczbę publicznie dostępnych modeli rozumowania łańcuchowego myśli (CoT), aby ustalić szerszy problem w tej klasie modeli:

[LRM-y] mają tendencję do marnowania ogromnej ilości budżetu dekodowania, po prostu powtarzając się słowo w słowo, z niewielkimi zmianami, lub angażując się w niekończące się wyliczanie przypadków, aż do wyczerpania całego budżetu – nazywamy to Word Salad, terminem często używanym do wyśmiewania publicznych rzeczników za długie, pełne jargonu odpowiedzi, które ostatecznie nie mają znaczenia ani wyraźnego sensu.

‘Kolumna „Oryginał” [w poniższej tabeli] pokazuje, że gdy odpowiadają na GPQA-Diamond, obserwujemy, że 55%+ tokenów wygenerowanych przez modele DeepSeek-R1-Distill są oznaczone jako „tokeny słownej sałatki”, które nie dodają wartości z punktu widzenia semantyki.’

Udział tokenów wyjściowych zidentyfikowanych jako semantycznie zbędne przy odpowiadaniu na GPQA-Diamond. WordSaladChopper redukuje ten nakład z ponad 55% do poniżej 6% we wszystkich testowanych modelach DeepSeek-R1-Distill, twierdzą autorzy. [ Źródło ] https://arxiv.org/pdf/2511.00536

Udział tokenów wyjściowych zidentyfikowanych jako semantycznie zbędne przy odpowiadaniu na GPQA-Diamond. WordSaladChopper redukuje ten nakład z ponad 55% do poniżej 6% we wszystkich testowanych modelach DeepSeek-R1-Distill, twierdzą autorzy. Źródło

Autorzy zauważają, że próby skrócenia procesów rozumowania przy zachowaniu jakości odpowiedzi stały się silnym podprądem w literaturze badawczej, a mianowicie long-to-short (L2S); oraz zauważają, że chociaż ich cele są podobne do kilku wcześniejszych inicjatyw, ich własne jest pierwszym, które oferuje ad hoc rozwiązanie, które nie wymaga interwencji w procesie szkolenia, edycji modelu lub innych możliwych narzutów na podstawową architekturę LLM; i w tym zakresie uważają, że ich podejście powinno stać się powszechne wśród stosowalnych systemów:

Uważamy, że nie jest zbyt daleko idące twierdzenie, że [WordSaladChopper] – lub podobny komponent – jest niezbędny dla wszystkich aplikacji LRM z myślą o doświadczeniu użytkownika

Artykuł nowy nosi tytuł WordSaladChopper: Modele Rozumowania Marnują Mnóstwo Budżetu Dekodowania Na Bezużyteczne Powtórzenia, Świadomie, i pochodzi od sześciu badaczy z Uniwersytetu Minnesoty, Uniwersytetu Rice, Instytutu Technologicznego Stevens i Lambda, Inc.

Prior Considerations

Aby śledzić tendencję modeli LRM do powtarzania się, autorzy podzielili wyjście modelu na fragmenty w miejscach, w których występowały podwójne przerwy linii, a następnie sprawdzili, jak podobne były poszczególne fragmenty do wcześniejszych:

Szacowany udział fragmentów rozumowania oznaczonych jako słowna sałatka pod dwiema temperaturami dekodowania (τ = 0,0, 0,6). Klasyfikator oznacza fragment jako „słowną sałatkę”, gdy wygląda na to, że ściśle przypomina wcześniejszą część wyjścia modelu, co sugeruje powtarzanie się zamiast postępu. Wyniki pokazują, że to zachowanie jest powszechne wśród zbiorów danych i rozmiarów modeli.

Szacowany udział fragmentów rozumowania oznaczonych jako słowna sałatka pod dwiema temperaturami dekodowania (τ = 0,0, 0,6). Klasyfikator oznacza fragment jako „słowną sałatkę”, gdy wygląda na to, że ściśle przypomina wcześniejszą część wyjścia modelu, co sugeruje powtarzanie się zamiast postępu. Wyniki pokazują, że to zachowanie jest powszechne wśród zbiorów danych i rozmiarów modeli.

Jeśli fragment był zbyt podobny, został oznaczony jako “słowna sałatka” (co skutkuje bezużytecznym powtórzeniem).

Badacze zauważają, że raz gdy model wejdzie w tryb “słownej sałatki”, jest bardzo mało prawdopodobne, że wyjdzie z niego bez zewnętrznej pomocy, pozostając w kosztownej pętli, aż do wyczerpania budżetu użytkownika††:

‘Nie trzeba dodawać, że stanowi to katastrofalny problem dla użytkowników, ponieważ idealnie znacznie krótszy fragment myślenia jest teraz maksymalizowany z bezużytecznymi powtórzeniami. Zatem użytkownik płaci maksymalną cenę za (prawdopodobnie) błędną odpowiedź, a jednocześnie doświadcza najdłuższej całkowitej opóźnienia.’

Udział fragmentów słownej sałatki pojawiających się przed i po punkcie cięcia (tj. momencie, w którym dominuje powtarzalność wyjścia). Większość powtórzeń występuje po tym punkcie, co pokazuje, że gdy model wchodzi w pętlę słownej sałatki, rzadko odzyskuje się bez interwencji.

Udział fragmentów słownej sałatki pojawiających się przed i po punkcie cięcia (tj. momencie, w którym dominuje powtarzalność wyjścia). Większość powtórzeń występuje po tym punkcie, co pokazuje, że gdy model wchodzi w pętlę słownej sałatki, rzadko odzyskuje się bez interwencji.

Autorzy wspominają o swoim zaskoczeniu, gdy odkryli, że modele LRM wykazują oznaki świadomości swojego stanu słownej sałatki. Jednak to świadomość, a także sposób, w jaki wchodzi w stan prawdopodobieństwa modelu, pozwala na system interwencji:

‘Lekkość tego klasyfikatora liniowego otwiera drzwi do wykrywania w locie, gdzie możemy skutecznie interweniować różnymi operacjami, aby rozwiązać problemy modeli uwięzionych w pętlach słownej sałatki.’

Metoda

Aby wykryć obecność słownej sałatki podczas inferencji, autorzy przeszkolili prosty klasyfikator liniowy, który działa na stanie ukrytym każdego tokenu nowej linii.

Każdy fragment występujący po tym, jak model wszedł w pętlę powtarzania, był traktowany jako słowna sałatka, a ten punkt odcięcia (nazywany punktem cięcia) był używany do oznaczenia danych szkoleniowych. Zostało wygenerowanych 1000 śladów rozumowania przy użyciu benchmarku S1, a każdy ślad podzielono na fragmenty oddzielone nowymi liniami.

Schemat koncepcyjny dla WordSaladChopper. Podczas generowania analizuowany jest stan ukryty w każdym tokenie nowej linii w celu wykrycia segmentów powtarzalnych. Gdy wykryto dwa fragmenty słownej sałatki z rzędu, generowanie jest zatrzymywane. Następnie dołączany jest prosty sygnał regeneracji, co pozwala modelowi kontynuować i ukończyć odpowiedź bez przekroczenia budżetu.

Schemat koncepcyjny dla WordSaladChopper. Podczas generowania analizuowany jest stan ukryty w każdym tokenie nowej linii w celu wykrycia segmentów powtarzalnych. Gdy wykryto dwa fragmenty słownej sałatki z rzędu, generowanie jest zatrzymywane. Następnie dołączany jest prosty sygnał regeneracji, co pozwala modelowi kontynuować i ukończyć odpowiedź bez przekroczenia budżetu.

Jeśli fragment był bardzo podobny do poprzedniego, został oznaczony jako słowna sałatka. Gdy wykryto najwcześniejsze utrwalone powtórzenie, wszystkie następne fragmenty również zostały oznaczone jako słowna sałatka, aby odzwierciedlić trwanie tych pętli.

Klasyfikator został zaimplementowany jako pojedyncza warstwa całkowicie połączona i przeszkolony na stanach ukrytych tokenów następujących po bloku transformatora. Oddzielny klasyfikator został przeszkolony dla każdego modelu, przy użyciu tych danych, i nie przeprowadzono dostosowywania podczas oceny.

Dane i testy

Szkolenie i inferencja wykorzystywały cztery procesory NVIDIA A100 (80G VRAM), pod optymalizatorem Adam, z stawką uczenia 1×10-2, przez 50 epok.

Zbiory danych oceny to ‘Grade School Math’ 8000, znany również jako GSM8K; MATH-500; GPQA-DIAMOND; oraz AIME25 (2025).

Testowane modele to DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; oraz DeepSeek-R1-Distill-Llama-8B, wszystkie na licencji MIT.

Wynikiem była dokładność i AUROC.

Dokładność i AUROC klasyfikatora słownej sałatki w Qwen-7B w czterech benchmarkach i dwóch temperaturach dekodowania. Wysokie wyniki potwierdzają, że początek powtórzenia można niezawodnie wykryć ze stanu ukrytego tokenu nowej linii.

Dokładność i AUROC klasyfikatora słownej sałatki w Qwen-7B w czterech benchmarkach i dwóch temperaturach dekodowania. Wysokie wyniki potwierdzają, że początek powtórzenia można niezawodnie wykryć ze stanu ukrytego tokenu nowej linii.

Z wyników przedstawionych tutaj autorzy komentują:

‘[Tabela wyników powyżej] pokazuje, że klasyfikator liniowy jest niezwykle dokładny w wykrywaniu fragmentów słownej sałatki; [tabela poniżej] demonstruje, że sygnał regeneracji pomaga odzyskać dokładność zadania utraconą z powodu brutalnego cięcia.’

Dokładność Qwen-7B w każdym benchmarku przy τ = 0,6, porównując wyniki przed słowną sałatką (Oryginał), po cięciu (Przycięty) i po zastosowaniu regeneracji (Zregenerowany). Zyski z regeneracji są umiarkowane, ale spójne, odzyskując wyniki przed pętlą w większości przypadków.

Dokładność Qwen-7B w każdym benchmarku przy τ = 0,6, porównując wyniki przed słowną sałatką (Oryginał), po cięciu (Przycięty) i po zastosowaniu regeneracji (Zregenerowany). Zyski z regeneracji są umiarkowane, ale spójne, odzyskując wyniki przed pętlą w większości przypadków.

W tabeli wyników poniżej widać, że WordSaladChopper poprawił lub zachował dokładność, znacznie redukując długość wyjść modelu, o ile nie o 57%:

Gdy WordSaladChopper jest używany z dekodowaniem chciwym (τ = 0), redukuje długość wyjść modelu, czasem o ponad połowę, przy zachowaniu dokładności na tym samym poziomie lub nieznacznie lepszym, co utrzymuje się w przypadku różnych modeli i zadań (AIME25 jest pominięty ze względu na przewidywalnie niestabilne wyniki w tym ustawieniu).

Gdy WordSaladChopper jest używany z dekodowaniem chciwym (τ = 0), redukuje długość wyjść modelu, czasem o ponad połowę, przy zachowaniu dokładności na tym samym poziomie lub nieznacznie lepszym, co utrzymuje się w przypadku różnych modeli i zadań (AIME25 jest pominięty ze względu na przewidywalnie niestabilne wyniki w tym ustawieniu).

Największe zyski pojawiły się w dłuższych odpowiedziach, szczególnie w GPQA-Diamond, gdzie prawie połowa tekstu została usunięta bez uszczerbku dla wyników. Poniżej widać podobne wyniki, gdy dodano losowość podczas generowania:

Przy wyższej temperaturze (τ = 0,6) WordSaladChopper nadal skraca wyjścia o 10-30%, przy utrzymaniu stabilności lub nieznacznym poprawieniu dokładności we wszystkich modelach i benchmarkach (wyniki AIME25 są uśrednione, aby zmniejszyć zmienność).

Przy wyższej temperaturze (τ = 0,6) WordSaladChopper nadal skraca wyjścia o 10-30%, przy utrzymaniu stabilności lub nieznacznym poprawieniu dokładności we wszystkich modelach i benchmarkach (wyniki AIME25 są uśrednione, aby zmniejszyć zmienność).

Tutaj dokładność pozostała stabilna, a krótsze wyjścia zostały osiągnięte. Ogólnie system nadal działał, nawet gdy odpowiedzi modelu stawały się bardziej powtarzalne; autorzy zauważają, że ponieważ klasyfikator sprawdza tylko jeden token na zdanie, działa niezwykle szybko, nawet podczas generowania na żywo.

Artykuł zauważa, że dodatkowe strategie w przyszłych badaniach w tym kierunku mogą skorzystać na przyznaniu modelowi niewielkiego budżetu regeneracji po interwencji; ciągłym stosowaniu systemu WordSaladChopper-style nad regeneracjami; oraz wymuszaniu tokenu “końca myślenia” w modelu, aby zażądać jego najlepszej bieżącej odpowiedzi.

W końcu badacze komentują jakość bieżącego stanu sztuki w ocenianiu modeli rozumowania, z krytycznym tonem:

Uważamy, że wiele efektywnych metod rozumowania wydaje się skutecznych częściowo dlatego, że bieżące benchmarki oceny rozumowania mają wiele miejsca do poprawy.

‘Gdy rozwiną się bardziej kompleksowe zestawy oceny oceny – co z pewnością nastąpi w przyszłości – spodziewamy się, że wiele efektywnych metod rozumowania zawiedzie lub zachowa się inaczej niż ich standardowe odpowiedniki LRM.’

Wnioski

Na poziomie osiągniętym przez wiodące systemy, takie jak ChatGPT, nawet niewielkie przesunięcia w zużyciu zasobów użytkownika mogą mieć znaczące implikacje dla infrastruktury, logistyki i kosztów. To sprawia, że efektywność jest wspólną priorytetem zarówno dla dostawców, jak i szerszej społeczności badawczej.

Jeśli zostanie wdrożony, nowy i lekki system proponowany w artykule (który musi być dostosowany do każdej nowej architektury modelu) mógłby zapobiec bezsensownemu spalaniu tokenów – co mogłoby dać klientowi wrażenie, że dostawca “wycieka” jego przydział w sposób rozrzutny lub oszukańczy. W rzeczywistości dostawca jest lepiej obsługiwany, dostarczając przydatne, a nie zbędne, dane wyjściowe, które kosztują tak samo w kategoriach obliczeniowych, jak słowna sałatka.

 

* Chociaż nie będziemy tego rozwijać tutaj, to również dotyczy modeli hostowanych lokalnie, które mogą być korporacyjne, a także hobbystyczne, i gdzie straty energii i produktywności wynikające ze słownej sałatki mogą być czynnikiem wartym zauważenia.

Jak zwykle, wszystkie podkreślenia pochodzą od autorów, a nie ode mnie. Gdzie stosowne, ich cytaty w linii zostały przekonwertowane na linki hypertextowe przeze mnie.

†† Tutaj musimy uznać, że ramy i API mogą przydzielać “pod-budżet” do zapytań, tak aby jedno zapytanie nie było w stanie spalić całego dziennego przydziału tokenów – ale to nie jest powszechna praktyka, ani powszechnie dyskutowana wśród dostawców tylko API.

††† Nie jestem zazwyczaj skłonny przyjąć użycie skrótu ‘LRM’ przez autorów, ponieważ nie jest to obecnie powszechny skrót, więc będę używał innej terminologii w tym artykule, gdzie to konieczne.

Pierwotnie opublikowane w czwartek, 6 listopada 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai