Anderson의 관점

AI 채팅 모델은 끝없는 잡담으로 비용을 증가시킬 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

인기 AI 채팅 모델은 무의미한 장황함에 막대한 유료 토큰을 몰래 낭비한다. 해당 모델은 자신이 그러고 있다는 사실을 알지만 스스로 멈추지 못한다.

ChatGPT-5와 Google Gemini 같은 대형 추론 모델(LRM)은 문제를 단계별로 풀어 가는 ‘추론’에 더 많은 비용을 청구한다. 빠르게 다음 단어를 예측하는 것보다 훨씬 많은 계산이 필요하고 시간과 실행 비용도 커지므로, 사용자는 추가 사고 시간에 돈을 지불한다.

하지만 최신 LLM을 사용해 보면 토큰이 문제 해결보다 장황함과 불필요한 내용에 쓰이는 일이 많다. 과도한 아첨, 길고 중복된 답, 또는 곤란한 상황에서 말로 빠져나가려는 듯한 횡설수설로 나타난다.

우리는 LLM이 패배를 인정하거나 다른 경로를 제시하거나 설명을 요청하기를 바란다. 그러나 AI가 답을 모른다고 인정하게 하는 것 자체가 상당한 도전이다.

그동안 낮은 요금제나 무료 사용자는 질문을 아무리 간결하게 해도 토큰을 빠르게 소진한다. AI 자체가 말하기를 좋아하기 때문이다. 이 경우 말은 결코 공짜가 아니다.

워드 샐러드

새 연구는 추론형 LLM이 ‘워드 샐러드’ 루프에 빠질 때 토큰을 태운다는 설명과 해결책을 제시한다. 추론 과정이 재귀적인 막다른 길에서 길을 잃어 혼란에 빠지는 동안 비용은 사용자가 부담한다.

일반적인 LLM이 처리하는 토큰의 상당 부분은 반복과 중복이며, 모델은 곤경에 빠진 것을 이해하는 듯하지만 비용이 드는 루프를 멈출 수 없다.

토큰의 상당 부분이 의미를 더하지 않고 디코딩 예산만 소진하는 쓸모없는 자기 반복, 즉 ‘워드 샐러드’임을 보였다. 흥미롭게도 LRM은 이 루프에 갇힌 사실을 인식한다. 각 추론 청크 뒤의 줄바꿈 토큰에 나타나는 은닉 상태 패턴을 단일 계층 선형 분류기로 실시간 감지할 수 있다. 감지되면 단순히 잘라 내고 재생성 프롬프트를 추가해 품질 손실을 최소화하면서 길이를 크게 줄인다.

새 기법은 학습 데이터에 넣거나 파인튜닝으로 인한 손상 없이, 잘못된 추론 LLM의 소용돌이를 실행 중에 차단한다. 프레임워크 WordSaladChopper는 GitHub에 공개됐다.

초기 연구는 Qwen과 Llama 계열의 DeepSeek 변형에 집중했지만, 저자들은 ChatGPT와 Gemini 같은 API 전용 모델을 포함해 비슷한 구조의 훨씬 넓은 추론 모델에서 나타날 가능성이 크다고 본다.

공개된 사고 사슬(CoT) 모델 수가 적기 때문에 이전 연구들도 이를 사용해 전체 모델군의 문제를 제시했다. LRM은 그대로 또는 약간 바꿔 반복하거나 모든 예산을 다 쓸 때까지 사례를 끝없이 열거해 막대한 디코딩 예산을 낭비한다. GPQA-Diamond에 답할 때 DeepSeek-R1-Distill이 생성한 토큰의 55% 이상이 의미적 가치를 더하지 않는 워드 샐러드로 표시됐다.

GPQA-Diamond 응답에서 의미적으로 중복된 토큰의 비율

WordSaladChopper는 시험한 모든 DeepSeek-R1-Distill 모델에서 중복 토큰 비율을 55% 이상에서 6% 미만으로 줄였다. 출처

답 품질을 유지하면서 추론을 줄이는 ‘long-to-short’(L2S)은 중요한 연구 분야가 되었다. 이 프로젝트는 비슷한 목표를 갖지만 학습 개입, 모델 편집, 기본 아키텍처 변경이 필요 없는 최초의 임시 실행형 해결책이다. 낮은 부담, 큰 절감, 중복 토큰의 무의미성을 고려하면 사용자 경험을 중시하는 모든 LRM 애플리케이션에 필수 구성 요소가 되어야 한다고 저자들은 주장한다.

논문 제목은 Word Salad Chopper: Reasoning Models Waste A Ton Of Decoding Budget On Useless Repetitions, Self-Knowingly이며 University of Minnesota, Rice University, Stevens Institute of Technology, Lambda의 연구자 여섯 명이 참여했다.

사전 검토

추론 LLM의 반복 성향을 추적하기 위해 출력에서 빈 줄이 두 번 나오는 지점마다 청크로 나누고, 각 청크가 이전 청크와 얼마나 비슷한지 검사했다.

두 디코딩 온도에서 워드 샐러드로 표시된 추론 청크 비율

분류기는 이전 출력과 매우 유사한 청크를 진행이 아닌 반복으로 판단한다. 이런 행동은 데이터셋과 모델 크기에 관계없이 널리 나타났다.

청크가 지나치게 비슷하면 쓸모없는 반복인 워드 샐러드로 표시했다. 모델이 이 모드에 들어가면 외부 도움 없이 빠져나올 가능성이 매우 낮고, 사용자의 디코딩 예산이 소진될 때까지 비싼 루프에 머문다.

이상적으로 짧아야 할 사고 구간이 쓸모없는 반복으로 최대화되므로 사용자에게 재앙적이다. 사용자는 가장 긴 지연을 견디면서, 틀렸을 가능성이 높은 답에 최대 비용을 지불한다.

절단 지점 전후의 워드 샐러드 청크 비율

대부분의 반복은 반복 출력이 지배하기 시작하는 절단 지점 이후 발생한다. 일단 루프에 들어가면 개입 없이 거의 회복하지 못한다.

저자들은 추론 LLM이 자신이 워드 샐러드 상태에 빠졌다는 사실을 인식하는 징후를 보인다는 점에 놀랐다고 설명한다. 하지만 바로 이 인식과 그것이 모델의 추론 상태에 나타나는 방식 덕분에 개입 시스템을 만들 수 있다.

이 선형 분류기는 매우 가볍기 때문에 실시간 감지가 가능하며, 워드 샐러드 루프에 갇힌 모델을 해결하기 위해 여러 연산으로 효과적으로 개입할 수 있다.

방법

추론 중 워드 샐러드를 감지하기 위해 저자들은 각 이중 줄바꿈 토큰의 은닉 상태에서 작동하는 간단한 선형 분류기를 학습했다.

모델이 반복 루프에 들어간 뒤 나타나는 모든 청크를 워드 샐러드로 처리했으며, 이 경계인 절단 지점을 학습 데이터의 라벨로 사용했다. S1 벤치마크로 추론 궤적 1,000개를 생성하고 각 궤적을 줄바꿈 기준 청크로 나눴다.

WordSaladChopper의 개념도

WordSaladChopper의 개념도. 생성 중 각 이중 줄바꿈 토큰의 은닉 상태를 분석해 반복 구간을 감지한다. 워드 샐러드 청크가 두 번 연속 표시되면 생성을 중단하고 고정된 재생성 프롬프트를 추가해, 예산을 넘기지 않으면서 답을 계속 완성하게 한다.

어떤 청크가 앞선 청크와 매우 비슷하면 워드 샐러드로 표시했다. 지속적인 반복이 처음 시작된 지점을 찾은 뒤에는 이런 루프가 계속되는 특성을 반영해 이후 모든 청크에도 같은 라벨을 부여했다.

분류기는 하나의 완전 연결 계층으로 구현하고 마지막 트랜스포머 블록에서 각 청크의 마지막 토큰이 가진 은닉 상태를 학습했다. 모델마다 별도 분류기를 학습했으며 평가 중에는 파인튜닝을 하지 않았다.

데이터와 시험

학습과 추론에는 NVIDIA A100 GPU 4대(각 80GB VRAM)를 사용했다. Adam 옵티마이저, 1×10-2의 학습률, 50 에포크로 실행했다.

평가 데이터셋은 초등 수학 8,000문제인 GSM8K, MATH-500, GPQA-DIAMOND, AIME25(2025)였다.

시험 모델은 DeepSeek-R1-Distill-Qwen-1.5B, DeepSeek-R1-Distill-Qwen-7B, DeepSeek-R1-Distill-Llama-8B였으며 모두 MIT 라이선스로 제공된다.

평가 지표로는 정확도와 AUROC를 사용했다.

Qwen-7B 워드 샐러드 분류기의 정확도와 AUROC

네 벤치마크와 두 디코딩 온도에서 측정한 Qwen-7B 워드 샐러드 분류기의 정확도와 AUROC. 높은 점수는 마지막 줄바꿈 토큰의 은닉 상태만으로 반복의 시작을 안정적으로 감지할 수 있음을 보여 준다.

저자들은 이 결과에 대해 선형 분류기가 워드 샐러드 청크를 매우 정확하게 감지하며, 아래 표는 재생성 프롬프트가 단순 절단으로 잃은 과제 정확도를 회복하는 데 도움이 된다고 설명한다.

원본, 절단, 재생성 조건에서 Qwen-7B의 정확도

온도 τ=0.6에서 각 벤치마크별 Qwen-7B 정확도. 워드 샐러드 전 원본, 절단 후, 재생성 적용 후 성능을 비교한다. 재생성의 향상 폭은 크지 않지만 일관되며 대부분의 경우 루프 이전 성능을 회복한다.

아래 결과에서 WordSaladChopper는 정확도를 높이거나 유지하면서 모델 출력 길이를 최대 57%까지 크게 줄였다.

그리디 디코딩에서 WordSaladChopper의 출력 길이와 정확도

그리디 디코딩(τ=0)에서 WordSaladChopper는 정확도를 유지하거나 소폭 높이면서 출력 길이를 때로 절반 이상 줄였다. 이 성능은 모델과 과제 전반에서 일관됐다. 이 설정에서 결과가 예상대로 불안정한 AIME25는 제외했다.

가장 큰 이득은 긴 답, 특히 GPQA-Diamond에서 나타났으며 성능 저하 없이 텍스트의 거의 절반을 제거했다. 생성 과정에 무작위성을 추가한 경우에도 아래와 같이 비슷한 결과가 나왔다.

높은 온도에서 WordSaladChopper의 출력 길이와 정확도

더 높은 온도(τ=0.6)에서도 WordSaladChopper는 모든 모델과 벤치마크에서 정확도를 유지하거나 소폭 높이면서 출력을 10~30% 줄였다. 분산을 줄이기 위해 AIME25 결과는 평균을 사용했다.

이 경우에도 더 짧은 출력으로 정확도를 안정적으로 유지했다. 모델의 답이 더 반복적으로 변해도 시스템은 계속 작동했다. 분류기는 문장마다 토큰 하나만 확인하므로 실시간 생성 중에도 매우 빠르다고 저자들은 설명한다.

향후 연구에서는 개입 뒤 모델에 작은 재생성 예산을 주는 방식, 재생성 과정 전체에 WordSaladChopper와 같은 시스템을 계속 적용하는 방식, 모델에 ‘사고 종료’ 토큰을 강제로 넣어 현재 가능한 최선의 답을 요구하는 방식이 도움이 될 수 있다.

마지막으로 연구진은 현재 최고 수준의 추론 모델 평가 방식에 개선할 여지가 많다고 비판한다.

많은 효율적 추론 기법이 효과적으로 보이는 이유 중 하나는 현재 추론 평가 벤치마크에 개선할 여지가 매우 크기 때문이라는 것이 우리의 솔직한 판단이다.

앞으로 더 포괄적인 평가 도구 모음이 개발되면, 많은 효율적 추론 기법이 실패하거나 기본 LRM과 매우 다르게 작동하는 모습을 보게 될 것으로 예상한다.

결론

ChatGPT 같은 선도 시스템의 규모에서는 사용자 한 명당 자원 소비가 조금만 달라져도 인프라, 운영, 비용에 큰 영향을 미칠 수 있다. 따라서 효율성은 제공업체와 연구 공동체 모두의 우선 과제다.

논문이 제안한 가벼운 새 시스템은 새로운 모델 아키텍처마다 별도로 학습해야 하지만, 구현된다면 무의미한 토큰 소모를 막을 수 있다. 이런 낭비는 고객에게 업체가 할당량을 방만하거나 기만적으로 소진한다는 인상을 줄 수 있다. 실제로 업체에도 중복 출력보다 유용한 출력을 제공하는 편이 낫다. 두 출력의 계산 비용은 같기 때문이다.

 

* 이 문제는 여기서 자세히 다루지 않지만 기업용과 취미용을 포함한 로컬 호스팅 모델에도 적용된다. 워드 샐러드가 유발하는 전력 및 생산성 손실도 고려할 요소다.

† 강조 표시는 모두 원저자의 것이며 필자의 강조가 아니다. 가능한 경우 원문의 인라인 인용은 하이퍼링크로 바꿨다.

†† 프레임워크와 API가 질의별 ‘하위 예산’을 배정할 수 있어 하나의 질의가 하루치 토큰을 반드시 모두 소진하는 것은 아니다. 그러나 이는 일반적인 관행이 아니며 API 전용 제공업체가 흔히 설명하는 내용도 아니다.

††† ‘LRM’은 아직 널리 쓰이는 약어가 아니므로 필자는 저자들의 용법을 일반적으로 채택하지 않고 필요에 따라 다른 표현을 사용했다.

2025년 11월 6일 목요일 최초 게시

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai