Anderson의 관점

AI 채팅 모델은 끝없는 잡담으로 비용을 증가시킬 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

人気 있는 AI 채팅 모델은 비밀리에 많은 양의 유료 토큰을 쓸모없는 잡담에浪費하고 있습니다. 영향을 받는 모델은 실제로 자신이 이것을 하고 있다는 것을 알고 있지만, 자신을 멈출 수 없습니다.

 

대규모 추론 모델 (LRMs)例如 ChatGPT-5와 Google Gemini는 추론에 더 많은 컴퓨팅 파워를 사용하기 때문에 더 많은 비용을 청구합니다. 시뮬레이션된 추론 프로세스는 더 오래 걸리고 더 많은 비용이 듭니다. 따라서 사용자는 그 ‘추가思考時間’에 대해 지불하게 됩니다.

그러나 최근에 최신의 LLM을 사용했다면, 토큰 할당이 문제를 해결하는 것보다 잡담과 쓸모없는 말에 쓰여진다는 것을 알 수 있습니다. 이것은 과도한 아첨, 길고 쓸모없는 답변 또는 ‘잡담’의 형태를 취할 수 있습니다.

자연스럽게, 우리는 우리의 LLM이 패배를 인정하거나, 대안 경로를 제안하거나, 명확성을 요청하는 것을 원할 것입니다. 그러나 이러한 종류의 AI가 답변을 모르는 것을 인정하는 것은 상당한 도전입니다.

한편, 무료 또는 저렴한 티어의 사용자는 토큰을 빠르게 소모할 수 있습니다. 왜냐하면 AI 자체가 말하기를 좋아하기 때문입니다. 이 경우, 말하는 것은 무료가 아닙니다.

말장난

위에서 언급한 ‘말장난’에 관하여, 새로운 학술 협력이 이유와 해결책을 제안하고 있습니다. 이유는 LLM이 추론 능력을 갖춘 경우 토큰을浪費할 수 있다는 것입니다. 해결책은 ‘Word Salad Chopper’라는 시스템을 제안하고 있습니다.

연구자들은 LLM의 출력을 newline으로 분할하여 각 chunk의 유사성을 확인했습니다. 너무 유사한 chunk는 ‘말장난’으로 표시되었습니다.

The 연구자들은 다음과 같이 말합니다.

‘우리는 이러한 토큰 중 상당 부분이 쓸모없는 반복이며, 우리는 이를 “말장난”이라고 부릅니다. 이는 디코딩 예산을 소모하지만, 의미적으로는 쓸모없습니다. 우리는 또한 이러한 반복을検出하기 위한 단순한 분류기를 개발했습니다.’

‘이 분류기는 hidden state를 분석하여 반복되는 chunk를検出할 수 있습니다. 한번検出되면, 우리는 모델의 출력을 중단하고, 새로운 프롬프트를追加하여 모델이 답변을 완료할 수 있도록 합니다.’

이 시스템은 공개되었습니다.

이전 고려 사항

연구자들은 LLM의 출력을 newline으로 분할하여 각 chunk의 유사성을 확인했습니다. 너무 유사한 chunk는 ‘말장난’으로 표시되었습니다.

추론 chunk의 word salad 비율. 분류기는 chunk가 이전 chunk와 유사한 경우, '말장난'으로 표시합니다.

추론 chunk의 word salad 비율. 분류기는 chunk가 이전 chunk와 유사한 경우, ‘말장난’으로 표시합니다.

chunk가 너무 유사한 경우, 그것은 ‘말장난’으로 표시되었습니다.

연구자들은 다음과 같이 말합니다.

‘이러한 반복은 사용자에게 큰 문제를 일으킵니다. 사용자는 쓸모없는 반복에 대해 지불해야 하며, 답변을 기다리는 동안 지연이 발생합니다.’

word salad chunk의 분포. 대부분의 반복은 chopping point 이후에 발생합니다.

word salad chunk의 분포. 대부분의 반복은 chopping point 이후에 발생합니다.

연구자들은 다음과 같이 말합니다.

‘분류기는 매우 빠르게 실행되며, live generation 중에 사용할 수 있습니다. 우리는 이러한 시스템이 추론 모델의 효율성을 개선하는 데 도움이 될 수 있다고 믿습니다.’

방법

연구자들은 단순한 분류기를 개발하여 hidden state를 분석하여 반복되는 chunk를検出했습니다.

분류기는 newline token의 hidden state를 분석하여 반복되는 chunk를検出했습니다.

WordSaladChopper의 개념적 schema. generation 중에, hidden state를 분석하여 반복되는 segment를検出합니다.

WordSaladChopper의 개념적 schema. generation 중에, hidden state를 분석하여 반복되는 segment를検出합니다.

chunk가 너무 유사한 경우, 그것은 ‘말장난’으로 표시되었습니다.

데이터 및 테스트

연구자들은 4개의 NVIDIA A100 (80G VRAM) GPU를 사용하여 Adam optimizer와 learning rate 1×10-2를 사용하여 50 epoch 동안 훈련했습니다.

평가 데이터셋은 ‘Grade School Math’ 8000, a.k.a., GSM8K; MATH-500; GPQA-DIAMOND; 및 AIME25 (2025)를 사용했습니다.

테스트된 모델은 DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; 및 DeepSeek-R1-Distill-Llama-8B를 사용했습니다.

결론

이 연구는 LLM의 효율성을 개선하는 데 도움이 될 수 있는 새로운 시스템을 제안합니다. 이 시스템은 반복되는 chunk를検出하여 모델의 출력을 중단하고, 새로운 프롬프트를追加하여 모델이 답변을 완료할 수 있도록 합니다.

이 시스템은 사용자에게 큰 문제를 일으키는 쓸모없는 반복을 줄일 수 있습니다. 우리는 이러한 시스템이 추론 모델의 효율성을 개선하는 데 도움이 될 수 있다고 믿습니다.

저자는 이 연구의 결과가 추론 모델의 효율성을 개선하는 데 도움이 될 수 있다고 믿습니다.

†† 이 연구는 LLM의 효율성을 개선하는 데 도움이 될 수 있는 새로운 시스템을 제안합니다.

††† 저자는 이 연구의 결과가 추론 모델의 효율성을 개선하는 데 도움이 될 수 있다고 믿습니다.

최초로 게시된 날짜는 2025년 11월 6일입니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]