Anderson의 관점

새로운 연구 논문: AI 채팅의 ‘토큰’ 가격 책정에 대한疑問

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGpT-40 + Adobe Firefly

새로운 연구에 따르면, AI 서비스가 토큰 단위로 청구하는 방식은 실제 비용을 사용자로부터 숨긴다. 제공업체는 사용자가 볼 수 없는 방식으로 토큰 수를 부풀리거나 숨겨진 단계를 삽입할 수 있다. 일부 시스템은 출력에 영향을 미치지 않는 추가 프로세스를 실행하지만 여전히 청구서에 나타난다. 감사 도구가 제안되었지만, 실제 감독 없이 사용자는 자신이 인식하지 못하는 비용을 지불하게 된다.

 

거의 모든 경우에, 우리는 AI 기반 채팅 인터페이스, 예를 들어 ChatGPT-4o를 사용할 때, 현재는 토큰 단위로 측정된다. 이러한 토큰은 사용 중에는 보이지 않지만 청구 목적으로는 정확하게 계산된다. 그러나 사용자는 직접 토큰 수를 확인할 수 있는 방법이 없다.

토큰 기반 청구는 제공업체 전체에서 표준적인 접근법이 되었으며, 이는 신뢰의 가정에 기반한다. 그러나 이 가정은 불안정할 수 있다.

토큰 단어

토큰은 단어와 유사하지만, 대부분의 제공업체는 작은 텍스트 단위, 즉 단어, 구두점, 단어 조각 등을 설명하기 위해 ‘토큰’이라는 용어를 사용한다. 예를 들어, 단어 ‘믿을 수 없다’는 하나의 토큰으로 계산될 수 있지만, 다른 시스템에서는 믿, , 로 분할되어 비용이 증가할 수 있다.

이 시스템은 사용자가 입력한 텍스트와 모델의 응답 모두에 적용되며, 가격은 이러한 단위의 총 수에 기반한다.

문제는 사용자가 이过程를 볼 수 없다는 것이다. 대부분의 인터페이스는 대화 중에 토큰 수를 표시하지 않으며, 토큰이 계산되는 방식은 재현하기 어렵다. 심지어 응답 후에 토큰 수를 표시하더라도, 그것이 공정한지 여부를 알 수 없다. 이것은 사용자가 지불하는 것과 실제로 받는 것 사이에 불일치를 생성한다.

최근 연구는 더 심각한 문제를 지적한다. 한 연구는 제공업체가 규칙을 위반하지 않고도 토큰 수를 부풀릴 수 있는 방법을 보여준다. 또 다른 연구는 인터페이스가 표시하는 것과 실제 청구되는 것 사이의 불일치를 보여주며, 사용자는 효율성의 환상을 경험할 수 있다. 세 번째 연구는 모델이 내부적으로 생성하는 단계는 사용자에게 표시되지 않지만 청구서에 나타날 수 있음을 보여준다.

이 연구 결과는 정확한 숫자로 인해 명확성이 보이는 시스템을 나타낸다. 그러나 이 시스템의 내부 논리는 숨겨져 있다. 이것이 의도적인지 구조적인 결함인지 여부와 상관없이, 결과는 같다. 사용자는 자신이 볼 수 있는 것보다 더 많은 것을 지불하며, 종종 예상보다 더 많은 것을 지불한다.

더 저렴한 도전?

첫 번째 논문 – Max Planck Institute for Software Systems의 네 명의 연구자에 의해 작성된 당신의 LLM이 당신에게 과금하고 있습니까? 토큰화, 투명성, 및 동기 -는 토큰 기반 청구의 위험은 불투명성에만 국한되지 않는다고 주장한다. 제공업체는 토큰 수를 부풀릴 수 있는 내부적인 동기를 가지고 있다.

‘문제의 핵심은 토큰화가 고유하지 않다는 사실에 있다. 예를 들어, 사용자가 “다음 NeurIPS는 어디에서 열릴까?”라는 프롬프트를 제출하면, 제공업체는 이를 LLM에 입력하고, 모델은 “샌디에고”라는 출력을 생성한다. 이 출력은 두 개의 토큰으로 구성될 수 있다.’

‘그러나 제공업체는 토큰화된 출력을 사용자에게 보고하지 않고, 대신 “S”, “a”, “n”, “D”, “i”, “e”, “g”, “o”라는 9개의 토큰으로 보고할 수 있다.这样하면 사용자는 2개의 토큰 대신 9개의 토큰에 대한 비용을 지불하게 된다!’

이 논문은 이러한 계산을 수행할 수 있는 휴리스틱을 제시하며, LLaMA, Mistral, Gemma 시리즈의 모델에서 테스트하여 측정 가능한 과금을 달성했다.

토큰 인플레이션을 사용한 '합리적인 보고' 각 패널은 400개의 LMSYS 프롬프트에 대한 출력에서 제공업체가 알고리즘 1을 적용하여 발생하는 과과금 토큰의 百分比를 보여준다. 모든 출력은 1.3의 온도에서 생성되었으며, 90%의 신뢰 구간을 계산하기 위해 각 설정당 5회 반복되었다. 출처: https://arxiv.org/pdf/2505.21627

토큰 인플레이션을 사용한 ‘합리적인 보고’ 각 패널은 400개의 LMSYS 프롬프트에 대한 출력에서 제공업체가 알고리즘 1을 적용하여 발생하는 과과금 토큰의 百分比를 보여준다. 출처: https://arxiv.org/pdf/2505.21627

이 문제를 해결하기 위해 연구자들은 문자 수에 기반한 청구를 제안하며, 이는 제공업체가 사용량을 정직하게 보고하도록 동기를 부여하는唯一한 접근법이라고 주장한다. 문자 기반 청구는 제공업체가 더 짧고 효율적인 출력을 생성하도록 동기를 부여할 것이다.

그러나 여기에는 몇 가지 추가적인 고려 사항이 있다. 첫째, 문자 기반 체계는 제공업체가 더 짧은 출력을 생성하도록 동기를 부여할 수 있지만, 이는 또한 제공업체가 더 짧은 출력을 생성하기 위해 비용을 절감하도록 동기를 부여할 수 있다. 둘째, 제공업체는 이 새로운 체계로 전환하기 위해 입법적 조치를 필요로 할 수 있다. 셋째, 이러한 알고리즘은 자신의 비용을 지불할 수 있다.

스위치

두 번째 논문 – Maryland UniversityBerkeley의 연구자들에 의해 작성된 보이지 않는 토큰, 보이는 청구서: 불투명한 LLM 서비스의 숨겨진 작업에 대한 긴급한 감사 필요성 -는 상업적인 언어 모델 API의 비정렬된 동기는 토큰 분할에만 국한되지 않는다. 내부 모델 호출, 추측적 추론, 도구 사용, 다중 에이전트 상호작용 등이 모두 사용자에게 보이지 않는 채로 청구될 수 있다.

이러한 내부 작업은 사용자에게 보이지 않지만, 청구서에는 나타난다. 제공업체는 이러한 작업을 숨기고, 사용자는 그에 대한 비용을 지불한다.

주요 제공업체의 가격과 투명성. 모든 서비스는 사용자에게 보이지 않는 내부 추론 토큰에 대해 사용자를 청구하며, هیچ 서비스도 런타임 시 이러한 토큰을 표시하지 않는다. 비용은 크게 다르며, OpenAI의 o1-pro 모델은 Claude Opus 4 또는 Gemini 2.5 Pro와 같은 다른 모델보다 1백만 토큰당 10배 더 비싼 청구를 한다.

주요 제공업체의 가격과 투명성. 모든 서비스는 사용자에게 보이지 않는 내부 추론 토큰에 대해 사용자를 청구하며, هیچ 서비스도 런타임 시 이러한 토큰을 표시하지 않는다. 출처: https://www.arxiv.org/pdf/2505.18471

대부분의 청구는 사용자에게 보이지 않는 채로 진행되며, 사용자는 실제로 수행된 작업과 청구된 작업이 일치하는지 여부를 확인할 수 없다.

이 논문은 두 가지 형태의 조작을 식별한다. 첫째, 수량 인플레이션은 토큰이나 호출의 수를 사용자에게ประโยชน이 없는 채로 증가시키는 것이다. 둘째, 품질 하락은 사용자에게 낮은 성능의 모델이나 도구를 제공하는 것이다.

‘추론 LLM API에서 제공업체는 동일한 모델 패밀리의 여러 변형을 유지하며, 용량, 훈련 데이터 또는 최적화 전략에 따라 다를 수 있다(예: ChatGPT o1, o3). 모델 다운그레이드는 더 낮은 비용의 모델을 사용자에게 제공하는 것을 의미하며, 이는 사용자가 예상하는 서비스 품질과 실제 서비스 품질 사이에 불일치를 초래할 수 있다.’

‘예를 들어, 프롬프트는 더 작은 크기의 모델로 처리될 수 있지만, 청구는 동일하게 유지된다. 이는 사용자가 실제로 수행된 작업의 관련성이나 정당성을 평가할 수 없는 경우에 발생한다.’

이 논문은 사용자에게 표시되지 않는 토큰이 90% 이상인 경우를 문서화하며, 내부 추론이 토큰 사용량을 20배 이상 증가시킬 수 있다.

보이지 않는 것을 세다

마지막 논문 – Maryland University의 10명의 연구자에 의해 작성된 CoIn: 상업적 불투명한 LLM API의 보이지 않는 추론 토큰을 세다 -는 청구 문제를 구조적인 문제로 재구성한다. 대부분의 상업적인 LLM 서비스는 중간 추론을 숨기고, 이는 청구서에 나타난다.

‘[이] 보이지 않음은 제공업체가 토큰 수를 잘못 보고하거나, 저렴한 가짜 추론 토큰을 삽입하여 토큰 수를 인위적으로 증가시킬 수 있다. 우리는 이를 토큰 수 인플레이션이라고 부른다.’

‘예를 들어, OpenAI의 o3 모델이 높은 효율성을 가진 ARC-AGI를 실행하여 111백만 토큰을 소비하고, 66,772.3달러의 비용을 발생시킨 경우, 이러한 정보 비대칭은 AI 회사들이 사용자를 상당히 과금할 수 있도록 한다.’

이 논문은 CoIn이라고 하는 제3자 감사 시스템을 제안하며, 이는 숨겨진 토큰을 검증할 수 있다.

상업적 불투명한 LLM에 대한 CoIn 감사 시스템 개요. 패널 A는 토큰 수를 확인하기 위해 토큰 임베딩을 Merkle 트리로 해싱하는 방법을 보여준다. 패널 B는 가벼운 신경망이 추론 블록을 최종 답변과 비교하는 의미적 유효성 검사를示す다. 이러한 구성 요소는 제3자 감사가 숨겨진 토큰 인플레이션을 감지할 수 있도록 하며, 동시에 모델 동작의 기밀성을 유지한다.

상업적 불투명한 LLM에 대한 CoIn 감사 시스템 개요. 출처: https://arxiv.org/pdf/2505.13778

이 시스템은 토큰 수를 암호학적으로 확인하고, 숨겨진 내용의 관련성을 평가한다. 이를 통해 감사가 토큰 인플레이션을 감지할 수 있다.

결론

스크립트 기반 통화(예: CivitAI의 “buzz” 시스템)는 사용자가 실제로 지불하는 금액이나 구매하는 상품에 대해 사용자를 분리시킨다. 제공업체가自己的 측정 단위를 정의할 수 있도록 하는 것도 사용자가 실제로 지불하는 금액에 대해 모호하게 한다.

예를 들어, 라스베이거스의 카지노에는 시계가 없다. 이러한 조치는 사용자를 비용에 대해 무감각하게 만들기 위한 것이다.

토큰은 사용자에게 보이지 않는 채로 소비되고 정의될 수 있기 때문에, LLM 소비를 측정하는 적절한 단위는 아니다. 특히, 토큰은 영어以外의 언어로 계산하는 경우 더 많은 토큰을 소비할 수 있다.

그러나 문자 기반 출력은 더 긴 언어를 처벌하고, 더 짧은 언어를 선호할 것이다. 시각적인 표시, 즉 토큰 카운터가 감소하는 것은 우리가 LLM 세션에서 더 낭비적이게 만들 수 있지만, 이러한 유용한 GUI 추가는 곧 나타날 가능성이 낮다.

 

* 저자 강조. 저자의 인라인 인용을 하이퍼링크로 변환.

최초로 2025년 5월 29일에 게시.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai