Anderson의 관점

예의 없는 질의는 기업용 ChatGPT 비용을 증가시킬 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

ChatGPT는 예의 없는 질의에 더 많은 토큰을 사용하여 응답하며, 이는 기업의 비용을 증가시킬 수 있습니다. 그러나 ‘제발’이라는 단어를 사용하면 비용을 줄일 수 있습니다.

 

예의는 아무런 비용도 들지 않는다고 합니다. 그러나 예의 없는 질의는 얼마나 많은 비용이 들까요? 미국의 새로운 연구에 따르면, ChatGPT에 대한 예의 없는 질의는 응답의 비용을 증가시킵니다. 아이오와 대학교의 새로운 논문은 예의 없는 질의가 동일한 응답을 생성하는 경우에도 더 많은 토큰을 사용한다는 것을 발견했습니다.

연구자들은 다음과 같이 말합니다:

‘GPT4의 출력 토큰 가격은 1M 출력 토큰당 $12입니다. 우리는 예의 없는 프롬프트가 평균적으로 14개 이상의 추가 토큰을 생성하는 것을 발견했으며, 이는 평균적으로 프롬프트당 $0.000168의 추가 비용을 발생시킵니다. OpenAI의 API에 대한 평균 일일 질의는 22억 개를 초과합니다.’

‘모든 프롬프트가 예의 있는 경우와 비교하여 예의 없는 프롬프트는 하루에 추가로 $369K의 수익을 생성합니다. 이는 예의 없는 프롬프트가 생성하는 추가 토큰으로 인해 발생하는 결과입니다.’

이 결과는 자체적으로 интерес롭지만, 연구자들은 이 예기치 않은 행동이 인간/AI 구성의 다양한 아직 알려지지 않은 특이성의 지표일 수 있다고 강조합니다. 예의 없는 질의가 고객에게 추가 토큰을 생성하여 비용을 증가시키는 이유에 대해 연구자들은 추측하지 않습니다.

이 현상을 검증하기 위해, 연구자들은 실제 ChatGPT 프롬프트를 예의 있는 경우와 예의 없는 경우로 다시 작성했습니다. 두 버전의 프롬프트는 GPT-4-Turbo 모델에 제출되었으며, 응답에서 사용된 토큰의 수를 측정했습니다.

이번 년초에 Sam Altman은 ChatGPT에 대한 예의가 OpenAI에 수십만 달러의 비용을 발생시킨다고 주장했습니다. 같은 기간에 발표된 연구에서는 예의가 더好的 답변을 얻는 데 도움이 되지 않는다는 것을 나타냈습니다.

새로운 논문의 결론이 올바르다면, 기업의 ChatGPT 사용자들은 2025년에 예의 없는 질의를 사용한 경우보다 예의 있는 질의를 사용한 경우보다 더 많은 비용을 지불했을 것입니다.

연구자들은 하나의 가능한 해결책으로 응답에 대한 토큰 제한을 설정하는 것을 제안합니다. 그러나 이 접근법은 LLM 시스템에서 쉽게 구현할 수 없습니다. 연구자들은 프롬프트가 비용 제어를 위한 약한 도구라는 것을 관찰합니다. LLM은 명시적인 길이 지시를 따라야 하는데, 대부분의 경우 이러한 지시를 따르지 않습니다.

테스트

원래 프롬프트 각각은 예의 있는 경우와 예의 없는 경우로 다시 작성되어 동일한 GPT-4-Turbo 모델에 제출되었습니다. 각 버전의 응답에서 사용된 토큰의 수를 측정했습니다.

온도를 일정하게 유지하여 임의의 변동을 방지했습니다. 프롬프트 쌍은 다시 작성하여 입력을 5개 토큰 이내로 변경했습니다. 이를 통해 연구된 효과가 톤에서 비롯된 것입니다.

첫 번째 테스트의 주요 결과는 예의 있는 프롬프트가 평균적으로 14.426개의 토큰을 줄였다는 것입니다.

탄력성

예의의 효과가 다양한 유형의 프롬프트에 걸쳐 변하는지 평가하기 위해, 각 프롬프트는 미리 정의된 작업 범주 중 하나에 할당되었습니다: 정보 검색; 텍스트 생성; 편집 및 다시 작성; 분류; 요약; 기술 작업.

각 프롬프트는 작업 설명의 임베딩과 비교하여 all-MiniLM-L6-v2 Sentence Transformers 모델을 사용하여 작업 레이블을 할당했습니다.

코사인 유사도 점수를 계산하여 각 프롬프트와 작업 정의 사이에서, 가장 높은 유사도를 가진 레이블을 할당했습니다.

작업 유형은 회귀분석에서 제어 변수로 사용되었습니다. 예의의 효과가 프롬프트 범주에 따라 달라지는지 테스트했습니다. 또한 작업과 처리 사이의 상호 작용 항을 도입하여 차별적인 효과를 확인했습니다.

두 경우 모두, 예의 있는 프롬프트가 일관되게 더 짧은 출력을 생성했습니다. 작업 유형에 따른 유의한 변동은 발견되지 않았습니다.

중지 단어

더 짧은 출력에서 줄어든 내용의 유형을 이해하기 위해, 가장 자주 삭제되는 단어를 조사했습니다. 이러한 단어는 일반적으로 ‘have’, ‘more’, ‘where’, ‘into’와 같은 중지 단어였습니다.

의미 있는 내용의 손실이 토큰 감소의 원인이 아니라는 것을 확인하기 위해, 중지 단어를 제거하고 4개 단어까지의 구를 분석했습니다. 그러나 일관된 또는 의미 있는 패턴은 발견되지 않았습니다.

인간 연구

출력 품질이 프롬프트 톤에 영향을 받는지 테스트하기 위해, 인간 평가를 수행했습니다. 20개의 예의 있는 프롬프트와 20개의 예의 없는 프롬프트를 무작위로 선택했습니다.

참가자들은 각 응답을 7점 척도에서 평가했습니다. 각 참가자는 하나의 응답만 보았으며, 이는 네 가지 조건 중 하나에서 나왔습니다: 예의 있는 경우 또는 예의 없는 경우, 원본 또는 대체 사실.

어떤 조건에서도 품질에 대한 유의한 차이는 발견되지 않았습니다. 예의 있는 출력과 예의 없는 출력은 거의 동일한 점수를 받았습니다.

연구자들은 이러한 결과가 토큰 출력의 감소가 품질의 손실로 인한 것이 아니라, 다시 작성이나 구조적인 변화로 인한 것임을 나타낸다고 주장합니다.

결론

새로운 연구는 기업용 ChatGPT 사용에 중점을 두고 있습니다. 그러나 하위 티어 사용자도 이 현상에 영향을 받습니다. ChatGPT에 대한 예의 없는 질의는 평균 사용자의 일일 토큰 할당을 더 빠르게 소모시킵니다.

새로운 연구는 인간/AI 상호작용에서 많이 연구된 열린 질문에 중점을 두고 있습니다. 그러나 연구자들은 예의의 문제가 아직 발견되지 않은 언어적 특이성의 더 깊은 가능성의 지표일 수 있다고 강조합니다.

 

2025년 11월 19일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai