Anderson의 관점

예의 없는 질의는 기업용 ChatGPT 비용을 증가시킬 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

질의는 얼마나 많은 비용이 들까요? 미국의 새로운 연구에 따르면, ChatGPT에 대한 예의

 

ChatGPT는 예의 없는 질의에 더 많은 토큰을 사용하여 응답하며, 이는 기업의 비용을 증가시킬 수 있습니다. 그러나 ‘제발’이라는 단어를 사용하면 비용을 줄일 수 있습니다. 예의는 아무런 비용도 들지 않는다고 합니다. 그러나 예의 없는

없는 질의는 응답의 비용을 증가시킵니다. 아이오와 대학교의 새로운 논문은 예의 없는 질의가 동일한 응답을 생성하는 경우에도 더 많은 토큰을 사용한다는 것을 발견했습니다. 연구자들은 다음과 같이

그 자체로 흥미롭지만, 연구원들은 이러한 예상치 못한 행동이 인간/AI 조합의 아직 알려지지 않은 다양한 특이성을 나타내는 지표일 수 있다고 강조합니다. 무례한 질의

말합니다: ‘GPT4의 출력 토큰 가격은 1M 출력 토큰당 $12입니다. 우리는 예의 없는 프롬프트가 평균적으로 14개 이상의 추가 토큰을 생성하는 것을 발견했으며, 이는 평균적으로 프롬프트당 $0.000168의 추가 비용을 발생시킵니다. OpenAI의 API에 대한 평균 일일 질의는 22억 개를 초과합니다.’ 이 결과는 고객에게추가 토큰을 생성하여 비용을 증가시키는 이유에 대해 연구자들은 추측하지 않습니다. ‘모든 프롬프트가 예의 있는 경우와 비교하여 예의 없는 프롬프트는 하루에 추가로 $369K의 수익을 생성합니다. 이는 예의 없는 프롬프트가 생성하는 추가 토큰으로 인해 발생하는 결과입니다.’ 이 현상을 검증하기 위해, 예의가 연구자들은 실제 ChatGPT 프롬프트를 예의 있는 경우와 예의 없는 경우로 다시 작성했습니다. 두 버전의 프롬프트는 GPT-4-Turbo 모델에 제출되었으며, 응답에서 사용된 토큰의 수를 측정했습니다. 이번 년초에 Sam Altman은 ChatGPT에 대한 예의가 OpenAI에 수십만 달러의 비용을 발생시킨다고 주장했습니다.같은 기간에 발표된 연구에서는 더好的 답변을 얻는데 도움이 되지 않는다는 것을 나타냈습니다. 새로운 논문의 결론이 올바르다면, 기업의 ChatGPT 사용자들은 2025년에 예의 없는 질의를 사용한 경우보다 예의 있는 질의를 LLM 사용한 경우보다 더 많은 비용을 지불했을 것입니다. 연구자들은 하나의 가능한 해결책으로 응답에 대한 토큰 제한을 설정하는 것을 제안합니다. 그러나 이 접근법은

시스템에서 쉽게 구현할 수 없습니다. 연구자들은

프롬프트가 비용 제어를 위한 약한 도구라는 것을 관찰합니다. LLM은 명시적인

길이 지시를 지시를 따르지 않습니다.따라야 하는데, 대부분의 경우 이러한

테스트

원래 프롬프트 각각은 예의 있는 경우와

WildChat 프로젝트 지원 사이트에서 ChatGPT 상호 작용의 검색 가능한 예를 확인하세요. 출처: https://wildvisualizer.com/ 예의 없는 경우로

다시 작성되어 동일한 GPT-4-Turbo 모델에 제출되었습니다. 각 버전의 응답에서 사용된 토큰의 수를 측정했습니다. 온도 를 일정하게 유지하여 임의의 변동을 방지했습니다. 프롬프트 쌍은 다시 작성하여 입력을 5개 토큰 이내로 변경했습니다. 이를 통해 연구된 효과가 톤에서 비롯된 것입니다. 첫 번째 테스트의 주요 결과는 예의 있는 프롬프트가 평균적으로

예의바르고 무례한 프롬프트가 의미론적 의미를 유지하면서 반사실적인 버전으로 변환된 방법의 예입니다. 14.426개의 토큰을 줄였다는 것입니다.

탄력성

예의의 효과가 다양한 유형의 프롬프트에 걸쳐 변하는지 평가하기 위해, 각 프롬프트는 미리 정의된 작업 범주 중

하나에 할당되었습니다: 정보 검색; 텍스트 생성; 편집 및 다시 작성; 분류;

입력 토큰이 약간 더 많음에도 불구하고 정중한 프롬프트가 비정의적인 프롬프트보다 평균적으로 더 적은 출력 토큰을 생성했음을 보여주는 요약 통계입니다. 요약; 기술 작업. 각 프롬프트는 작업

설명의 임베딩과 비교하여 all-MiniLM-L6-v2 Sentence Transformers 모델을

생성된 출력 길이(토큰)에 대한 폴라이트 프롬프트 형식의 효과를 간략하게 설명하는 추정 결과입니다. 사용하여 작업 레이블을 할당했습니다.

코사인 유사도 점수를 계산하여 각 프롬프트와 정의작업 사이에서, 가장

공손함의 유형에 따른 추정 결과입니다. 높은 유사도를

가진 레이블을 할당했습니다. 작업 유형은 회귀분석에서제어 변수로 사용되었습니다. 예의의 효과가 프롬프트 범주에 따라 달라지는지 테스트했습니다. 또한 작업과 처리 사이의 확인했습니다. 상호 작용 항을 도입하여 차별적인 효과를 두 경우 모두, 예의 있는 프롬프트가 일관되게 더 짧은 출력을 생성했습니다. 작업 유형에

LIWC로 재분류될 때 이진 레이블과 연속 점수 모두로 공손함을 통해 토큰 절약이 가능합니다. 따른 유의한 변동은 발견되지 않았습니다.

중지 단어

더 짧은 출력에서 줄어든 내용의 유형을 이해하기 위해, 조사했습니다.가장 자주 삭제되는 단어를 이러한

단어는 일반적으로 ‘have’, ‘more’, ‘where’, ‘into’와 같은 중지 단어였습니다. 의미 있는 내용의 손실이 토큰 감소의 원인이 아니라는

회귀 분석 결과는 정중 프롬프트가 모든 작업 유형에 걸쳐 출력 길이를 줄였으며 중요한 상호 작용 효과가 없음을 보여줍니다. 것을 확인하기 위해,

중지 단어를 제거하고 4개 단어까지의 구를 분석했습니다. 그러나 일관된또는 의미 있는 패턴은 발견되지 않았습니다.

중지 단어

더 짧은 출력에서 줄어든 내용의 유형을 이해하기 위해, 가장 자주 삭제되는 단어를 조사했습니다. 이러한 단어는 일반적으로 ‘have’, ‘more’, ‘where’, ‘into’와 같은 중지 단어였습니다. 의미 있는 내용의 손실이 토큰 감소의 원인이 아니라는 것을 확인하기 위해, 중지 단어를 제거하고 4개 단어까지의 구를 분석했습니다. 그러나 일관된 또는 의미 있는 패턴은 발견되지 않았습니다.

인간 연구

출력 품질이 프롬프트 톤에 영향을 받는지 테스트하기 위해, 인간 평가를 수행했습니다. 20개의 예의 있는 네 프롬프트와 20개의 예의 없는 프롬프트를 무작위로 선택했습니다. 참가자들은 각 응답을 7점 척도에서 평가했습니다. 각 참가자는 하나의 응답만 보았으며, 이는 가지 중 하나에서조건 나왔습니다: 원본예의 있는 경우 또는 예의 없는 경우, 또는 대체 사실. 어떤 조건에서도 품질에 대한 유의한 차이는 발견되지 않았습니다. 예의 있는 출력과 예의 없는 출력은 거의 동일한 점수를 받았습니다. 연구자들은 이러한 결과가 토큰 출력의 감소가 품질의 손실로 인한 것이 아니라, 다시 작성이나 구조적인 변화로 인한 것임을 나타낸다고 주장합니다.

결론

새로운 연구는 기업용 ChatGPT 사용에 중점을 두고 있습니다. 그러나 하위 티어 사용자도 이 현상에 영향을 받습니다. ChatGPT에 대한 예의 없는 질의는 평균 사용자의 일일 토큰 할당을 더 빠르게 소모시킵니다. 새로운 연구는 인간/AI 상호작용에서 많이 연구된 열린 질문에 중점을 두고 있습니다. 그러나 연구자들은 예의의 문제가 아직 발견되지 않은 언어적 특이성의 더 깊은 가능성의 지표일 수 있다고 강조합니다. 2025년 11월

 

19일 처음 게시되었습니다.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai