사상 리더

대규모 AI의 숨겨진 비용

mm
Unite.AI를 Google의 선호 소스에 추가

2026년 6월 1일에 2026년 6월 1일, GitHub는 Copilot에 대한 고정 요금 “프리미엄 요청”을 영구적으로 중단하고 사용량 기반 AI 크레딧으로 교체했습니다. 새로운 모델에 따른 첫 청구서가 한 달 뒤에 도착했을 때, 일부 에이전트 사용자들은 준비되지 않은 청구서를 보았습니다: 한 개발자가 보고했다 가장 무거운 에이전트 워크플로의 월 비용이 $29에서 $750으로 급증했다고.

이는 2026년 동안 AI 툴링 시장 전반에 걸친 더 넓은 변화의 눈에 보이는 사례 중 하나였으며, 현재도 고정 요금을 지불하고 있는 조직들에게도 다가올 수 있습니다.

조직은 절감한 시간을 계산합니다. 그러나 많은 조직은 고정 요금이 보이지 않게 하는 비용, 즉 컨텍스트 사용량과 실패 후 재시도를 계산하지 않습니다. 출력 검토와 프롬프트 유지에 소요되는 시간 등 다른 비용은 공급업체 청구서에 전혀 나타나지 않습니다. 청구가 실제 사용량으로 전환되면, 비용 관리가 없는 조직은 Copilot의 새로운 모델이 일부 사용자들을 놀라게 했던 것과 같은 방식으로 놀라운 청구서를 받게 될 위험이 있습니다.

가격에 반영되지 않은 컨텍스트

AI는 당연히 컨텍스트가 필요합니다; 이것은 의문이 아닙니다. 문제는 전송되는 컨텍스트가 실제로 관련성이 있는지, 아니면 단지 편리하게 사용 가능한지 여부입니다. 전체 문서를 보내는 것이 모델에 정보를 제공하는 가장 빠른 방법이지만, 반드시 가장 저렴하거나 최선의 방법은 아닙니다.

2026년 5월, 스탠포드 디지털 이코노미 랩은 8개의 최첨단 모델에 걸친 에이전트 코딩 작업을 분석하고, 이러한 작업이 단순 코드 채팅보다 최대 천 배 더 많은 토큰을 소비한다는 것을 발견했습니다. 주요 원인은 모델 출력이 아니라 반복적으로 재전송되는 입력 컨텍스트입니다. 에이전트는 매 단계마다 전체 히스토리를 다시 읽습니다. 동일한 작업을 여러 번 실행하면 토큰 소비량이 최대 30배까지 변동합니다.

정확도는 컨텍스트 양에 따라 선형적으로 확장되지 않습니다. 보통 적당한 양에서 정점에 도달하고, 그 이후에는 가치를 추가하지 않고 비용만 증가시킵니다.

따라서 토큰 맹목성은 AI가 컨텍스트를 필요로 하지 않다는 문제가 아니라, 측정이 없으면 그 모든 컨텍스트가 실제로 필요한지 아무도 묻지 않는다는 사실에 관한 것입니다. 고정 요금 체제에서는 이 질문을 쉽게 무시할 수 있지만, 사용량 기반 청구에서는 비용의 일부가 됩니다.

실패에 두 번 비용을 지불할 때

에이전트 워크플로는 ROI 계산에 거의 나타나지 않는 또 다른 비용을 수반합니다. 각각 95% 확률로 올바르게 실행되는 10단계의 단순화된 체인을 상상해 보세요. 이는 충분히 신뢰할 만해 보이지만, 연속될 경우 그 체인은 전체 실행을 한 번도 오류 없이 통과할 확률이 약 60%에 불과하다.

모든 호출마다 누적된 컨텍스트를 다시 전송하는 워크플로에서는, 각 실패와 그에 따른 재시도가 단순히 반복 단계에 대한 비용만 발생시키는 것이 아니라, 이전에 전송된 모든 내용에 대해서도 다시 비용을 지불하게 됩니다.

첫 번째 에이전트 파이프라인을 구축할 때 거의 모든 사람이 겪는 흔한 고통입니다. 저도 직접 경험했습니다. 초기에는 몇 개의 에이전트만 있었기에 큰 문제가 아니었지만, 파이프라인이 커지면서 실패한 실행마다 비용이 증가했고, 이 때문에 각 에이전트가 어떤 컨텍스트를 필요로 하는지, 그리고 이를 어떻게 캐시할지에 대해 고민하게 되었습니다. 단순히 실행이 성공했는지 여부만 보는 것이 아니라 말이죠.

동일한 분석에 따르면, 단계당 95% 신뢰성을 가진 10단계 에이전트는 완벽히 신뢰되는 시스템에 비해 재시도 시 약 40% 더 많은 토큰을 소비합니다. 이는 청구서에 나타나는 비용이지만, ROI 스프레드시트에는 거의 포함되지 않을 것입니다.

감시는 버그가 아니라 예산에 포함되어야 합니다

이 점은 정확히 짚어야 합니다. 잘못 이해하기 쉽기 때문입니다. AI 출력 검토는 시스템 오류가 아니라 AI와 작업할 때 기대되는 정당한 과정이며, 개발자와 작업할 때 코드 리뷰가 정당한 과정인 것과 같습니다. 문제는 출력이 검토된다는 것이 아니라, 이 작업이 AI가 실제로 절감한 비용 계산에 거의 반영되지 않는다는 점입니다.

Glean의 Work AI Institute는 6,000명의 근로자를 조사한 결과, 자동화가 주당 약 11시간을 절감하지만, 그 중 거의 6시간 반이 유지보수 작업에 사용된다: AI 시스템에 컨텍스트 제공, 작업 검토, 오류 정리 등. 따라서 순절감량은 약 4시간 반에 불과해 헤드라인 수치의 절반 이하입니다. AI는 여전히 시간을 절감하지만, 처음 제시된 수치만큼은 아닙니다.

프롬프트는 유지보수가 필요하며, 단순히 작성자만은 아니다

프롬프트는 오늘날 프로덕션 코드와 더 유사하게 동작합니다: 모델 업데이트, 컨텍스트 변경 또는 사소한 편집이라도 성능에 영향을 줄 수 있습니다. 버전 관리와 테스트가 없으면 이러한 변경이 조용히 문제를 일으킬 수 있습니다. 코드에 대한 회귀 테스트가 표준인 반면, 프롬프트 검증에서는 종종 생략됩니다. 단일 문장의 사소한 편집처럼 보이는 변경이 프로덕션에 적용되어 정확도가 감소하고, 문제가 눈에 보이게 누적될 때까지 아무도 인지하지 못합니다.

적절한 평가 프레임워크를 구축하는 것—테스트 세트와 모든 변경에 대한 자동 회귀 테스트를 포함—은 “AI가 시간을 절감한다”는 계산에 거의 반영되지 않는 추가 작업입니다.

저렴한 토큰, 높은 청구서

GitHub Copilot도 예외는 아니었습니다. CFO Dive가 인용한 설문조사에 따르면 미국 기업 10곳 중 거의 7곳이 최소 부분적인 AI 예산 초과를 보고했습니다 지난 1년 동안, 대부분은 사용량 기반 청구로 완전 전환하기 전이었으며, 전환 후는 아니었습니다.

Bain & Company는 6월 토큰 경제 분석에서 전체 상황을 가장 잘 포착하는 역설을 추가합니다: 토큰당 가격이 1년 동안 절반으로 떨어졌지만, 같은 기간 동안 소비는 4.5배 증가했습니다.

모델은 더 저렴해졌지만, 청구서는 여전히 완고하게 높게 유지됩니다. 기업들은 최신 모델로 전환하고, 에이전트에게 더 복잡한 작업을 부여하며, 그들을 위한 워크플로를 더 많이 찾았습니다. 토큰이 저렴해졌다고 해서 지출이 줄어든 것은 아니며, 오히려 소비할 이유가 더 많아졌다는 의미였습니다.

청구서가 도착하기 전에 준비하는 방법

이후 제시되는 프레임워크는 AI 사용량을 줄이는 것이 아니라, AI 비용을 파악한 뒤에 추가 확장을 결정하는 것에 관한 것입니다.

  1. 우선 가시성을 확보하세요

팀, 워크플로별로 소비가 세분화될 때까지, 애플리케이션 및 완료된 작업별로, 모든 확장은 맹목적인 도박입니다. 그 가시성도 무료가 아닙니다: 특히 에이전트 기반 워크플로의 경우, 각 단계를 추적하고, 무슨 일이 일었는지와 이유를 기록하며, 무한 루프를 모니터링하는 데 자체적인 엔지니어링 시간과 도구가 필요합니다. 이를 AI 운영 비용의 일부로 예산에 포함시키고, 사후에 추가 비용으로 생각하지 마세요.

  1. 순수 기준으로 ROI를 재계산하세요

보고된 절감 시간에서 검토, 수정 및 프롬프트 유지보수에 소요된 시간을 차감하십시오. 시간 절감이 사용 사례의 목적이며 순 결과가 부정적이거나 검증할 수 없으면, 확장할 준비가 되지 않은 것입니다. 대신 의도된 이점이 품질, 용량, 위험 감소 또는 수익이라면, 그 결과를 직접 측정하십시오.

  1. 비용 절제를 적용하되, 일괄적으로는 하지 마세요

실패 비용이 낮은 경우, 예를 들어 내부 도구, 실험용 에이전트, 개발 환경에서는 강력한 지출 한도가 타당합니다. 그러나 고객에게 직접 제공되는 핵심 기능—예를 들어 고객 서비스 어시스턴트—의 경우, 강제 한도는 작동하지 않으며, 서비스 중단 위험을 초래합니다. 이 경우, 저렴한 모델로 단계적 대체와 사전 경고 알림이 필요하며, 완전 차단은 적절하지 않습니다.

  1. 프롬프트와 평가를 엔지니어링 자산으로 다루세요

배포 전에 버전 관리하고, 테스트하며, 변경 사항을 검토하십시오. 이는 프로덕션 코드를 관리하는 방식과 동일합니다.

자신의 데이터를 가지고 갱신에 임하세요

벤더 가격은 자체 사용량 데이터 없이는 평가하기 어렵습니다. 갱신이나 모델 변경 전에, 기존 워크플로가 제안된 조건 하에서 어느 정도 비용이 드는지 계산하십시오. 목표는 단순히 낮은 가격을 협상하는 것이 아니라, 청구서에서 확인하는 대신 실제 소비 수준에서 그 가격이 어떻게 변동할지를 아는 것입니다.

이번 주에 할 수 있는 세 가지: AI 소비를 팀 및 워크플로별로 세분화할 수 있는지 확인하기; 하나의 사용 사례를 선택하고 검토에 소요된 시간을 보고된 절감 시간과 비교하기; 그리고 강력한 지출 한도가 비용을 통제하기보다 서비스 중단을 초래할 수 있는지를 파악하기.

AI 비용은 관리할 수 있습니다. 단, 처음 청구서에서 비용을 확인할 때는 그렇지 않다는 점을 기억하세요.

ズザナ・ドロタロバはアベンガのビジネス分析を担当し、チェコとスロバキアの企業プログラムで約100人のアナリストを監督しています。她は、AIを含む企業のイニシアチブが生産で機能するかどうかを決定する運用と意思決定構造に焦点を当てています。