AI 모델 및 플랫폼
오픈AI, GPT-5.6의 두 가지 저렴한 티어의 API 가격 인하

오픈AI는 2026년 7월 30일, GPT-5.6 모델의 두 가지 저렴한 티어의 API 가격을 인하했다. 가장 저렴한 티어는 80% 인하되었고, 중간 티어는 20% 인하되었으며, 최고 티어의 가격은 변하지 않았다. 이 변경은 회사自己的 API 변경 로그에 기록되어 있으며, 이미 공개된 요금표에 반영되어 있다.
입력 및 출력 토큰당 표준 요금은 다음과 같다.
- GPT-5.6 Luna: 20 센트 및 $1.20, 이전에는 $1 및 $6
- GPT-5.6 Terra: $2 및 $12, 이전에는 $2.50 및 $15
- GPT-5.6 Sol: $5 및 $30, 변하지 않음, 이전 모델 GPT-5.5의 요금과 동일
세 가지 티어 모두 2026년 7월 9일에 일반적으로 उपलब성이 시작되었으며, 이는 가격 인하가 시작된 지 3주 후이다.
요금 인하는 표준 요금뿐만 아니라 모든 서비스 티어에 적용된다. 배치 및 플렉스 처리는 표준 가격의 절반으로, 루나의 경우 입력은 10 센트, 출력은 60 센트이다. 캐시된 입력 읽기는 90% 할인되어 루나의 경우 2 센트, 테라의 경우 20 센트이다. 긴 문맥 요청은 입력 가격의 2배, 출력 가격의 1.5배로 청구되며, 루나의 경우 40 센트 및 $1.80이다. 아마존을 통해 구매하는 경우, AWS에서 청구되며, 오픈AI는 이 가격이 자신의 가격과 다를 수 있다고 언급한다.
저렴한 티어는 높은 볼륨의 생산 트래픽이 있는 곳이다. 분류, 추출, 요청 라우팅, 초안 작성, 에이전트 루프 등이 여기서 발생한다. 5배의 가격 인하는 이러한 작업의 경제성을 크게 변경한다.
클라우드와의 비교
루나의 경우, 20 센트 및 $1.20의 가격으로, 앤트로픽의 가장 저렴한 모델인 하이쿠 4.5보다 5배 저렴하다. 테라의 경우, 새로운 가격은 클라우드 소네트 5의 예정된 가격보다 저렴하다. 최고 티어인 솔의 경우, 출력 가격은 오푸스 5보다 여전히 높다.
우선 처리가 빠른 모드로 변경
同じ 변경 로그 항목에서, 우선 처리가 빠른 모드로 변경되었다. 솔의 경우, 빠른 모드는 표준 속도의 2.5배로, 가격은 2배이다. 이 변경은 이전에 우선 처리를 사용하던 요청에도 자동으로 적용된다. 빠른 모드의 가격은 솔의 경우 $10 및 $60, 테라의 경우 $4 및 $24, 루나의 경우 40 센트 및 $2.40이다.
앤트로픽도 같은 제품을 같은 이름으로 판매하며, 같은 조건으로 제공한다. 두 회사의 요금표는 이제 지역 고정 추론에서도 일치한다. 오픈AI는 2026년 3월 5일 이후에 출시된 모델의 경우, 데이터 주거에 따라 10%의 추가 요금을 부과한다. 앤트로픽은 미국에서만 추론하는 경우, 표준 가격의 1.1배를 부과한다.
저렴한 티어의 가격 인하 이유
오픈AI는 가격 인하 전날, 기술적인 설명을 발표했다. 2026년 7월 29일, 5명의 기술 직원이 코덱스와 채트GPT 워크의 성능을 개선했다. 솔은 코덱스 내에서 생산용 GPU 커널을 다시 작성했으며, 이는 전체 비용을 20% 절감했다. 또한, 솔은 hundreds개의 실험을 통해, 추측적 디코딩_draft 모델을 개선했으며, 이는 토큰 생성 효율성을 15% 이상提高했다.
이러한 개선은 오픈AI自己的 스택에서 이루어졌다. 게시글은 “사용자와 고객에게 더广泛하게, 비용 효율적인 지능을 제공하기 위한 노력”을 강조했다. 다음날, 요금표가 변경되었다.
이러한 개선은 가격 인하와 같은 비용 중심이다. 오픈AI는 도구 출력을 기본적으로 10,000 토큰으로 제한하며, 모델에서 볼 수 있는 기록은 추가 전용으로 유지된다. 따라서, 에이전트 루프에서 같은 지시와 도구 정의를 반복적으로 보내는 경우, 캐시된 입력 읽기가 아닌 전체 입력 요금을 지불하는 경우가 줄어든다. 30회의 모델 요청이 있는 작업의 경우, 30회의 기회가 있다.
가격 인하는 추론 비용을 감소시키고, 더 많은 팀이 모델에 접근하는 동안 발생한다. 오픈AI自己的 연구에 따르면, 직원들은 채트GPT를 직책을超えて 사용하고 있다. 아마존의 엔지니어링 조직은 AI 비용 초과로 인해 AI 비용을 제한하기로 결정했다. 오픈AI는 2026년 7월 22일, API 조직과 프로젝트에 대한 하드 스펜드 한도를 제공하기 시작했으며, 관리자는 월간 한도를 설정할 수 있다. 이 한도는 추적된 비용이 이를 초과할 때 오류를 반환하기 시작한다.
루나를 사용하는 팀의 경우, 동일한 요청이 이제 이전의 5분의 1의 비용으로 청구되며, 대시보드에서 설정할 수 있는 한도도 있다. 솔의 가격은 변하지 않으므로, 오픈AI가 가족을 출시한 이후로 유지해온 라이브 결정은 유지된다. 즉, 각 요청에 필요한 티어를 결정한다. ning errors once tracked spend reaches it. For a team already routing bulk work to Luna, the same calls now cost a fifth of what they did, with a ceiling they can set in the dashboard. With Sol’s price unchanged, the live decision stays where OpenAI has put it since the family shipped: which tier each request requires.












