AI 모델 및 플랫폼

AWS, 호주 지역에서 Amazon Bedrock을 통한 GPT-5.6 접근 권한 제공

mm
Unite.AI를 Google의 선호 소스에 추가

Amazon Web Services는 2026년 9월 2일, 호주 팀이 이제 Amazon Bedrock에서 OpenAI의 GPT-5.6 모델에 접근할 수 있으며, 아시아 태평양(시드니) 및 아시아 태평양(멜버른) 리전에서 Sol, Terra, Luna 변형을 전역 교차 리전 추론을 통해 호출할 수 있다고 발표했습니다.

이 구성에 따라 애플리케이션은 시드니 또는 멜버른에 있는 Amazon Bedrock Runtime 엔드포인트를 호출하고, Bedrock은 요청을 지원되는 상업용 AWS 리전으로 라우팅하여 처리합니다. AWS는 이를 통해 호주 고객이 대상 리전 라우팅을 관리할 필요 없이 더 넓은 용량 풀에 접근할 수 있게 된다고 밝혔습니다. 세 가지 전역 추론 프로파일이 모델을 포괄합니다: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, 및 global.openai.gpt-5.6-luna. 시드니 리전 코드는 ap-southeast-2이며 멜버른은 ap-southeast-4입니다.

세 가지 GPT-5.6 변형

AWS는 세 변형이 서로 다른 워크로드 프로파일을 지원한다고 설명했습니다. AWS Machine Learning Blog post에 따르면, GPT-5.6 Sol은 복잡한 추론, 코딩, 에이전트 워크로드에 적합하고; Terra는 일상적인 프로덕션 사용을 위한 성능과 비용의 균형을 맞추며; Luna는 대용량 및 지연 민감 애플리케이션을 위한 빠르고 저렴한 추론을 제공합니다. 세 변형 모두 텍스트와 이미지 입력을 받아 텍스트를 생성하며, 최대 100만 토큰의 컨텍스트 윈도우를 지원합니다.

두 개의 호주 리전에서 개발자는 Bedrock Runtime 엔드포인트를 통해 세 가지 접근 경로로 모델을 호출할 수 있습니다: OpenAI Responses API, OpenAI Chat Completions API, 그리고 Amazon Bedrock Converse API. OpenAI 호환 API는 AWS SDK가 아니라 엔드포인트의 /openai/v1 경로를 통해 호출되며, 엔드포인트는 AWS Signature Version 4 서명 또는 Amazon Bedrock 모델 추론 API 키 중 하나를 허용합니다.

프롬프트 캐싱은 지원되는 API를 통해 두 가지 모드로 GPT-5.6에 사용할 수 있습니다. 암시적 캐싱은 기본적으로 코드 변경 없이 활성화되며, 명시적 캐싱은 개발자가 재사용 가능한 프리픽스, 캐시 경계 및 캐시 키를 정의하도록 합니다. AWS는 프로파일 멤버십 및 모델 가용성이 변동될 수 있음을 언급했으며, 배포 전에 구성을 확인하기 위해 cross-Region inference support documentation을 참조하도록 고객에게 안내했습니다.

Codex 통합 및 OIDC 인증

OpenAI의 Codex 코딩 에이전트는 최신 Codex CLI에 내장된 Bedrock Runtime 모델 제공자를 통해 동일한 전역 추론 프로파일을 사용할 수 있습니다. AWS는 시드니에서 GPT-5.6 Sol을 실행하는 codex-cli 0.149.1으로 구성을 검증했다고 밝혔습니다.

Okta, Auth0, Microsoft Entra ID, Amazon Cognito 또는 AWS IAM Identity Center를 통해 신원을 연동하는 조직을 위해, AWS는 OpenID Connect 토큰을 임시 AWS 자격 증명으로 교환하는 샘플 자격 증명 도우미를 제공합니다. 이후 Codex는 표준 AWS 자격 증명 체인을 통해 해당 자격 증명을 읽으며, 요청은 SigV4로 서명되어 추론 경로에 API 키가 포함되지 않습니다. 프로파일이 IAM Identity Center에 의해 지원되는 경우, 자격 증명은 이미 단기이며 싱글 사인온 세션과 함께 회전됩니다.

호주 배포를 위해서는 시드니 또는 멜버른을 소스 리전으로 활성화한 AWS 계정, GPT-5.6 추론 프로파일을 호출할 수 있는 IAM 역할 또는 사용자, 그리고 openai, boto3, aws-bedrock-token-generator 패키지가 설치된 Python 3.9 이상이 필요합니다. 서비스 제어 정책을 사용하는 조직은 선택한 소스 리전에서 GPT-5.6 전역 추론 프로파일을 허용하도록 정책을 확인해야 합니다. 관리자는 AWS CLI 또는 Amazon Bedrock 콘솔의 추론 프로파일 뷰를 통해 활성 프로파일을 확인할 수 있습니다.

쿼터, 모니터링 및 로깅

GPT-5.6 온디맨드 쿼터는 분당 요청 수와 토큰 수로 측정되며, 토큰 소모량이 각 요청이 토큰 쿼터를 어떻게 소비하는지를 결정합니다. GPT-5.6의 경우 입력 토큰과 캐시 쓰기 입력 토큰은 1:1 비율로 계산되지만, 각 출력 토큰은 쿼터에서 10 토큰을 차감합니다. 쿼터는 애플리케이션이 사용하는 소스 리전의 Service Quotas 콘솔을 통해 검토 및 증액할 수 있으며, AWS는 고객에게 증액을 조기에 요청하고, 사용량을 모니터링하며, 프로덕션 배포 전에 대표 프롬프트, 스트리밍 동작, 동시성 및 피크 트래픽을 테스트할 것을 권고했습니다.

GPT-5.6 요청은 Bedrock Runtime API를 사용하므로, 전역 추론 프로파일을 통해 이루어진 호출은 다른 온디맨드 요청과 마찬가지로 모델 호출 로그에 기록되며, 기록에는 추론 프로파일 ID와 호출 메타데이터가 포함됩니다. Codex는 OpenTelemetry 프로토콜을 통해 메트릭을 내보내며, CloudWatch Coding Agent Insights는 해당 텔레메트리를 위한 대시보드를 제공하여 토큰 사용량, API 요청, 활성 사용자, 대화 활동 및 캐시 적중률을 보여줍니다.

AWS는 대시보드 구성을 위해 두 가지 경로를 제공합니다: CloudWatch 메트릭스 API 키를 사용하는 베어러 토큰 방식, 그리고 로컬 컬렉터가 개발자의 연합 자격 증명을 사용해 SigV4로 내보내기를 서명하는 엔터프라이즈 롤아웃 방식입니다. AWS는 메트릭스 API 키를 장기 자격 증명으로 분류하고 단기 자격 증명이 불가능한 경우에만 사용을 권장합니다. 엔터프라이즈 경로는 개발자 신원을 기업 싱글 사인온을 통해 연동하는 조직에 권장되는 옵션이라고 AWS는 말했습니다.

테오 내쉬유나이트.AI의 AI 생성 전문가로, AI 인프라, 컴퓨팅, 및 현대적인 인공 지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드를 위한 기술적 기초에 중점을 두고 있으며, 데이터 센터, 가속기, 네트워킹, 및 이를 연결하는 소프트웨어 스택을 포함합니다.
분석적이고 엔지니어링 중심의 관점에서 테오 내쉬는 GPU, 커스텀 실리콘, 메모리 아키텍처, 및 분산 시스템의 발전에 따라 새로운 세대의 AI 모델이 어떻게 가능해지는지 조사합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성, 및 실제로 AI 인프라를 배치하는 실질적인 제약에 특별한 주의를 기울입니다.
테오 내쉬가 작성한 기사들은 AI로 생성되어 유나이트.AI의 편집 팀에 의해 검토되어 기술적 정확성, 명확성, 및 급변하는 AI 컴퓨팅 환경에 대한 책임 있는 보도를 보장합니다.