AI 模型与平台

AWS 在澳大利亚地区通过 Amazon Bedrock 开放 GPT-5.6 访问

mm
将 Unite.AI 添加到您在 Google 上的首选来源

亚马逊网络服务于2026年9月2日表示,澳大利亚的团队现在可以通过 Amazon Bedrock 访问 OpenAI 的 GPT-5.6 模型,并可在亚太(悉尼)和亚太(墨尔本)地区通过全球跨区域推理调用 Sol、Terra 和 Luna 变体。

根据该安排,应用程序调用位于悉尼或墨尔本的 Amazon Bedrock Runtime 端点,Bedrock 会将请求路由到受支持的商业 AWS 区域进行处理。AWS 表示,这使得澳大利亚客户能够访问更大的容量池,而无需应用程序自行管理目标区域的路由。三个全局推理配置文件覆盖这些模型:global.openai.gpt-5.6-sol、global.openai.gpt-5.6-terra 和 global.openai.gpt-5.6-luna。悉尼的区域代码为 ap-southeast-2,墨尔本为 ap-southeast-4。

三种 GPT-5.6 变体

AWS 将这三种变体描述为针对不同工作负载配置文件。根据 AWS Machine Learning Blog post,GPT-5.6 Sol 适用于要求严格的推理、编码和代理工作负载;Terra 在性能与成本之间取得平衡,适合日常生产使用;Luna 则为高吞吐量和对延迟敏感的应用提供快速且经济的推理。三者均支持文本和图像输入,生成文本,并支持最高达 100 万 token 的上下文窗口。

在这两个澳大利亚区域,开发者可以通过 Bedrock Runtime 端点的三条访问路径调用模型:OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API。兼容 OpenAI 的 API 通过端点的 /openai/v1 路径调用,而不是通过 AWS SDK,端点接受 AWS Signature Version 4 签名或 Amazon Bedrock 模型推理 API 密钥。

GPT-5.6 通过受支持的 API 提供提示缓存功能,分为两种模式。默认情况下启用隐式缓存,无需代码更改;显式缓存则允许开发者定义可重用的前缀、缓存边界和缓存键。AWS 指出,配置文件成员资格和模型可用性可能会变化,并引导客户查阅其跨区域推理支持文档,以在部署前验证配置。

Codex 集成与 OIDC 身份验证

OpenAI 的 Codex 编码代理可以通过最新 Codex CLI 中内置的 Bedrock Runtime 模型提供程序,使用相同的全局推理配置文件。AWS 表示已使用在悉尼运行 GPT-5.6 Sol 的 codex-cli 0.149.1 验证了该配置。

对于通过 Okta、Auth0、Microsoft Entra ID、Amazon Cognito 或 AWS IAM Identity Center 联合身份的组织,AWS 提供了一个示例凭证助手,可将 OpenID Connect 令牌交换为临时 AWS 凭证。随后 Codex 通过标准的 AWS 凭证链读取这些凭证,请求使用 SigV4 签名,因此推理路径中不涉及 API 密钥。当配置文件由 IAM Identity Center 支持时,凭证已是短期的,并随单点登录会话轮换。

在澳大利亚部署的前提条件包括:拥有已在悉尼或墨尔本启用为源区域的 AWS 账户、具备调用 GPT-5.6 推理配置文件权限的 IAM 角色或用户,以及已安装 openai、boto3 和 aws-bedrock-token-generator 包的 Python 3.9 或更高版本。使用服务控制策略的组织需确认其策略允许在所选源区域使用 GPT-5.6 全局推理配置文件。管理员可通过 AWS CLI 或 Amazon Bedrock 控制台的推理配置文件视图确认已激活的配置文件。

配额、监控与日志记录

GPT-5.6 按需配额以每分钟请求数和每分钟 token 数计量,token 消耗速率决定每个请求如何使用配额。根据 AWS 的说明,GPT-5.6 的输入 token 与缓存写入输入 token 按 1:1 计数,而每个输出 token 会消耗配额中的 10 个 token。配额可通过应用所在源区域的 Service Quotas 控制台进行审查和提升,AWS 建议客户提前申请提升、监控使用情况,并在正式上线前测试代表性提示、流式行为、并发性和峰值流量。

由于 GPT-5.6 请求使用 Bedrock Runtime API,通过全局推理配置文件发出的调用会像其他按需请求一样出现在模型调用日志中,记录中包含推理配置文件 ID 和调用元数据。Codex 通过 OpenTelemetry 协议导出指标,CloudWatch Coding Agent Insights 提供相应的仪表盘,涵盖 token 使用情况、API 请求、活跃用户、对话活动以及缓存命中率。

AWS 为仪表盘提供了两种配置路径:一种是使用 CloudWatch 指标 API 密钥的 Bearer Token 方式,另一种是企业级部署,即本地收集器使用开发者的联合凭证通过 SigV4 对导出进行签名。AWS 将指标 API 密钥归类为长期凭证,并建议仅在短期凭证不可行的情况下使用。AWS 表示,企业路径是通过企业单点登录联合开发者身份的组织的推荐方案。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。