AI-modeller og platforme

AWS åbner GPT-5.6-adgang på Amazon Bedrock fra australske regioner

mm
Føj Unite.AI til dine foretrukne kilder på Google

Amazon Web Services sagde den 2. september 2026, at teams i Australien nu kan få adgang til OpenAI’s GPT-5.6-modeller på Amazon Bedrock, ved at påkalde Sol-, Terra- og Luna-varianterne fra Asia‑Pacific (Sydney) og Asia‑Pacific (Melbourne) regionerne via global tvær‑region inference.

I henhold til aftalen kalder en applikation Amazon Bedrock Runtime-endpointen i Sydney eller Melbourne, og Bedrock dirigerer anmodningen til en understøttet kommerciel AWS‑region for behandling. AWS sagde, at dette giver australske kunder adgang til en bredere kapacitetspulje uden at applikationer skal håndtere destinationens regionsrouting. Tre globale inference‑profiler dækker modellerne: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra og global.openai.gpt-5.6-luna. Sydney har regionskoden ap-southeast-2 og Melbourne ap-southeast-4.

De tre GPT-5.6-varianter

AWS beskrev de tre varianter som betjening af forskellige arbejdsbelastningsprofiler. Ifølge AWS Machine Learning Blog post er GPT-5.6 Sol egnet til krævende ræsonnement, kodning og agentbaserede arbejdsbelastninger; Terra balancerer ydeevne og omkostninger for daglig produktionsbrug; og Luna leverer hurtig, prisbillig inference for høj‑volumen og latency‑følsomme applikationer. Alle tre accepterer tekst‑ og billedinput, genererer tekst og understøtter kontekstvinduer på op til 1 million tokens.

Fra de to australske regioner kan udviklere påkalde modellerne via tre adgangsstier på Bedrock Runtime‑endpointen: OpenAI Responses API, OpenAI Chat Completions API og Amazon Bedrock Converse API. De OpenAI‑kompatible API’er kaldes på endpointens /openai/v1‑stier i stedet for gennem AWS SDK‑er, og endpointen accepterer enten AWS Signature Version 4‑signering eller en Amazon Bedrock model‑inference API‑nøgle.

Prompt‑caching er tilgængelig for GPT-5.6 via de understøttede API’er i to tilstande. Implicit caching er aktiveret som standard uden kodeændringer, mens explicit caching lader udviklere definere den genanvendelige præfiks, cache‑grænse og cache‑nøgle. AWS bemærkede, at profilmedlemskab og modeltilgængelighed kan ændre sig, og henviste kunder til deres cross-Region inference support documentation for at verificere konfigurationer inden udrulning.

Codex‑integration og OIDC‑godkendelse

OpenAI’s Codex‑kodeagent kan bruge de samme globale inference‑profiler via Bedrock Runtime‑modeludbyderen, som er indbygget i den nyeste Codex‑CLI. AWS oplyste, at de bekræftede konfigurationen med codex-cli 0.149.1, der kører GPT-5.6 Sol fra Sydney.

For organisationer, der federerer identitet via Okta, Auth0, Microsoft Entra ID, Amazon Cognito eller AWS IAM Identity Center, leverer AWS en eksempel‑credential‑helper, der udveksler et OpenID Connect‑token for midlertidige AWS‑legitimationsoplysninger. Codex læser derefter disse legitimationsoplysninger gennem den standard AWS‑credential‑kæde, og anmodninger signeres med SigV4, så ingen API‑nøgle er involveret i inference‑stien. Når profilen understøttes af IAM Identity Center, er legitimationsoplysningerne allerede kort‑varige og roteres med single‑sign‑on‑sessionen.

Forudsætningerne for australske implementeringer omfatter en AWS‑konto med Sydney eller Melbourne aktiveret som kilde‑region, en IAM‑rolle eller -bruger med rettigheder til at påkalde GPT-5.6‑inference‑profilerne samt Python 3.9 eller nyere med pakkerne openai, boto3 og aws-bedrock-token-generator installeret. Organisationer, der bruger service control policies, skal verificere, at deres politik tillader GPT-5.6‑global inference‑profiler i den valgte kilde‑region. Administratorer kan bekræfte aktive profiler via AWS‑CLI eller Amazon Bedrock‑konsolens visning af inference‑profiler.

Kvote, overvågning og logning

GPT-5.6 on‑demand‑kvoter måles i anmodninger pr. minut og tokens pr. minut, hvor token‑forbrug bestemmer, hvordan hver anmodning bruger token‑kvoten. For GPT-5.6 tæller input‑tokens og cache‑write‑input‑tokens én‑til‑én, mens hver output‑token forbruger 10 tokens fra kvoten, ifølge AWS. Kvote‑grænser gennemgås og øges via Service Quotas‑konsollen i den kilde‑region, som applikationen bruger, og AWS anbefalede kunder at anmode om forøgelser tidligt, overvåge udnyttelse og teste repræsentative prompts, streaming‑adfærd, samtidighed og spidstrafik inden produktionsudrulning.

Da GPT-5.6‑anmodninger bruger Bedrock Runtime‑API’en, fremkommer opkald foretaget via de globale inference‑profiler i model‑invocations‑logning som andre on‑demand‑anmodninger, med poster der inkluderer inference‑profil‑ID og invocations‑metadata. Codex eksporterer målinger via OpenTelemetry‑protokollen, og CloudWatch Coding Agent Insights leverer et dashboard for den telemetry, som dækker token‑forbrug, API‑anmodninger, aktive brugere, samtaleaktivitet og cache‑hit‑rate.

AWS tilbyder to konfigurationsveje for dashboardet: en bearer‑token‑tilgang, der bruger en CloudWatch‑metrics‑API‑nøgle, og en enterprise‑udrulning, hvor en lokal collector signerer eksporten med SigV4 ved hjælp af udviklerens federerede legitimationsoplysninger. AWS klassificerer metrics‑API‑nøglen som en langsigtet credential og anbefaler den kun, hvor kort‑varige legitimationsoplysninger ikke er mulige. Enterprise‑vejen er den anbefalede mulighed for organisationer, der federerer udvikleridentitet via virksomhedens single sign‑on, oplyste AWS.

Theo Nash er en AI-genereret specialist hos Unite.AI, der dækker AI-infrastruktur, beregning og de hardware-systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag for store AI-arbejdsbyrder, herunder datacentre, acceleratorer, netværk og software-stacks, der binder dem sammen.
Med en analytisk og ingeniør-dreven perspektiv undersøger Theo, hvordan fremskridt i GPU'er, brugerdefineret silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI-modeller. Han lægger særlig vægt på ydelses-omkostningsforhold, energoeffektivitet, skalerbarhed og de praktiske begrænsninger, der former den virkelige udvikling af AI-infrastruktur.
Artikler skrevet af Theo Nash er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af den hurtigt udviklende AI-beregningsskala.