AI-modeller og plattformer
AWS åpner GPT-5.6-tilgang på Amazon Bedrock fra australske regioner

Amazon Web Services kunngjorde 2. september 2026 at team i Australia nå kan få tilgang til OpenAI sine GPT-5.6-modeller på Amazon Bedrock, og kalle på Sol-, Terra- og Luna-varianter fra Asia‑Pacific (Sydney) og Asia‑Pacific (Melbourne)-regionene via global kryss‑region‑inference.
Under avtalen kaller en applikasjon Amazon Bedrock Runtime-endepunktet i Sydney eller Melbourne, og Bedrock ruter forespørselen til en støttet kommersiell AWS‑region for behandling. AWS oppgir at dette gir australske kunder tilgang til et bredere kapasitetsbasseng uten at applikasjoner må håndtere ruting til destinasjonsregionen. Tre globale inferensprofiler dekker modellene: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra og global.openai.gpt-5.6-luna. Sydney har regionkoden ap-southeast-2 og Melbourne ap-southeast-4.
De tre GPT-5.6‑variantene
AWS beskrev de tre variantene som å betjene ulike arbeidsbelastningsprofiler. Ifølge innlegget i AWS Machine Learning‑bloggen er GPT-5.6 Sol egnet for krevende resonnering, koding og agent‑baserte arbeidsbelastninger; Terra balanserer ytelse og kostnad for daglig produksjonsbruk; og Luna gir rask og rimelig inferens for høyvolum‑ og latensfølsomme applikasjoner. Alle tre aksepterer tekst‑ og bilde‑innganger, genererer tekst og støtter kontekstvinduer på opptil 1 million token.
Fra de to australske regionene kan utviklere kalle modellene via tre tilgangsstier på Bedrock Runtime‑endepunktet: OpenAI Responses‑API, OpenAI Chat Completions‑API og Amazon Bedrock Converse‑API. De OpenAI‑kompatible API‑ene kalles på endepunktets /openai/v1‑stier i stedet for gjennom AWS‑SDK‑er, og endepunktet godtar enten AWS Signature Version 4‑signering eller en Amazon Bedrock‑modell‑inferens‑API‑nøkkel.
Prompt‑caching er tilgjengelig for GPT-5.6 via de støttede API‑ene i to moduser. Implisitt caching er aktivert som standard uten kodeendringer, mens eksplisitt caching lar utviklere definere gjenbrukbart prefiks, cache‑grense og cache‑nøkkel. AWS bemerket at profilmedlemskap og modelltilgjengelighet kan endres, og henviste kunder til sin dokumentasjon for kryss‑region‑inferens for å verifisere konfigurasjoner før utrulling.
Codex‑integrasjon og OIDC‑autentisering
OpenAI sin Codex‑kodeagent kan bruke de samme globale inferensprofilene via Bedrock Runtime‑modelltilbyderen som er innebygd i den nyeste Codex‑CLI‑en. AWS oppga at de validerte konfigurasjonen med codex-cli 0.149.1 som kjører GPT-5.6 Sol fra Sydney.
For organisasjoner som federerer identitet via Okta, Auth0, Microsoft Entra ID, Amazon Cognito eller AWS IAM Identity Center, tilbyr AWS et eksempel‑credential‑helper som bytter en OpenID‑Connect‑token mot midlertidige AWS‑legitimasjoner. Codex leser deretter disse legitimasjonene gjennom den standard AWS‑credential‑kjeden, og forespørsler signeres med SigV4, slik at ingen API‑nøkkel er involvert i inferens‑stien. Når profilen støttes av IAM Identity Center, er legitimasjonene allerede kort‑varige og roteres med enkelt‑på‑logg‑økten.
Forutsetninger for australske utrullinger inkluderer en AWS‑konto med Sydney eller Melbourne aktivert som kilde‑region, en IAM‑rolle eller -bruker med tillatelser til å kalle GPT-5.6‑inferensprofilene, samt Python 3.9 eller nyere med pakkene openai, boto3 og aws‑bedrock‑token‑generator installert. Organisasjoner som bruker service control‑policyer må verifisere at deres policy tillater GPT-5.6‑globale inferensprofiler i den valgte kilde‑regionen. Administratorer kan bekrefte aktive profiler via AWS‑CLI eller Amazon Bedrock‑konsollens visning av inferensprofiler.
Kvote, overvåking og logging
GPT-5.6‑on‑demand‑kvoter måles i forespørsler per minutt og token per minutt, med token‑forbruk som bestemmer hvordan hver forespørsel bruker token‑kvoten. For GPT-5.6 teller inngangs‑token og cache‑skriv‑inngangs‑token én‑til‑én, mens hver utgangs‑token bruker 10 token fra kvoten, ifølge AWS. Kvoter gjennomgås og økes via Service Quotas‑konsollen i kilde‑regionen applikasjonen bruker, og AWS rådet kunder til å be om økninger tidlig, overvåke utnyttelse og teste representative prompt‑er, streaming‑adferd, samtidighet og topp‑trafikk før produksjonsutrulling.
Siden GPT-5.6‑forespørsler bruker Bedrock Runtime‑API‑et, vises kall gjort via de globale inferensprofilene i modell‑invokasjons‑loggingen på samme måte som andre on‑demand‑forespørsler, med poster som inkluderer inferensprofil‑ID og invokasjonsmetadata. Codex eksporterer målinger via OpenTelemetry‑protokollen, og CloudWatch Coding Agent Insights tilbyr et dashbord for denne telemetrien, som dekker token‑bruk, API‑forespørsler, aktive brukere, samtaleaktivitet og cache‑treffrate.
AWS tilbyr to konfigurasjonsveier for dashbordet: en bearer‑token‑tilnærming som bruker en CloudWatch‑metrics‑API‑nøkkel, og en bedriftsutrulling der en lokal collector signerer eksporten med SigV4 ved hjelp av utviklerens federerte legitimasjoner. AWS klassifiserer metrics‑API‑nøkkelen som en langsiktig legitimasjon og anbefaler den kun der kort‑varige legitimasjoner ikke er mulige. Bedriftsveien er det anbefalte alternativet for organisasjoner som federerer utvikleridentitet via bedrifts‑single‑sign‑on, opplyser AWS.












