AI-modeller och plattformar

AWS öppnar GPT-5.6‑åtkomst på Amazon Bedrock från australiensiska regioner

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Amazon Web Services meddelade den 2 september 2026 att team i Australien nu kan komma åt OpenAI:s GPT-5.6‑modeller på Amazon Bedrock, genom att anropa Sol‑, Terra‑ och Luna‑varianterna från regionerna Asien‑Stilla havet (Sydney) och Asien‑Stilla havet (Melbourne) via global kors‑region‑inferens.

Under arrangemanget anropar en applikation Amazon Bedrock Runtime-slutpunkten i Sydney eller Melbourne, och Bedrock dirigerar begäran till en stödd kommersiell AWS‑region för bearbetning. AWS säger att detta ger australiensiska kunder tillgång till en bredare kapacitetspool utan att applikationer behöver hantera routing till destinationsregionen. Tre globala inferensprofiler täcker modellerna: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra och global.openai.gpt-5.6-luna. Sydney har regionkoden ap-southeast-2 och Melbourne ap-southeast-4.

De tre GPT-5.6‑varianterna

AWS beskrev de tre varianterna som att de stödjer olika arbetsbelastningsprofiler. Enligt AWS Machine Learning Blog post är GPT-5.6 Sol lämpad för krävande resonemang, kodning och agentbaserade arbetsuppgifter; Terra balanserar prestanda och kostnad för daglig produktionsanvändning; och Luna erbjuder snabb, prisvärd inferens för högvolym‑ och latenskänsliga applikationer. Alla tre accepterar text‑ och bildinmatning, genererar text och stödjer kontextfönster på upp till 1 miljon token.

Från de två australiensiska regionerna kan utvecklare anropa modellerna via tre åtkomstvägar på Bedrock Runtime‑slutpunkten: OpenAI Responses‑API, OpenAI Chat Completions‑API och Amazon Bedrock Converse‑API. De OpenAI‑kompatibla API:erna anropas på slutpunktens /openai/v1‑vägar snarare än via AWS‑SDK:er, och slutpunkten accepterar antingen AWS Signature Version 4‑signering eller en Amazon Bedrock‑modell‑inferens‑API‑nyckel.

Prompt‑cachning är tillgänglig för GPT-5.6 via de stödda API:erna i två lägen. Implicit cachning är aktiverad som standard utan kodändringar, medan explicit cachning låter utvecklare definiera återanvändbart prefix, cachegräns och cache‑nyckel. AWS påpekade att profilmedlemskap och modelltillgänglighet kan förändras och hänvisade kunder till sin dokumentation för kors‑region‑inferens för att verifiera konfigurationer innan driftsättning.

Codex‑integration och OIDC‑autentisering

OpenAI:s Codex‑kodningsagent kan använda samma globala inferensprofiler via Bedrock Runtime‑modellleverantören som är inbyggd i den senaste Codex‑CLI:n. AWS uppgav att de validerade konfigurationen med codex-cli 0.149.1 som kör GPT-5.6 Sol från Sydney.

För organisationer som federerar identitet via Okta, Auth0, Microsoft Entra ID, Amazon Cognito eller AWS IAM Identity Center tillhandahåller AWS ett exempel‑credential‑helper som byter ett OpenID Connect‑token mot temporära AWS‑referenser. Codex läser sedan dessa referenser via den standardiserade AWS‑referenskedjan, och förfrågningarna signeras med SigV4, så ingen API‑nyckel är inblandad i inferensvägen. När profilen stöds av IAM Identity Center är referenserna redan kort‑livade och roterar med en‑sign‑on‑sessionen.

Förutsättningar för australiensiska distributioner inkluderar ett AWS‑konto med Sydney eller Melbourne aktiverade som källregion, en IAM‑roll eller -användare med behörighet att anropa GPT-5.6‑inferensprofilerna samt Python 3.9 eller senare med paketen openai, boto3 och aws‑bedrock‑token‑generator installerade. Organisationer som använder service control‑policys måste verifiera att deras policy tillåter GPT-5.6‑globala inferensprofiler i den valda källregionen. Administratörer kan bekräfta aktiva profiler via AWS‑CLI eller Amazon Bedrock‑konsolens vy för inferensprofiler.

Kvoter, övervakning och loggning

GPT-5.6‑on‑demand‑kvoter mäts i förfrågningar per minut och token per minut, där token‑förbrukning bestämmer hur varje förfrågan använder token‑kvoten. För GPT-5.6 räknas inmatningstoken och cache‑skrivningstoken en‑till‑en, medan varje utmatningstoken förbrukar 10 token från kvoten, enligt AWS. Kvoter granskas och ökas via Service Quotas‑konsolen i den källregion som applikationen använder, och AWS rekommenderade att kunder begär ökningar i förväg, övervakar användning och testar representativa prompts, streaming‑beteende, samtidighet och topptrafik innan produktionssättning.

Eftersom GPT-5.6‑förfrågningar använder Bedrock Runtime‑API:n visas anrop som görs via de globala inferensprofilerna i modell‑invokeringsloggning på samma sätt som andra on‑demand‑förfrågningar, med poster som inkluderar inferensprofil‑ID och anropsmetadata. Codex exporterar metrik via OpenTelemetry‑protokollet, och CloudWatch Coding Agent Insights tillhandahåller en instrumentpanel för den telemetriken, som täcker token‑användning, API‑förfrågningar, aktiva användare, konversationsaktivitet och cache‑träffprocent.

AWS erbjuder två konfigurationsvägar för instrumentpanelen: ett bärartoken‑förfarande med en CloudWatch‑metrik‑API‑nyckel, och en företagsutplacering där en lokal insamlare signerar exporten med SigV4 med utvecklarens federerade referenser. AWS klassificerar metrik‑API‑nyckeln som en lång‑siktig referens och rekommenderar den endast där kort‑livade referenser inte är möjliga. Företagsvägen är det rekommenderade alternativet för organisationer som federerar utvecklaridentitet via företagets en‑sign‑on, enligt AWS.

Theo Nash är en AI-genererad specialist på Unite.AI, som täcker AI-infrastruktur, beräkningar och de hårdvarusystem som driver modern konstgjord intelligens. Hans arbete fokuserar på de tekniska grunderna bakom storskaliga AI-arbetsbelastningar, inklusive datacenter, acceleratorer, nätverk och de programvarustackar som binder samman dem.
Med en analytisk och ingenjörsdriven perspektiv undersöker Theo hur framsteg inom GPU:er, anpassad kisel, minnesarkitekturer och distribuerade system möjliggör nya generationer av AI-modeller. Han ägnar särskild uppmärksamhet åt prestandaavvägningar, energoeffektivitet, skalbarhet och de praktiska begränsningarna som formar den verkliga distributionen av AI-infrastruktur.
Artiklar skrivna av Theo Nash är AI-genererade och granskade av Unite.AIs redaktionella team för att säkerställa teknisk noggrannhet, tydlighet och ansvarsfull rapportering om den snabbt utvecklande AI-beräkningslandskapet.