Modele și platforme AI
AWS deschide accesul la GPT-5.6 pe Amazon Bedrock din regiunile australiene

Amazon Web Services a anunțat pe 2 septembrie 2026 că echipele din Australia pot accesa acum modelele GPT-5.6 ale OpenAI pe Amazon Bedrock, invocând variantele Sol, Terra și Luna din regiunile Asia Pacific (Sydney) și Asia Pacific (Melbourne) prin inferență globală cross‑Region.
În cadrul aranjamentului, o aplicație apelează endpoint‑ul Amazon Bedrock Runtime din Sydney sau Melbourne, iar Bedrock redirecționează cererea către o regiune comercială AWS suportată pentru procesare. AWS a declarat că aceasta oferă clienților australieni acces la un pool de capacitate mai larg fără a necesita ca aplicațiile să gestioneze rutarea către regiunea de destinație. Trei profiluri globale de inferență acoperă modelele: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra și global.openai.gpt-5.6-luna. Sydney are codul de regiune ap-southeast-2, iar Melbourne ap-southeast-4.
Cele trei variante GPT-5.6
AWS a descris cele trei variante ca servind profiluri de sarcini diferite. Conform AWS Machine Learning Blog, GPT-5.6 Sol este potrivit pentru sarcini exigente de raționament, programare și agenție; Terra echilibrează performanța și costul pentru utilizarea zilnică în producție; iar Luna oferă inferență rapidă și accesibilă pentru aplicații cu volum mare și sensibilitate la latență. Toate trei acceptă intrări text și imagine, generează text și suportă ferestre de context de până la 1 milion de tokeni.
Din cele două regiuni australiene, dezvoltatorii pot invoca modelele prin trei căi de acces pe endpoint‑ul Bedrock Runtime: OpenAI Responses API, OpenAI Chat Completions API și Amazon Bedrock Converse API. API‑urile compatibile cu OpenAI sunt apelate pe căile /openai/v1 ale endpoint‑ului, în loc de SDK‑urile AWS, iar endpoint‑ul acceptă fie semnarea cu AWS Signature Version 4, fie o cheie API de inferență a modelului Amazon Bedrock.
Cache‑ul de prompturi este disponibil pentru GPT-5.6 prin API‑urile suportate în două moduri. Cache‑ul implicit este activat în mod implicit fără modificări de cod, în timp ce cache‑ul explicit permite dezvoltatorilor să definească prefixul reutilizabil, limita cache‑ului și cheia cache‑ului. AWS a remarcat că apartenența la profil și disponibilitatea modelului pot varia și a îndrumat clienții către documentația de suport pentru inferență cross‑Region pentru a verifica configurațiile înainte de implementare.
Integrarea Codex și autentificarea OIDC
Agentul de programare Codex de la OpenAI poate utiliza aceleași profiluri globale de inferență prin furnizorul de modele Bedrock Runtime integrat în cea mai recentă versiune a Codex CLI. AWS a declarat că a validat configurația cu codex-cli 0.149.1 rulând GPT-5.6 Sol din Sydney.
Pentru organizațiile care federă identitatea prin Okta, Auth0, Microsoft Entra ID, Amazon Cognito sau AWS IAM Identity Center, AWS furnizează un exemplu de helper pentru acreditări care schimbă un token OpenID Connect în acreditări temporare AWS. Codex citește apoi aceste acreditări prin lanțul standard de acreditări AWS, iar cererile sunt semnate cu SigV4, astfel încât nicio cheie API nu este implicată în calea de inferență. Când profilul este susținut de IAM Identity Center, acreditările sunt deja pe termen scurt și se rotesc odată cu sesiunea de autentificare unică.
Precondițiile pentru implementările din Australia includ un cont AWS cu Sydney sau Melbourne activat ca regiune sursă, un rol sau utilizator IAM cu permisiuni pentru a invoca profilurile de inferență GPT-5.6 și Python 3.9 sau o versiune ulterioară cu pachetele openai, boto3 și aws-bedrock-token-generator instalate. Organizațiile care utilizează politici de control al serviciilor trebuie să verifice că politica lor permite profilurile globale de inferență GPT-5.6 în regiunea sursă selectată. Administratorii pot confirma profilurile active prin AWS CLI sau prin vizualizarea profilurilor de inferență din consola Amazon Bedrock.
Cote, monitorizare și înregistrare
Cotele on‑demand pentru GPT-5.6 sunt măsurate în cereri pe minut și tokeni pe minut, iar consumul de tokeni determină modul în care fiecare cerere consumă cota de tokeni. Pentru GPT-5.6, tokenii de intrare și tokenii de scriere în cache se numără la un raport unu la unu, în timp ce fiecare token de ieșire consumă 10 tokeni din cotă, conform AWS. Cotele sunt revizuite și majorate prin consola Service Quotas din regiunea sursă utilizată de aplicație, iar AWS a sfătuit clienții să solicite majorări din timp, să monitorizeze utilizarea și să testeze prompturi reprezentative, comportamentul de streaming, concurența și traficul de vârf înainte de lansarea în producție.
Deoarece cererile GPT-5.6 utilizează Bedrock Runtime API, apelurile efectuate prin profilurile globale de inferență apar în jurnalizarea invocărilor de model la fel ca alte cereri on‑demand, cu înregistrări care includ ID‑ul profilului de inferență și metadatele invocării. Codex exportă metrici prin protocolul OpenTelemetry, iar CloudWatch Coding Agent Insights furnizează un tablou de bord pentru acea telemetrie, acoperind utilizarea tokenilor, cererile API, utilizatorii activi, activitatea conversațiilor și rata de hit a cache‑ului.
AWS oferă două căi de configurare pentru tabloul de bord: o abordare cu token de tip bearer care folosește o cheie API de metrici CloudWatch și o implementare enterprise în care un colector local semnează exportul cu SigV4 utilizând acreditările federate ale dezvoltatorului. AWS clasifică cheia API de metrici ca o acreditare pe termen lung și o recomandă doar în cazurile în care acreditările pe termen scurt nu sunt fezabile. Calea enterprise este opțiunea recomandată pentru organizațiile care federă identitatea dezvoltatorului prin autentificarea unică corporativă, a declarat AWS.












