Modele și platforme AI

AWS deschide accesul la GPT-5.6 pe Amazon Bedrock din regiunile australiene

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Amazon Web Services a anunțat pe 2 septembrie 2026 că echipele din Australia pot accesa acum modelele GPT-5.6 ale OpenAI pe Amazon Bedrock, invocând variantele Sol, Terra și Luna din regiunile Asia Pacific (Sydney) și Asia Pacific (Melbourne) prin inferență globală cross‑Region.

În cadrul aranjamentului, o aplicație apelează endpoint‑ul Amazon Bedrock Runtime din Sydney sau Melbourne, iar Bedrock redirecționează cererea către o regiune comercială AWS suportată pentru procesare. AWS a declarat că aceasta oferă clienților australieni acces la un pool de capacitate mai larg fără a necesita ca aplicațiile să gestioneze rutarea către regiunea de destinație. Trei profiluri globale de inferență acoperă modelele: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra și global.openai.gpt-5.6-luna. Sydney are codul de regiune ap-southeast-2, iar Melbourne ap-southeast-4.

Cele trei variante GPT-5.6

AWS a descris cele trei variante ca servind profiluri de sarcini diferite. Conform AWS Machine Learning Blog, GPT-5.6 Sol este potrivit pentru sarcini exigente de raționament, programare și agenție; Terra echilibrează performanța și costul pentru utilizarea zilnică în producție; iar Luna oferă inferență rapidă și accesibilă pentru aplicații cu volum mare și sensibilitate la latență. Toate trei acceptă intrări text și imagine, generează text și suportă ferestre de context de până la 1 milion de tokeni.

Din cele două regiuni australiene, dezvoltatorii pot invoca modelele prin trei căi de acces pe endpoint‑ul Bedrock Runtime: OpenAI Responses API, OpenAI Chat Completions API și Amazon Bedrock Converse API. API‑urile compatibile cu OpenAI sunt apelate pe căile /openai/v1 ale endpoint‑ului, în loc de SDK‑urile AWS, iar endpoint‑ul acceptă fie semnarea cu AWS Signature Version 4, fie o cheie API de inferență a modelului Amazon Bedrock.

Cache‑ul de prompturi este disponibil pentru GPT-5.6 prin API‑urile suportate în două moduri. Cache‑ul implicit este activat în mod implicit fără modificări de cod, în timp ce cache‑ul explicit permite dezvoltatorilor să definească prefixul reutilizabil, limita cache‑ului și cheia cache‑ului. AWS a remarcat că apartenența la profil și disponibilitatea modelului pot varia și a îndrumat clienții către documentația de suport pentru inferență cross‑Region pentru a verifica configurațiile înainte de implementare.

Integrarea Codex și autentificarea OIDC

Agentul de programare Codex de la OpenAI poate utiliza aceleași profiluri globale de inferență prin furnizorul de modele Bedrock Runtime integrat în cea mai recentă versiune a Codex CLI. AWS a declarat că a validat configurația cu codex-cli 0.149.1 rulând GPT-5.6 Sol din Sydney.

Pentru organizațiile care federă identitatea prin Okta, Auth0, Microsoft Entra ID, Amazon Cognito sau AWS IAM Identity Center, AWS furnizează un exemplu de helper pentru acreditări care schimbă un token OpenID Connect în acreditări temporare AWS. Codex citește apoi aceste acreditări prin lanțul standard de acreditări AWS, iar cererile sunt semnate cu SigV4, astfel încât nicio cheie API nu este implicată în calea de inferență. Când profilul este susținut de IAM Identity Center, acreditările sunt deja pe termen scurt și se rotesc odată cu sesiunea de autentificare unică.

Precondițiile pentru implementările din Australia includ un cont AWS cu Sydney sau Melbourne activat ca regiune sursă, un rol sau utilizator IAM cu permisiuni pentru a invoca profilurile de inferență GPT-5.6 și Python 3.9 sau o versiune ulterioară cu pachetele openai, boto3 și aws-bedrock-token-generator instalate. Organizațiile care utilizează politici de control al serviciilor trebuie să verifice că politica lor permite profilurile globale de inferență GPT-5.6 în regiunea sursă selectată. Administratorii pot confirma profilurile active prin AWS CLI sau prin vizualizarea profilurilor de inferență din consola Amazon Bedrock.

Cote, monitorizare și înregistrare

Cotele on‑demand pentru GPT-5.6 sunt măsurate în cereri pe minut și tokeni pe minut, iar consumul de tokeni determină modul în care fiecare cerere consumă cota de tokeni. Pentru GPT-5.6, tokenii de intrare și tokenii de scriere în cache se numără la un raport unu la unu, în timp ce fiecare token de ieșire consumă 10 tokeni din cotă, conform AWS. Cotele sunt revizuite și majorate prin consola Service Quotas din regiunea sursă utilizată de aplicație, iar AWS a sfătuit clienții să solicite majorări din timp, să monitorizeze utilizarea și să testeze prompturi reprezentative, comportamentul de streaming, concurența și traficul de vârf înainte de lansarea în producție.

Deoarece cererile GPT-5.6 utilizează Bedrock Runtime API, apelurile efectuate prin profilurile globale de inferență apar în jurnalizarea invocărilor de model la fel ca alte cereri on‑demand, cu înregistrări care includ ID‑ul profilului de inferență și metadatele invocării. Codex exportă metrici prin protocolul OpenTelemetry, iar CloudWatch Coding Agent Insights furnizează un tablou de bord pentru acea telemetrie, acoperind utilizarea tokenilor, cererile API, utilizatorii activi, activitatea conversațiilor și rata de hit a cache‑ului.

AWS oferă două căi de configurare pentru tabloul de bord: o abordare cu token de tip bearer care folosește o cheie API de metrici CloudWatch și o implementare enterprise în care un colector local semnează exportul cu SigV4 utilizând acreditările federate ale dezvoltatorului. AWS clasifică cheia API de metrici ca o acreditare pe termen lung și o recomandă doar în cazurile în care acreditările pe termen scurt nu sunt fezabile. Calea enterprise este opțiunea recomandată pentru organizațiile care federă identitatea dezvoltatorului prin autentificarea unică corporativă, a declarat AWS.

Theo Nash este un specialist generat de inteligență artificială la Unite.AI, care acoperă infrastructura de inteligență artificială, calcul și sistemele hardware care alimentează inteligența artificială modernă. Lucrarea sa se concentrează pe fundamentele tehnice ale sarcinilor de lucru cu inteligență artificială la scară largă, incluzând centre de date, acceleratoare, rețele și stivele de software care le leagă împreună.
Cu o perspectivă analitică și inginerice, Theo examinează modul în care progresele în domeniul unităților de procesare grafică, siliciului personalizat, arhitecturilor de memorie și sistemelor distribuite permit noi generații de modele de inteligență artificială. El acordă o atenție deosebită schimburilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care influențează implementarea în lumea reală a infrastructurii de inteligență artificială.
Articolele scrise de Theo Nash sunt generate de inteligență artificială și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului de calcul cu inteligență artificială în evoluție rapidă.