AI-mallit ja alustat

AWS avaa GPT-5.6 -pääsyn Amazon Bedrockiin Australian alueilta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Amazon Web Services ilmoitti 2. syyskuuta 2026, että Australian tiimit voivat nyt käyttää OpenAI:n GPT‑5.6 -malleja Amazon Bedrock -palvelussa, kutsuen Sol-, Terra- ja Luna‑variantteja Aasia‑Tyynenmeren (Sydney) ja Aasia‑Tyynenmeren (Melbourne) -alueilta globaalin alueiden välisen inferenssin avulla.

Järjestelyn mukaisesti sovellus kutsuu Amazon Bedrock Runtime -päätepistettä Sydneyssä tai Melbournessa, ja Bedrock ohjaa pyynnön tuettuun kaupalliseen AWS‑alueeseen käsiteltäväksi. AWS:n mukaan tämä antaa Australian asiakkaille pääsyn laajempaan kapasiteettivarastoon ilman, että sovellusten täytyy hallita kohdealueen reititystä. Kolme globaalia inferenssiprofiilia kattavat mallit: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra ja global.openai.gpt-5.6-luna. Sydneyn aluekoodi on ap-southeast-2 ja Melbournen ap-southeast-4.

Kolme GPT‑5.6 -varianttia

AWS kuvasi kolme varianttia palvelevan erilaisia työkuormaprofiileja. AWS Machine Learning Blog post mukaan GPT‑5.6 Sol soveltuu vaativiin päättely‑, koodaus‑ ja agenttipohjaisiin työkuormiin; Terra tasapainottaa suorituskykyä ja kustannuksia jokapäiväiseen tuotantokäyttöön; ja Luna tarjoaa nopean, edullisen inferenssin suurta volyymia ja viiveherkkiä sovelluksia varten. Kaikki kolme hyväksyvät teksti‑ ja kuva‑syötteet, tuottavat tekstiä ja tukevat kontekstin ikkunoita, joiden koko on enintään miljoona tokenia.

Australian kahdesta alueesta kehittäjät voivat kutsua malleja kolmella pääsypolulla Bedrock Runtime -päätepisteessä: OpenAI Responses API, OpenAI Chat Completions API ja Amazon Bedrock Converse API. OpenAI-yhteensopivia API-rajapintoja kutsutaan päätepisteen /openai/v1 -poluilla sen sijaan, että käytettäisiin AWS SDK:ita, ja päätepiste hyväksyy joko AWS Signature Version 4 -allekirjoituksen tai Amazon Bedrock -mallin inferenssi‑API‑avaimen.

Prompt‑välimuistin käyttö on saatavilla GPT‑5.6:lle tuettujen API:en kautta kahdessa tilassa. Implicit‑välimuisti on oletuksena käytössä ilman koodimuutoksia, kun taas eksplisiittinen välimuisti antaa kehittäjien määritellä uudelleenkäytettävän etuliitteen, välimuistin rajan ja välimuistin avaimen. AWS totesi, että profiilin jäsenyys ja mallien saatavuus voivat muuttua, ja ohjasi asiakkaat cross‑Region‑inferenssin tukidokumentaatioonsa tarkistaakseen kokoonpanot ennen käyttöönottoa.

Codex‑integraatio ja OIDC‑todennus

OpenAI:n Codex‑koodausagentti voi käyttää samoja globaaleja inferenssiprofiileja Bedrock Runtime -mallin tarjoajan kautta, joka on sisällytetty uusimpaan Codex‑CLI:hin. AWS kertoi vahvistaneensa kokoonpanon codex-cli 0.149.1:n kanssa, jossa ajetaan GPT‑5.6 Sol Sydneyssä.

Organisaatioille, jotka federoi identiteetin Okta, Auth0, Microsoft Entra ID, Amazon Cognito tai AWS IAM Identity Centerin kautta, AWS tarjoaa esimerkkikrediittiapulaisen, joka vaihtaa OpenID Connect -tokentin tilapäisiin AWS‑krediitteihin. Codex lukee nämä krediitit vakiintuneen AWS‑krediittiketjun kautta, ja pyynnöt allekirjoitetaan SigV4:llä, joten API‑avainta ei käytetä inferenssipolussa. Kun profiilia tukee IAM Identity Center, krediitit ovat jo lyhytaikaisia ja ne kiertävät single sign‑on -istunnon mukana.

Australian käyttöönottojen edellytykset sisältävät AWS‑tilin, jossa Sydney tai Melbourne on määritetty lähdealueeksi, IAM‑roolin tai -käyttäjän, jolla on oikeudet kutsua GPT‑5.6 -inferenssiprofiileja, sekä Python 3.9:n tai uudemman, jossa on asennettuna openai-, boto3- ja aws-bedrock-token-generator‑paketit. Palvelunhallintapolitiikkoja käyttävien organisaatioiden on varmistettava, että niiden politiikka sallii GPT‑5.6 -globaaliin inferenssiin liittyvät profiilit valitussa lähdealueessa. Ylläpitäjät voivat tarkistaa aktiiviset profiilit AWS CLI:n tai Amazon Bedrock -konsolin inferenssiprofiilien näkymän kautta.

Kiintiöt, valvonta ja lokitus

GPT‑5.6 -kysyntäkiintiöt mitataan pyynnöinä minuutissa ja tokeneina minuutissa, ja tokenin kuluminen määrää, kuinka kukin pyyntö kuluttaa token‑kiintiötä. GPT‑5.6:n osalta syöte‑tokenit ja välimuistin kirjoitus‑syötteet lasketaan yksi‑yksi‑suhteessa, kun taas jokainen tulostoken kuluttaa 10 tokenia kiintiöstä, AWS:n mukaan. Kiintiöitä tarkastellaan ja kasvatetaan Service Quotas -konsolin kautta siinä lähdealueessa, jota sovellus käyttää, ja AWS neuvoi asiakkaita hakemaan lisäyksiä ajoissa, seuraamaan käyttöä sekä testaamaan edustavia kehoituksia, suoratoistokäyttäytymistä, samanaikaisuutta ja huippuliikennettä ennen tuotantoon siirtymistä.

Koska GPT‑5.6 -pyynnöt käyttävät Bedrock Runtime -API:a, globaalien inferenssiprofiilien kautta tehdyt kutsut näkyvät mallin kutsulokien lokituksessa kuten muutkin kysyntäpyynnöt, ja tietueet sisältävät inferenssiprofiilin tunnuksen sekä kutsun metatiedot. Codex vie mittarit OpenTelemetry‑protokollan kautta, ja CloudWatch Coding Agent Insights tarjoaa hallintapaneelin tälle telemetrialle, kattaen token‑käytön, API‑pyynnöt, aktiiviset käyttäjät, keskustelutoiminnan ja välimuistin osumatason.

Amazon Web Services tarjoaa kaksi konfigurointipolkua hallintapaneelia varten: kantajapohjainen (bearer‑token) lähestymistapa, jossa käytetään CloudWatch‑mittareiden API‑avainta, sekä yritystason käyttöönotto, jossa paikallinen kerääjä allekirjoittaa viennin SigV4:llä käyttäen kehittäjän federatiivisia tunnistetietoja. AWS luokittelee mittareiden API‑avaimen pitkäaikaiseksi tunnisteeksi ja suosittelee sen käyttöä vain, kun lyhytaikaiset tunnistetiedot eivät ole mahdollisia. Yrityspolku on suositeltu vaihtoehto organisaatioille, jotka federoi kehittäjän identiteetin yrityksen single sign‑on -ratkaisun kautta, AWS:n mukaan.

Theo Nash on tekoälygeneroitu asiantuntija Unite.AI:ssa, joka kattaa tekoälyinfrastruktuurin, laskennan ja modernin tekoälyä voimistavat laitteistojärjestelmät. Hänen työnsä keskittyy suurten tekoälykuormien taustalla oleviin teknisiin perusteisiin, mukaan lukien datakeskukset, kiihdyttimet, verkkotiet ja ohjelmistopinot, jotka sitoutuvat niihin.
Analyytisesta ja insinöörijohtoisesta näkökulmasta Theo tarkastelee, miten GPU:n, mukautetun piirin, muistiarkkitehtuurien ja hajautettujen järjestelmien edistysaskeleet mahdollistavat uusia tekoälymallien sukupolvia. Hän kiinnittää erityistä huomiota suorituskyky-yhteyksiin, energiatehokkuuteen, skaalautuvuuteen ja käytännön rajoituksiin, jotka muokkaavat tekoälyinfrastruktuurin todellista käyttöönottoa.
Artikkelit, joita Theo Nash on kirjoittanut, on tekoälygeneroitu ja Unite.AI:n toimittajatiimi on tarkastanut ne varmistaakseen teknisen tarkkuuden, selkeyden ja vastuullisen kattavuuden nopeasti kehittyvässä tekoälylaskennan maisemassa.