Model dan platform AI

AWS Membuka Akses GPT-5.6 di Amazon Bedrock dari Wilayah Australia

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Amazon Web Services mengatakan pada 2 September 2026 bahwa tim di Australia kini dapat mengakses model GPT-5.6 milik OpenAI di Amazon Bedrock, dengan memanggil varian Sol, Terra, dan Luna dari Wilayah Asia Pasifik (Sydney) dan Asia Pasifik (Melbourne) melalui inferensi lintas‑Wilayah global.

Menurut pengaturan ini, sebuah aplikasi memanggil endpoint Amazon Bedrock Runtime di Sydney atau Melbourne, dan Bedrock meneruskan permintaan ke Wilayah AWS komersial yang didukung untuk diproses. AWS menyatakan hal ini memberi pelanggan Australia akses ke kumpulan kapasitas yang lebih luas tanpa harus mengelola routing ke Wilayah tujuan. Tiga profil inferensi global mencakup model: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, dan global.openai.gpt-5.6-luna. Sydney menggunakan kode Wilayah ap-southeast-2 dan Melbourne ap-southeast-4.

The Three GPT-5.6 Variants

AWS menjelaskan ketiga varian tersebut melayani profil beban kerja yang berbeda. Menurut posting AWS Machine Learning Blog, GPT-5.6 Sol cocok untuk beban kerja penalaran, pemrograman, dan agen yang menuntut; Terra menyeimbangkan kinerja dan biaya untuk penggunaan produksi sehari‑hari; dan Luna menyediakan inferensi cepat dan terjangkau untuk aplikasi bervolume tinggi serta sensitif terhadap latensi. Ketiganya menerima masukan teks dan gambar, menghasilkan teks, serta mendukung jendela konteks hingga 1 juta token.

Dari dua Wilayah Australia, pengembang dapat memanggil model melalui tiga jalur akses pada endpoint Bedrock Runtime: OpenAI Responses API, OpenAI Chat Completions API, dan Amazon Bedrock Converse API. API yang kompatibel dengan OpenAI dipanggil pada jalur /openai/v1 endpoint alih‑alih melalui SDK AWS, dan endpoint menerima baik penandatanganan AWS Signature Version 4 maupun kunci API inferensi model Amazon Bedrock.

Prompt caching tersedia untuk GPT-5.6 melalui API yang didukung dalam dua mode. Caching implisit diaktifkan secara default tanpa perubahan kode, sedangkan caching eksplisit memungkinkan pengembang mendefinisikan prefiks yang dapat digunakan kembali, batas cache, dan kunci cache. AWS mencatat bahwa keanggotaan profil dan ketersediaan model dapat berubah, dan mengarahkan pelanggan ke dokumentasi dukungan inferensi lintas‑Wilayah untuk memverifikasi konfigurasi sebelum penerapan.

Codex Integration and OIDC Authentication

Agent pemrograman Codex milik OpenAI dapat menggunakan profil inferensi global yang sama melalui penyedia model Bedrock Runtime yang dibangun ke dalam Codex CLI terbaru. AWS menyatakan bahwa mereka telah memvalidasi konfigurasi dengan codex-cli 0.149.1 yang menjalankan GPT-5.6 Sol dari Sydney.

Untuk organisasi yang memfederasi identitas melalui Okta, Auth0, Microsoft Entra ID, Amazon Cognito, atau AWS IAM Identity Center, AWS menyediakan contoh helper kredensial yang menukarkan token OpenID Connect menjadi kredensial AWS sementara. Codex kemudian membaca kredensial tersebut melalui rantai kredensial AWS standar, dan permintaan ditandatangani dengan SigV4, sehingga tidak ada kunci API yang terlibat dalam jalur inferensi. Ketika profil didukung oleh IAM Identity Center, kredensial sudah bersifat jangka pendek dan berputar bersama sesi single sign‑on.

Prasyarat untuk penyebaran di Australia meliputi akun AWS dengan Sydney atau Melbourne diaktifkan sebagai Wilayah sumber, peran atau pengguna IAM dengan izin memanggil profil inferensi GPT-5.6, serta Python 3.9 atau lebih baru dengan paket openai, boto3, dan aws-bedrock-token-generator terpasang. Organisasi yang menggunakan kebijakan kontrol layanan harus memastikan kebijakan mereka mengizinkan profil inferensi global GPT-5.6 di Wilayah sumber yang dipilih. Administrator dapat mengonfirmasi profil aktif melalui AWS CLI atau tampilan profil inferensi di konsol Amazon Bedrock.

Quotas, Monitoring, and Logging

Kuota on‑demand GPT-5.6 diukur dalam permintaan per menit dan token per menit, dengan pengurangan token menentukan bagaimana tiap permintaan mengonsumsi kuota token. Untuk GPT-5.6, token masukan dan token tulis‑cache dihitung satu‑banding‑satu, sementara tiap token keluaran menghabiskan 10 token dari kuota, menurut AWS. Kuota ditinjau dan dapat ditingkatkan melalui konsol Service Quotas di Wilayah sumber yang digunakan aplikasi, dan AWS menyarankan pelanggan mengajukan peningkatan lebih awal, memantau pemanfaatan, serta menguji prompt representatif, perilaku streaming, konkruensi, dan lalu lintas puncak sebelum peluncuran produksi.

Karena permintaan GPT-5.6 menggunakan Bedrock Runtime API, panggilan yang dilakukan melalui profil inferensi global muncul dalam pencatatan pemanggilan model seperti permintaan on‑demand lainnya, dengan catatan yang mencakup ID profil inferensi dan metadata pemanggilan. Codex mengekspor metrik melalui protokol OpenTelemetry, dan CloudWatch Coding Agent Insights menyediakan dasbor untuk telemetri tersebut, meliputi penggunaan token, permintaan API, pengguna aktif, aktivitas percakapan, dan tingkat hit cache.

AWS menawarkan dua jalur konfigurasi untuk dasbor: pendekatan token bearer menggunakan kunci API metrik CloudWatch, dan peluncuran enterprise di mana kolektor lokal menandatangani ekspor dengan SigV4 menggunakan kredensial federasi pengembang. AWS mengklasifikasikan kunci API metrik sebagai kredensial jangka panjang dan merekomendasikannya hanya bila kredensial jangka pendek tidak memungkinkan. Jalur enterprise adalah opsi yang direkomendasikan bagi organisasi yang memfederasi identitas pengembang melalui single sign‑on korporat, kata AWS.

Theo Nash adalah seorang spesialis yang dihasilkan oleh AI di Unite.AI, yang meliputi infrastruktur AI, komputasi, dan sistem perangkat keras yang memungkinkan kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI skala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.
Dengan perspektif analitis dan berbasis teknik, Theo memeriksa bagaimana kemajuan dalam GPU, silikon kustom, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memperhatikan khusus pada pertukaran kinerja, efisiensi energi, skalabilitas, dan kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.
Artikel yang ditulis oleh Theo Nash dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang pesat.