Mô hình và nền tảng AI

AWS Mở Quyền Truy Cập GPT-5.6 trên Amazon Bedrock Từ Các Vùng Úc

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Amazon Web Services cho biết vào ngày 2 tháng 9 năm 2026, các đội tại Úc hiện có thể truy cập các mô hình GPT-5.6 của OpenAI trên Amazon Bedrock, gọi các biến thể Sol, Terra và Luna từ các vùng Châu Á Thái Bình Dương (Sydney) và Châu Á Thái Bình Dương (Melbourne) thông qua suy luận xuyên vùng toàn cầu.

The arrangement, một ứng dụng gọi endpoint Amazon Bedrock Runtime ở Sydney hoặc Melbourne, và Bedrock sẽ định tuyến yêu cầu tới một khu vực AWS thương mại được hỗ trợ để xử lý. AWS cho biết điều này mang lại cho khách hàng Úc khả năng truy cập vào một bể năng lực rộng hơn mà không cần các ứng dụng quản lý định tuyến khu vực đích. Ba hồ sơ suy luận toàn cầu bao phủ các mô hình: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra, và global.openai.gpt-5.6-luna. Sydney có mã khu vực ap-southeast-2 và Melbourne là ap-southeast-4.

Ba Biến Thể GPT-5.6

AWS mô tả ba biến thể này phục vụ các hồ sơ tải công việc khác nhau. Theo bài đăng trên AWS Machine Learning Blog, GPT-5.6 Sol phù hợp với các tải công việc yêu cầu suy luận phức tạp, lập trình và tác vụ tự động; Terra cân bằng hiệu năng và chi phí cho việc sử dụng sản xuất hàng ngày; còn Luna cung cấp suy luận nhanh, giá cả phải chăng cho các ứng dụng có khối lượng lớn và nhạy cảm với độ trễ. Cả ba đều chấp nhận đầu vào văn bản và hình ảnh, tạo ra văn bản và hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token.

Từ hai khu vực Úc, các nhà phát triển có thể gọi các mô hình qua ba đường truy cập trên endpoint Bedrock Runtime: OpenAI Responses API, OpenAI Chat Completions API và Amazon Bedrock Converse API. Các API tương thích OpenAI được gọi trên các đường dẫn /openai/v1 của endpoint thay vì thông qua AWS SDK, và endpoint chấp nhận ký tên AWS Signature Version 4 hoặc khóa API suy luận mô hình Amazon Bedrock.

Bộ nhớ đệm lời nhắc (prompt caching) khả dụng cho GPT-5.6 thông qua các API được hỗ trợ ở hai chế độ. Bộ nhớ đệm ngầm được bật mặc định mà không cần thay đổi mã, trong khi bộ nhớ đệm rõ ràng cho phép các nhà phát triển xác định tiền tố có thể tái sử dụng, ranh giới bộ nhớ đệm và khóa bộ nhớ đệm. AWS lưu ý rằng thành viên hồ sơ và tính khả dụng mô hình có thể thay đổi, và đã hướng dẫn khách hàng tới tài liệu hỗ trợ suy luận xuyên khu vực để xác minh cấu hình trước khi triển khai.

Tích Hợp Codex và Xác Thực OIDC

Đại lý lập trình Codex của OpenAI có thể sử dụng cùng các hồ sơ suy luận toàn cầu thông qua nhà cung cấp mô hình Bedrock Runtime được tích hợp trong Codex CLI mới nhất. AWS cho biết đã xác thực cấu hình bằng codex-cli 0.149.1 chạy GPT-5.6 Sol từ Sydney.

Đối với các tổ chức liên kết danh tính qua Okta, Auth0, Microsoft Entra ID, Amazon Cognito hoặc AWS IAM Identity Center, AWS cung cấp một công cụ trợ giúp chứng chỉ mẫu để đổi token OpenID Connect lấy chứng chỉ AWS tạm thời. Codex sau đó đọc các chứng chỉ này qua chuỗi chứng chỉ AWS tiêu chuẩn, và các yêu cầu được ký bằng SigV4, vì vậy không có khóa API tham gia vào đường dẫn suy luận. Khi hồ sơ được hỗ trợ bởi IAM Identity Center, các chứng chỉ đã là ngắn hạn và được quay vòng cùng phiên đăng nhập một lần.

Các điều kiện tiên quyết cho triển khai tại Úc bao gồm một tài khoản AWS với Sydney hoặc Melbourne được kích hoạt làm khu vực nguồn, một vai trò hoặc người dùng IAM có quyền gọi các hồ sơ suy luận GPT-5.6, và Python 3.9 trở lên với các gói openai, boto3 và aws-bedrock-token-generator được cài đặt. Các tổ chức sử dụng chính sách kiểm soát dịch vụ cần xác minh rằng chính sách của họ cho phép các hồ sơ suy luận toàn cầu GPT-5.6 trong khu vực nguồn đã chọn. Quản trị viên có thể xác nhận các hồ sơ đang hoạt động thông qua AWS CLI hoặc giao diện hồ sơ suy luận của Amazon Bedrock console.

Hạn Ngạch, Giám Sát và Ghi Nhận

Hạn ngạch theo yêu cầu của GPT-5.6 được đo bằng số yêu cầu mỗi phút và số token mỗi phút, với việc tiêu thụ token xác định cách mỗi yêu cầu tiêu thụ hạn ngạch token. Đối với GPT-5.6, token đầu vào và token ghi bộ nhớ đệm đầu vào được tính theo tỷ lệ một-một, trong khi mỗi token đầu ra tiêu thụ 10 token từ hạn ngạch, theo AWS. Hạn ngạch được xem xét và tăng lên thông qua bảng Service Quotas trong khu vực nguồn mà ứng dụng sử dụng, và AWS khuyên khách hàng nên yêu cầu tăng hạn ngạch sớm, giám sát mức sử dụng và kiểm tra các lời nhắc đại diện, hành vi streaming, đồng thời, và lưu lượng cao điểm trước khi triển khai sản xuất.

Vì các yêu cầu GPT-5.6 sử dụng Bedrock Runtime API, các cuộc gọi qua các hồ sơ suy luận toàn cầu xuất hiện trong nhật ký gọi mô hình giống như các yêu cầu theo yêu cầu khác, với các bản ghi bao gồm ID hồ sơ suy luận và siêu dữ liệu gọi. Codex xuất các chỉ số qua giao thức OpenTelemetry, và CloudWatch Coding Agent Insights cung cấp bảng điều khiển cho các dữ liệu này, bao gồm việc sử dụng token, yêu cầu API, người dùng hoạt động, hoạt động hội thoại và tỷ lệ hit bộ nhớ đệm.

AWS cung cấp hai đường cấu hình cho bảng điều khiển: cách tiếp cận token mang (bearer-token) sử dụng khóa API metrics của CloudWatch, và triển khai doanh nghiệp trong đó một bộ thu thập cục bộ ký xuất dữ liệu bằng SigV4 sử dụng chứng chỉ liên hợp của nhà phát triển. AWS phân loại khóa API metrics là chứng chỉ dài hạn và khuyến nghị chỉ sử dụng khi không thể dùng chứng chỉ ngắn hạn. Đường doanh nghiệp là tùy chọn được khuyến nghị cho các tổ chức liên kết danh tính nhà phát triển qua đăng nhập một lần doanh nghiệp, AWS cho biết.

Theo Nash là một chuyên gia được tạo bởi trí tuệ nhân tạo tại Unite.AI, chuyên về cơ sở hạ tầng trí tuệ nhân tạo, tính toán và các hệ thống phần cứng hỗ trợ trí tuệ nhân tạo hiện đại. Công việc của ông tập trung vào các nền tảng kỹ thuật đằng sau các công việc trí tuệ nhân tạo quy mô lớn, bao gồm trung tâm dữ liệu, tăng tốc, mạng và các phần mềm liên kết chúng lại với nhau.
Với quan điểm phân tích và kỹ thuật, Theo nghiên cứu cách các tiến bộ trong GPU, silicon tùy chỉnh, kiến trúc bộ nhớ và hệ thống phân tán cho phép tạo ra các mô hình trí tuệ nhân tạo mới. Ông đặc biệt chú ý đến việc trao đổi hiệu suất, hiệu quả năng lượng, khả năng mở rộng và các hạn chế thực tế định hình việc triển khai cơ sở hạ tầng trí tuệ nhân tạo trong thế giới thực.
Các bài viết được viết bởi Theo Nash được tạo bởi trí tuệ nhân tạo và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác kỹ thuật, sự rõ ràng và phạm vi bao quát có trách nhiệm về tính toán trí tuệ nhân tạo đang phát triển nhanh chóng.