Моделі та платформи ШІ

AWS відкриває доступ до GPT-5.6 на Amazon Bedrock з австралійських регіонів

mm
Додайте Unite.AI до бажаних джерел у Google

Amazon Web Services повідомив 2 вересня 2026 р., що команди в Австралії тепер можуть отримати доступ до моделей GPT-5.6 від OpenAI на Amazon Bedrock, викликаючи варіанти Sol, Terra і Luna з регіонів Азіатсько‑Тихоокеанського (Сідней) та Азіатсько‑Тихоокеанського (Мельбурн) через глобальне крос‑регіональне виведення.

За цією схемою застосунок викликає кінцеву точку Amazon Bedrock Runtime у Сіднеї або Мельбурні, а Bedrock перенаправляє запит до підтримуваного комерційного регіону AWS для обробки. AWS зазначив, що це дає австралійським клієнтам доступ до більшого пулу потужностей без необхідності керувати маршрутизацією до регіону‑призначення. Три глобальні профілі виведення охоплюють моделі: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra і global.openai.gpt-5.6-luna. Сідней має код регіону ap-southeast-2, а Мельбурн — ap-southeast-4.

Три варіанти GPT-5.6

AWS описав три варіанти як орієнтовані на різні профілі навантажень. За даними посту в AWS Machine Learning Blog, GPT-5.6 Sol підходить для вимогливих задач розумової обробки, кодування та агентних навантажень; Terra забезпечує баланс продуктивності та вартості для щоденного виробничого використання; Luna пропонує швидке та доступне виведення для високих обсягів і застосунків, чутливих до затримки. Усі три приймають текстові та зображувальні входи, генерують текст і підтримують контекстні вікна до 1 мільйона токенів.

З двох австралійських регіонів розробники можуть викликати моделі через три шляхи доступу на кінцевій точці Bedrock Runtime: OpenAI Responses API, OpenAI Chat Completions API та Amazon Bedrock Converse API. Сумісні з OpenAI API викликаються за шляхами /openai/v1 кінцевої точки, а не через SDK AWS, і кінцева точка приймає підписання AWS Signature Version 4 або ключ API виведення моделі Amazon Bedrock.

Кешування запитів доступне для GPT-5.6 через підтримувані API у двох режимах. Неявне кешування ввімкнено за замовчуванням без змін коду, тоді як явне кешування дозволяє розробникам визначати повторно використовуваний префікс, межу кешу та ключ кешу. AWS зазначив, що членство у профілі та доступність моделей може змінюватися, і рекомендує клієнтам перевіряти конфігурації у документації з підтримки крос‑регіонального виведення перед розгортанням.

Інтеграція Codex та автентифікація OIDC

Кодуючий агент Codex від OpenAI може використовувати ті самі глобальні профілі виведення через постачальника моделей Bedrock Runtime, вбудованого у останню версію Codex CLI. AWS підтвердив конфігурацію за допомогою codex-cli 0.149.1, що працює з GPT-5.6 Sol у Сіднеї.

Для організацій, які федератують ідентифікацію через Okta, Auth0, Microsoft Entra ID, Amazon Cognito або AWS IAM Identity Center, AWS надає зразок допоміжної утиліти, що обмінює токен OpenID Connect на тимчасові облікові дані AWS. Codex потім читає ці облікові дані через стандартний ланцюжок облікових даних AWS, а запити підписуються SigV4, тому в шляху виведення не використовується ключ API. Коли профіль підкріплений IAM Identity Center, облікові дані вже короткострокові і оновлюються разом із сесією єдиного входу.

Передумови для австралійських розгортань включають обліковий запис AWS із включеним Сіднеєм або Мельбурном як вихідним регіоном, роль або користувача IAM з правами виклику профілів виведення GPT-5.6, а також Python 3.9 або новішу версію з встановленими пакетами openai, boto3 та aws-bedrock-token-generator. Організації, що використовують політики контролю сервісу, повинні переконатися, що їх політика дозволяє глобальні профілі виведення GPT-5.6 у вибраному вихідному регіоні. Адміністратори можуть перевірити активні профілі через AWS CLI або у вигляді профілів виведення в консолі Amazon Bedrock.

Квоти, моніторинг і журналювання

Квоти GPT-5.6 у режимі «за запитом» вимірюються у запитах за хвилину та токенах за хвилину, причому споживання токенів визначає, скільки токен‑квоти використовується кожним запитом. Для GPT-5.6 вхідні токени та токени запису кешу рахуються один до одного, тоді як кожен вихідний токен споживає 10 токенів з квоти, згідно з даними AWS. Квоти переглядаються та збільшуються через консоль Service Quotas у вихідному регіоні, який використовує застосунок, і AWS радить клієнтам заздалегідь запитувати збільшення, моніторити використання та тестувати репрезентативні підказки, потокове поводження, конкурентність і піковий трафік перед випуском у продакшн.

Оскільки запити GPT-5.6 використовують API Bedrock Runtime, виклики через глобальні профілі виведення потрапляють у журнал викликів моделей так само, як інші запити «за запитом», з записами, що містять ідентифікатор профілю виведення та метадані виклику. Codex експортує метрики за протоколом OpenTelemetry, а CloudWatch Coding Agent Insights надає панель інструментів для цієї телеметрії, охоплюючи використання токенів, API‑запити, активних користувачів, активність розмов та рівень попадання в кеш.

AWS пропонує два шляхи налаштування панелі: підхід із токеном‑носієм, що використовує ключ API метрик CloudWatch, та корпоративний розгортання, у якому локальний колектор підписує експорт за допомогою SigV4, використовуючи федеративні облікові дані розробника. AWS класифікує ключ API метрик як довгостроковий обліковий запис і рекомендує його лише там, де короткострокові облікові дані недоступні. Корпоративний шлях є рекомендованим варіантом для організацій, які федератують ідентифікацію розробників через корпоративний єдиний вхід, зазначив AWS.

Тео Неш - це спеціаліст з генерації штучного інтелекту в Unite.AI, який займається інфраструктурою штучного інтелекту, обчисленнями та апаратними системами, які живлять сучасний штучний інтелект. Його робота зосереджена на технічних засадах великомасштабних завдань штучного інтелекту, включаючи центри даних, прискорювачі, мережування та програмні стеки, які їх поєднують.
З аналітичною та інженерно-орієнтованою перспективою Тео вивчає, як вдосконалення графічних процесорів, спеціалізованої мікросхеми, архітектур пам'яті та розподілених систем дозволяють створювати нові покоління моделей штучного інтелекту. Він приділяє особливу увагу компромісам між продуктивністю, енергоефективністю, масштабованістю та практичними обмеженнями, які формують реальне розгортання інфраструктури штучного інтелекту.
Статті, написані Тео Нешем, генеруються штучним інтелектом і перевіряються редакційною командою Unite.AI для забезпечення технічної точності, ясності та відповідальної висвітлення швидко розвивається ландшафту обчислень штучного інтелекту.