Модели и платформы ИИ

AWS открывает доступ к GPT-5.6 в Amazon Bedrock из регионов Австралии

mm
Добавьте Unite.AI в избранные источники в Google

Amazon Web Services заявила 2 сентября 2026 года, что команды в Австралии теперь могут получать доступ к моделям GPT-5.6 от OpenAI через Amazon Bedrock, вызывая варианты Sol, Terra и Luna из регионов Asia Pacific (Sydney) и Asia Pacific (Melbourne) с помощью глобального межрегионального вывода.

В рамках этой схемы приложение обращается к конечной точке Amazon Bedrock Runtime в Сиднее или Мельбурне, а Bedrock перенаправляет запрос в поддерживаемый коммерческий регион AWS для обработки. AWS заявила, что это даёт австралийским клиентам доступ к более широкому пулу мощности без необходимости управлять маршрутизацией в целевой регион. Три глобальных профиля вывода охватывают модели: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra и global.openai.gpt-5.6-luna. Сидней использует код региона ap-southeast-2, а Мельбурн — ap-southeast-4.

Три варианта GPT-5.6

AWS описала три варианта как обслуживающие разные профили нагрузок. Согласно посту в блоге AWS Machine Learning, GPT-5.6 Sol подходит для требовательных задач рассуждения, кодирования и агентных нагрузок; Terra балансирует производительность и стоимость для повседневного производственного использования; а Luna обеспечивает быстрый и недорогой вывод для приложений с высоким объёмом и чувствительных к задержке. Все три принимают текстовые и графические входы, генерируют текст и поддерживают контекстные окна до 1 млн токенов.

Из двух австралийских регионов разработчики могут вызывать модели через три пути доступа к конечной точке Bedrock Runtime: OpenAI Responses API, OpenAI Chat Completions API и Amazon Bedrock Converse API. Совместимые с OpenAI API вызываются по путям /openai/v1 конечной точки, а не через SDK AWS, и конечная точка принимает либо подпись AWS Signature Version 4, либо ключ API вывода модели Amazon Bedrock.

Кеширование подсказок доступно для GPT-5.6 через поддерживаемые API в двух режимах. Неявное кеширование включено по умолчанию без изменения кода, тогда как явное кеширование позволяет разработчикам задавать переиспользуемый префикс, границу кеша и ключ кеша. AWS отметила, что состав профилей и доступность моделей могут изменяться, и направила клиентов к документации по поддержке межрегионального вывода для проверки конфигураций перед развертыванием.

Интеграция Codex и аутентификация OIDC

Кодировочный агент Codex от OpenAI может использовать те же глобальные профили вывода через провайдер моделей Bedrock Runtime, встроенный в последнюю версию Codex CLI. AWS заявила, что проверила конфигурацию с codex-cli 0.149.1, запущенным с GPT-5.6 Sol из Сиднея.

Для организаций, федеративно аутентифицирующихся через Okta, Auth0, Microsoft Entra ID, Amazon Cognito или AWS IAM Identity Center, AWS предоставляет пример вспомогательной программы, которая обменивает токен OpenID Connect на временные учётные данные AWS. Codex затем читает эти учётные данные через стандартную цепочку учётных данных AWS, а запросы подписываются SigV4, поэтому ключ API не участвует в пути вывода. Когда профиль поддерживается IAM Identity Center, учётные данные уже краткосрочные и вращаются вместе с сеансом единого входа.

Требования к развертыванию в Австралии включают учётную запись AWS с включённым Сиднеем или Мельбурном в качестве исходного региона, роль IAM или пользователя с правами вызова профилей вывода GPT-5.6, а также Python 3.9 или новее с установленными пакетами openai, boto3 и aws-bedrock-token-generator. Организации, использующие политики контроля сервисов, должны убедиться, что их политика разрешает глобальные профили вывода GPT-5.6 в выбранном исходном регионе. Администраторы могут проверить активные профили через AWS CLI или в представлении профилей вывода консоли Amazon Bedrock.

Квоты, мониторинг и журналирование

Квоты на запросы GPT-5.6 по требованию измеряются в запросах в минуту и токенах в минуту, при этом расход токенов определяется «сжиганием» токенов: каждый входной токен и токен записи в кеш считаются один к одному, а каждый выходной токен потребляет 10 токенов из квоты, согласно AWS. Квоты пересматриваются и увеличиваются через консоль Service Quotas в исходном регионе, где работает приложение, и AWS советует клиентам запрашивать увеличения заранее, мониторить использование и тестировать типичные подсказки, потоковую передачу, конкурентность и пиковый трафик перед запуском в продакшн.

Поскольку запросы GPT-5.6 используют API Bedrock Runtime, вызовы через глобальные профили вывода отображаются в журнале вызовов модели так же, как и другие запросы по требованию, включая идентификатор профиля вывода и метаданные вызова. Codex экспортирует метрики через протокол OpenTelemetry, а CloudWatch Coding Agent Insights предоставляет панель мониторинга для этих телеметрических данных, охватывающую использование токенов, запросы API, активных пользователей, активность диалогов и коэффициент попаданий в кеш.

AWS предлагает два пути конфигурации панели мониторинга: подход с токеном‑носителем, использующий ключ API метрик CloudWatch, и корпоративный развертывание, при котором локальный коллектор подписывает экспорт SigV4, используя федеративные учётные данные разработчика. AWS классифицирует ключ API метрик как долгосрочные учётные данные и рекомендует его только там, где краткосрочные учётные данные невозможны. Корпоративный путь считается рекомендованным вариантом для организаций, федеративно связывающих идентичность разработчиков через корпоративный единый вход, заявила AWS.

Тео Нэш - специалист, сгенерированный ИИ, в Unite.AI, освещающий инфраструктуру ИИ, вычисления и аппаратные системы, которые обеспечивают современный искусственный интеллект. Его работа сосредоточена на технических основах, лежащих в основе крупномасштабных рабочих нагрузок ИИ, включая центры данных, ускорители, сетевое взаимодействие и программные стеки, которые их объединяют.
С аналитической и инженерно-ориентированной точки зрения, Тео исследует, как достижения в области GPU, специального кремния, архитектур памяти и распределенных систем позволяют создавать новые поколения моделей ИИ. Он уделяет особое внимание компромиссам между производительностью, энергоэффективностью, масштабируемостью и практическими ограничениями, которые формируют реальное развертывание инфраструктуры ИИ.
Статьи, написанные Тео Нэшем, сгенерированы ИИ и рассмотрены редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и ответственное освещение быстро развивающегося ландшафта вычислений ИИ.