Modelos y plataformas de IA

AWS abre acceso a GPT-5.6 en Amazon Bedrock desde regiones australianas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Amazon Web Services anunció el 2 de septiembre de 2026 que los equipos en Australia ahora pueden acceder a los modelos GPT-5.6 de OpenAI en Amazon Bedrock, invocando las variantes Sol, Terra y Luna desde las regiones Asia Pacífico (Sídney) y Asia Pacífico (Melbourne) mediante inferencia global entre regiones.

Según el acuerdo, una aplicación llama al endpoint Amazon Bedrock Runtime en Sídney o Melbourne, y Bedrock dirige la solicitud a una región comercial de AWS compatible para su procesamiento. AWS indicó que esto brinda a los clientes australianos acceso a un conjunto de capacidad más amplio sin que las aplicaciones tengan que gestionar el enrutamiento a la región de destino. Tres perfiles de inferencia global cubren los modelos: global.openai.gpt-5.6-sol, global.openai.gpt-5.6-terra y global.openai.gpt-5.6-luna. Sídney tiene el código de región ap-southeast-2 y Melbourne ap-southeast-4.

Las tres variantes de GPT-5.6

AWS describió las tres variantes como orientadas a diferentes perfiles de carga de trabajo. Según el AWS Machine Learning Blog post, GPT-5.6 Sol está diseñada para razonamiento exigente, codificación y cargas de trabajo de agente; Terra equilibra rendimiento y costo para el uso de producción cotidiano; y Luna ofrece inferencia rápida y económica para aplicaciones de alto volumen y sensibles a la latencia. Las tres aceptan entradas de texto e imagen, generan texto y admiten ventanas de contexto de hasta 1 millón de tokens.

Desde las dos regiones australianas, los desarrolladores pueden invocar los modelos a través de tres vías de acceso en el endpoint Bedrock Runtime: la API de Respuestas de OpenAI, la API de Finalizaciones de Chat de OpenAI y la Amazon Bedrock Converse API. Las API compatibles con OpenAI se llaman en las rutas /openai/v1 del endpoint en lugar de a través de los SDK de AWS, y el endpoint acepta ya sea la firma AWS Signature Version 4 o una clave de API de inferencia de modelo de Amazon Bedrock.

El almacenamiento en caché de prompts está disponible para GPT-5.6 a través de las API compatibles en dos modos. El caché implícito se habilita de forma predeterminada sin cambios de código, mientras que el caché explícito permite a los desarrolladores definir el prefijo reutilizable, el límite de caché y la clave de caché. AWS señaló que la membresía del perfil y la disponibilidad del modelo pueden cambiar, y dirigió a los clientes a su documentación de soporte de inferencia entre regiones para verificar las configuraciones antes del despliegue.

Integración de Codex y autenticación OIDC

El agente de codificación Codex de OpenAI puede usar los mismos perfiles de inferencia global a través del proveedor de modelo Bedrock Runtime integrado en la última Codex CLI. AWS informó que validó la configuración con codex-cli 0.149.1 ejecutando GPT-5.6 Sol desde Sídney.

Para organizaciones que federan la identidad a través de Okta, Auth0, Microsoft Entra ID, Amazon Cognito o AWS IAM Identity Center, AWS ofrece un asistente de credenciales de ejemplo que intercambia un token OpenID Connect por credenciales temporales de AWS. Codex luego lee esas credenciales mediante la cadena de credenciales estándar de AWS, y las solicitudes se firman con SigV4, por lo que no se utiliza una clave de API en la ruta de inferencia. Cuando el perfil está respaldado por IAM Identity Center, las credenciales ya son de corto plazo y se rotan con la sesión de inicio único.

Los requisitos previos para implementaciones en Australia incluyen una cuenta de AWS con Sídney o Melbourne habilitada como región de origen, un rol o usuario IAM con permisos para invocar los perfiles de inferencia GPT-5.6, y Python 3.9 o superior con los paquetes openai, boto3 y aws-bedrock-token-generator instalados. Las organizaciones que utilizan políticas de control de servicio deben verificar que su política permita los perfiles de inferencia global GPT-5.6 en la región de origen seleccionada. Los administradores pueden confirmar los perfiles activos mediante la AWS CLI o la vista de perfiles de inferencia en la consola de Amazon Bedrock.

Cuotas, monitoreo y registro

Las cuotas bajo demanda de GPT-5.6 se miden en solicitudes por minuto y tokens por minuto, y el consumo de tokens determina cómo cada solicitud utiliza la cuota de tokens. Para GPT-5.6, los tokens de entrada y los tokens de escritura en caché cuentan a una tasa de uno a uno, mientras que cada token de salida consume 10 tokens de la cuota, según AWS. Las cuotas se revisan y aumentan mediante la consola Service Quotas en la región de origen que utiliza la aplicación, y AWS aconsejó a los clientes solicitar aumentos con anticipación, monitorear la utilización y probar prompts representativos, el comportamiento de transmisión, la concurrencia y el tráfico máximo antes del despliegue en producción.

Dado que las solicitudes de GPT-5.6 utilizan la API Bedrock Runtime, las llamadas realizadas a través de los perfiles de inferencia global aparecen en el registro de invocaciones de modelo como otras solicitudes bajo demanda, con registros que incluyen el ID del perfil de inferencia y los metadatos de la invocación. Codex exporta métricas mediante el protocolo OpenTelemetry, y CloudWatch Coding Agent Insights ofrece un panel para esa telemetría, que cubre el uso de tokens, solicitudes de API, usuarios activos, actividad de conversación y la tasa de aciertos en caché.

AWS ofrece dos rutas de configuración para el panel: un enfoque de token portador que utiliza una clave de API de métricas de CloudWatch, y un despliegue empresarial en el que un colector local firma la exportación con SigV4 usando las credenciales federadas del desarrollador. AWS clasifica la clave de API de métricas como una credencial a largo plazo y la recomienda solo cuando no son viables las credenciales de corto plazo. La ruta empresarial es la opción recomendada para organizaciones que federan la identidad del desarrollador mediante inicio de sesión único corporativo, según AWS.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.