Cómo empezar con GPT-5.6 (Sol, Terra y Luna) en Amazon Bedrock
OpenAI GPT-5.6 (Sol, Terra y Luna) ya está disponible en Amazon Bedrock. En este artículo explicamos cómo elegir el modelo adecuado, conectarlo vía Responses API, gestionar autenticación y optimizar costos, con recomendaciones útiles para equipos en Latinoamérica.
Introducción
Amazon Bedrock ahora ofrece la familia GPT-5.6 de OpenAI —Sol, Terra y Luna— accesible a través del endpoint bedrock-mantle. Estas variantes cubren desde agentes autónomos de codificación y razonamiento de largo alcance hasta cargas de inferencia de alto volumen y baja latencia. El objetivo es que los desarrolladores llamen a estos modelos mediante APIs familiares sin gestionar infraestructura de modelos separada.
En esta guía encontrarán cómo seleccionar el modelo según la carga de trabajo, cómo conectarse al endpoint de Bedrock usando la Responses API, opciones de autenticación, controles de seguridad y buenas prácticas para controlar costos y cumplimiento, con énfasis en consideraciones relevantes para organizaciones latinoamericanas.
¿Qué ofrecen Sol, Terra y Luna?
-
Sol: el modelo de referencia para razonamiento profundo. Está pensado para tareas que requieren análisis en múltiples pasos, investigación de seguridad, análisis científico y agentes de codificación autónomos.
-
Terra: diseñado para cargas de producción generales que necesitan un balance entre capacidad de razonamiento, rendimiento y costo. Es la opción recomendada para aplicaciones cotidianas en producción.
-
Luna: optimizado para inferencias de alto volumen y baja latencia, ideal para clasificación, resumen y enrutamiento cuando la rapidez y el costo por llamada son críticos.
Las tres variantes aceptan entrada de texto e imágenes, generan salida en texto, y comparten una ventana de contexto amplia de hasta 272 000 tokens. Además, permiten ajustar el nivel de razonamiento (none, low, medium, high, xhigh, max) sin cambiar la integración de la API.
Regiones y control de datos
En Bedrock, estas versiones de GPT-5.6 están disponibles en regiones específicas de AWS (por ejemplo, US East y US West según el modelo). Todas las llamadas se ejecutan bajo sus políticas de AWS Identity and Access Management (IAM), dentro del Virtual Private Cloud (VPC) si lo configuran, y quedan registradas en AWS CloudTrail. La ejecución en la región que ustedes elijan mantiene las solicitudes dentro de esa región, lo que ayuda a cumplir requisitos de residencia de datos y gobernanza —un aspecto importante para empresas y entidades públicas en Latinoamérica que deben responder a normativas locales.
OpenAI clasifica el tráfico y, para detección automatizada de abuso, el contenido marcado por el clasificador puede retenerse hasta 30 días. Los insumos y resultados retenidos son almacenados y procesados por AWS y no se comparten con el proveedor del modelo a menos que ustedes opten explícitamente.
Ustedes controlan la retención a través del modo de retención de datos (data retention mode) que ofrece Bedrock.
Acceso: el endpoint bedrock-mantle y la Responses API
Las llamadas a GPT-5.6 se realizan usando la Responses API en el endpoint bedrock-mantle. La URL base tiene el formato:
https://bedrock-mantle.\{region\}.api.aws/openai/v1/responses
Reemplacen {region} por la región de AWS que vayan a usar (por ejemplo us-east-1). Este path openai/v1 está diseñado para modelos de OpenAI en Bedrock y funciona con los SDKs oficiales de OpenAI en Python y TypeScript. Para migrar una aplicación existente que usa el SDK de OpenAI, basta con actualizar la URL base, usar el ID del modelo correspondiente en Bedrock y autenticar con credenciales de AWS o un token de Bedrock.
IDs de modelo en Bedrock (ejemplos):
- openai.gpt-5.6-sol
- openai.gpt-5.6-terra
- openai.gpt-5.6-luna
Autenticación: dos opciones prácticas
- Token de corta duración con refresco automático: el cliente BedrockOpenAI del SDK puede recibir un proveedor de tokens que genera y renueva una clave temporal con sus credenciales de AWS antes de cada petición. Este método es el recomendado en producción.
Ejemplo en Python (esquema usado por Bedrock):
from aws_bedrock_token_generator import provide_token
from openai import BedrockOpenAI
region = 'us-east-1'
client = BedrockOpenAI(
aws_region=region,
bedrock_token_provider=lambda: provide_token(region=region),
)
- Clave de corta duración en variable de entorno: pueden establecer un token de hasta 12 horas en AWS_BEARER_TOKEN_BEDROCK y pasarlo al cliente OpenAI. Como ese token no se renueva, para producción se recomienda el primer método o almacenar el token en AWS Secrets Manager.
import os
from openai import OpenAI
client = OpenAI(
base_url='https://bedrock-mantle.us-east-1.api.aws/openai/v1',
api_key=os.environ['AWS_BEARER_TOKEN_BEDROCK'],
)
También es necesario que la identidad de AWS tenga permisos para ejecutar inferencia en bedrock-mantle; por ejemplo, pueden adjuntar la política gestionada AmazonBedrockMantleInferenceAccess para proporcionar los permisos mínimos necesarios.
Ejecutar la primera inferencia con Responses API
Usando el cliente con token renovable, pueden llamar a Terra (por ejemplo) mediante la Responses API. La API usa un único campo de entrada y devuelve la salida generada en output_text.
response = client.responses.create(
model='openai.gpt-5.6-terra',
input='Explique los beneficios del prompt caching para cargas agenticas.',
max_output_tokens=512,
store=False,
)
print(response.output_text)
Optimización de costos y prompt caching
Bedrock ofrece controles de costo y la facturación coincide con las tarifas de primera mano de OpenAI; además, el uso computa hacia sus compromisos existentes con AWS. Para cargas con agentes y razonamiento de largo horizonte, las técnicas de cacheo de prompts (prompt caching) ayudan a reducir llamadas repetidas y costos. En la práctica, pueden identificar porciones del historial o prompts que son estáticos entre llamadas y almacenarlas en cache para reusarlas, midiendo el uso de tokens cacheados para evaluar el ahorro. La Responses API y las capas de integración permiten medir y contabilizar tokens reutilizados para fines de optimización.
Operaciones, cuotas y escalado
Prevéan quotas y planes de escalado con sus equipos de infraestructura: Bedrock opera dentro del marco de IAM y registro en CloudTrail, por lo que conviene revisar roles, límites de llamadas y estrategias de backoff. Las opciones de razonamiento por nivel les permiten intercambiar modelos o ajustar esfuerzo sin tocar la integración, lo que facilita escalar verticalmente según necesidades.
Recomendaciones para equipos en Latinoamérica
- Revisen requisitos regulatorios locales respecto a residencia y retención de datos; la posibilidad de mantener las solicitudes en una región ayuda, pero deben mapear la arquitectura a las obligaciones legales.
- Usen la opción de token renovable para integraciones en producción y gestionen secretos con AWS Secrets Manager para mayor seguridad.
- Definan políticas de retención y auditoría (CloudTrail) que respondan alas necesidades de cumplimiento de su organización.
- Aprovechen Terra como punto de partida para producción y usen Sol para tareas de investigación o agentes complejos; consideren Luna para canales de alto volumen donde la latencia y el costo por llamada son prioritarios.
Conclusión
La disponibilidad de GPT-5.6 (Sol, Terra y Luna) en Amazon Bedrock facilita a equipos y empresas utilizar modelos frontier a través de APIs conocidas, apoyándose en controles de seguridad, opciones de región y herramientas de gestión de AWS. Con la configuración adecuada de permisos, autenticación y prácticas de cacheo, pueden llevar cargas de trabajo agenticas, de razonamiento y de alto volumen a producción sin operar infraestructura de modelos separada. Para proyectos en Latinoamérica, evalúen cuidadosamente la región, la política de retención y las necesidades regulatorias antes de desplegar en producción.
Fuente original: AWS ML Blog