GPT-6 Sol y Luna: rendimiento cercano a Astra a la mitad de precio
OpenAI presentó GPT-6 Sol y GPT-6 Luna para llevar capacidades cercanas a GPT-6 Astra a niveles de uso más accesibles. Además de reducir costos, prometen mejor caching, menos errores factuales y un estilo de respuesta más claro.
Introducción
OpenAI lanzó GPT-6 Sol y GPT-6 Luna como alternativas más económicas a su modelo de punta, GPT-6 Astra. La idea no es superar a Astra, sino desplegar muchas de sus mejoras —en factualidad, rendimiento profesional y uso con herramientas— en modelos que sean viables para uso diario y a gran escala. En este artículo desglosamos qué cambia, cómo impactan los precios y caching, qué dicen los benchmarks publicados y qué resultados prácticos vimos en pruebas rápidas.
¿Qué ofrecen Sol y Luna? Dos niveles, dos objetivos
OpenAI posiciona a Sol como el nivel intermedio: pensado para tareas exigentes a menor costo que Astra, con límites de uso más altos para iteración. Luna, por su parte, es la alternativa económica para volúmenes grandes donde el precio es crítico. Ambos reemplazan a sus versiones anteriores basadas en GPT-5.6.
Importante: OpenAI aclara que Astra sigue siendo su modelo más capaz en general. Sol y Luna buscan acercarse a esa calidad ofreciendo una relación costo/beneficio distinta.
Precios y disponibilidad
OpenAI anunció recortes de precio del 50% para las versiones GPT-6 de Sol y Luna frente a sus predecesores 5.6. En el caso de la salida de Luna, la caída en precio es mayor: de $1.20 a $0.50, lo que equivale a aproximadamente 58% menos. La compañía atribuye estas reducciones a mejoras en caching e inferencia que abaratan el servicio.
En cuanto a disponibilidad, GPT-6 Sol y Luna aparecen ya en ChatGPT Work y en Codex para usuarios Plus, Pro, Business, Enterprise y Edu; no están aún en el chat regular. Usuarios Free y Go pueden probar Luna desde la app de escritorio.
Mejoras técnicas relevantes
-
Mejor caching para agentes: los agentes y las conversaciones largas reinciden en contextos repetidos; el caching permite reutilizar esa información en lugar de reprocesarla. OpenAI dice que GPT-6 ofrece tasas de aciertos de cache más altas por defecto y aplica un descuento del 90% sobre el input cacheado. Además entrega herramientas para que desarrolladores midan y optimicen la cache: un dashboard que muestra cuánto se cachea y un diagnóstico que explica oportunidades perdidas. Cambios en el esfuerzo de razonamiento o activar/desactivar herramientas ya no invalidan el cache, y hay puntos explícitos para definir dónde termina la porción cacheada.
-
Menos errores factuales: en las pruebas internas de factualidad, GPT-6 Sol comete aproximadamente la mitad de errores que GPT-5.6 Sol, acercándose a la fiabilidad de Astra. OpenAI también afirma que Luna, cuando trabaja a mayor “esfuerzo”, iguala la factualidad de GPT-5.6 Sol a una fracción del costo (el anuncio menciona una relación cercana a una centésima del costo).
-
Estilo de colaboración más claro: tanto Sol como Luna heredan cambios en el estilo comunicativo de Astra: respuestas con menos jerga, menos detalles de bajo valor y un tono más directo y condensado, especialmente útil en conversaciones técnicas y de código.
Benchmarks públicos: cercano pero no superior
OpenAI publicó una tabla comparando a Sol y Luna con modelos líderes en varias pruebas. El patrón general: los nuevos modelos no superan consistentemente a las alternativas de punta, pero logran puntajes comparables a una fracción del costo por tarea. Algunos números destacados del anuncio:
- AutomationBench (workflows de negocio): Sol (xhigh) 33.2% frente a Claude Opus 5 (max) 26.9%; OpenAI resalta que Sol alcanza ese puntaje a ~9% del costo por tarea de Opus 5.
- Agents’ Last Exam (workflows profesionales): Sol (max) 56.4%, comparable al puntaje más alto de Claude Opus 5 pero con ~60% menos costo por tarea.
- DeepSWE v1.1 (ingeniería de software): Sol (max) 68.8% vs Claude Fable 5 (xhigh) 69.9% — cercano en rendimiento y alrededor de 80% más barato.
- DeepSWE v1.1 para Luna (max) 66.6% — comparable a competidores, con ahorros enormes (93%–96% más barato en el reporte).
- OSWorld 2.0 offline (uso de computadora): Sol (xhigh) 60.5% vs Claude Opus 5 (medium) 60.3% — similar pero con coste mucho menor.
OpenAI señala que muchas comparaciones usan puntajes de competidores tomados de informes públicos y que el entorno de prueba puede diferir del uso en ChatGPT.
Pruebas prácticas rápidas (hands-on)
Probamos GPT-6 Sol y Luna en tareas alineadas con sus objetivos: ver factualidad y habilidades técnicas en Sol; tareas prácticas y de volumen en Luna.
Test 1 (Sol): Verificación factual
Prompt: Listar decisiones del RBI sobre la tasa repo en 2025 con fechas, la tasa tras cada decisión y el cambio en puntos básicos. Si no está seguro, decirlo en lugar de adivinar.
Resultado: En la prueba, GPT-6 Sol respondió correctamente las seis decisiones de 2025, incluyendo la reunión de diciembre que no habíamos confirmado inicialmente. En lugar de conjeturar, Sol usó navegación en vivo para citar la decisión del RBI, lo que OpenAI califica como un pase limpio: la respuesta fue precisa y referenciada.
Test 2 (Sol): ¿Qué falla en este SQL?
Prompt y consulta SQL enviados al modelo mostraron que había “dos bugs” en la consulta. La primera vulnerabilidad que sugiere la consulta es el uso del WHERE sobre una columna de la tabla derecha (orders) en una LEFT JOIN, lo que convierte efectivamente la LEFT JOIN en una INNER JOIN y elimina a clientes sin pedidos. La segunda observación frecuente en este tipo de consultas es agrupar por el nombre del cliente en lugar de un identificador único (por ejemplo, c.id), lo que puede producir resultados ambiguos si existen nombres duplicados. En nuestro test, Sol identificó al menos la primera de estas fallas y explicó por qué la condición de filtrado debe moverse al ON o ajustarse para preservar clientes sin pedidos.
Pruebas con Luna: tareas de negocio y calendario
Probamos Luna en dos tareas representativas: cálculos de negocio cotidianos y programación entre zonas horarias. En línea con los benchmarks y la propuesta de valor, Luna resolvió las operaciones de aritmética y la organización de horarios de forma sólida y eficiente, mostrando el perfil esperado para un modelo optimizado para volumen y costo. OpenAI apunta que, con mayor esfuerzo, Luna puede igualar la factualidad de versiones previas más caras a una fracción del costo.
Puntos a vigilar para empresas en América Latina
- Costos y uso a escala: las reducciones de precio y el mejor caching hacen atractivo el despliegue masivo (por ejemplo, asistentes internos, automatizaciones de soporte y copilotos de código). Sin embargo, deben monitorear métricas de cache hit y diagnósticos para evitar sorpresas en la factura.
- Factualidad y fuentes: Sol mejora la factualidad y puede usar navegación, pero siempre es recomendable validar decisiones críticas con fuentes oficiales y rutinas de verificación.
- Integración con agentes y herramientas locales: el soporte mejorado de caching y puntos de ruptura facilitará integrar modelos en pipelines que manejan contexto largo (workflows de RR. HH., atención al cliente, procesos legales), muy presentes en la región.
- Privacidad y cumplimiento: antes de incorporar GPT-6 a procesos que manejan datos sensibles (finanzas, salud), revisar contratos y opciones de despliegue empresarial para asegurar cumplimiento local.
Conclusión
GPT-6 Sol y Luna representan la apuesta de OpenAI por democratizar capacidades cercanas a su modelo de punta, Astra, reduciendo costos y mejorando aspectos técnicos como caching y factualidad. Para empresas y equipos en América Latina esto abre oportunidades para desplegar IA avanzada en más procesos cotidianos, siempre con la precaución de medir cache, validar salidas críticas y ajustar el nivel de modelo según el caso de uso: Sol para trabajo técnico exigente y Luna para volumen económico.
En resumen: no son la nueva cima, pero sí una alternativa muy práctica para quien busca aproximarse a la calidad de Astra sin pagar su coste completo.
Fuente original: Analytics Vidhya