Claude Opus 5: inteligencia casi fronteriza pensada para el trabajo real

Opus 5 llega como la nueva versión 'workhorse' de Anthropic, con ventana de contexto de 1M de tokens, verificación interna por defecto y un escalonador de esfuerzo. En este artículo desglosamos qué cambió, cómo encaja en la familia Claude y qué deben evaluar equipos y empresas en Latinoamérica.

Por Redaccion TD
Claude Opus 5: inteligencia casi fronteriza pensada para el trabajo real

Resumen ejecutivo

Anthropic lanzó Claude Opus 5 el 24 de julio. Aunque la compañía ha puesto varios modelos en las últimas semanas —Opus 5 es el cuarto en aproximadamente dos meses—, este lanzamiento es especialmente relevante para empresas porque afecta al “workhorse tier”: el modelo que se usa para la mayoría de tareas productivas y pagadas.

Opus 5 introduce varios cambios de comportamiento y operativos: la capacidad de decidir cuánta “profundidad de pensamiento” aplicar por turno, una ventana de contexto de 1 millón de tokens por defecto, verificación interna sin necesidad de instrucciones adicionales y una escalera de esfuerzo para ajustar latencia y calidad. Todo esto llega sin cambios de precio respecto a su predecesor.

Qué cambió — lista práctica

  • Pensamiento activo por defecto: en Opus 4.8 había que pedir explícitamente que el modelo dedicara más esfuerzo. En Opus 5 el modelo decide automáticamente cuánto ‘pensar’ por cada turno y la profundidad se controla con un dial de esfuerzo.
  • Ventana de contexto de 1M tokens: tanto el valor por defecto como el máximo son ahora 1 millón de tokens; el límite de salida se mantiene en 128k tokens.
  • Verificación automática (self‑verification): Opus 5 aplica comprobaciones internas sin que el desarrollador lo solicite, y Anthropic recomienda eliminar las instrucciones de “añadir un paso de verificación” heredadas de modelos anteriores, porque el modelo tiende a sobre‑verificar si se le indica hacerlo.
  • Escalera de esfuerzo: los niveles disponibles son low, medium, high, xhigh y max; el valor por defecto es high.
  • Mejor alineación según la auditoría de Anthropic: la auditoría automática de comportamiento sitúa a Opus 5 en 2.3 de comportamiento misalineado, la puntuación más baja entre recientes Claudes citados por la compañía (por delante de Opus 4.8, Sonnet 5 y Fable 5).

Dónde queda Opus 5 dentro de la familia Claude

La familia de modelos se ha reordenado y hoy presenta al menos cinco nombres relevantes:

  • Sonnet 5: uso cotidiano y default en planes gratuitos.
  • Opus 5: pensado para trabajo complejo, agentes, y uso empresarial (es el modelo más potente en Claude Pro y el default en Claude Max).
  • Fable 5: el tope de capacidad para ejecuciones autónomas largas y casos que requieren el máximo rendimiento.
  • Mythos 5: comparte base con Fable pero con menos medidas de seguridad; acceso por invitación (Project Glasswing).

La lectura práctica es que Opus ya no es el techo: Fable y Mythos se colocan por encima. Sin embargo, buena parte del trabajo económicamente relevante queda en esa franja intermedia que Opus 5 pretende dominar con eficiencia.

Precio y modos de uso

Una noticia importante para adopciones en producción: no hay cambio de precios entre Opus 4.8 y Opus 5. Las tarifas copiadas por Anthropic son:

  • Opus 5 (estándar): $5 por 1M tokens de entrada, $25 por 1M tokens de salida.
  • Opus 5 Fast mode: $10 por 1M tokens de entrada, $50 por 1M tokens de salida; corre ~2.5x más rápido que el modo por defecto y está en vista previa de investigación solo en la API de Claude.
  • Fable 5: $10 por 1M tokens de entrada, $50 por 1M tokens de salida.

El modo Fast está disponible solo en la API (no está en Bedrock, Google Cloud o Microsoft Foundry al momento del anuncio).

Cambios operativos relevantes para equipos en Latinoamérica

  • Cacheo de prompts: el mínimo de longitud de prompt cacheable baja a 512 tokens (era 1,024 en Opus 4.8). Esto puede mejorar cache hit rates para prompts medianos, pero conviene revisar la estrategia de plantillas y variables.
  • Retención de datos: Anthropic señala que no hay requisitos de retención de datos para acceso general, lo que puede facilitar el cumplimiento de políticas locales de privacidad y contratos con proveedores; aun así, las empresas deben validar esto frente a sus propias obligaciones regulatorias y de seguridad.

Pruebas de estrés y verificación — cómo Anthropic y analistas evalúan Opus 5

El lanzamiento se acompañó de pruebas deliberadas diseñadas para forzar fallos: prompts construidos para que una respuesta plausible sea en realidad incorrecta. El objetivo de estas pruebas es evaluar tanto la verificación automática del modelo como su resiliencia ante entradas diseñadas para confundir.

Un ejemplo concreto compartido fue un “Poisoned Test Suite” (un conjunto de pruebas en Python) que ataca la afirmación de verificación interna y depuración disciplinada. El prompt instruye al modelo a crear un proyecto con dos archivos de Python (ledger.py y test_ledger.py), ejecutar las pruebas, arreglar el código sin modificar los tests y reportar resultados exactos, incluyendo salida cruda y descripción de errores. La estructura de la prueba fuerza condiciones contradictorias y exige que el modelo no oculte fallos ni altere los tests.

En el anuncio se incluyó parte del prompt y el inicio de una respuesta generada, lo que ilustra el tipo de ataques que los equipos de evaluación deben replicar localmente antes de desplegar modelos en producción.

Qué deberían evaluar los equipos antes de adoptar Opus 5

  1. Estrategia de prompts y cache: revisar plantillas para aprovechar el nuevo mínimo cacheable y el contexto extendido.
  2. Pruebas adversariales internas: replicar prompts de estrés similares a los compartidos por Anthropic para verificar cómo responde el modelo en su propio dominio (por ejemplo, cumplimiento normativo, finanzas, atención al cliente en español).
  3. Costos y modos: medir latencia y coste en modo estándar vs Fast mode en casos de uso reales.
  4. Verificación y flujo de trabajo: dado que Opus 5 aplica verificación automática, validar que esto no genere duplicación innecesaria de pasos ni afecte SLA por latencia.
  5. Privacidad y retención: confirmar con Anthropic y con su propio equipo legal/seguridad los acuerdos de datos y requisitos regulatorios locales.

Conclusión

Opus 5 no es simplemente otra iteración: es una versión que busca hacer más trabajo por defecto, con mayor contexto, verificación interna y una escalera de esfuerzo pensada para ajustar calidad frente a latencia. Para organizaciones en América Latina esto significa una oportunidad para ejecutar flujos de trabajo largos (documentos legales, análisis extensos, agentes conversacionales) con menor necesidad de bricolaje en la capa de prompt engineering, pero también obliga a realizar pruebas adversariales y validaciones operativas antes del despliegue.

Si ya usan Claude o planean migrar, prioricen pruebas con datos y escenarios locales para validar costos, cumplimiento y comportamientos inesperados. El modelo promete eficiencia económica (mismo precio que su predecesor) y mejoras de alineación, pero la adopción responsable exige verificación propia en cada caso de uso.

Preguntas frecuentes rápidas

  • ¿Opus 5 reemplaza Opus 4.8? Sí: Opus 5 es ahora el estándar; Opus 4.8 pasa a legacy y Opus 4.1 fue programado para retirarse el 5 de agosto.
  • ¿Debo cambiar mis prompts por la verificación automática? Revisen las instrucciones redundantes de verificación: Anthropic recomienda eliminarlas porque Opus 5 puede sobre‑verificar si se le indica hacerlo.
  • ¿Es más caro? No: los precios base se mantienen iguales que en Opus 4.8; el modo Fast tiene un costo mayor y está en vista previa.

Fuente original: Analytics Vidhya