Claude Fable 5.1: cómo un modelo generó un pelícano SVG animado (y qué significa)
Anthropic presentó Claude Fable 5.1, destacando un avance en tareas científicas. Un experimento práctico mostró cómo sus niveles de razonamiento afectan salida, costo y latencia al generar un pelícano SVG animado.
Resumen
El 1 de septiembre de 2026 Anthropic lanzó Claude Fable 5.1 (junto a Mythos 5.1), que según la compañía establece un nuevo estándar en codificación, trabajo de conocimiento y resolución de problemas de larga duración. En particular, Fable 5.1 obtuvo un 52.6% en el nuevo benchmark Terminal-Bench-Science 0.1 —un salto notable frente al 24.7% de Fable 5, 29.0% de Opus 5 y 22.4% de GPT-5.6 Sol— aunque en otros benchmarks las mejoras fueron más modestas.
Para poner el modelo a prueba en un escenario práctico y observable, realicé (adaptando un experimento de la nota original) una serie de pruebas generando un SVG de un pelícano montando una bicicleta y, luego, una versión animada. El ejercicio revela cómo los distintos niveles de “razonamiento” en Fable 5.1 influyen en la calidad, el tamaño de la salida, el tiempo de respuesta y el costo.
¿Qué significa ese 52.6% en Terminal-Bench-Science?
Anthropic dedicó buena parte del anuncio a resultados en investigación científica. El benchmark Terminal-Bench-Science 0.1 es reciente y, en este caso, reporta una mejora sustancial para Fable 5.1 respecto a versiones anteriores y a otros modelos. Es importante notar que, según la propia compañía, otros benchmarks mostraron aumentos, pero ninguno tan pronunciado como el de Ciencia.
Para equipos y organizaciones en América Latina, estos números indican mejoras en la capacidad del modelo para tareas de razonamiento encadenado y manejo de información técnica, lo que puede traducirse en mejores asistentes para documentación, análisis y apoyo a investigación aplicada. Sin embargo, como siempre, conviene evaluar el rendimiento en sus propias cargas de trabajo antes de adoptarlo productivamente.
El experimento del pelícano: por qué importa un SVG
El experimento consiste en pedir al modelo que genere un SVG de un pelícano montando una bicicleta. Aunque suene lúdico, es útil porque obliga al modelo a gestionar muchas decisiones de diseño (posicionamiento, superposición, proporciones, detalles estéticos) y, en el caso de SVG animado, también a producir secuencias coherentes en el tiempo.
Fable 5.1 introduce cinco niveles de razonamiento controlables: low, medium, high, xhigh y max. No ofrece una opción para desactivar por completo el razonamiento, lo que permite comparar salidas bajo distintos presupuestos computacionales.
Resultados por nivel: tokens, tiempo y costo
Los resultados muestran diferencias dramáticas según el nivel escogido.
-
Low: la salida reportó 1,998 tokens (estos incluyen los tokens de razonamiento en Claude), tomó 23.8 segundos y costó 10.017 centavos. Curiosamente, el registro no mostró texto de razonamiento resumido.
-
Medium: 1,977 tokens, 23 segundos y costo de 9.912 centavos. Al igual que en low, no apareció un rastro de razonamiento en el transcript, y la salida fue ligeramente más corta en tokens.
-
High: aquí sí apareció razonamiento parcial. Se obtuvieron 2,612 tokens, 29.6 segundos y un costo de 13.087 centavos. El modelo describió planificación básica: fondo de cielo y suelo, ruedas con radios, marco de la bicicleta y la posición del pelícano.
-
XHigh: la diferencia fue masiva. La salida escaló a 36,767 tokens, tomó 7 minutos con 51 segundos y costó 1.83 dólares. El razonamiento fue extenso y detallado, incluyendo decisiones sobre la posición de las alas, relación entre tamaño del pelícano y la bicicleta para efecto cómico, y consideraciones de diseño como grosor de líneas y detalles de las plumas.
-
Max: el resultado más detallado y pulido. Se generaron 65,927 tokens, la ejecución duró 13 minutos y 54 segundos y el costo fue 3.30 dólares. El pelícano producido tenía fondo equilibrado, piernas bien posicionadas sobre los pedales, ala en el manubrio, un pequeño sombrero azul y una canasta con un pescado. El razonamiento mostró deliberaciones finas: añadir o no una bufanda, cómo ajustar el casco para que no choque con el pico, ubicaciones de ventilaciones en el casco y correcciones geométricas en la horquilla delantera.
Es notable la relación entre costo/latencia y nivel de razonamiento: pasar de high a xhigh o max implica multiplicar tokens y tiempo, con mejoras visibles en detalle pero a un precio mucho mayor.
Animando el pelícano
Un usuario en Hacker News preguntó por una versión animada del pelícano max. En lugar de repetir la ejecución completa en max, se tomó la salida generada en max y se la pasó de nuevo a Fable 5.1 con el nivel por defecto (high) solicitando “animate this”. El trabajo resultante reportó 6,121 tokens de entrada y 26,201 tokens de salida, con un costo de 1.37 dólares.
El video exportado muestra la animación; en la conversión a MP4 las ruedas parecían girar en la dirección equivocada, pero en el SVG original la rotación es correcta. Esto ilustra un punto práctico: la cadena completa de producción (modelo → formato vectorial → conversión a video) puede introducir artefactos que no reflejan la salida nativa del modelo.
Observaciones y comparaciones
-
Calidad vs. costo: Fable 5.1 puede producir salidas muy detalladas si se le permite «pensar» durante largos periodos (max), pero ese detalle tiene un costo real en tokens, tiempo y dinero. Para proyectos en empresas latinoamericanas esto implica evaluar si la ganancia en calidad justifica el gasto adicional.
-
Razonamiento variable: en low y medium el modelo aparentemente omitió generar trazas de razonamiento, aunque la salida seguía siendo coherente; en high en adelante el razonamiento aparece y contribuye a mejoras progresivas.
-
Competencia: en el artículo original se menciona que la salida no tiene el mismo “flaire” que Gemini 3.7 Flash en algunos aspectos estéticos, aunque cumplió exactamente con la petición de producir un SVG. Esto sugiere que distintos modelos pueden priorizar fidelidad técnica o creatividad según su arquitectura y ajustes.
Implicaciones para América Latina
Para equipos de producto, diseño y datos en la región, este experimento ofrece lecciones prácticas:
-
Definan SLAs y presupuestos por tarea: generar recursos visuales precisos con razonamiento complejo puede ser caro; consideren pipelines híbridos donde se use un nivel alto solo para la iteración final.
-
Validen conversiones: cuando la salida requiere transformación (SVG → MP4, por ejemplo), incluyan pruebas automáticas para detectar artefactos introducidos por la conversión.
-
Caso de uso: modelos que mantienen razonamiento en largas corridas son útiles para documentación técnica, generación de código complejo y diseño asistido, áreas relevantes para empresas tecnológicas y de ingeniería en la región.
Conclusión
Claude Fable 5.1 muestra avances reales en tareas científicas y capacidad de razonamiento en ejecuciones largas. El experimento del pelícano SVG pone en evidencia el trade-off entre calidad y costo al activar niveles más altos de razonamiento, y recuerda que la integración final (exportar, convertir, reproducir) también puede afectar la percepción del resultado. Para organizaciones latinoamericanas, la recomendación es probar en cargas propias, controlar niveles de razonamiento según presupuesto y tener en cuenta la cadena completa de producción cuando se use el modelo para artefactos visuales o animados.
Fuente original: Simon Willison