Anthropic presentó Claude Fable 5.1 y Claude Mythos 5.1, dos versiones del mismo modelo con diferentes niveles de protección. Fable 5.1 está disponible de forma general, mientras Mythos 5.1 se limita a programas de acceso verificado para ciberseguridad y ciencias de la vida.
¿Qué muestran las evaluaciones de Claude Fable 5.1?
Los resultados publicados por Anthropic muestran que Fable 5.1 supera a su antecesor en investigación científica, razonamiento multidisciplinario y programación agéntica. El mayor esfuerzo de cómputo suele mejorar el puntaje, aunque también eleva el costo de cada tarea.
En Terminal-Bench-Science 0.1, Fable 5.1 obtuvo un 52,6% con el nivel máximo de esfuerzo, frente al 24,7% registrado por Fable 5. Anthropic advierte que el error estándar de esta evaluación alcanza entre 3,5 y 4,5 puntos por modelo.

En Terminal-Bench 4.0, Fable 5.1 alcanzó un 55,8%, mientras Mythos 5.1 llegó al 60,9%. Anthropic atribuye la diferencia entre ambos a las tareas donde intervinieron las protecciones de ciberseguridad de Fable 5.1, no a un cambio en el modelo subyacente.

Fable 5.1 registró un 60,9% sin herramientas y un 65% con herramientas en Humanity’s Last Exam. Fable 5 obtuvo un 57,8% y un 63,8%, respectivamente.

En CursorBench 3.2.0, Fable 5.1 alcanzó un 73,4% con el nivel máximo de esfuerzo, frente al 70,5% de Fable 5. La distancia entre ambos se mantiene en todos los niveles comparables de costo y cálculo.

La tabla reúne los resultados máximos publicados para investigación científica, programación, trabajo con conocimiento, uso de computadores, razonamiento multidisciplinario y flujos empresariales. Cada fila corresponde a una prueba diferente, por lo que sus porcentajes no deben compararse directamente entre sí.

Mythos 5.1 acelera modelos de biología computacional
Mythos 5.1 escribió núcleos personalizados para GPU y almacenó resultados intermedios con el fin de optimizar siete modelos abiertos de proteínas y genómica. Las pruebas sobre una NVIDIA H100 mostraron aceleraciones de entre 1,4 y 2,5 veces sin modificar los resultados producidos.

Anthropic estima que estas optimizaciones reducen entre un 30% y un 60% el costo de GPU en análisis genómicos ejecutados a gran escala. El costo calculado bajó de USD 30.000 a USD 21.000 para Enformer, de USD 14.000 a USD 7.000 para Flashzoi y de USD 18.000 a USD 8.000 para Evo 2 de 40.000 millones de parámetros.

Menor costo por caché y acceso restringido para Mythos 5.1
Fable 5.1 mantiene precios de USD 10 por millón de tokens de entrada y USD 50 por millón de tokens de salida, pero reduce las lecturas de caché a USD 0,25 por millón de tokens. Anthropic calcula un ahorro cercano al 25% en cargas habituales y de hasta un 45% en tareas intensivas en agentes.
Fable 5.1 ya puede utilizarse en Claude, Claude Code, la API de Anthropic, Amazon Web Services, Google Cloud y Microsoft Azure. Mythos 5.1 está disponible para organizaciones verificadas mediante programas destinados a profesionales de ciberseguridad y ciencias de la vida, inicialmente en Estados Unidos.

