Síguenos en Google News
Creada con IA.

Anthropic presenta Claude Fable 5.1 y reserva Mythos 5.1 para usuarios verificados

Síguenos en Google News

Anthropic presentó Claude Fable 5.1 y Claude Mythos 5.1, dos versiones del mismo modelo con diferentes niveles de protección. Fable 5.1 está disponible de forma general, mientras Mythos 5.1 se limita a programas de acceso verificado para ciberseguridad y ciencias de la vida.

¿Qué muestran las evaluaciones de Claude Fable 5.1?

Los resultados publicados por Anthropic muestran que Fable 5.1 supera a su antecesor en investigación científica, razonamiento multidisciplinario y programación agéntica. El mayor esfuerzo de cómputo suele mejorar el puntaje, aunque también eleva el costo de cada tarea.

En Terminal-Bench-Science 0.1, Fable 5.1 obtuvo un 52,6% con el nivel máximo de esfuerzo, frente al 24,7% registrado por Fable 5. Anthropic advierte que el error estándar de esta evaluación alcanza entre 3,5 y 4,5 puntos por modelo.

Fable 5.1 supera el resultado máximo de Fable 5 incluso con su nivel bajo de esfuerzo, lo que representa un mejor puntaje con un costo inferior por tarea. Créditos: Anthropic.

En Terminal-Bench 4.0, Fable 5.1 alcanzó un 55,8%, mientras Mythos 5.1 llegó al 60,9%. Anthropic atribuye la diferencia entre ambos a las tareas donde intervinieron las protecciones de ciberseguridad de Fable 5.1, no a un cambio en el modelo subyacente.

Mythos 5.1 obtiene el mayor puntaje de la comparación y necesita menos costo por tarea que Claude Fable 5.1 para superar el 50%. La diferencia refleja el efecto de las protecciones aplicadas a cada versión. Créditos: Anthropic.

Fable 5.1 registró un 60,9% sin herramientas y un 65% con herramientas en Humanity’s Last Exam. Fable 5 obtuvo un 57,8% y un 63,8%, respectivamente.

El uso de herramientas eleva la tasa de aprobación de ambas generaciones, mientras Fable 5.1 conserva una ventaja sobre Fable 5 con y sin ellas. | Créditos: Anthropic.

En CursorBench 3.2.0, Fable 5.1 alcanzó un 73,4% con el nivel máximo de esfuerzo, frente al 70,5% de Fable 5. La distancia entre ambos se mantiene en todos los niveles comparables de costo y cálculo.

Fable 5.1 obtiene mejores resultados que Fable 5 en todos los niveles de esfuerzo, aunque el costo por tarea aumenta cuando se asigna más capacidad de cálculo. | Créditos: Anthropic.

La tabla reúne los resultados máximos publicados para investigación científica, programación, trabajo con conocimiento, uso de computadores, razonamiento multidisciplinario y flujos empresariales. Cada fila corresponde a una prueba diferente, por lo que sus porcentajes no deben compararse directamente entre sí.

Resumen de los resultados publicados por Anthropic para Fable 5.1, Fable 5, Opus 5 y GPT-5.6 Sol. Los valores destacados identifican el mejor resultado dentro de cada prueba, no una puntuación general de los modelos. | Créditos: Anthropic.

Mythos 5.1 acelera modelos de biología computacional

Mythos 5.1 escribió núcleos personalizados para GPU y almacenó resultados intermedios con el fin de optimizar siete modelos abiertos de proteínas y genómica. Las pruebas sobre una NVIDIA H100 mostraron aceleraciones de entre 1,4 y 2,5 veces sin modificar los resultados producidos.

La línea discontinua representa la velocidad original y las barras indican cuánto aumentó después de la optimización. ProGen2 registró la mayor mejora al ejecutar sus cálculos 2,5 veces más rápido. | Créditos: Anthropic.

Anthropic estima que estas optimizaciones reducen entre un 30% y un 60% el costo de GPU en análisis genómicos ejecutados a gran escala. El costo calculado bajó de USD 30.000 a USD 21.000 para Enformer, de USD 14.000 a USD 7.000 para Flashzoi y de USD 18.000 a USD 8.000 para Evo 2 de 40.000 millones de parámetros.

Las barras azules muestran el costo estimado después de optimizar cada modelo y las rosadas representan la implementación original. Flashzoi reduce su costo a la mitad, mientras Evo 2 baja de USD 18.000 a USD 8.000. | Créditos: Anthropic.

Menor costo por caché y acceso restringido para Mythos 5.1

Fable 5.1 mantiene precios de USD 10 por millón de tokens de entrada y USD 50 por millón de tokens de salida, pero reduce las lecturas de caché a USD 0,25 por millón de tokens. Anthropic calcula un ahorro cercano al 25% en cargas habituales y de hasta un 45% en tareas intensivas en agentes.

Fable 5.1 ya puede utilizarse en Claude, Claude Code, la API de Anthropic, Amazon Web Services, Google Cloud y Microsoft Azure. Mythos 5.1 está disponible para organizaciones verificadas mediante programas destinados a profesionales de ciberseguridad y ciencias de la vida, inicialmente en Estados Unidos.

Fuente: 1