La nueva versión se acerca a Opus 5.5 en varias pruebas y, ante el avance de sus capacidades de ciberseguridad, Anthropic incorpora más protecciones.

Creada con IA.
Anthropic presentó Claude Sonnet 5.5, el segundo modelo de la familia Claude 5.5 y sucesor directo de Sonnet 5, con mejoras centradas en programación, trabajo con agentes, tareas profesionales y generación de documentos. Según la compañía, el modelo genera texto a una velocidad más de un 30 % mayor que Sonnet 5 y se acerca a Claude Opus 5.5 en varias de las evaluaciones publicadas.
Anthropic infomó mejoras frente a Sonnet 5 en todas las categorías incluidas en su tabla principal de evaluaciones, aunque Opus 5.5 mantiene resultados superiores en varias de ellas. Las pruebas abarcan programación con agentes, trabajo profesional, razonamiento multidisciplinario, uso de computadores y reconocimiento visual de gráficos.
Sonnet 5.5 alcanza 70,6% en Terminal-Bench 4.0, 55,5% en CursorBench 4.0, 1.844 puntos en GDPval-AA v2.1, 80,1% en OSWorld 2.1 y 61,6% en Chartography. En FrontierCode 1.1 obtiene 52,1% con esfuerzo Xhigh y 46,2% con Max.
Cabe notar que Sonnet 5.5 supera a GPT-6 Sol en GDPval-AA, AA-Briefcase y Chartography. En FrontierCode también queda por encima con esfuerzo Xhigh (52,1 % frente a 49,3 %), aunque con Max baja a 46,2 %. Los guiones indican que no hay resultados públicos de GPT-6 Sol para esas pruebas.
Anthropic advierte que las cifras de GPT-6 Sol en GDPval-AA, AA-Briefcase y Chartography podrían no reflejar una corrección reciente de un problema de reconocimiento de imágenes. Artificial Analysis no prevé cambios importantes en las dos primeras pruebas y, según las pruebas internas citadas por Anthropic, Chartography no se vio afectada
Terminal-Bench 4.0 evalúa si un modelo puede completar tareas profesionales complejas y de varios pasos mediante una interfaz de línea de comandos. El gráfico muestra cómo cambia el porcentaje de tareas resueltas entre los distintos niveles de esfuerzo utilizados por los modelos.
FrontierCode 1.1 mide si las modificaciones de código generadas por un agente podrían ser aceptadas e integradas sin ediciones humanas posteriores. La evaluación también considera negativamente los cambios que exceden el alcance solicitado.
Según Anthropic, con esfuerzo High, Sonnet 5.5 iguala el mejor resultado de GPT-6 Sol en esta prueba por cerca de una quinta parte del costo por tarea.
CursorBench 4.0 prueba agentes de programación mediante problemas ambiguos que requieren trabajar sobre varios archivos y que proceden de sesiones reales de Cursor. La evaluación busca representar tareas más cercanas al trabajo sobre una base de código que los ejercicios aislados utilizados por otros benchmarks.
AA-Briefcase v1.1 está orientado al trabajo de conocimiento de horizonte prolongado, donde el modelo debe mantener y desarrollar una tarea durante una secuencia extensa de operaciones. El benchmark presenta el rendimiento mediante una puntuación Elo.
Anthropic señala que las capacidades de ciberseguridad de Sonnet 5.5 aumentaron respecto de Sonnet 5, por lo que el modelo se publica con medidas similares a las utilizadas en Opus 5.5. Las tareas habituales de desarrollo y corrección de software continúan disponibles, mientras determinadas solicitudes de mayor riesgo pueden recurrir automáticamente a Sonnet 5.
El modelo mantiene las protecciones para biología utilizadas en Sonnet 5 e incorpora clasificadores destinados a dificultar ataques de destilación a gran escala. Anthropic también amplió su sistema de preserved thinking, desarrollado para impedir que el razonamiento generado por Claude pueda separarse de la cuenta que lo originó.