Noticias

Anthropic presenta Claude Sonnet 5.5 con mejoras en programación, agentes y uso de computadores

La nueva versión se acerca a Opus 5.5 en varias pruebas y, ante el avance de sus capacidades de ciberseguridad, Anthropic incorpora más protecciones.

Compartir

Anthropic presentó Claude Sonnet 5.5, el segundo modelo de la familia Claude 5.5 y sucesor directo de Sonnet 5, con mejoras centradas en programación, trabajo con agentes, tareas profesionales y generación de documentos. Según la compañía, el modelo genera texto a una velocidad más de un 30 % mayor que Sonnet 5 y se acerca a Claude Opus 5.5 en varias de las evaluaciones publicadas.

Claude Sonnet 5.5 aumenta su rendimiento frente a Sonnet 5

Anthropic infomó mejoras frente a Sonnet 5 en todas las categorías incluidas en su tabla principal de evaluaciones, aunque Opus 5.5 mantiene resultados superiores en varias de ellas. Las pruebas abarcan programación con agentes, trabajo profesional, razonamiento multidisciplinario, uso de computadores y reconocimiento visual de gráficos.

Sonnet 5.5 alcanza 70,6% en Terminal-Bench 4.0, 55,5% en CursorBench 4.0, 1.844 puntos en GDPval-AA v2.1, 80,1% en OSWorld 2.1 y 61,6% en Chartography. En FrontierCode 1.1 obtiene 52,1% con esfuerzo Xhigh y 46,2% con Max.

Comparación de Claude Sonnet 5.5 con Sonnet 5, Opus 5.5 y GPT-6 Sol en las evaluaciones publicadas por Anthropic. | Créditos: Anthropic

Cabe notar que Sonnet 5.5 supera a GPT-6 Sol en GDPval-AA, AA-Briefcase y Chartography. En FrontierCode también queda por encima con esfuerzo Xhigh (52,1 % frente a 49,3 %), aunque con Max baja a 46,2 %. Los guiones indican que no hay resultados públicos de GPT-6 Sol para esas pruebas.

Anthropic advierte que las cifras de GPT-6 Sol en GDPval-AA, AA-Briefcase y Chartography podrían no reflejar una corrección reciente de un problema de reconocimiento de imágenes. Artificial Analysis no prevé cambios importantes en las dos primeras pruebas y, según las pruebas internas citadas por Anthropic, Chartography no se vio afectada

Terminal-Bench 4.0 mide tareas complejas ejecutadas desde una terminal

Terminal-Bench 4.0 evalúa si un modelo puede completar tareas profesionales complejas y de varios pasos mediante una interfaz de línea de comandos. El gráfico muestra cómo cambia el porcentaje de tareas resueltas entre los distintos niveles de esfuerzo utilizados por los modelos.

  • Sonnet 5.5 alcanza un máximo de 70,6%, frente al 10,3% registrado por Sonnet 5.
  • Con esfuerzo Medium, Sonnet 5.5 ya supera el mejor resultado mostrado para Sonnet 5.
  • Opus 5.5 obtiene 66,4% en el resultado incluido en la tabla general de Anthropic.
  • El rendimiento de Sonnet 5.5 aumenta entre Low, Medium, High, Xhigh y Max.
  • Anthropic no muestra GPT-6 Sol en esta evaluación porque Terminal-Bench y OpenAI no habían publicado resultados para ese modelo, por lo que el gráfico utiliza GPT-5.6 Sol.
Rendimiento de Claude Sonnet 5.5, Opus 5.5, Sonnet 5 y GPT-5.6 Sol en Terminal-Bench 4.0. | Créditos: Anthropic

FrontierCode 1.1 evalúa si los cambios realizados por un agente podrían integrarse al código

FrontierCode 1.1 mide si las modificaciones de código generadas por un agente podrían ser aceptadas e integradas sin ediciones humanas posteriores. La evaluación también considera negativamente los cambios que exceden el alcance solicitado.

  • Sonnet 5.5 registra 52,1% con Xhigh y 46,2% con Max, mientras Sonnet 5 alcanza 42,4%.
  • Opus 5.5 obtiene 54,4% y GPT-6 Sol registra 49,3%.
  • El resultado de Sonnet 5.5 no aumenta de forma continua al elevar el esfuerzo, ya que Xhigh supera a Max.
  • Anthropic atribuye esa caída en Max a que Claude Code ejecutó con mayor frecuencia su función de revisión de código, lo que en algunos casos produjo tiempos de espera o modificaciones adicionales fuera del alcance solicitado.
Resultados de Claude Sonnet 5.5, Opus 5.5, Sonnet 5 y GPT-6 Sol en FrontierCode v1.1. | Créditos: Anthropic

Según Anthropic, con esfuerzo High, Sonnet 5.5 iguala el mejor resultado de GPT-6 Sol en esta prueba por cerca de una quinta parte del costo por tarea.

CursorBench 4.0 utiliza tareas ambiguas y de múltiples archivos

CursorBench 4.0 prueba agentes de programación mediante problemas ambiguos que requieren trabajar sobre varios archivos y que proceden de sesiones reales de Cursor. La evaluación busca representar tareas más cercanas al trabajo sobre una base de código que los ejercicios aislados utilizados por otros benchmarks.

  • Sonnet 5.5 obtiene un máximo de 55,5%, frente al 34,1% de Sonnet 5.
  • Opus 5.5 alcanza 57,8%, una diferencia de 2,3 puntos porcentuales respecto del mejor resultado de Sonnet 5.5.
  • Sonnet 5.5 supera el mejor resultado de Sonnet 5 incluso con el nivel de esfuerzo Low mostrado en el gráfico.
  • La curva de Sonnet 5.5 permanece próxima a la de Opus 5.5 al aumentar el esfuerzo.
  • CursorBench 4.0 tampoco muestra resultados públicos para GPT-6 Sol, por lo que Anthropic utiliza GPT-5.6 Sol como referencia.
Comparación de agentes de programación en CursorBench 4.0, basado en tareas ambiguas y de múltiples archivos procedentes de sesiones reales de Cursor. | Créditos: Anthropic

AA-Briefcase v1.1 prueba trabajo de conocimiento de mayor duración

AA-Briefcase v1.1 está orientado al trabajo de conocimiento de horizonte prolongado, donde el modelo debe mantener y desarrollar una tarea durante una secuencia extensa de operaciones. El benchmark presenta el rendimiento mediante una puntuación Elo.

  • Sonnet 5.5 alcanza 1.811 puntos, frente a 1.359 de Sonnet 5.
  • Opus 5.5 obtiene 1.822 puntos, once puntos por encima de Sonnet 5.5.
  • GPT-6 Sol registra 1.483 puntos.
  • Sonnet 5.5 con esfuerzo Medium ya supera el mejor resultado presentado para Sonnet 5.
  • Anthropic señala que Artificial Analysis ejecutó AA-Briefcase y GDPval-AA sobre una versión previa al lanzamiento de Sonnet 5.5 afectada por un problema relacionado con solicitudes que utilizaban salidas estructuradas, posteriormente corregido.
Rendimiento de Claude Sonnet 5.5, Opus 5.5, Sonnet 5 y GPT-6 Sol en AA-Briefcase v1.1 según puntuación Elo. | Créditos: Anthropic

Sonnet 5.5 incorpora nuevas protecciones para tareas de ciberseguridad

Anthropic señala que las capacidades de ciberseguridad de Sonnet 5.5 aumentaron respecto de Sonnet 5, por lo que el modelo se publica con medidas similares a las utilizadas en Opus 5.5. Las tareas habituales de desarrollo y corrección de software continúan disponibles, mientras determinadas solicitudes de mayor riesgo pueden recurrir automáticamente a Sonnet 5.

El modelo mantiene las protecciones para biología utilizadas en Sonnet 5 e incorpora clasificadores destinados a dificultar ataques de destilación a gran escala. Anthropic también amplió su sistema de preserved thinking, desarrollado para impedir que el razonamiento generado por Claude pueda separarse de la cuenta que lo originó.

Ivan

Editor especializado en ciencia y tecnología, con foco en innovación, inteligencia artificial, telecomunicaciones y centros de datos. Trabajo con un enfoque riguroso y técnico, desarrollando contenidos sobre semiconductores, energía, ciberseguridad e infraestructura tecnológica.

Los comentarios de Disqus están cargando....
Publicado por
Ivan