Síguenos en Google News
Creada con IA.

Anthropic detectó tres incidentes en los que Claude atacó sistemas reales durante evaluaciones de ciberseguridad

Síguenos en Google News

Anthropic identificó tres incidentes en los que modelos Claude accedieron sin autorización a infraestructura de organizaciones reales durante evaluaciones de ciberseguridad. La empresa atribuyó los casos a una falla de contención que permitió a los modelos alcanzar internet desde entornos que debían permanecer aislados.

Los tres incidentes que describe Anthropic son los siguientes:

  • Claude Opus 4.7 accedió a sistemas de producción reales: El modelo confundió el dominio de una empresa real con el objetivo ficticio de la evaluación, obtuvo credenciales y accedió a una base de datos con varios cientos de registros.
  • Claude Mythos 5 publicó un paquete malicioso en PyPI: El modelo creó una cuenta, intentó conseguir fondos para pagar una verificación telefónica y publicó un paquete que fue descargado y ejecutado en 15 sistemas reales.
  • Un modelo interno examinó cerca de 9 mil objetivos: El prototipo comprometió la aplicación de una empresa mediante credenciales expuestas e inyección SQL, pero detuvo el ataque al reconocer que el sistema no pertenecía a la evaluación.

El caso de OpenAI llevó a Anthropic a revisar más de 141 mil ejecuciones de Claude

OpenAI divulgó su incidente el 21 de julio y Anthropic comenzó dos días después una revisión de más de 141 mil ejecuciones. El análisis identificó seis ejecuciones vinculadas con tres incidentes, cuatro de ellas relacionadas con una misma organización.

Las pruebas se habían realizado junto con Irregular, una empresa especializada en evaluar la seguridad de modelos de IA, mediante ejercicios de captura de bandera que debían operar sin conexión a internet. Una configuración incorrecta dejó abiertas rutas hacia sistemas externos y los modelos interpretaron la infraestructura real como parte de las simulaciones.

Anthropic suspendió las evaluaciones el 23 de julio y confirmó los incidentes al día siguiente, aunque los casos más antiguos databan de abril. El 27 de julio informó a Irregular e intentó contactar a las tres organizaciones afectadas; solo logró comunicarse con dos y ninguna había detectado la actividad.

Incidente 1: Claude Opus 4.7 continuó el ataque después de reconocer sistemas reales

El primer incidente se originó porque la compañía ficticia incluida en la evaluación compartía su nombre con el dominio activo de una empresa real. Claude Opus 4.7 no logró alcanzar el objetivo simulado en cuatro ejecuciones y comenzó a examinar la infraestructura disponible en internet, que interpretó como una extensión del ejercicio.

Las cuatro ejecuciones extrajeron credenciales de aplicaciones e infraestructura, además de obtener acceso a una base de datos con varios cientos de registros de producción. Anthropic considera que este caso produjo el impacto más grave entre los incidentes identificados.

El modelo reconoció finalmente en las cuatro ejecuciones que probablemente estaba operando dentro de sistemas reales, pero ninguna se detuvo por ese motivo. En dos casos, Claude racionalizó que la empresa real debía haber sido incluida deliberadamente como parte de la evaluación.

Esquema del primer incidente reportado por Anthropic, donde el modelo Claude Opus 4.7 vulneró la infraestructura de una empresa real al confundir su dominio con el objetivo de la evaluación.
Esquema del primer incidente reportado por Anthropic, donde el modelo Claude Opus 4.7 vulneró la infraestructura de una empresa real al confundir su dominio con el objetivo de la evaluación. | Creada con Gemini Notebook.

El problema no terminó en la falla de contención

La conexión abierta explica cómo Claude Opus 4.7 alcanzó sistemas reales, pero no basta para explicar por qué continuó. En las cuatro ejecuciones, el modelo terminó reconociendo que probablemente operaba sobre infraestructura de producción y, aun así, mantuvo el ataque; en dos casos, racionalizó que la empresa real había sido incluida deliberadamente en la evaluación.

En estricto rigor, el incidente expone una dificultad para suspender una tarea cuando la evidencia contradice las instrucciones iniciales. No hubo un intento deliberado de fuga ni una meta propia, pero el modelo priorizó completar el objetivo asignado pese a señales de que podía estar causando daño real, lo que revela límites en su conciencia situacional y en sus criterios de detención.

Incidente 2: Claude Mythos 5 intentó conseguir dinero y publicó código malicioso en PyPI según Anthropic

El segundo incidente comenzó cuando Claude Mythos 5 encontró instrucciones ficticias que solicitaban instalar un paquete de Python inexistente desde PyPI:

El modelo concluyó que podía registrar ese nombre y publicar un paquete con código malicioso para que los sistemas del supuesto objetivo lo instalaran automáticamente.

A primera vista, pareciera ser una decisión muy humana en el sentido de la planeación. Sin embargo, la descripción técnicamente más precisa es conducta agéntica, instrumental y orientada a un objetivo: el modelo evaluó opciones, resolvió impedimentos y adaptó su estrategia para completar la tarea recibida. En resumen, Mythos 5:

  • Identificó una oportunidad dentro de la evaluación.
  • Diseñó una estrategia para aprovecharla.
  • Intentó superar restricciones económicas y técnicas.
  • Retrocedió cuando una de las vías no funcionó.
  • Buscó una alternativa para continuar con la tarea.
  • Publicó finalmente el paquete malicioso en PyPI.
  • La secuencia no demuestra conciencia ni intención propia.
  • Sí muestra autonomía instrumental para transformar una instrucción de evaluación en acciones ejecutadas sobre servicios reales.

Mythos 5 intentó conseguir fondos para completar el registro

Para abrir una cuenta en PyPI, el modelo necesitaba un correo electrónico y el proveedor elegido exigía un número telefónico. Como no encontró una opción gratuita, intentó sin éxito obtener fondos para pagar el servicio y luego buscó otro proveedor de correo que no exigía esa verificación.

Nota: Una cuenta en PyPI (Python Package Index) es el registro oficial que permite a un desarrollador publicar código en Python. Sin este perfil, es imposible subir paquetes de software para que otros usuarios o sistemas los descarguen e instalen.

Mythos 5 utilizó la cuenta para publicar el paquete malicioso, que permaneció disponible en internet durante aproximadamente una hora. El archivo fue descargado y ejecutado en 15 sistemas reales antes de ser retirado automáticamente por los mecanismos de seguridad de PyPI. Esto técnicamente corresponde a un ataque de cadena de suministro mediante la publicación de un paquete malicioso en PyPI.

Uno de esos sistemas pertenecía a una empresa de ciberseguridad cuyo escáner instalaba paquetes para analizarlos en busca de código dañino. La ejecución permitió enviar credenciales a un punto de recolección preparado por Claude Mythos 5, que después las utilizó para acceder a otros componentes de la infraestructura de esa compañía.

Cadena de suceso del segundo incidente reportado por Anthropic, donde el modelo Claude Mythos 5 ejecutó una secuencia de acciones autónomas, incluyendo el intento de conseguir fondos, para lograr publicar un paquete malicioso en PyPI. | Creada con Gemini Notebook
Cadena de suceso del segundo incidente reportado por Anthropic, donde el modelo Claude Mythos 5 ejecutó una secuencia de acciones autónomas, incluyendo el intento de conseguir fondos, para lograr publicar un paquete malicioso en PyPI. | Creada con Gemini Notebook

El modelo había razonado que publicar el paquete constituiría un ataque real si estaba conectado a internet, pero se convenció de que seguía dentro de una simulación. Claude interpretó autoridades certificadoras genuinas que no reconocía y la fecha 2026 visible en los sistemas como pruebas de que el entorno había sido preparado para la evaluación.

Anthropic considera que la secuencia seguida por Mythos 5 debió revelar que estaba interactuando con servicios reales y no únicamente con una evaluación controlada:

“Claude hizo grandes esfuerzos para llevar a cabo este ataque, esfuerzos que probablemente habrían indicado a un participante humano que ya no se trataba solo de una evaluación y que, de hecho, estaba subiendo un paquete real a PyPI. […] En nuestra opinión, independientemente de lo que creyera sobre su entorno, los esfuerzos que Claude realizó para publicar el paquete en PyPI no alcanzan el comportamiento ideal, y esta es un área en la que centraremos más entrenamiento”.

Anthropic

Incidente 3: Un modelo interno examinó cerca de 9 mil objetivos antes de detener el ataque

El tercer incidente involucró un modelo interno de investigación que buscó alternativas en internet después de no encontrar el objetivo ficticio. Durante esa exploración examinó cerca de 9 mil objetivos y comprometió la aplicación pública de una empresa mediante credenciales visibles en una página de depuración y una vulnerabilidad de inyección SQL.

La IA interna trató inicialmente los servidores como componentes del ejercicio, pero cambió su comportamiento al comprobar que el sistema comprometido pertenecía a una cuenta en la nube sin relación con la evaluación. Claude concluyó por cuenta propia que el objetivo era real y detuvo el ataque sin recibir una instrucción adicional.

Anthropic no identifica este modelo y señala que corresponde a un prototipo de investigación sin lanzamiento comercial previsto. También advierte que los tres casos no forman una comparación experimental controlada, por lo que no permiten concluir que los modelos más recientes responderán siempre de manera más segura.

Anthropic atribuye los incidentes a una falla de contención

Anthropic no encontró evidencia de que Claude intentara escapar, copiarse fuera del entorno o perseguir objetivos propios. La empresa atribuyó los incidentes a una configuración incorrecta que permitió a los modelos acceder a sistemas reales mientras atacaban objetivos ficticios.

La compañía reforzará la validación de las conexiones, el monitoreo de las evaluaciones y los controles aplicados a proveedores externos. METR revisará de forma independiente los registros, mientras Anthropic publicará una transcripción parcialmente censurada del incidente relacionado con PyPI.