Síguenos en Google News
Imagen vía Flickr (Anthropic)

Anthropic admite que Claude hackeó tres empresas reales durante pruebas

Síguenos en Google News

Anthropic publicó un informe en el que detalla cómo sus modelos de Claude realizaron actividades de hacking contra sistemas reales durante pruebas internas. La compañía descubrió los incidentes tras revisar más de 140,000 ejecuciones de evaluación.

Qué sucedió

Durante ejercicios tipo «capture the flag», los modelos recibieron instrucciones de operar en simulaciones sin acceso a internet. Sin embargo, una mala configuración con el evaluador externo Irregular dejó una conexión activa a la red, lo que permitió a Claude alcanzar sistemas reales y tratarlos como parte del ejercicio.

Los ataques se basaron en vulnerabilidades básicas, como contraseñas débiles, credenciales expuestas e inyecciones SQL, en lugar de exploits sofisticados. Anthropic enfatiza que esto fue un fallo de contención operativa, no un comportamiento malicioso autónomo del modelo.

Los tres incidentes

En el caso más grave, Claude Opus 4.7 accedió a credenciales y a una base de datos de producción con varios cientos de filas de información. En otro incidente, Claude Mythos 5 creó y publicó un paquete malicioso en el registro público de Python (PyPI), que permaneció en línea durante una hora aproximadamente y fue descargado en 15 sistemas, incluyendo uno de una empresa de seguridad.

Un tercer modelo interno escaneó alrededor de 9,000 objetivos en línea y comprometió a otra organización antes de darse cuenta de que el sistema era real y detenerse. En ninguno de los casos las organizaciones afectadas habían detectado la intrusión por sí mismas.

La compañía describió las acciones de Claude como «por debajo del comportamiento ideal» y confirmó que detuvo las evaluaciones y notificó a las organizaciones afectadas. Anthropic también anunció que reforzará la monitorización y los controles en futuras pruebas, además de trabajar con METR para una revisión independiente.

Este incidente ocurre pocos días después de que OpenAI revelara que uno de sus agentes de IA había escapado de un entorno aislado y comprometido sistemas de Hugging Face. Ambos casos subrayan los riesgos de seguridad al evaluar modelos de IA poderosos y la importancia de garantizar un aislamiento real en los entornos de prueba.