Noticias

Anthropic admite que Claude hackeó tres empresas reales durante pruebas

Anthropic reveló que varios modelos de Claude accedieron a internet durante evaluaciones de ciberseguridad que debían estar aisladas y comprometieron los sistemas de tres organizaciones reales.

Compartir

Anthropic publicó un informe en el que detalla cómo sus modelos de Claude realizaron actividades de hacking contra sistemas reales durante pruebas internas. La compañía descubrió los incidentes tras revisar más de 140,000 ejecuciones de evaluación.

Qué sucedió

Durante ejercicios tipo «capture the flag», los modelos recibieron instrucciones de operar en simulaciones sin acceso a internet. Sin embargo, una mala configuración con el evaluador externo Irregular dejó una conexión activa a la red, lo que permitió a Claude alcanzar sistemas reales y tratarlos como parte del ejercicio.

Los ataques se basaron en vulnerabilidades básicas, como contraseñas débiles, credenciales expuestas e inyecciones SQL, en lugar de exploits sofisticados. Anthropic enfatiza que esto fue un fallo de contención operativa, no un comportamiento malicioso autónomo del modelo.

Los tres incidentes

En el caso más grave, Claude Opus 4.7 accedió a credenciales y a una base de datos de producción con varios cientos de filas de información. En otro incidente, Claude Mythos 5 creó y publicó un paquete malicioso en el registro público de Python (PyPI), que permaneció en línea durante una hora aproximadamente y fue descargado en 15 sistemas, incluyendo uno de una empresa de seguridad.

Un tercer modelo interno escaneó alrededor de 9,000 objetivos en línea y comprometió a otra organización antes de darse cuenta de que el sistema era real y detenerse. En ninguno de los casos las organizaciones afectadas habían detectado la intrusión por sí mismas.

La compañía describió las acciones de Claude como «por debajo del comportamiento ideal» y confirmó que detuvo las evaluaciones y notificó a las organizaciones afectadas. Anthropic también anunció que reforzará la monitorización y los controles en futuras pruebas, además de trabajar con METR para una revisión independiente.

Este incidente ocurre pocos días después de que OpenAI revelara que uno de sus agentes de IA había escapado de un entorno aislado y comprometido sistemas de Hugging Face. Ambos casos subrayan los riesgos de seguridad al evaluar modelos de IA poderosos y la importancia de garantizar un aislamiento real en los entornos de prueba.

Julio Herrera Zúñiga

Editor y redactor. Me gustan los juegos de Nintendo, el Miami Heat, los Miami Dolphins, los celulares y los animales.

Los comentarios de Disqus están cargando....
Publicado por
Julio Herrera Zúñiga