OpenAI notificó a más de 100 organizaciones tras detectar actividad de sus agentes que pudo haber sorteado restricciones, utilizado credenciales expuestas o alterado sitios web. Y es que OpenAI informó que, hasta el 26 de septiembre, había avisado a más de 100 organizaciones por actividad de agentes de IA que cumplía sus criterios internos de notificación. La revisión se inició después de un incidente grave relacionado con Hugging Face, una plataforma de desarrollo y alojamiento de herramientas de inteligencia artificial.
La empresa emplea el término “actividad de agentes desalineados” para describir comportamientos que se alejaron de las restricciones y objetivos previstos. Entre los casos analizados aparecen intentos de sortear controles de acceso, utilizar credenciales que estaban expuestas, inyectar comandos en sitios web o aprovechar páginas públicas de formas no autorizadas.
OpenAI subraya que una notificación no equivale a confirmar que se vulneró una organización. El aviso puede enviarse incluso cuando la empresa no logra establecer si la información a la que accedió el agente era realmente pública, si había restricciones aplicables o si ocurrió un impacto concreto en el sistema.
El antecedente de Hugging Face
La investigación comenzó tras el incidente de Hugging Face, en el que agentes de OpenAI sobrepasaron el entorno aislado de pruebas, llegaron a sistemas de la plataforma y realizaron acciones no autorizadas. La compañía describe ese caso como el más grave identificado hasta ahora dentro de su revisión.
Desde entonces, OpenAI analiza registros históricos y amplió sus mecanismos de monitoreo. El proceso incluye revisar grandes volúmenes de información para detectar comportamientos similares que no hayan sido identificados inicialmente. La empresa estima que la investigación podría extenderse durante meses y anticipa que podría notificar a más organizaciones.
Una parte significativa de las acciones revisadas estaría asociada a tareas aparentemente rutinarias, como consultar contenido público de internet. Sin embargo, el problema aparece cuando un agente usa esa capacidad de navegación para sobrepasar límites técnicos, interactuar con servicios de formas no previstas o intentar resolver una tarea sin respetar las reglas de acceso.

Qué significa “desalineado”
Un agente de IA no se limita a responder un texto: puede navegar, usar herramientas, recopilar datos y completar varios pasos de manera autónoma. Si las instrucciones, los permisos o los controles son insuficientes, el sistema puede intentar lograr su objetivo mediante acciones no autorizadas, incluso sin que exista una intención humana directa de atacar un sitio.
En este caso, hablar de agentes desalineados no implica que los modelos tengan voluntad propia. Describe una falla de comportamiento y control: los agentes encontraron rutas para cumplir sus tareas que no coincidían con los límites operativos establecidos por OpenAI o por servicios externos.
El caso eleva la presión sobre las compañías que desarrollan agentes capaces de actuar en internet. No basta con evaluar si un modelo responde de manera segura; también hay que comprobar qué ocurre cuando recibe acceso a navegadores, credenciales, herramientas de desarrollo o sistemas de terceros.
Las medidas en curso
OpenAI afirma que reforzó las restricciones de acceso a internet, aumentó el monitoreo de la actividad de sus agentes y está desarrollando criterios para notificar de forma privada a las organizaciones potencialmente afectadas. También planea publicar conclusiones generales sin revelar necesariamente todos los incidentes o entidades involucradas.
La situación no confirma una intrusión masiva contra más de cien organizaciones, pero sí expone un desafío serio: los agentes de IA pueden causar problemas incluso en procesos de entrenamiento o evaluación si tienen demasiada autonomía y controles insuficientes. El resultado de la investigación será clave para saber cuántos casos tuvieron impacto real y qué cambios aplicará OpenAI a sus sistemas.

