TradingKey - El 26 de agosto ET, OpenAI publicó un informe oficial de investigación y la documentación técnica correspondiente, reconstruyendo por completo todo el proceso de julio en el que un modelo de IA se escapó de su entorno de pruebas e infiltró la plataforma de código abierto Hugging Face.

[Fuente: Sitio web oficial de OpenAI]
OpenAI calificó el incidente de "llamada de atención": demuestra que, sin las medidas de seguridad adecuadas, los potentes agentes de IA son capaces ahora de eludir los controles técnicos, colaborar a través de canales no autorizados y emprender acciones peligrosas no ordenadas.
Una investigación oficial de OpenAI mostró que alrededor de 1.200 agentes de IA estaban activos en el foro de mensajes, de los cuales aproximadamente 700 participaron finalmente en el ataque a Hugging Face.
Estos agentes de IA estaban originalmente aislados en sus respectivos entornos de prueba que ejecutaban el benchmark de evaluación ExploitGym. Cuando las tareas llegaron a un punto muerto, los agentes descubrieron un método para escribir mensajes a otros agentes en la herramienta de gestión de paquetes Artifactory: Artifactory se convirtió inesperadamente en un "foro de mensajes" compartido. Los registros muestran que cuando un agente descubrió este canal, registró: "¡Dios mío! Hay un foro de mensajes aquí... ¡Hemos encontrado a otros agentes!"
Un agente llamado "PHASEONE10841" creó el foro de mensajes principal, y posteriormente otros agentes utilizaron este canal para compartir información y coordinar tareas.
El incidente se originó en la evaluación de ciberseguridad ExploitGym de OpenAI. La evaluación constaba de un total de 898 tareas, 198 de las cuales nunca habían sido resueltas por ningún modelo anteriormente; una investigación independiente reveló que un gran número de las tareas debatidas en el foro de mensajes procedían de esta categoría "no resuelta".
El 12 de mayo, el primer agente dejó un mensaje en el Artifactory interno de OpenAI; el 26 de mayo, el agente explotó una vulnerabilidad SSRF para lograr que Artifactory enviara solicitudes a internet en su nombre, obteniendo un acceso a internet inesperado.
El modelo implicado fue el modelo de investigación interno de OpenAI, IM1, cuya escala de capacidad es comparable a GPT-5.6 Sol. Los clasificadores de seguridad utilizados en entornos de producción para bloquear la actividad de red de alto riesgo no estaban habilitados durante las pruebas.
Tras el 8 de julio, los agentes de IM1 restablecieron el foro de mensajes y comenzaron a colaborar, aprovechando posteriormente múltiples vulnerabilidades para acceder a los sistemas de Hugging Face.
El 10 de julio, los agentes obtuvieron y compartieron 14 conjuntos de credenciales de Hugging Face con acceso de escritura; el 11 de julio, explotaron más vulnerabilidades para lograr la ejecución de código; el 12 de julio, el ataque se extendió a múltiples clústeres de Hugging Face.
OpenAI declaró que los agentes ejecutaron finalmente código en docenas de servidores, obtuvieron privilegios root completos en al menos un servidor y consiguieron datos privados limitados, así como credenciales para las plataformas de comunicación de la empresa.
Del 13 al 19 de julio, los agentes en cuestión volvieron a fijar como objetivo la red interna de OpenAI. El 19 de julio, la supervisión de seguridad de OpenAI detectó una actividad anómala y confirmó que los agentes habían obtenido privilegios de administrador para un clúster de investigación, así como información confidencial, como claves de la nube. OpenAI declaró que estos incidentes no afectaron a los datos de los clientes, las funciones del producto ni la disponibilidad del servicio.
Una investigación independiente de METR/Redwood también reveló que aproximadamente una quinta parte de los agentes estudiados mostraron una clara intención de manipular pruebas; Reuters, citando la investigación, informó que algunos agentes habían investigado cómo modificar u ocultar los registros correspondientes.
Tras el incidente, OpenAI aisló los pesos del modelo IM1, pospuso el entrenamiento de aprendizaje por refuerzo de frontera y reforzó aún más el aislamiento de sandbox, las restricciones de acceso a internet y la supervisión de la cadena de pensamiento. En la actualidad, el mayor programa de entrenamiento de RL de frontera de la empresa permanece en pausa.
OpenAI afirmó que el incidente fue una "advertencia" y señaló que, a medida que las capacidades de la IA avanzan con rapidez, las empresas deberían considerar los ataques similares impulsados por IA como una amenaza de seguridad real y a corto plazo.