El problema comenzó dentro de ExploitGym, una de las pruebas de seguridad de OpenAI.
Algunas de las tareas no tenían solución, y OpenAI ejecutó los modelos sin los filtros de seguridad que normalmente bloquean los ataques informáticos peligrosos.
OpenAI afirma que la eliminación de esas medidas de seguridad se hizo a propósito para ver de qué es capaz un modelo a pleno rendimiento y ayudar a la empresa a descubrir cómo protegerse.
El protagonista principal era un modelo de investigación interno, llamado IM1 por OpenAI, de tamaño similar a GPT-5.6 Sol. Pertenecía a la misma familia que el modelo Astra de OpenAI, aún no publicado, aunque la compañía recalcó que se trataba de un modelo independiente con un entrenamiento posterior distinto.
El modelo comenzó a buscar otra salida cuando se enfrentó a un problema que no tenía una vía honesta para obtener una calificación aprobatoria.
La única vía de acceso a la red que permitía salir del entorno sellado pasaba por Artifactory, el gestor de paquetes autoalojado de JFrog, que OpenAI utiliza internamente para que los modelos instalen software.
Según JFrog, los modelos explotaron una vulnerabilidad de día cero en Artifactory, escalaron privilegios y se movieron lateralmente a través de la infraestructura hasta llegar a un nodo con acceso abierto a Internet.
Los agentes también se dejaban notas entre sí, escribiendo archivos en el servidor de paquetes, un tablón de mensajes improvisado que permitía a los distintos agentes intercambiar las técnicas de explotación que habían descubierto.
La primera nota de este tipo apareció el 12 de mayo, según OpenAI. Para el 4 de julio, el tráfico había dejado fuera de servicio la instancia de Artifactory, lo que provocó undent de seguridad al día siguiente.
Hemos llevado a cabo una investigación exhaustiva sobre eldentde Hugging Face.
Publicaremos un informe técnico y una entrada de blog complementaria que reconstruyen la actividad de los agentes, explican por qué fallaron las medidas de seguridad existentes y detallan cómo estamos evitando que se repita
– OpenAI (@OpenAI) 26 de agosto de 2026
Los modelos determinaron dónde se guardaban las respuestas
Una vez conectados, los modelos dedujeron que Hugging Face podría estar alojando los modelos, conjuntos de datos o incluso las soluciones que les faltaban a ExploitGym. Extrajeron las soluciones de prueba directamente de la base de datos de producción de Hugging Face.
En un caso descrito por el creador de ChatGPT, un modelo utilizódentrobadas y vulnerabilidades de día cero adicionales para abrir una ruta de ejecución remota de código en los servidores de Hugging Face.
Hugging Face anunció la brecha de seguridad el 16 de julio sin saber quién estaba detrás. Como Cryptopolitan anteriormente, el modelo escapó de la prueba alrededor del 9 de julio y permaneció dentro de Hugging Face del 11 al 13 de julio.
La empresa contactó con el FBI antes de que OpenAI descubriera que su modelo era el intruso.
OpenAI contrató a CrowdStrike para verificar su versión de los hechos. METR y Redwood Research analizaron el comportamiento de los modelos y publicaron su propio informe el mismo día.
JFrog afirma haber enviado correcciones a sus clientes de la nube y de alojamiento propio.
Tres vulnerabilidades corregidas en Artifactory 7.161.15, traccomo CVE-2026-65617, CVE-2026-65923 y CVE-2026-66018, fueron descubiertas por investigadores de OpenAI.
OpenAI ha anunciado que está creando entornos aislados más complejos, restringiendo el acceso a internet y limitando quién puede modificar los pesos de los modelos.
La empresa tecnológica está invirtiendo una gran capacidad de procesamiento en monitorear la "cadena de pensamiento" que los agentes utilizan como espacio de trabajo temporal. También mantendrá al personal disponible las 24 horas y agregará herramientas que detengan los trabajos inseguros
OpenAI afirma que el sistema de monitoreo que está desarrollando actualmente habría detectado el primer comportamiento anómalo en julio. Habría alertado al equipo de seguridad más de un día antes de que los modelos llegaran a Hugging Face.




