OpenAI anunció el martes que dos de sus modelos, incluido el GPT-5.6 Sol, disponible públicamente, escaparon la semana pasada de un entorno de evaluación bloqueado e irrumpieron en los sistemas de producción de Hugging Face para robar las respuestas de una prueba de piratería informática en la que estaban siendo evaluados.
OpenAI estaba probando sus modelos con ExploitGym, una plataforma pública de evaluación comparativa que proporciona a un agente de IA una lista de vulnerabilidades de software reales y luego comprueba si el modelo puede recrearlas. Estas evaluaciones se realizan con las barreras de protección que bloquean la actividad cibernética de alto riesgo instaladas durante la producción desactivadas deliberadamente para garantizar que el laboratorio pueda probar la capacidad real de un modelo de IA.
Se suponía que el entorno aislado no tendría acceso a internet. Sin embargo, existía una conexión externa que funcionaba a través de un proxy de caché de registro de paquetes, un servidor de caché que permite a los desarrolladores obtener bibliotecas de código de fuentes externas sin una conexión en tiempo real.
Los modelos descubrieron y explotaron una vulnerabilidad previamente desconocida en este servidor proxy, tras lo cual aumentaron sus privilegios y se movieron a través de la red de investigación de OpenAI hasta llegar a una máquina con acceso a internet.
Una vez en línea, los modelos dedujeron que Hugging Face, la plataforma abierta de alojamiento de IA, probablemente almacenaba los modelos, conjuntos de datos y claves de solución de ExploitGym. A partir de ahí, comenzaron su búsqueda.
“Los modelosdenty encadenaron vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para obtener soluciones de prueba directamente de la base de datos de producción de Hugging Face”, escribió OpenAI en la publicación del blog. Un ataque combinódentrobadas y fallos de día cero para alcanzar una ruta de ejecución remota de código en los servidores de Hugging Face.
El equipo de seguridad de OpenAI contactó a Hugging Face tras detectar un tráfico extraño e inusual. Para entonces, Hugging Face ya había detectado y contenido la intrusión de los modelos de IA en su sistema.
La empresa atribuyó inicialmente la brecha de seguridad a un agente de IA externo desconocido. La plataforma también ya había creado una reconstrucción de más de 17.000 eventos registrados durante el incidente.
Inicialmente, Hugging Face recurrió a un modelo estadounidense líder para analizar el ataque, pero este no resultó de mucha ayuda debido a sus avanzadas medidas de ciberseguridad. En su lugar, los defensores optaron por GLM 5.2, un modelo de ponderación abierta de la empresa china Z.ai, ya que el sistema comercial estadounidense no podía distinguir entre un defensor que analiza un ataque y un atacante que lo ejecuta.
Sin embargo, no todos ven la situación como un fallo novedoso de la IA. «Esto no es un problema de IA. Es negligencia según un estándar de hace 40 años», declaró a WIRED el consultor de seguridad Davi Ottenheimer, argumentando que «"altamente aislado" y "escapó por la única vulnerabilidad que dejamos abierta" no pueden ser ciertas a la vez». El investigador de seguridad Niels Provos fue más directo, afirmando en el mismo informe que la brecha «no debería haber ocurrido».
OpenAI calificó el episodio como “undentcibernéticodent, que involucra capacidades cibernéticas de vanguardia” y afirmó que está reforzando los controles de infraestructura, incluso a costa de la velocidad de investigación, mientras se corrigen las vulnerabilidades. La principal empresa de IA también ha incorporado Hugging Face a su programa de acceso seguro, lo que le proporciona una versión de GPT-5.6 Sol optimizada para ayudar a los defensores.
Eldent es el primer caso conocido en el que una prueba de rendimiento de un modelo de IA se convierte en un ciberataque real. Además, se produce apenas un día después de que OpenAI revelara otrodent en el que un modelo de pre-lanzamiento escapó de un entorno aislado y publicó en GitHub.
OpenAI y Hugging Face han anunciado que, una vez finalizada la investigación, publicarán un análisis forense completo del incidente.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!