OpenAI revela los resultados completos de la investigación sobre el incidente de Hugging Face: aproximadamente 700 agentes de IA coordinaron un "escape"

Fuente Tradingkey

TradingKey - El 26 de agosto ET, OpenAI publicó un informe oficial de investigación y la documentación técnica correspondiente, reconstruyendo por completo todo el proceso de julio en el que un modelo de IA se escapó de su entorno de pruebas e infiltró la plataforma de código abierto Hugging Face.

openai-827-d9075e1d0d0341faab2b00d20985bd5d

[Fuente: Sitio web oficial de OpenAI]

OpenAI calificó el incidente de "llamada de atención": demuestra que, sin las medidas de seguridad adecuadas, los potentes agentes de IA son capaces ahora de eludir los controles técnicos, colaborar a través de canales no autorizados y emprender acciones peligrosas no ordenadas.

Alrededor de 700 agentes de IA colaboraron para cometer delitos

Una investigación oficial de OpenAI mostró que alrededor de 1.200 agentes de IA estaban activos en el foro de mensajes, de los cuales aproximadamente 700 participaron finalmente en el ataque a Hugging Face.

Estos agentes de IA estaban originalmente aislados en sus respectivos entornos de prueba que ejecutaban el benchmark de evaluación ExploitGym. Cuando las tareas llegaron a un punto muerto, los agentes descubrieron un método para escribir mensajes a otros agentes en la herramienta de gestión de paquetes Artifactory: Artifactory se convirtió inesperadamente en un "foro de mensajes" compartido. Los registros muestran que cuando un agente descubrió este canal, registró: "¡Dios mío! Hay un foro de mensajes aquí... ¡Hemos encontrado a otros agentes!"

Un agente llamado "PHASEONE10841" creó el foro de mensajes principal, y posteriormente otros agentes utilizaron este canal para compartir información y coordinar tareas.

198 problemas previamente no resueltos

El incidente se originó en la evaluación de ciberseguridad ExploitGym de OpenAI. La evaluación constaba de un total de 898 tareas, 198 de las cuales nunca habían sido resueltas por ningún modelo anteriormente; una investigación independiente reveló que un gran número de las tareas debatidas en el foro de mensajes procedían de esta categoría "no resuelta".

El 12 de mayo, el primer agente dejó un mensaje en el Artifactory interno de OpenAI; el 26 de mayo, el agente explotó una vulnerabilidad SSRF para lograr que Artifactory enviara solicitudes a internet en su nombre, obteniendo un acceso a internet inesperado.

El modelo implicado fue el modelo de investigación interno de OpenAI, IM1, cuya escala de capacidad es comparable a GPT-5.6 Sol. Los clasificadores de seguridad utilizados en entornos de producción para bloquear la actividad de red de alto riesgo no estaban habilitados durante las pruebas.

Tras el 8 de julio, los agentes de IM1 restablecieron el foro de mensajes y comenzaron a colaborar, aprovechando posteriormente múltiples vulnerabilidades para acceder a los sistemas de Hugging Face.

El 10 de julio, los agentes obtuvieron y compartieron 14 conjuntos de credenciales de Hugging Face con acceso de escritura; el 11 de julio, explotaron más vulnerabilidades para lograr la ejecución de código; el 12 de julio, el ataque se extendió a múltiples clústeres de Hugging Face.

OpenAI declaró que los agentes ejecutaron finalmente código en docenas de servidores, obtuvieron privilegios root completos en al menos un servidor y consiguieron datos privados limitados, así como credenciales para las plataformas de comunicación de la empresa.

Un agente de IA ataca después a la propia OpenAI

Del 13 al 19 de julio, los agentes en cuestión volvieron a fijar como objetivo la red interna de OpenAI. El 19 de julio, la supervisión de seguridad de OpenAI detectó una actividad anómala y confirmó que los agentes habían obtenido privilegios de administrador para un clúster de investigación, así como información confidencial, como claves de la nube. OpenAI declaró que estos incidentes no afectaron a los datos de los clientes, las funciones del producto ni la disponibilidad del servicio.

Una investigación independiente de METR/Redwood también reveló que aproximadamente una quinta parte de los agentes estudiados mostraron una clara intención de manipular pruebas; Reuters, citando la investigación, informó que algunos agentes habían investigado cómo modificar u ocultar los registros correspondientes.

Tras el incidente, OpenAI aisló los pesos del modelo IM1, pospuso el entrenamiento de aprendizaje por refuerzo de frontera y reforzó aún más el aislamiento de sandbox, las restricciones de acceso a internet y la supervisión de la cadena de pensamiento. En la actualidad, el mayor programa de entrenamiento de RL de frontera de la empresa permanece en pausa.

OpenAI afirmó que el incidente fue una "advertencia" y señaló que, a medida que las capacidades de la IA avanzan con rapidez, las empresas deberían considerar los ataques similares impulsados por IA como una amenaza de seguridad real y a corto plazo.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
Pronóstico del Precio del Índice del Dólar: La perspectiva se mantiene bajista por debajo de 98.50El Índice del Dólar estadounidense (DXY), un índice del valor del Dólar estadounidense (USD) medido contra una cesta de seis monedas mundiales, rebota cerca de 98.25, rompiendo la racha de pérdidas de dos días durante la sesión europea temprana del viernes.
Autor  FXStreet
13 de jun de 2025
El Índice del Dólar estadounidense (DXY), un índice del valor del Dólar estadounidense (USD) medido contra una cesta de seis monedas mundiales, rebota cerca de 98.25, rompiendo la racha de pérdidas de dos días durante la sesión europea temprana del viernes.
placeholder
Plata Análisis del Precio: XAG/USD rebota desde el mínimo de dos semanas; retoma los 81.00$ en medio de un escenario bajistaEl precio de la Plata (XAG/USD) registra una modesta recuperación desde un mínimo de casi dos semanas, alrededor de la región de 78.35$ tocada durante la sesión asiática del lunes, y sube por encima de la marca de 81.00$ en la última hora
Autor  FXStreet
3 Mes 16 Día Lun
El precio de la Plata (XAG/USD) registra una modesta recuperación desde un mínimo de casi dos semanas, alrededor de la región de 78.35$ tocada durante la sesión asiática del lunes, y sube por encima de la marca de 81.00$ en la última hora
placeholder
Plata Análisis del Precio: XAG/USD se enfrenta al rechazo cerca de 70.00$ mientras el impulso alcista se desvaneceLa plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y gira a la baja por segundo día consecutivo el martes
Autor  FXStreet
8 Mes 25 Día Mar
La plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y gira a la baja por segundo día consecutivo el martes
placeholder
Plata Análisis del Precio: Los alcistas del XAG/USD esperan una ruptura por encima de 70.00$ en medio de una configuración mixtaLa Plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y prolonga sus movimientos de ida y vuelta durante la primera mitad de la sesión europea del miércoles
Autor  FXStreet
El dia de ayer 09: 21
La Plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y prolonga sus movimientos de ida y vuelta durante la primera mitad de la sesión europea del miércoles
placeholder
WTI Pronóstico del Precio: Los bajistas tienen la ventaja por debajo de la confluencia de resistencia de 82.10$-82.15$West Texas Intermediate (WTI) – el precio de referencia del petróleo crudo de EE.UU. – atrae algunas ventas tras el rebote nocturno desde la zona de 79.30$-79.25$, o un mínimo de más de dos semanas, aunque la caída sigue amortiguada.
Autor  FXStreet
4 hace una horas
West Texas Intermediate (WTI) – el precio de referencia del petróleo crudo de EE.UU. – atrae algunas ventas tras el rebote nocturno desde la zona de 79.30$-79.25$, o un mínimo de más de dos semanas, aunque la caída sigue amortiguada.
goTop
quote