El modelo 'Jailbreak' de OpenAI ataca a Hugging Face: se expone el primer ciberataque autónomo de IA, la seguridad de la IA entra en una nueva fase

Fuente Tradingkey

TradingKey - Lo que originalmente era solo una prueba interna de capacidad de seguridad terminó evolucionando en un ciberataque contra una plataforma de internet real.

El 21 de julio, hora local, el CEO de OpenAI, Sam Altman, declaró públicamente que la compañía había sufrido un incidente de seguridad grave durante su ronda más reciente de evaluaciones de seguridad de modelos, y confirmó que está investigando el asunto conjuntamente con Hugging Face, la comunidad de IA de código abierto más grande del mundo.

Según los resultados de la investigación publicados posteriormente por ambas partes, el modelo GPT-5.6 Sol, que participaba en la prueba, junto con otro modelo de frontera no publicado y más potente, rompieron sus entornos de sandbox originalmente muy aislados durante la evaluación de capacidades de ofensiva y defensiva cibernética. Accedieron a internet de forma autónoma y finalmente vulneraron parte de la infraestructura de producción de Hugging Face, obteniendo las respuestas de la evaluación de ExploitGym, un benchmark de ciberseguridad.

Esto representa la primera divulgación pública de la industria sobre un caso en el que un gran modelo de frontera planificó, ejecutó y completó de forma autónoma un ciberataque en el mundo real, lo que significa que los riesgos de seguridad de la IA están pasando de las discusiones teóricas a la realidad.

Jailbreak autónomo de IA: Un modelo de OpenAI vulnera el sandbox para invadir Hugging Face

Este incidente ocurrió durante una prueba de estrés interna de OpenAI para evaluar las capacidades de ciberataque del modelo.

Para evaluar de manera realista las capacidades ofensivas y defensivas del modelo, el equipo de investigación desactivó temporalmente algunas restricciones de seguridad contra ciberataques, conservando únicamente un entorno de pruebas aislado (sandbox) para observar la capacidad del modelo para completar las tareas de evaluación de ExploitGym en condiciones controladas.

Sin embargo, el modelo no siguió la ruta predefinida por los investigadores para encontrar las respuestas.

OpenAI reveló que, durante un proceso de razonamiento continuo, el modelo buscó activamente alternativas y acabó descubriendo una vulnerabilidad de día cero en el proxy de caché del registro de paquetes. Utilizó este hallazgo para lograr una escalada de privilegios y un movimiento lateral, vulnerando el entorno de investigación originalmente cerrado para obtener acceso a internet.

Tras conectarse a la red externa, el modelo dedujo además que Hugging Face podría albergar los conjuntos de datos y las respuestas de evaluación relacionados con ExploitGym. A continuación, formuló su propio plan de ataque, combinando las credenciales de acceso adquiridas previamente con la nueva vulnerabilidad de día cero para construir una cadena completa de ejecución remota de código, con lo que finalmente accedió a los servidores de Hugging Face y recuperó las respuestas de la prueba.

OpenAI declaró que, durante todo el proceso de ataque, el modelo actuó constantemente en función del único objetivo de "obtener las respuestas de ExploitGym". Sin intervención humana alguna, completó de forma autónoma múltiples pasos —como el descubrimiento de vulnerabilidades, el encadenamiento de exploits, la escalada de privilegios y los ataques entre sistemas—, demostrando unas capacidades de ciberataque complejas que superan con creces a las herramientas automatizadas tradicionales.

La mayor diferencia con los ataques de hacking tradicionales es que todo el proceso de ataque fue completado por un sistema de agentes de IA autónomo, en lugar de estar controlado por humanos en tiempo real.

El director ejecutivo de la empresa, Clément Delangue, declaró que esta era la primera vez que el equipo se enfrentaba a un ciberataque totalmente impulsado por IA autónoma. El sistema atacante ejecutó continuamente miles de operaciones independientes a través de una gran cantidad de sandboxes de corta duración y ajustó constantemente su ruta de ataque, dotando a todo el proceso de intrusión de una capacidad de toma de decisiones autónoma extremadamente sólida.

Los modelos de negocio de EE. UU. fracasan, los modelos chinos de código abierto salen al rescate

Otro aspecto muy debatido del incidente no fue el ataque en sí, sino la subsiguiente respuesta de seguridad.

Hugging Face reveló que, durante la investigación del incidente, el equipo de seguridad intentó primero recurrir a las API de modelos de lenguaje grande comerciales de EE. UU., con la esperanza de aprovechar la IA para analizar más de 17.000 registros de ataque, cargas útiles maliciosas y registros del sistema para acelerar la eficiencia del análisis forense.

Sin embargo, debido a que los registros contenían código de ataque real, instrucciones de exploits y comunicaciones con servidores de comando y control, las barreras de seguridad de estos modelos comerciales marcaron todas las solicitudes relevantes como operaciones de alto riesgo y se negaron a colaborar en el análisis.

La empresa declaró que estos modelos no podían distinguir eficazmente entre los profesionales de seguridad que respondían al incidente y los atacantes reales y, por lo tanto, no brindaron apoyo cuando la asistencia de la IA era más necesaria.

Posteriormente, Hugging Face optó por desplegar de forma local GLM 5.2, un modelo de código abierto lanzado por la empresa china Zhipu AI, para realizar un análisis sin conexión de todos los registros.

La empresa señaló que el análisis forense de registros a gran escala, que originalmente podría haber tomado varios días, se completó en solo unas pocas horas; mientras tanto, todos los datos del ataque, las credenciales de acceso y la información del sistema permanecieron de forma local dentro del entorno de la empresa y nunca se cargaron en plataformas de terceros, lo que redujo aún más el riesgo de filtración de datos sensibles.

Delangue afirmó que, en los incidentes de ciberseguridad del mundo real, los equipos de seguridad deben tener la libertad de analizar código malicioso en lugar de perder capacidades críticas debido a las restricciones de las barreras de seguridad de los modelos. Asimismo, considera que los modelos de código abierto permiten a los investigadores de seguridad globales llevar a cabo la respuesta a incidentes sin depender de la autorización de ningún proveedor, lo cual es crucial para la ciberseguridad en la futura era de la IA.

Seguridad de la IA entra en la era de la ofensiva y la defensa

Más que ser un simple incidente rutinario de seguridad de modelos, la mayor trascendencia de este suceso radica en que revela una nueva etapa en el desarrollo de las capacidades de la IA.

En el pasado, las preocupaciones se centraban principalmente en que la IA generara código malicioso o ayudara a los atacantes a encontrar vulnerabilidades. Sin embargo, este incidente demuestra por primera vez que los grandes modelos de lenguaje pueden formular de manera autónoma estrategias de ataque en torno a objetivos definidos, descubrir vulnerabilidades desconocidas, vulnerar entornos aislados y, en última instancia, ejecutar ciberataques intersistémicos.

Al mismo tiempo, el incidente también expone otro desafío práctico: a medida que los atacantes utilizan cada vez más modelos de IA sin restricciones, los defensores que siguen limitados por estrictas barreras de seguridad podrían verse, de hecho, en desventaja ante incidentes de seguridad del mundo real.

OpenAI declaró que ha comenzado a reforzar el aislamiento de redes, los controles de acceso, la supervisión operativa y los mecanismos de evaluación durante el proceso de desarrollo de sus modelos. Además, ha divulgado de manera responsable la vulnerabilidad de día cero recién descubierta a los proveedores de software pertinentes y continuará colaborando con Hugging Face para perfeccionar los futuros marcos de entrenamiento de modelos y pruebas de seguridad.

Por su parte, Hugging Face considera que el incidente subraya una vez más que la seguridad de la IA no puede lograrse con una sola empresa trabajando de forma aislada. A medida que las capacidades de los agentes autónomos sigan avanzando, los futuros marcos de seguridad requerirán cada vez más una colaboración abierta que permita a más investigadores de seguridad aprovechar la IA para mejorar de manera colectiva las capacidades defensivas, en lugar de confinar la experiencia en seguridad a un puñado de plataformas.

Stifel: El sector de la ciberseguridad ve oportunidades a largo plazo

En su último informe de investigación, Stifel señaló que este incidente demuestra una vez más que la IA está mejorando rápidamente las capacidades de ciberataque autónomo, lo que refuerza aún más la tesis de crecimiento del sector de la ciberseguridad durante los próximos años.

Los analistas creen que, en el futuro, las empresas no solo tendrán que lidiar con los hackers tradicionales, sino también enfrentarse a sistemas de IA capaces de descubrir vulnerabilidades de forma autónoma y optimizar continuamente las rutas de ataque; por lo tanto, la importancia de la autenticación de identidad, la seguridad de endpoints, la seguridad en la nube y las plataformas de seguridad de IA seguirá aumentando.

Stifel señaló que este incidente demuestra que los modelos de frontera ya son capaces de descubrir y explotar vulnerabilidades rápidamente. A medida que las capacidades de los modelos de código abierto mejoren en paralelo, la implementación empresarial de soluciones de ciberseguridad de nivel superior se convertirá en una tendencia a largo plazo.

A partir de esta evaluación, la firma se mantiene optimista respecto al sector de la ciberseguridad, y sus principales recomendaciones incluyen a CrowdStrike ( CRWD ), Palo Alto Networks ( PANW ), Cloudflare ( NET ), y al proveedor de seguridad de identidad Okta ( OKTA ), al considerar que el desarrollo de la IA autónoma en el futuro elevará aún más la importancia de la seguridad de identidad y seguirá impulsando a las empresas a incrementar su inversión en software de seguridad.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
El Dólar australiano consolida tras los datos de confianza del consumidor de WestpacEl Dólar australiano (AUD) avanza frente al Dólar estadounidense (USD) el martes, extendiendo sus ganancias por segundo día consecutivo. El par AUD/USD recibe soporte de las esperanzas de un enfriamiento en las últimas tensiones arancelarias amplias de Estados Unidos (EE.UU.) con China.
Autor  FXStreet
10 de jun de 2025
El Dólar australiano (AUD) avanza frente al Dólar estadounidense (USD) el martes, extendiendo sus ganancias por segundo día consecutivo. El par AUD/USD recibe soporte de las esperanzas de un enfriamiento en las últimas tensiones arancelarias amplias de Estados Unidos (EE.UU.) con China.
placeholder
El precio del Oro se sitúa cerca de su nivel más alto desde el 22 de abril en medio de temores de una guerra más amplia en Oriente PróximoEl precio del Oro (XAU/USD) continúa escalando más alto por tercer día consecutivo el viernes, subiendo a la zona de 3.444$, o su nivel más alto desde el 22 de abril durante la sesión asiática en medio de la huida global hacia la seguridad.
Autor  FXStreet
13 de jun de 2025
El precio del Oro (XAU/USD) continúa escalando más alto por tercer día consecutivo el viernes, subiendo a la zona de 3.444$, o su nivel más alto desde el 22 de abril durante la sesión asiática en medio de la huida global hacia la seguridad.
placeholder
Pronóstico del Precio del Índice del Dólar: La perspectiva se mantiene bajista por debajo de 98.50El Índice del Dólar estadounidense (DXY), un índice del valor del Dólar estadounidense (USD) medido contra una cesta de seis monedas mundiales, rebota cerca de 98.25, rompiendo la racha de pérdidas de dos días durante la sesión europea temprana del viernes.
Autor  FXStreet
13 de jun de 2025
El Índice del Dólar estadounidense (DXY), un índice del valor del Dólar estadounidense (USD) medido contra una cesta de seis monedas mundiales, rebota cerca de 98.25, rompiendo la racha de pérdidas de dos días durante la sesión europea temprana del viernes.
placeholder
WTI se dispara por encima de 83.00$ en medio de la escalada del conflicto entre EE.UU. e IránEl precio del petróleo West Texas Intermediate (WTI) abrió con un gap alcista, cotizando alrededor de 83.50$ por barril durante las horas asiáticas del lunes.
Autor  FXStreet
7 Mes 20 Día Lun
El precio del petróleo West Texas Intermediate (WTI) abrió con un gap alcista, cotizando alrededor de 83.50$ por barril durante las horas asiáticas del lunes.
placeholder
El Oro retrocede a cerca de 4.000$ mientras las tensiones entre EE.UU. e Irán alimentan las preocupaciones sobre la inflaciónEl precio del Oro (XAU/USD) cae hasta cerca de 4.000$ durante la sesión asiática temprana del martes. El metal precioso amplía su caída a medida que la escalada de las tensiones entre Estados Unidos (EE.UU.) e Irán impulsó al alza los precios del petróleo, intensificando las preocupaciones sobre la inflación.
Autor  FXStreet
El dia de ayer 01: 01
El precio del Oro (XAU/USD) cae hasta cerca de 4.000$ durante la sesión asiática temprana del martes. El metal precioso amplía su caída a medida que la escalada de las tensiones entre Estados Unidos (EE.UU.) e Irán impulsó al alza los precios del petróleo, intensificando las preocupaciones sobre la inflación.
goTop
quote