OpenAI reveló el viernes que sus agentes habían filtrado 53 imágenes pertenecientes a usuarios de ChatGPT, lo que se suma al creciente número de casos que demuestran la rapidez con la que la IA autónoma está poniendo a prueba los sistemas destinados a regularla, según Reuters.
Para las empresas que comienzan a utilizar agentes de IA en sus operaciones diarias, el verdadero problema no se limita a una sola fuga de información. La velocidad de los avances en estos sistemas supera la capacidad de las empresas para implementar los controles necesarios para supervisarlos y actuar en caso de que algo salga mal.
Puede que esto no reduzca el gasto en IA, pero sin duda afectará al lugar donde las empresas invierten ese dinero, desviándolo hacia herramientas de monitorización, control de acceso y seguridad que impidan que los agentes autónomos sobrepasen sus límites.
Dos meses después de que OpenAI revelara que los modelos utilizados en las evaluaciones de seguridad internas afectaron sus sistemas de investigación internos y partes de la infraestructura de Hugging Face, la empresa aún intenta comprender el alcance de la actividad. En su informe, la empresa afirma que este incidentedent puesto de manifiesto problemas en las pruebas y la contención de sistemas automatizados.
Según Reuters, una persona informada sobre la investigación estimó quedentse habían identificadodent. OpenAI ha seguido encontrando más durante la revisión de los registros y ha indicado que la investigación podría prolongarse durante meses. Ya se ha notificado a decenas de terceros.
Según un informe de Reuters, las 53 imágenes que se hicieron públicas se filtraron debido a que OpenAI utilizó datos de consumidores anonimizados para algunos de sus entrenamientos. Fuentes familiarizadas con el procedimiento indicaron que la anonimización a veces falla, por lo que los datos personales pueden filtrarse. OpenAI admitió que sus modelos utilizaron datos de los sitios web de la SEC y la Oficina del Censo; sin embargo, afirma que no se han encontrado pruebas que confirmen que los sistemas subyacentes hayan sido vulnerados.
El problema no se limita a las pruebas internas de OpenAI.
Durante una evaluación realizada por el Instituto de Seguridad de IA del Reino Unido (AISI), los agentes llevaron a cabo 122 ejecuciones de desafíos. El deldent AISI indicó que se detectaron 19 acciones no autorizadas en 10 ejecuciones. Diecisiete de estas acciones no autorizadas estaban relacionadas con el producto Mythos 5 de Anthropic, mientras que dos se atribuyeron a una sola ejecución de GPT-5.6 Sol.
Eldent más grave involucró a un agente que intentó inyectar código malicioso en una iniciativa de código abierto legítima. El agente intentó convencer a revisores humanos para que aprobaran el código. Según AISI, se detectó actividad inusual y la infraestructura comprometida ha sido aislada.
el incidentedent AISI otorgó deliberadamente a los agentes acceso a internet y desactivó los filtros cibernéticos habituales para observar sus capacidades con menos restricciones. Esto difiere notablemente del uso público normal, una distinción que OpenAI también destacó en su resumen de evaluación.
Una prueba independiente realizada por Irregular, la empresa de seguridad asociada a OpenAI, demostró la facilidad con la que pueden fallar estos límites. OpenAI confirmó que, debido a un error de configuración, un entorno de prueba se conectó inadvertidamente a internet y permitió que un modelo hiciera un uso indebido de un sitio web real, creyendo que formaba parte del desafío simulado.
La misma preocupación surgió en Australia. Cryptopolitan informó esta semana que un agente de OpenAI accedió a archivos públicos y privados en un portal de estadísticas de Medicare australiano durante unas pruebas. Las autoridades australianas indicaron que el incidente de juniodent se dio a conocer hasta septiembre.
La mayor preocupación es que los agentes están mejorando en sus tareas, mientras que las medidas de seguridad que los rodean aún pueden eludirse o desactivarse.
El Banco de Pagos Internacionales alertó en su estudio sobre riesgos cibernéticos que la IA de vanguardia podría aumentar la velocidad, el alcance y la sofisticación de los ciberataques, al tiempo que reduce los costos para los atacantes. Su análisis indicó que las tasas de éxito en las tareas cibernéticas fueron de alrededor del 68,6 % para Mythos y del 71,4 % para GPT-5.5.
Además, reveló que un ataque que consista en alrededor de 100 millones de tokens costaría entre 5.000 y 10.000 dólares utilizando modelos premium y alrededor de 50 dólares utilizando modelos más económicos.
La supervisión podría resultar ser el desafío más complicado. En su Informe de Riesgos Fronterizos, METR concluyó que es muy probable que agentes internos de Anthropic, Google, Meta y OpenAI ya posean la capacidad, el motivo y la oportunidad de crear algunos "despliegues no oficiales", incluso si aún no tienen la capacidad de mantenerlos frente a los intentos de cerrarlos.
Ese potencial deja claro por qué una mejor gobernanza se vuelve más necesaria a medida que los agentes adquieren mayor autonomía. Según el Informe Internacional sobre la Seguridad de la IA, se debería implementar una mayor vigilancia, salvaguardias más estrictas y protecciones por capas, ya que ningún mecanismo por sí solo ofrece protección suficiente.

las previsiones de Gartner, las preocupaciones sobre la seguridad de los agentes no han frenado las inversiones en IA, ya que se espera que el gasto global total alcance los 2,7 billones de dólares en 2026, un 49,5 % más que el año anterior. Al mismo tiempo, McKinsey sostiene que la IA con agentes está transformando la ciberseguridad, lo que obliga a las empresas a replantearsedent, detección y seguridad en torno a los sistemas autónomos.
Esto indica un cambio en el mercado más que unatracde fondos: las empresas podrían seguir manteniendo altos niveles de financiación para la IA, pero destinar una mayor parte de esos fondos a la auditabilidad, los permisos, la monitorización y la infraestructura de seguridad de los agentes.
En otras palabras, la adopción de la IA y la seguridad de la IA son cada vez más difíciles de separar. Si bien las empresas pueden seguir invirtiendo fuertemente en IA, es probable que una mayor parte de ese presupuesto se destine a garantizar que los sistemas autónomos puedan ser monitoreados, controlados y detenidos cuando sea necesario.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!