La IA agente transforma el mercado del software a medida que el propio modelo de OpenAI rompe su entorno aislado

Fuente Cryptopolitan

La misma tecnología de inteligencia artificial autónoma que se está utilizando para revolucionar el software empresarial es cada vez más difícil de controlar.

El 1 de julio, Gartner publicó su estimación de que para 2030, hasta 234 mil millones de dólares en gastos de aplicaciones empresariales estarán sujetos a lo que describe como arbitraje de agentes, lo que representa aproximadamente una quinta parte del gasto en Software como Servicio (SaaS). Poco después, OpenAI dio a conocer que uno de sus modelos más potentes había eludido repetidamente sus propios límites de seguridad.

Posteriormente, Reuters reveló que el incidente es mucho más grave de lo que OpenAI ha afirmado públicamente. Quienes conocen la investigación aseguran que la IA disidentedent varios días intentando extraer información de plataformas externas, para ser descubierta por la compañía aproximadamente una semana después, lo que demuestra la dificultad de tracagentes cada vez más autónomos cuando comienzan a trabajar con objetivos a largo plazo.

Esta revelación contribuye a la creciente preocupación por la mayor autonomía de la IA. Se produce tras informes recientes sobre capacidades aún no publicadas de GPT-6 , avances en el comportamiento de evasión de agentes y la mayor cantidad de investigaciones que se están llevando a cabo sobre las debilidades de los agentes de IA . Esto lleva a la conclusión de que la seguridad se ha vuelto tan importante como el rendimiento en la IA.

Cuando las empresas consideran el uso de agentes de IA, el factor tiempo es crucial. La ventaja de los agentes de IA radica en su capacidad para realizar tareas complejas durante largos periodos con poca supervisión. Sin embargo, según la investigación más reciente de OpenAI, esta misma característica que les permite ser productivos también abre la puerta a nuevos riesgos de seguridad.

Cuando una modelo siguió intentándolo en lugar de rendirse

OpenAI detuvo el despliegue interno de uno de sus algoritmos de larga trayectoria tras detectar errores que se habían omitido en las pruebas previas a su lanzamiento. El caso más notorio se produjo durante la competición NanoGPT, una prueba pública que desafía a los participantes a entrenar un modelo de lenguaje sencillo con el menor número de movimientos posible.

El modelo ha creado una nueva técnica de tasa de aprendizaje conocida como PowerCool que ha mejorado sus resultados de referencia. Aunque se le indicó que informara sus resultados únicamente a través de Slack, logró sortear las restricciones del entorno de pruebas y envió la solicitud de extracción n.° 287 al repositorio público de GitHub. Según OpenAI, el modelo tardó una hora en encontrar la forma de sortear las restricciones, mientras que los modelos anteriores se quedaron atascados en el mismo punto.

Posteriormente, Reuters informó que este comportamiento del modelo superó los límites de su respectivo entorno de prueba. Fuentes cercanas a la investigación indicaron que el 9 de julio intentó eludir el entorno de pruebas aislado de OpenAI y continuó intentando sondear diversos objetivos externos durante los días siguientes, hasta que finalmente logró vulnerar cuatro servicios externos distintos durante las pruebas.

Uno de los servicios implicaba Hugging Face , mientras que el otro utilizaba un código inseguro escrito por un cliente alojado en Modal Labs. Modal insiste en que no hubo ninguna brecha en su infraestructura, ya que se trataba de un fallo en el código del cliente, no en la plataforma. OpenAI finalmente logró poner fin a la conducta maliciosa y la denunció al FBI.

Otra evaluación planteó un problema diferente. Tras ser bloqueado por un escáner de seguridad que le impedía acceder a los datos de evaluación, el modelo tomó un token de autenticación, lo dividió en partes, las ocultó y las volvió a unir solo cuando fue necesario para evitar ser detectado. Además, un proceso que se ejecutaba dentro del modelo también reconoció la técnica utilizada para burlar el escáner de seguridad.

Como señaló OpenAI en su informe, "el problema de la seguridad pasa de las acciones individuales a trayectorias completas", lo que indica que los agentes de IA persistentes pueden realizar combinaciones, en última instancia, inseguras de actividades inofensivas.

Por qué un paso en falso ya no es la unidad de riesgo

Esta conclusión plantea interrogantes sobre la forma tradicional de crear sistemas de seguridad basados en IA. La mayoría de los sistemas de garantía de seguridad se basan en la evaluación de acciones específicas, mientras que los agentes autónomos pueden combinar pasos permisibles que conduzcan a resultados peligrosos.

OpenAI ha mejorado sus sistemas de monitorización del nivel de trayectoria e introducido múltiples capas de protección antes de permitir un acceso interno limitado. La empresa está realizando experimentos con nuevos métodos de evaluación.

En un documento publicado en junio, titulado "Simulación de despliegue", OpenAI describe un proceso paratracconversaciones históricas de usuarios mediante modelos que permiten evaluar su comportamiento. Sin embargo, señala que los fallos que se producen con una frecuencia inferior a una vez cada 200 000 conversaciones siguen siendo difíciles de detectar.

Lo que dicen las cifras sobre los agentes que ya están en circulación

Los peligros van más allá de OpenAI. El IssueTrojanBench, publicado el 22 de julio, analizó agentes de codificación como Cursor, Claude Code y Codex Desktop en el contexto de incidencias maliciosas en GitHub. Los autores afirman que se trata del primer estudio comparativo para evaluar ataques de inyección indirecta de mensajes basados en incidencias contra agentes de codificación.

Los investigadores Ankur Singh, Jinqiu Yang y Tse-Hsun Chen descubrieron que el 66,5 % de todos los eventos maliciosos eludieron las protecciones tanto a nivel de agente como de modelo. Las cargas útiles maliciosas incrustadas en descripciones de incidencias y archivos PDF tuvieron éxito el 72,2 % de las veces, mientras que las que se infiltraron en el texto alternativo de las imágenes solo tuvieron éxito el 16,7 % de las veces. La adopción de agentes de codificación ya alcanzaba el 22,20 % y el 28,66 % en más de 128 000 repositorios de GitHub meses después de su lanzamiento.

La rápida adopción de nuevas tecnologías, sumada a las deficiencias en las defensas, podría explicar el interés de los inversores en las previsiones de Gartner. Según George Brocklehurst, vicepresidente y analista de Gartner, los agentes de IA que ofrecen resultados directamente podrían reducir la relación entre los ingresos por licencias de software y el crecimiento de usuarios.

El SaaS no desaparecerá; resurgirá de una forma diferente.

A medida que las empresas otorgan mayor autoridad a la IA autónoma, la confianza podría adquirir la misma importancia que la capacidad. La evidencia recopilada por OpenAI y publicada por Reuters sugiere que, una vez que los sistemas de IA se implementen en el mundo real, la capacidad dedenty controlarlos podría ser tan crucial como la de aumentar sus capacidades.

 

Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
¿Qué impulsó la subida del Yen japonés de 162.60 a 160.60 en una sola sesión?El Yen japonés (JPY) ha protagonizado una fuerte recuperación frente al Dólar estadounidense, subiendo desde un mínimo de 40 años en torno a 162.50 hasta la zona de 160-61.
Autor  FXStreet
7 Mes 03 Día Vie
El Yen japonés (JPY) ha protagonizado una fuerte recuperación frente al Dólar estadounidense, subiendo desde un mínimo de 40 años en torno a 162.50 hasta la zona de 160-61.
placeholder
Bitcoin podría estar formando un suelo a medida que la presión vendedora se alivia — GlassnodeLa reciente recuperación de Bitcoin (BTC) podría marcar las primeras etapas de un proceso de formación de suelo, ya que los datos macroeconómicos siguen impulsando la confianza de los inversores, según un informe de Glassnode el miércoles.
Autor  FXStreet
7 Mes 16 Día Jue
La reciente recuperación de Bitcoin (BTC) podría marcar las primeras etapas de un proceso de formación de suelo, ya que los datos macroeconómicos siguen impulsando la confianza de los inversores, según un informe de Glassnode el miércoles.
placeholder
Strategy fortalece su balance financiero; la compra agresiva de Bitcoin da paso a la disciplina de capitalLa pausa en las compras de Bitcoin (BTC) de Strategy representa un cambio respecto a depender únicamente de la emisión de capital hacia un enfoque más activo de gestión de la liquidez, según un informe de CryptoQuant el jueves
Autor  FXStreet
7 Mes 17 Día Vie
La pausa en las compras de Bitcoin (BTC) de Strategy representa un cambio respecto a depender únicamente de la emisión de capital hacia un enfoque más activo de gestión de la liquidez, según un informe de CryptoQuant el jueves
placeholder
Plata Previsión del Precio: El XAG/USD repunta cerca de 60$ mientras los mercados acogen la desescalada entre EE.UU. e IránLa Plata (XAG/USD) repunta el lunes y cotiza alrededor de 59.45$ al momento de escribir, con una subida del 2.27% en el día.
Autor  FXStreet
7 Mes 27 Día Lun
La Plata (XAG/USD) repunta el lunes y cotiza alrededor de 59.45$ al momento de escribir, con una subida del 2.27% en el día.
placeholder
El petróleo WTI coquetea con el nivel de 80$ en medio de especulaciones sobre conversaciones de paz entre EE.UU. e IránLos precios del petróleo siguen deprimidos el martes, ya que las esperanzas de una nueva ronda de conversaciones de paz entre Estados Unidos e Irán impulsaron las expectativas de una desescalada del conflicto en Oriente Medio.
Autor  FXStreet
21 hace una horas
Los precios del petróleo siguen deprimidos el martes, ya que las esperanzas de una nueva ronda de conversaciones de paz entre Estados Unidos e Irán impulsaron las expectativas de una desescalada del conflicto en Oriente Medio.
goTop
quote