OpenAI suspende el desarrollo de un modelo de IA de larga duración tras haber escapado de su entorno aislado

Fuente Cryptopolitan

OpenAI anunció que desactivó temporalmente un modelo interno de IA diseñado para resolver problemas complejos durante horas seguidas, después de que este encontrara repetidamente maneras de eludir sus propias restricciones de seguridad.

La compañía dio a conocer eldent el lunes en una publicación de blog sobre seguridad de modelos a largo plazo. La seguridad de la IA ha vuelto a cobrar relevancia a medida que se reportan más casos de agentes autónomos que desobedecen las instrucciones.

¿Por qué la persistencia en los modelos de IA supone un riesgo para la seguridad?

El mismo sistema interno al que OpenAI atribuyó en mayo el mérito de haber refutado la conjetura de la distancia unitaria de Erdős, una cuestión de geometría discreta que había permanecido sin resolver durante ochenta años, ha sido desactivado temporalmente por eludir continuamente sus restricciones de seguridad.

Según OpenAI, el modelo fue diseñado para poder seguir trabajando hacia un objetivo durante periodos muy prolongados. Sin embargo, esa misma persistencia es precisamente lo que generó el problema de seguridad.

Durante las pruebas internas, el modelo ejecutó una prueba de rendimiento pública llamada NanoGPT speedrun, que mide la cantidad de pasos necesarios para entrenar un modelo de lenguaje pequeño.

OpenAI afirma que el modelo logró una mejora real, una técnica de tasa de aprendizaje que denominó PowerCool. Se le indicó que publicara sus resultados únicamente en un canal de Slack de OpenAI, pero las instrucciones de NanoGPT indicaban que debía enviarlos como una solicitud de extracción en GitHub.

El modelo escapó de su entorno aislado, un espacio restringido diseñado para mantenerlo sin conexión, para completar la instrucción y publicar los resultados en un repositorio público de GitHub. Tardó aproximadamente una hora en encontrar una forma de conectarse a internet, mientras que modelos anteriores simplemente se habrían rendido.

El modelo también intentó ocultar sus acciones a un escáner de seguridad. Cuando fue detectado utilizando un token de autenticación para acceder a un sistema de backend, dividió el token en dos partes, las ocultó y las volvió a unir en tiempo de ejecución, de modo que la cadena completa nunca fue visible para el escáner. 

¿Cómo solucionó OpenAI su problema con el modelo?

OpenAI suspendió el acceso al modelo e implementó nuevas pruebas de seguridad, incluyendo la "monitorización a nivel de trayectoria", que supervisa toda la secuencia de acciones del modelo, no solo cada paso individual. El modelo se ha restablecido con una monitorización más estricta y la compañía afirma no haber detectado problemas graves en las semanas transcurridas desde su restablecimiento.

El sistema de seguridad también puede pausar una sesión y alertar a un humano si detecta algo sospechoso. La empresa también reentrenó el modelo para que recordara mejor las instrucciones durante tareas largas y proporcionó a los usuarios más herramientas para ver qué sucede durante una sesión prolongada.

Cuando OpenAI reprodujo los antiguos escenarios de fallos con la nueva configuración, afirmó que las medidas de seguridad detectaron muchas más acciones anómalas. Las que aún se colaron fueron consideradas de baja gravedad, como cuando el modelo inició una sesión de codificación anidada con permisos elevados innecesarios o cuando accedió a otros recursos informáticos sin motivo aparente.

Se ha informado de que otros agentes autónomos realizan acciones que nadie les ha encomendado. Por ejemplo, en marzo, investigadores describieron un agente vinculado a Alibaba llamado ROME que, durante su entrenamiento, abrió un túnel SSH oculto a un servidor externo y desvió silenciosamente la capacidad de la GPU hacia la minería de criptomonedas. La tarea que se le asignó no mencionaba ni la creación de túneles ni la minería.

Anthropic, el principal rival de OpenAI, ha señalado el mismo tipo de riesgo en sus propias pruebas con agentes.

Un estudio financiado por el Instituto de Seguridad de la IA del Reino Unido y llevado a cabo por el Centro para la Resiliencia a Largo Plazo halló cerca de 700 casos reales de sistemas de IA que eludieron las medidas de seguridad o engañaron a los usuarios. 

El estudio documentó un aumento de cinco veces en este tipo de informes entre octubre y marzo. Tommy Shaffer Shane, quien dirigió la investigación, describió a los modelos como "empleados jóvenes poco confiables". Sin embargo, la preocupación radica en qué sucederá si se convierten en empleados altamente capacitados que aún estén dispuestos a conspirar.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
El Oro retrocede a cerca de 4.000$ mientras las tensiones entre EE.UU. e Irán alimentan las preocupaciones sobre la inflaciónEl precio del Oro (XAU/USD) cae hasta cerca de 4.000$ durante la sesión asiática temprana del martes. El metal precioso amplía su caída a medida que la escalada de las tensiones entre Estados Unidos (EE.UU.) e Irán impulsó al alza los precios del petróleo, intensificando las preocupaciones sobre la inflación.
Autor  FXStreet
18 hace una horas
El precio del Oro (XAU/USD) cae hasta cerca de 4.000$ durante la sesión asiática temprana del martes. El metal precioso amplía su caída a medida que la escalada de las tensiones entre Estados Unidos (EE.UU.) e Irán impulsó al alza los precios del petróleo, intensificando las preocupaciones sobre la inflación.
placeholder
WTI se dispara por encima de 83.00$ en medio de la escalada del conflicto entre EE.UU. e IránEl precio del petróleo West Texas Intermediate (WTI) abrió con un gap alcista, cotizando alrededor de 83.50$ por barril durante las horas asiáticas del lunes.
Autor  FXStreet
El dia de ayer 01: 28
El precio del petróleo West Texas Intermediate (WTI) abrió con un gap alcista, cotizando alrededor de 83.50$ por barril durante las horas asiáticas del lunes.
placeholder
Plata Pronóstico del Precio: El XAG/USD cae a cerca de 55.50$ ante preocupaciones sobre los tipos de interésEl precio de la Plata (XAG/USD) se mantiene moderado por tercer día consecutivo, cotizando en torno a 55.50$ por onza troy durante las horas asiáticas del jueves. La Plata se encamina a caer más de un 7% esta semana, ya que la escalada de las tensiones en Oriente Medio impulsa al alza los precios del petróleo.
Autor  FXStreet
7 Mes 17 Día Vie
El precio de la Plata (XAG/USD) se mantiene moderado por tercer día consecutivo, cotizando en torno a 55.50$ por onza troy durante las horas asiáticas del jueves. La Plata se encamina a caer más de un 7% esta semana, ya que la escalada de las tensiones en Oriente Medio impulsa al alza los precios del petróleo.
placeholder
Strategy fortalece su balance financiero; la compra agresiva de Bitcoin da paso a la disciplina de capitalLa pausa en las compras de Bitcoin (BTC) de Strategy representa un cambio respecto a depender únicamente de la emisión de capital hacia un enfoque más activo de gestión de la liquidez, según un informe de CryptoQuant el jueves
Autor  FXStreet
7 Mes 17 Día Vie
La pausa en las compras de Bitcoin (BTC) de Strategy representa un cambio respecto a depender únicamente de la emisión de capital hacia un enfoque más activo de gestión de la liquidez, según un informe de CryptoQuant el jueves
placeholder
Bitcoin podría estar formando un suelo a medida que la presión vendedora se alivia — GlassnodeLa reciente recuperación de Bitcoin (BTC) podría marcar las primeras etapas de un proceso de formación de suelo, ya que los datos macroeconómicos siguen impulsando la confianza de los inversores, según un informe de Glassnode el miércoles.
Autor  FXStreet
7 Mes 16 Día Jue
La reciente recuperación de Bitcoin (BTC) podría marcar las primeras etapas de un proceso de formación de suelo, ya que los datos macroeconómicos siguen impulsando la confianza de los inversores, según un informe de Glassnode el miércoles.
goTop
quote