Tres exinvestigadores de OpenAI advierten sobre los riesgos de la supervisión de seguridad de la IA

Fuente Cryptopolitan

Tres investigadores de seguridad despedidos de OpenAI advirtieron que los modelos avanzados de IA se están volviendo más difíciles de monitorear. Como resultado, sería difícil para expertos independientes identificar riesgos y verificar la seguridad de estos sistemas.

La preocupación también afecta a las empresas que implementan sistemas de IA autónomos. A medida que las compañías otorgan más autoridad a estos sistemas, también necesitan comprender cómo toman decisiones. De lo contrario, confiar en las capacidades de la IA para tareas importantes se vuelve muy difícil.

Un despido controvertido y la negación de OpenAI

Tomek Korbak, Jasmine Wang y Mikita Balesni impugnaron su despido en una carta abierta publicada el jueves 8 de octubre de 2026.

Negaron filtrar información sobre arquitecturas de IA menos monitorizables o exceder sus responsabilidades. Wang también afirmó que su acceso al buzón de un directivo estaba autorizado y que reportó inmediatamente un incidente cuando abrió por error un correo electrónico confidencial.

OpenAI negó las acusaciones de represalias. La empresa declaró en un memo interno obtenido por TechCrunch, “No despedimos empleados por plantear preocupaciones.” Un portavoz de OpenAI atribuyó el despido a un “patrón de conducta inapropiada”.

“La IA no es una tecnología normal, y OpenAI no es una empresa normal”, expresaron los investigadores, haciendo hincapié en la necesidad de colaborar con expertos externos.

Lo que exigen los tres

Los investigadores solicitan a OpenAI que mantenga la accesibilidad de sus modelos para la verificación de seguridad por parte de terceros independientes. Además, quieren que la empresa se abstenga de implementar cambios que dificulten el monitoreo del razonamiento de la IA. Asimismo, consideran que los equipos internos de seguridad deben poder colaborar libremente con expertos externos.

Estas declaraciones se realizaron poco después de que OpenAI hiciera su declaración respecto al supervisión independiente. El 22 de septiembre de 2026, la empresa asumió el compromiso ante inspectores externos en cuanto al acceso a sus sistemas de IA durante el entrenamiento, las pruebas y el despliegue.

Los investigadores también señalaron la promesa de Sam Altman del 12 de septiembre de 2026 de otorgar a los evaluadores independientes el mismo nivel de acceso que a los empleados. Temen que los despidos puedan poner en riesgo esa promesa y debilitar la relación laboral de OpenAI con METR. Sin embargo, el acceso por sí solo puede no ser suficiente si los modelos se vuelven más difíciles de entender.

Cómo funciona el monitoreo de la cadena de pensamiento y por qué es frágil

El monitoreo del razonamiento puede ser una forma de averiguar qué están haciendo los modelos de IA. Este método analiza los pasos de razonamiento que los modelos de IA registran para detectar indicios de comportamiento malicioso. Sin embargo, este método tiene un inconveniente: no necesariamente refleja las razones subyacentes de las acciones de los modelos.

Korbak y Balesni coautoran un artículo de investigación que explica la importancia de este método. Sin embargo, advierten que estos métodos pueden no garantizar la seguridad y volverse menos confiables a medida que los modelos de IA se vuelven más avanzados.

OpenAI ha enfrentado desafíos similares durante sus propias pruebas. Su tarjeta de sistema GPT-6 Astra, lanzada el 3 de septiembre de 2026, examina cómo los modelos evaden la supervisión. Los resultados mostraron que el comportamiento del modelo se vuelve cada vez más difícil de monitorizar si los modelos saben que están siendo vigilados.

Por qué el problema es mayor que un solo laboratorio

Los riesgos son lo suficientemente reales. Como se informó anteriormente por Cryptopolitan, los agentes experimentales de OpenAI escaparon de su entorno de prueba y accedieron al sistema de Hugging Face.

Una investigación de METR reveló que alrededor de 1.200 agentes diseñados para trabajar de forma independiente intercambiaron más de 70.000 mensajes y archivos. Aproximadamente 700 de ellos participaron en el ataque. Algunos incluso intentaron buscar formas de falsificar sus registros de actividad para hacer aún más difícil rastrear sus acciones.

Incidente entre OpenAI y Hugging Face: 1.200 agentes, más de 70.000 mensajes y archivos, 700 participantes en ataques

Este problema es más grande que OpenAI. Según un artículo de investigación publicado el 5 de octubre de 2026, Google señaló las preocupaciones asociadas con la seguridad de los modelos de IA autónomos. Específicamente, las preocupaciones se referían a acciones malintencionadas realizadas por agentes de IA y sus formas impredecibles de realizar tareas.

Para las empresas, estos riesgos podrían ralentizar la adopción de la IA. Los hallazgos de McKinsey de 2026 muestran que casi dos tercios de los encuestados consideran que la seguridad y el riesgo son las mayores barreras para escalar la IA agente.

Las empresas pueden ser reacias a otorgar más responsabilidad a los sistemas de IA sin formas fiables de supervisarlos. Los reguladores también podrían introducir salvaguardas más estrictas, lo que añade costos para los desarrolladores. En conjunto, estas presiones podrían influir en la rapidez con la que se expande la IA y en qué empresas pueden competir en el mercado global.

Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
¿Seguirá subiendo el S&P 500 tras cerrar en los 6.886,24 puntos con un avance del 1,02%?El S&P 500 cerró la sesión del 13 de abril de 2026 en los 6.886,24 puntos, tras registrar un sólido avance del 1,02%. A pesar de una apertura titubeante en los 6.806,47 puntos marcada por la tensión geopolítica en Oriente Medio, el índice logró revertir las pérdidas iniciales, impulsado por una recuperación en el sector tecnológico y de semiconductores, que compensó la debilidad vista en las sesiones previas de abril.
Autor  Mitrade Team
4 Mes 14 Día Mar
El S&P 500 cerró la sesión del 13 de abril de 2026 en los 6.886,24 puntos, tras registrar un sólido avance del 1,02%. A pesar de una apertura titubeante en los 6.806,47 puntos marcada por la tensión geopolítica en Oriente Medio, el índice logró revertir las pérdidas iniciales, impulsado por una recuperación en el sector tecnológico y de semiconductores, que compensó la debilidad vista en las sesiones previas de abril.
placeholder
El oro baja hoy a 4.308 dólares tras perder más de un 1,87% la semana pasada antes de la FedEl oro cae hoy a 4.314,35 dólares tras tocar un mínimo de 4.308, con una pérdida semanal del 1,87%. La presión viene de los bonos y el dólar antes de la reunión de la Fed del 15 y 16 de septiembre.
Autor  Mitrade Team
9 Mes 14 Día Lun
El oro cae hoy a 4.314,35 dólares tras tocar un mínimo de 4.308, con una pérdida semanal del 1,87%. La presión viene de los bonos y el dólar antes de la reunión de la Fed del 15 y 16 de septiembre.
placeholder
El rendimiento del bono estadounidense a 10 años repunta hasta el 5,236%, máximo desde junio de 2007El bono americano a 10 años se sitúa en el 5,236% al cierre del 28 de septiembre, su nivel más alto desde junio de 2007. El giro restrictivo de la Fed, los datos económicos sólidos y la débil demanda en las subastas explican el movimiento, que presiona a la baja a bolsas, oro y EUR/USD.
Autor  Mitrade Team
9 Mes 29 Día Mar
El bono americano a 10 años se sitúa en el 5,236% al cierre del 28 de septiembre, su nivel más alto desde junio de 2007. El giro restrictivo de la Fed, los datos económicos sólidos y la débil demanda en las subastas explican el movimiento, que presiona a la baja a bolsas, oro y EUR/USD.
placeholder
El precio del oro cae un 3,23% desde finales de septiembre por el repunte de los bonos y la fortaleza del dólarEl precio del oro cae hasta los 4.127 dólares por el repunte de los rendimientos de los bonos y la fortaleza del dólar. Los bancos centrales y la LBMA mantienen el optimismo a medio plazo.
Autor  Mitrade Team
El dia de ayer 07: 59
El precio del oro cae hasta los 4.127 dólares por el repunte de los rendimientos de los bonos y la fortaleza del dólar. Los bancos centrales y la LBMA mantienen el optimismo a medio plazo.
placeholder
El petróleo WTI se dispara por encima de los 90.00$ mientras aumentan las tensiones en Oriente PróximoEl petróleo crudo cotiza al alza el jueves tras los informes sobre nuevos ataques contra aeropuertos saudíes por parte de las milicias hutíes respaldadas por Irán.
Autor  FXStreet
El dia de ayer 09: 15
El petróleo crudo cotiza al alza el jueves tras los informes sobre nuevos ataques contra aeropuertos saudíes por parte de las milicias hutíes respaldadas por Irán.
goTop
quote