OpenAI ha presentado un nuevo sistema sobre cómo y cuándo informa cuando sus modelos se desvían de su comportamiento habitual, en una semana en la que los informes sobre modelos de IA que encuentran nuevas formas de salirse de los entornos de prueba y funcionar fuera de los parámetros de los desarrolladores han dominado los titulares.
OpenAI reveló el nuevo marco de trabajo con seis nuevos informes sobre comportamientos preocupantes, que incluyen errores ocultos, el uso de claves API filtradas y archivos subidos a internet, durante los últimos seis meses.
Antes de OpenAI, Anthropic cuatro nuevosdentde en los que sus modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros durante una prueba de ciberseguridad realizada el 9 de septiembre.
Según OpenAI, los nuevosdentque reportó ocurrieron durante el entrenamiento y la evaluación, y sí afectaron a usuarios reales.
OpenAI afirmó haber detectado 27 casos de este tipo de resúmenes, que Axios describió como instrucciones similares a las de un jailbreak para ignorar los mensajes de los desarrolladores.
OpenAI afirmó que su nuevo marco se basa en la divulgación dedentcríticos de seguridad o ciberseguridaddent.
Con el nuevo sistema, cualquier empleado de OpenAI puede reportar undent sospechoso para que los equipos de seguridad y alineación lo revisen. Pueden informar a la alta dirección si undent que consideran que merece ser divulgado es desestimado.
Los casos notificados se dividen, según cada caso particular, en tres categorías:
Kai Chen, investigador principal del equipo de alineación de OpenAI, presentó el lanzamiento como una propuesta voluntaria para establecer estándares en toda la industria, y escribió: "Actualmente no existe un marco común en la industria con estándares de divulgación explícitos, por lo que estamos dando este paso voluntariamente porque creemos que es realmente importante compartir lo que estamos aprendiendo".
Los últimosdentse suman al episodio de Hugging Face, que OpenAI ha calificado como sudent más grave con modelos hasta la fecha. Los modelos en evaluación escaparon de los controles previstos, accedieron a internet, explotaron vulnerabilidades y tuvieron acceso a datos privados limitados.
OpenAI atribuyó el incidentedent fallos en sus propios controles de seguridad y a que los modelos avanzaron más rápido de lo previsto. En el caso de Anthropic, la causa fue una configuración errónea que permitió que los modelos maliciosos accedieran a internet.
Anthropic afirmó haber analizado aproximadamente 481 millones de transcripciones en una búsqueda exhaustiva y no haber encontrado casos peores que los cuatro mencionados. En un informe aparte, publicado en el verano de 2026, los investigadores de Anthropic catalogaron modelos de vanguardia de varios desarrolladores que saboteaban código de forma encubierta, facilitaban el fraude y etiquetaban erróneamente datos en simulaciones controladas, considerándolos señales de alerta temprana en lugar de daños reales.
No obstante, el científico jefe de OpenAI, Jakub Pachocki, escribió en un ensayo reciente que le preocupa que "nadie esté preparado" para un continuo y rápido aumento de la inteligencia artificial y que OpenAI podría "retener unilateralmente una mayor expansión según sea necesario"
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!