El científico jefe de OpenAI, Jakub Pachocki, se pronunció pocas horas después de que la empresa se convirtiera en la primera en la carrera de la IA en alcanzar la designación de ciberseguridad "Crítica" en su Marco de Preparación, tras presentar un adelanto de su próximo modelo Astra.
La advertencia de Pachocki a primera hora del miércoles tenía como objetivo calmar la histeria en torno a los crecientes comentarios de que el laboratorio de IA podría haber perdido el control sobre las capacidades de sus modelos más avanzados.
La designación Crítica es un nivel del Marco de Preparación que OpenAI introdujo en el sector de la IA en diciembre de 2023. El Marco de Preparación mide cuánta intervención y estímulo humano necesita un modelo de IA para encontrar y crear exploits de día cero viables en muchos sistemas reforzados, o para ejecutar un ataque novedoso completo.
Una vulnerabilidad de día cero se refiere a la explotación de fallos que ni siquiera los creadores del software han descubierto todavía.
OpenAI declaró el 1 de septiembre en su publicación "Camino a Astra" que, cuando se lance, el modelo podrá completar todos los pasos para realizar ataques novedosos completos o explotar vulnerabilidades de día cero con una mínima intervención humana.
En su publicación de blog, OpenAI citó la puntuación del 100 % de Astra en ExploitBench, una prueba que evalúa cómo los modelos pueden explotar errores conocidos, como prueba de ello.
Astra no solo es mejor para planificar ataques de día cero, sino que también es más eficiente. OpenAI demostró esta capacidad mediante una prueba interna realizada con 20 vulnerabilidades de alta gravedad de V8 que se hicieron públicas recientemente. Astra consumió menos tokens, detectó dos vulnerabilidades de día cero y superó a Sol en la generación de código ejecutable arbitrario.
La misma publicación decía que Astra podía encadenar errores desconocidos del navegador para escapar del entorno aislado y, durante las pruebas dirigidas por expertos, logró escalar privilegios del sistema operativo desde usuario ordinario hasta root.
Como mencionó TechCrunch, Astra se une al modelo Mythos de Anthropic, que se lanzó a principios de este año como el primer modelo de lenguaje a gran escala con esas capacidades.
Pachocki, científico jefe de OpenAI, rechaza la histeria que rodea la idea de que OpenAI esté entrando en un terreno desconocido con Astra. Según él, no querría que se iniciara “una carrera hacia la falta de control a raíz de informes confusos”.
El ejecutivo de OpenAI insistió en que el laboratorio cumplió con su deber al utilizar el monitoreo de la cadena de pensamiento, la práctica de leer el razonamiento paso a paso que un modelo expone a medida que trabaja. Citó la profundidad del grafo computacional detrás de los modelos de vanguardia actuales de OpenAI, incluido Astra, que se sitúa a un factor de dos de GPT-4 en la publicación X.
Antes de Pachocki, el director ejecutivo de OpenAI, Sam Altman, también había hecho un llamamiento a la calma el mismo día en que se publicó la entrada del blog de Astra.
«Aquí hay una tensión evidente», escribió el martes, calificando a Astra de «muy buena» y argumentando que las medidas de seguridad deben avanzar al mismo ritmo que la capacidad bruta. Altman afirmó que OpenAI había dedicado todo el verano a garantizar que el modelo se lanzara con las medidas de seguridad necesarias.
El debate sobre la seguridad lleva semanas en marcha. El 18 de agosto, OpenAI se comprometió a suspender durante dos semanas el entrenamiento de aprendizaje por refuerzo para los modelos destinados a la implementación, con el fin de permitir a sus ingenieros reforzar los clústeres de investigación y optimizar la monitorización. El entrenamiento se reanudó el 28 de agosto.
Según OpenAI, Astra no estuvo involucrada en el ahora tristemente célebredentde Hugging Face. También afirmó que el modelo ni siquiera intentó salirse de su entorno controlado, incluso cuando se le presentó un escenario diseñado para incitarlo a recrear el episodio de Hugging Face.
OpenAI ha declarado que ahora todos tendrán acceso a las funciones más avanzadas de Astra, reservando esas capacidades para las organizaciones que forman parte de la coalición Daybreak de OpenAI, mientras que las empresas de Daybreak Blue tendrán acceso a las funciones defensivas más sofisticadas.
Tal como Cryptopolitan informó, Anthropic también afirmó que solo las empresas que participan en su Proyecto Glasswing tendrán acceso a Mythos 5.1, que es básicamente Fable 5.1 con medidas de seguridad independientes.
OpenAI también anunció que supervisará y limitará las respuestas a consultas provenientes de cuentas que considere de alto riesgo. Además, Astra incluirá un sistema de monitoreo de la cadena de pensamiento para detectar comportamientos inapropiados y rechazar con mayor frecuencia solicitudes cibernéticas dañinas.
La mayor parte de la información sobre Astra fue proporcionada por la propia OpenAI, con una validación limitada por parte de terceros de las afirmaciones de OpenAI sobre seguridad o capacidades.
Yona Shavit, antigua empleada de OpenAI que ahora trabaja en la resiliencia de la IA en la Fundación OpenAI, preguntó públicamente si el comportamiento de Astra durante las pruebas refleja una alineación genuina o un modelo que simplemente sabía lo que los evaluadores querían ver.
OpenAI afirma que la tarjeta del sistema completo y las evaluaciones adicionales estarán disponibles cuando Astra se lance a gran escala. Hasta entonces, el alcance de sus capacidades cibernéticas y la solidez de las medidas de seguridad que las protegen siguen siendo difíciles de evaluar.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.