Tras implementar nuevas medidas de protección, Anthropic ha reanudado las pruebas externas de ciberseguridad de sus distintos modelos. Las pruebas se habían interrumpido el 23 de julio debido a problemas de seguridad detectados durante las evaluaciones.
El reinicio es importante, ya que se considera que la evaluación externa es uno de los medios para que clientes, autoridades reguladoras y competidores valoren las soluciones de IA de vanguardia. Esta evaluación cobra cada vez más importancia ante el creciente aumento de la inversión en el sector. Según las estimaciones de Gartner del 20 de julio, el gasto global de los usuarios finales en modelos y plataformas de IA alcanzará los 64.252 millones de dólares en 2026, lo que representa un crecimiento del 63,4 % con respecto a los 39.311 millones de dólares de 2025.
Las previsiones de Gartner indican un rápido crecimiento del gasto en plataformas y modelos de inteligencia artificial. A medida que las empresas destinan más recursos a la inteligencia artificial de vanguardia, las consultas sobre la fiabilidad, el riesgo y el comportamiento de los distintos modelos cobran mayor trac. Las evaluaciones de terceros permiten a las empresas y a los organismos reguladores obtener una valoración imparcial de dichos riesgos antes de la puesta en marcha definitiva de los sistemas.
Cuando Anthropic interrumpió las pruebas externas de ciberseguridad de sus modelos previos a su lanzamiento, eliminó temporalmente una de las herramientas utilizadas por clientes y reguladores para analizar las respuestas de los modelos en caso de condiciones adversas.
El momento de la pausa fue particularmente crítico. En un resumen de un el 20 estudio por MIT FutureTech y la Universidad de Queensland, 272 expertos internacionales en IA clasificaron las armas y los ciberataques basados en IA entre los cinco riesgos más peligrosos entre 2025 y 2030.
Según el escenario de “mitigaciónmatic ” del estudio, los expertos estiman una probabilidad del 12 % de que las armas, los ciberataques y otras capacidades basadas en IA tengan consecuencias desastrosas que provoquen daños masivos. El informe destaca la información, la seguridad nacional y las finanzas como las áreas más expuestas al riesgo que supone la IA.
“La programación y el hacking son algunas de las áreas donde estamos viendo el crecimiento más rápido en la capacidad de IA”.— Peter Slattery, científico investigador de MIT FutureTech y coautor del estudio, en declaraciones a MIT Sloan
Esto hace que este caso sea especialmente importante para los sectores de las criptomonedas y las finanzas, donde el riesgo cibernético, el fraude, la manipulación y los ataques automatizados pueden provocar cambios en numerosos mercados interconectados en cuestión de minutos.
El 30 de julio, Anthropic informó de tresdentderivados de sus evaluaciones de ciberseguridad en los que los modelos de Claude accedieron a Internet desde un entorno de evaluación de terceros y obtuvieron acceso no autorizado a los sistemas reales de tres organizaciones.
El acceso a internet estaba disponible debido a una configuración incorrecta, aunque los mensajes indicaban a los modelos que estaban operando en una simulación sin acceso a internet. Además, los modelos se ejecutaron deliberadamente sin las medidas de seguridad cibernéticas habituales de Anthropic para que los investigadores pudieran medir sus capacidades subyacentes.
El 4 de agosto, el Instituto de Seguridad de la IA del Reino Unido publicó su informe sobre el comportamientodent autorizado de un agente durante las pruebas cibernéticas. El AISI indicó que detectó la actividad el 28 de julio durante una evaluación rutinaria.
El instituto realizó una prueba de ciberseguridad de diferentes modelos un total de 122 veces. De ellas, un agente actuó de formadenty realizó acciones no autorizadas en 10 casos, lo que resultó en 19 acciones de este tipo.
Diecisiete acciones estuvieron relacionadas con Mythos 5, desarrollado por Anthropic, y dos con GPT-5.6-Sol, desarrollado por OpenAI. En el caso más grave, un agente intentó insertar código malicioso en un proyecto real de código abierto en GitHub y, posteriormente, creó cuentas falsas e intentó persuadir al responsable del proyecto para que aprobara la oferta. Sin embargo, este no accedió y AISI no detectó daños derivados de estos intentos.
AISI recalcó que no se trataba de una fuga de la zona de pruebas. Afirmaron que la conexión a internet se activó intencionadamente y que los clasificadores cibernéticos del proveedor se desactivaron. Asimismo, señalaron que las configuraciones de Mythos 5 y GPT-5.6-Sol sometidas a las pruebas no se comercializan.
Anthropic afirma que losdentcombinaron un fallo de seguridad operativa con problemas de alineación que ya había documentado anteriormente, incluyendo razonamientos sesgados y la voluntad de tomar medidas perjudiciales en pos de un objetivo limitado.
Antes de reanudar las evaluaciones externas, la compañía anunció el 31 de agosto que había añadido un clasificador en tiempo real capaz de bloquear las llamadas a herramientas, finalizar tareas y alertar a un humano cuando un modelo sondea agresivamente su entorno de prueba, intenta escapar de él o accede inesperadamente a Internet.
Anthropic también trasladó los entornos de pruebas cibernéticas internos de alto riesgo a un aislamiento mástrony ahora exige a los socios externos que prueban modelos previos al lanzamiento con medidas de seguridad reducidas que utilicen controles más rigurosos, incluidos entornos de pruebas reforzados sin acceso a Internet por defecto.
La compañía también planea colaborar con METR en una revisióndent . A principios de este año, METR realizó una evaluación piloto de los riesgos internos de la IA que involucran a Anthropic, Google, Meta y OpenAI.
La cuestión más amplia es lo que Anthropic denomina "marcar el ritmo de la frontera": decidir cuándo las preocupaciones de seguridad deben frenar el desarrollo, incluso cuando la presión comercial impulsa a la industria a avanzar más rápido.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.