Un informe de evaluación conjunto ha declarado que Kimi K3, de Moonshot AI, no está a la altura de los sistemas de IA estadounidenses mástronen lo que respecta a la creación de exploits de software y la ejecución de ataques de red simulados.
El Instituto de Seguridad de la IA del Reino Unido (AISI) y el Centro de Estándares e Innovación de la IA de EE. UU. (CAISI) llevaron a cabo la evaluación y publicaron sus conclusiones el 23 de julio.
Se espera que Moonshot publique todos los datos del modelo el 27 de julio, y los resultados indican que las medidas de seguridad de Kimi K3 no impidieron que colaborara en actividades cibernéticas ofensivas.
Los dos institutos sometieron a Kimi K3 a ExploitBench, una prueba de Carnegie Mellon que evalúa hasta qué punto un modelo puede explotar una vulnerabilidad. Se basa en 41 vulnerabilidades encontradas en el motor V8 de Chrome después de 2023. Kimi K3 obtuvo un 32 % de éxito. Los modelos líderes de EE. UU. alcanzaron un promedio del 76,2 %, mientras que el GLM-5.2 de China obtuvo un 24 %.
La ejecución de código arbitrario, que otorga al atacante el control total de la máquina objetivo, es el resultado más peligroso de la prueba. Los modelos estadounidenses lo alcanzaron en 20 de las 41 tareas, en promedio. Kimi K3 no lo alcanzó en ninguna.
GLM-5.2 tampoco lo logró. Así que, si bien Kimi K3 ahora lidera a sus rivales de peso libre en ciberseguridad, se queda corto en el punto donde un ataque real causaría el mayor daño.
La segunda prueba, denominada "Los últimos", consiste en introducir un modelo en una red corporativa simulada con unos 20 hosts distribuidos en cuatro subredes.
Un especialista humano tardaría unas 20 horas en completar el proceso de 32 pasos. Kimi K3 completó un promedio de 17 pasos, mientras que los modelos estadounidenses más capaces promediaron 28,5 y GLM-5.2 logró 11.
Sin embargo, los evaluadores observaron que Kimi K3 completó toda la cadena una vez en diez intentos y se mantuvo por debajo del límite de 100 millones de tokens que establecieron los evaluadores.
Los mejores modelos estadounidenses lo resolvieron seis o siete veces de cada diez. Los institutos interpretaron ese único éxito como prueba de que el modelo tiene la capacidad; sin embargo, no puede activarla a demanda. Señalaron que el campo de tiro no cuenta con defensores activos y tiene una ruta predefinida hacia el objetivo, por lo que resulta vulnerable ante cualquier atacante.
Los evaluadores señalaron que la disposición del modelo a realizar tareas sin resistencia representaba un riesgo importante. Afirmaron: «Kimi K3 es capaz de atacar de forma autónoma sistemas empresariales pequeños, con defensas débiles y vulnerables cuando se le ordena hacerlo y se le otorga acceso inicial a la red»
AISI ya advirtió que el creciente potencial de los modelos abiertos crea "un riesgo persistente e irreversible de mal uso". Una vez que los pesos de Kimi K3 se hagan públicos el 27 de julio, su comportamiento ya no podrá ser controlado por quien lo aloje.
Antes de este informe, Kimi K3 teníatronresultados en general, y eso no ha cambiado; sin embargo, puso de manifiesto sus deficiencias al poner a prueba sus capacidades cibernéticas. Según se informa, el modelo chino de 2,8 billones de parámetros superó a Claude 4.8 y GPT-5.5, y también lideró algunas clasificaciones.
Según los institutos, esto podría ser posible como resultado de la forma en que se construyó el modelo.
El director científico de la Casa Blanca, Michael Kratsios, acusó el 22 de julio al proyecto Moonshot de haber extraído información del modelo Fable de Anthropic, utilizando sus resultados como datos de entrenamiento.
Los clasificadores de Anthropic bloquean las indicaciones cibernéticas ofensivas avanzadas. Esto significa que un conjunto de entrenamiento extraído de las respuestas de Claude no ofrecería suficiente material sobre esas habilidades específicas.
Kimi K3 no cuenta con esos clasificadores, lo que le permitió igualar a los modelos occidentales en tareas generales, aunque seguía siendo deficiente en cuanto a capacidad de explotación.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.