Kimi K3 tiene un rendimiento inferior al de los modelos de IA de vanguardia estadounidenses en la planificación de ciberataques

Fuente Cryptopolitan

Un informe de evaluación conjunto ha declarado que Kimi K3, de Moonshot AI, no está a la altura de los sistemas de IA estadounidenses mástronen lo que respecta a la creación de exploits de software y la ejecución de ataques de red simulados. 

El Instituto de Seguridad de la IA del Reino Unido (AISI) y el Centro de Estándares e Innovación de la IA de EE. UU. (CAISI) llevaron a cabo la evaluación y publicaron sus conclusiones el 23 de julio.

Se espera que Moonshot publique todos los datos del modelo el 27 de julio, y los resultados indican que las medidas de seguridad de Kimi K3 no impidieron que colaborara en actividades cibernéticas ofensivas.

¿Qué reveló la evaluación conjunta sobre Kimi K3?

Los dos institutos sometieron a Kimi K3 a ExploitBench, una prueba de Carnegie Mellon que evalúa hasta qué punto un modelo puede explotar una vulnerabilidad. Se basa en 41 vulnerabilidades encontradas en el motor V8 de Chrome después de 2023. Kimi K3 obtuvo un 32 % de éxito. Los modelos líderes de EE. UU. alcanzaron un promedio del 76,2 %, mientras que el GLM-5.2 de China obtuvo un 24 %.

La ejecución de código arbitrario, que otorga al atacante el control total de la máquina objetivo, es el resultado más peligroso de la prueba. Los modelos estadounidenses lo alcanzaron en 20 de las 41 tareas, en promedio. Kimi K3 no lo alcanzó en ninguna.

GLM-5.2 tampoco lo logró. Así que, si bien Kimi K3 ahora lidera a sus rivales de peso libre en ciberseguridad, se queda corto en el punto donde un ataque real causaría el mayor daño.

A mitad de una brecha de seguridad de red de 32 pasos

La segunda prueba, denominada "Los últimos", consiste en introducir un modelo en una red corporativa simulada con unos 20 hosts distribuidos en cuatro subredes. 

Un especialista humano tardaría unas 20 horas en completar el proceso de 32 pasos. Kimi K3 completó un promedio de 17 pasos, mientras que los modelos estadounidenses más capaces promediaron 28,5 y GLM-5.2 logró 11.

Sin embargo, los evaluadores observaron que Kimi K3 completó toda la cadena una vez en diez intentos y se mantuvo por debajo del límite de 100 millones de tokens que establecieron los evaluadores. 

Los mejores modelos estadounidenses lo resolvieron seis o siete veces de cada diez. Los institutos interpretaron ese único éxito como prueba de que el modelo tiene la capacidad; sin embargo, no puede activarla a demanda. Señalaron que el campo de tiro no cuenta con defensores activos y tiene una ruta predefinida hacia el objetivo, por lo que resulta vulnerable ante cualquier atacante.

¿Tiene Kimi K3 mecanismos de seguridad que le permitan decir que no?

Los evaluadores señalaron que la disposición del modelo a realizar tareas sin resistencia representaba un riesgo importante. Afirmaron: «Kimi K3 es capaz de atacar de forma autónoma sistemas empresariales pequeños, con defensas débiles y vulnerables cuando se le ordena hacerlo y se le otorga acceso inicial a la red» 

AISI ya advirtió que el creciente potencial de los modelos abiertos crea "un riesgo persistente e irreversible de mal uso". Una vez que los pesos de Kimi K3 se hagan públicos el 27 de julio, su comportamiento ya no podrá ser controlado por quien lo aloje.

¿Por qué las puntuaciones de ciberseguridad del Kimi K3 son inferiores a sus puntuaciones generales?

Antes de este informe, Kimi K3 teníatronresultados en general, y eso no ha cambiado; sin embargo, puso de manifiesto sus deficiencias al poner a prueba sus capacidades cibernéticas. Según se informa, el modelo chino de 2,8 billones de parámetros superó a Claude 4.8 y GPT-5.5, y también lideró algunas clasificaciones.

Según los institutos, esto podría ser posible como resultado de la forma en que se construyó el modelo.

El director científico de la Casa Blanca, Michael Kratsios, acusó el 22 de julio al proyecto Moonshot de haber extraído información del modelo Fable de Anthropic, utilizando sus resultados como datos de entrenamiento. 

Los clasificadores de Anthropic bloquean las indicaciones cibernéticas ofensivas avanzadas. Esto significa que un conjunto de entrenamiento extraído de las respuestas de Claude no ofrecería suficiente material sobre esas habilidades específicas. 

Kimi K3 no cuenta con esos clasificadores, lo que le permitió igualar a los modelos occidentales en tareas generales, aunque seguía siendo deficiente en cuanto a capacidad de explotación.

Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
Los dirigentes monetarios de la Fed se muestran divididos ante la reunión de diciembreLos responsables de la Reserva Federal (Fed) continuaron el lunes con opiniones contrapuestas sobre la situación de la economía y los riesgos que enfrenta, un debate que se intensificará antes de la próxima reunión de política monetaria del banco central de Estados Unidos y en ausencia de datos suspendidos por al cierre de la Administración federal.
Autor  Reuters
04 de nov de 2025
Los responsables de la Reserva Federal (Fed) continuaron el lunes con opiniones contrapuestas sobre la situación de la economía y los riesgos que enfrenta, un debate que se intensificará antes de la próxima reunión de política monetaria del banco central de Estados Unidos y en ausencia de datos suspendidos por al cierre de la Administración federal.
placeholder
El IBEX 35 corrige tras tocar los 17.833,50 puntos este mes. ¿Cómo va a ir el índice en el futuro?Al comenzar enero de 2026, el IBEX 35 ha mostrado el comportamiento típico de una corrección tras alcanzar máximos. El pasado 14 de enero, el índice tocó los 17.833,50 puntos, estableciendo un nuevo récord histórico. Posteriormente, el mercado experimentó la previsible recogida de beneficios, entrando el precio en una fase de ligera corrección.
Autor  Mitrade Team
1 Mes 26 Día Lun
Al comenzar enero de 2026, el IBEX 35 ha mostrado el comportamiento típico de una corrección tras alcanzar máximos. El pasado 14 de enero, el índice tocó los 17.833,50 puntos, estableciendo un nuevo récord histórico. Posteriormente, el mercado experimentó la previsible recogida de beneficios, entrando el precio en una fase de ligera corrección.
placeholder
WTI sube por encima de 95.50$ mientras Irán dice que el Estrecho de Ormuz debe permanecer cerradoEl West Texas Intermediate (WTI), el referente del petróleo crudo de EE.UU., se cotiza alrededor de 95.75$ durante las primeras horas de negociación en Asia el viernes. El precio del WTI se dispara debido al cierre efectivo del Estrecho de Ormuz en medio del conflicto que involucra a Estados Unidos (EE.UU.), Israel e Irán.
Autor  FXStreet
3 Mes 13 Día Vie
El West Texas Intermediate (WTI), el referente del petróleo crudo de EE.UU., se cotiza alrededor de 95.75$ durante las primeras horas de negociación en Asia el viernes. El precio del WTI se dispara debido al cierre efectivo del Estrecho de Ormuz en medio del conflicto que involucra a Estados Unidos (EE.UU.), Israel e Irán.
placeholder
El Yen japonés sube ligeramente por temor a una intervención; USD/JPY apunta a un mínimo semanal ante un dólar más débilEl par USD/JPY no logra aprovechar las modestas ganancias del día anterior y se encuentra con nuevas ventas durante la sesión asiática del jueves. Los precios al contado caen a la región de 158.70-158.65 en la última hora y se mantienen cerca del mínimo semanal, tocado el martes en medio de un Dólar estadounidense bajista.
Autor  FXStreet
4 Mes 16 Día Jue
El par USD/JPY no logra aprovechar las modestas ganancias del día anterior y se encuentra con nuevas ventas durante la sesión asiática del jueves. Los precios al contado caen a la región de 158.70-158.65 en la última hora y se mantienen cerca del mínimo semanal, tocado el martes en medio de un Dólar estadounidense bajista.
placeholder
Plata Previsiones del Precio: El XAG/USD sube por encima de 58.00$ mientras el Dólar estadounidense recorta gananciasLa Plata (XAG/USD) sube ligeramente en la sesión europea temprana del viernes, regresando a niveles por encima de 58.00$ mientras el Dólar estadounidense recorta parte de sus ganancias.
Autor  FXStreet
14 hace una horas
La Plata (XAG/USD) sube ligeramente en la sesión europea temprana del viernes, regresando a niveles por encima de 58.00$ mientras el Dólar estadounidense recorta parte de sus ganancias.
goTop
quote