Um relatório de avaliação conjunta afirmou que o Kimi K3 da Moonshot AI não está à altura dos sistemas de IA americanos maistronquando se trata de criar exploits de software e executar ataques de rede simulados.
O Instituto de Segurança de IA do Reino Unido (AISI) e o Centro de Padrões e Inovação de IA dos EUA (CAISI) realizaram a avaliação e divulgaram suas conclusões em 23 de julho.
A Moonshot deverá divulgar ao público os pesos totais do modelo em 27 de julho, e as conclusões indicam que as medidas de segurança do Kimi K3 não impediram que ele auxiliasse em atividades cibernéticas ofensivas.
Os dois institutos executaram o Kimi K3 no ExploitBench, um teste da Carnegie Mellon que avalia o quão longe um modelo consegue levar uma exploração até a sua conclusão. Ele se baseia em 41 vulnerabilidades encontradas no mecanismo V8 do Chrome após 2023. O Kimi K3 obteve uma pontuação de 32%. Os principais modelos dos EUA tiveram uma média de 76,2%, e o GLM-5.2 da China ficou com 24%.
A execução de código arbitrário, que concede ao atacante controle total de uma máquina alvo, é o resultado mais perigoso do teste. Os modelos americanos atingiram esse resultado em 20 das 41 tarefas, em média. O Kimi K3 não o atingiu em nenhuma.
O GLM-5.2 também não conseguiu atingir esse objetivo. Portanto, embora Kimi K3 agora lidere seus rivais da categoria peso-mosca em capacidade cibernética, ele fica devendo no ponto em que um ataque real causaria o maior dano.
O segundo teste, chamado "Os Últimos", insere um modelo em uma rede corporativa simulada com cerca de 20 hosts distribuídos em quatro sub-redes.
Um especialista humano levaria cerca de 20 horas para percorrer todo o caminho de 32 etapas. O modelo Kimi K3 atingiu uma média de 17 etapas, enquanto os modelos americanos mais avançados alcançaram uma média de 28,5, e o GLM-5.2, 11.
No entanto, os avaliadores observaram que Kimi K3 completou toda a cadeia uma vez em dez tentativas e ficou abaixo do limite de 100 milhões de tokens estabelecido pelos avaliadores.
Os melhores modelos americanos resolveram o problema seis ou sete vezes em dez. Os institutos interpretaram esse único sucesso como prova de que o modelo possui a capacidade; no entanto, ele não pode acioná-la sob demanda. Eles observaram que o campo de testes não possui defensores ativos e tem um caminho pré-definido até o alvo, o que facilita a vida de qualquer atacante.
Os avaliadores apontaram que a disposição do modelo em executar tarefas sem resistência representava um risco significativo. Eles afirmaram: "O Kimi K3 é capaz de atacar autonomamente sistemas empresariais pequenos, pouco protegidos e vulneráveis, quando instruído a fazê-lo e após receber acesso inicial à rede."
A AISI já havia alertado que o aumento da capacidade de modelos abertos cria “um risco persistente e irreversível de uso indevido”. Assim que os pesos do Kimi K3 forem divulgados publicamente em 27 de julho, seu comportamento não poderá mais ser controlado por quem o hospeda.
Antes deste relatório, o Kimi K3 apresentavatronresultados em benchmarks gerais, e isso não mudou; no entanto, suas deficiências ficaram evidentes quando suas capacidades cibernéticas foram colocadas à prova. O modelo chinês de 2,8 trilhões de parâmetros teria superado o Claude 4.8 e o GPT-5.5, além de liderar alguns rankings.
Segundo os institutos, isso pode ser possível devido à forma como o modelo foi construído.
O diretor científico da Casa Branca, Michael Kratsios, acusou a Moonshot, em 22 de julho, de usar o modelo Fable da Anthropic como base para seus resultados, utilizando-os como dados de treinamento.
Os classificadores da Anthropic bloqueiam comandos cibernéticos ofensivos avançados. Isso significa que um conjunto de treinamento extraído das respostas de Claude não ofereceria material suficiente sobre essas habilidades específicas.
O Kimi K3 não possui esses classificadores, o que lhe permitiu igualar os modelos ocidentais em tarefas gerais, embora ainda apresentasse deficiências em capacidade de exploração.
Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.