O modelo Kimi K3 apresenta desempenho inferior aos modelos de IA de ponta dos EUA no planejamento de ciberataques

Fonte Cryptopolitan

Um relatório de avaliação conjunta afirmou que o Kimi K3 da Moonshot AI não está à altura dos sistemas de IA americanos maistronquando se trata de criar exploits de software e executar ataques de rede simulados. 

O Instituto de Segurança de IA do Reino Unido (AISI) e o Centro de Padrões e Inovação de IA dos EUA (CAISI) realizaram a avaliação e divulgaram suas conclusões em 23 de julho.

A Moonshot deverá divulgar ao público os pesos totais do modelo em 27 de julho, e as conclusões indicam que as medidas de segurança do Kimi K3 não impediram que ele auxiliasse em atividades cibernéticas ofensivas.

O que a avaliação conjunta descobriu sobre Kimi K3?

Os dois institutos executaram o Kimi K3 no ExploitBench, um teste da Carnegie Mellon que avalia o quão longe um modelo consegue levar uma exploração até a sua conclusão. Ele se baseia em 41 vulnerabilidades encontradas no mecanismo V8 do Chrome após 2023. O Kimi K3 obteve uma pontuação de 32%. Os principais modelos dos EUA tiveram uma média de 76,2%, e o GLM-5.2 da China ficou com 24%.

A execução de código arbitrário, que concede ao atacante controle total de uma máquina alvo, é o resultado mais perigoso do teste. Os modelos americanos atingiram esse resultado em 20 das 41 tarefas, em média. O Kimi K3 não o atingiu em nenhuma.

O GLM-5.2 também não conseguiu atingir esse objetivo. Portanto, embora Kimi K3 agora lidere seus rivais da categoria peso-mosca em capacidade cibernética, ele fica devendo no ponto em que um ataque real causaria o maior dano.

Na metade de uma invasão de rede de 32 etapas

O segundo teste, chamado "Os Últimos", insere um modelo em uma rede corporativa simulada com cerca de 20 hosts distribuídos em quatro sub-redes. 

Um especialista humano levaria cerca de 20 horas para percorrer todo o caminho de 32 etapas. O modelo Kimi K3 atingiu uma média de 17 etapas, enquanto os modelos americanos mais avançados alcançaram uma média de 28,5, e o GLM-5.2, 11.

No entanto, os avaliadores observaram que Kimi K3 completou toda a cadeia uma vez em dez tentativas e ficou abaixo do limite de 100 milhões de tokens estabelecido pelos avaliadores. 

Os melhores modelos americanos resolveram o problema seis ou sete vezes em dez. Os institutos interpretaram esse único sucesso como prova de que o modelo possui a capacidade; no entanto, ele não pode acioná-la sob demanda. Eles observaram que o campo de testes não possui defensores ativos e tem um caminho pré-definido até o alvo, o que facilita a vida de qualquer atacante.

O Kimi K3 possui mecanismos de segurança que lhe permitem dizer não?

Os avaliadores apontaram que a disposição do modelo em executar tarefas sem resistência representava um risco significativo. Eles afirmaram: "O Kimi K3 é capaz de atacar autonomamente sistemas empresariais pequenos, pouco protegidos e vulneráveis, quando instruído a fazê-lo e após receber acesso inicial à rede." 

A AISI já havia alertado que o aumento da capacidade de modelos abertos cria “um risco persistente e irreversível de uso indevido”. Assim que os pesos do Kimi K3 forem divulgados publicamente em 27 de julho, seu comportamento não poderá mais ser controlado por quem o hospeda.

Por que as pontuações cibernéticas da Kimi K3 ficam abaixo das pontuações gerais?

Antes deste relatório, o Kimi K3 apresentavatronresultados em benchmarks gerais, e isso não mudou; no entanto, suas deficiências ficaram evidentes quando suas capacidades cibernéticas foram colocadas à prova. O modelo chinês de 2,8 trilhões de parâmetros teria superado o Claude 4.8 e o GPT-5.5, além de liderar alguns rankings.

Segundo os institutos, isso pode ser possível devido à forma como o modelo foi construído.

O diretor científico da Casa Branca, Michael Kratsios, acusou a Moonshot, em 22 de julho, de usar o modelo Fable da Anthropic como base para seus resultados, utilizando-os como dados de treinamento. 

Os classificadores da Anthropic bloqueiam comandos cibernéticos ofensivos avançados. Isso significa que um conjunto de treinamento extraído das respostas de Claude não ofereceria material suficiente sobre essas habilidades específicas. 

O Kimi K3 não possui esses classificadores, o que lhe permitiu igualar os modelos ocidentais em tarefas gerais, embora ainda apresentasse deficiências em capacidade de exploração.

Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
Lucro da Tesla no 2º trimestre cai mais de 14%, Musk apoia investidores de varejo: eles são perspicazesTradingKey - A fabricante global de veículos elétricos Tesla ( TSLA) está enfrentando sua semana mais difícil desde 2026. Afetada por uma forte queda na margem operacional e pelo fluxo de caixa livre
Autor  TradingKey
12 horas atrás
TradingKey - A fabricante global de veículos elétricos Tesla ( TSLA) está enfrentando sua semana mais difícil desde 2026. Afetada por uma forte queda na margem operacional e pelo fluxo de caixa livre
placeholder
Previsão do Preço do Petróleo Bruto: Tensões no Oriente Médio Impulsionam Preços do Petróleo, Eles Ainda Podem Subir Após Romperem US$ 100?TradingKey - Afetado pela contínua escalada das tensões geopolíticas no Oriente Médio, o petróleo Brent ( UKOIL) voltou a superar a barreira psicológica de US$ 100 por barril após dois meses, à medida
Autor  TradingKey
12 horas atrás
TradingKey - Afetado pela contínua escalada das tensões geopolíticas no Oriente Médio, o petróleo Brent ( UKOIL) voltou a superar a barreira psicológica de US$ 100 por barril após dois meses, à medida
placeholder
Ouro aprofunda queda com temores de inflação elevando apostas em alta de juros do Fed e fortalecendo o dólar diante das tarifas de TrumpO ouro (XAU/USD) atrai vendedores pelo segundo dia consecutivo nesta sexta-feira e acentua as perdas abaixo do nível de US$ 4.050 durante a sessão asiática.
Autor  FXStreet
16 horas atrás
O ouro (XAU/USD) atrai vendedores pelo segundo dia consecutivo nesta sexta-feira e acentua as perdas abaixo do nível de US$ 4.050 durante a sessão asiática.
placeholder
A receita do Google Cloud saltou 82%, para US$ 24,8 bilhões, enquanto a Alphabet defende seus investimentos em IAA receita do Google Cloud, da Alphabet, aumentou 82% em relação ao ano anterior, atingindo US$ 24,8 bilhões no segundo trimestre fiscal.
Autor  Cryptopolitan
20 horas atrás
A receita do Google Cloud, da Alphabet, aumentou 82% em relação ao ano anterior, atingindo US$ 24,8 bilhões no segundo trimestre fiscal.
placeholder
Os gastos das grandes empresas de tecnologia com IA devem superar a geração cash até 2027Prevê-se que as cinco maiores empresas de computação em nuvem dos Estados Unidos gastarão mais na criação de infraestrutura de IA do que arrecadarão em receita até 2027. Relatórios sugerem que os acionistas estão começando a se perguntar quando o cash em IA começará a dar retorno. Com bilhões sendo investidos em novos data centers, os investidores estão cada vez menos entusiasmados...
Autor  Cryptopolitan
20 horas atrás
Prevê-se que as cinco maiores empresas de computação em nuvem dos Estados Unidos gastarão mais na criação de infraestrutura de IA do que arrecadarão em receita até 2027. Relatórios sugerem que os acionistas estão começando a se perguntar quando o cash em IA começará a dar retorno. Com bilhões sendo investidos em novos data centers, os investidores estão cada vez menos entusiasmados...
goTop
quote