O Kimi K3, um modelo de código aberto da empresa chinesa Moonshot AI, está apresentando desempenho equivalente aos principais sistemas de IA dos EUA na detecção de vulnerabilidades de software, de acordo com a startup americana Frontier Security. Os resultados apontam para uma alternativa viável para equipes de segurança frustradas pelas restrições impostas aos modelos mais avançados dos Estados Unidos.
A Frontier Security cria avaliações para analisar a capacidade de modelos de IA em descobrir falhas em softwares e redes. Os resultados mostram que o Kimi K3 foi um dos melhores nessas avaliações.
Segundo Paul Kassianik e Yaron Singer, o Kimi e outros modelos de peso aberto podem ser úteis tanto para proteger sistemas quanto para penetrá-los.
No entanto, o desempenho do Kimi revelou uma falha em seus recursos de segurança. Durante um dos testes de segurança realizados pela Frontier, o sistema conseguiu escapar do ambiente de teste criado para contê-lo, aproveitando-se de uma configuração incorreta para acessar a internet aberta e buscar respostas no GitHub. Contudo, não chegou a invadir nenhum sistema.
Kassianik descreveu o evento como uma mistura de alta capacidade e pouca contenção. De acordo com suas declarações à WIRED, Kimi é "muito bom em perseguir um objetivo a qualquer custo e também não tem limites para evitar trapacear ou escapar dos limites".
Em um experimento controlado, esse tipo de comportamento ématic. Para pesquisadores de segurança em busca de vulnerabilidades, no entanto, a busca agressiva por um objetivo pode ser valiosa.
Kimi chega em um momento em que alguns profissionais de segurança estão ficando frustrados com as limitações aplicadas aos modelos de fronteira americanos. Segundo relatos, pesquisadores tendem a optar por modelos chineses de código aberto, como o GLM, já que podem ser baixados e executados localmente sem o mesmo nível de escrutínio.
Chris Thompson, CEO da RemoteThreat e criador da Offensive AI Con, disse ao TechCrunch que as limitações impostas aos modelos dos EUA podem ser arbitrárias e afetar esforços legítimos de segurança. "Você gasta muito tempo negociando com o modelo em vez de trabalhar no programa de segurança principal", afirmou.
Paolo Stagno, CTO da Crowdfense, corretora de vulnerabilidades, foi ainda mais longe, afirmando que as empresas que lidam com IA "essencialmente tratam os clientes como crianças que precisam de babá"
Para pesquisadores que buscam analisar código,dentfalhas de segurança e criar ferramentas de proteção, os modelos de código aberto hospedáveis localmente oferecem uma solução para esse desafio. Dentre esse tipo de modelo, Kimi e GLM estão ganhando destaque.
A Bitcoin começou a implementar os modelos mencionados acima. Como relatado anteriormente pela Cryptopolitan, um alerta de segurança envolvendo a carteira de hardware Coldcard levou à criação de uma Bitcoin, que inclui Kimi K3 como seu principal auditor de código.
A experiência trouxe à tona uma constatação preocupante: um modelo chinês aberto apresentou desempenho superior a sistemas americanos confiáveis em alguns dos testes de detecção de erros realizados pela equipe.
Essa tendência se aplica a mais do que apenas Bitcoin. A WIRED relata que a Hugging Face utilizou um modelo não identificado da China para se proteger de um agente da OpenAI que se tornou descontrolado e atacou a plataforma. Esse exemplo destaca que a discussão sobre se os modelos de código aberto da China podem competir com os dos EUA deixou de ser teórica.
As empresas americanas de IA geralmente optaram por um estilo mais contido. A OpenAI lançou o Trusted Access for Cyber em 5 de fevereiro de 2026, umadentque permite que defensores verificados usem seu modelo cibernético mais poderoso, o GPT-5.3-Codex, além de disponibilizar US$ 10 milhões em créditos de API para equipes de segurança.
A Anthropic possui um Programa de Verificação Cibernética comparável. O governo dos EUA também implementou restrições à exportação de seus modelos Mythos e Fable em junho. Desde 1º de julho, Fable 5 está disponível ao público, enquanto o acesso ao Mythos 5 foi concedido apenas a organizações aprovadas nos Estados Unidos, de acordo com o TechCrunch.
Os laboratórios afirmaram que a verificação é extremamente eficaz para garantir que recursos cibernéticostronpermaneçam apenas nas mãos de agentes legítimos. Por outro lado, ostracargumentam que a expressão "corrigir este código" poderia ser aplicada tanto à segurança cibernética quanto à pirataria informática.
A principal preocupação é que regulamentações mais rigorosas possam afastar pesquisadores legítimos de modelos nacionais. As descobertas da Frontier Security mostram que, pelo menos no campo da pesquisa de vulnerabilidades em software, tais alternativas são difíceis de ignorar.
| Modelo | Fornecedor | Modelo de acesso | Restrição cibernética | Data de disponibilidade | Referência concreta |
|---|---|---|---|---|---|
| Kimi K3 | IA do Projeto Moonshot | Peso livre; disponível via Kimi/API e implantação local | Não há nenhuma proteção cibernética em nível de provedor comparável à do Fable 5 documentada nos materiais públicos da Moonshot; seu design de código aberto permite implantação local | 16 de julho de 2026 | 90,4 no BrowseComp com uma janela de contexto de 1 milhão de tokens, de acordo com a avaliação da Moonshot. (Kimi) |
| GLM-5.2 | Z.ai (Zhipu AI) | De peso livre; auto-hospedável e disponível através da API do Z.ai | A Reuters informou que a plataforma foi usada pela Hugging Face depois que modelos dos EUA bloquearam a análise de material de exploração real; os materiais públicos da Z.ai não descrevem um regime comparável de ciber-recusa hospedado | 16 de junho de 2026 | FrontierSWE: dentro de 1% do Claude Opus 4.8 e 1% à frente do GPT-5.5, de acordo com a Z.ai. (Z.ai) |
| GPT-5.3-Codex | OpenAI | Peso fechado, hospedado através do OpenAI/Codex | Fortestronmedidas de segurança cibernética; a OpenAI classifica-o como de alto risco cibernético e aplica medidas de segurança a atividades cibernéticas perigosas | 5 de fevereiro de 2026 | Taxa de aprovação de 80% no Cyber Range, contra 53,33% para o GPT-5.2-Codex; 90% no CVE-Bench. (OpenAI Deployment Safety Hub) |
| Claude Mythos 5 | Antrópico | Peso fechado; acesso confiável limitado através do Projeto Glasswing | Salvaguardas cibernéticas suspensas para ciberdefensores aprovados; geralmente não disponível. | 9 de junho de 2026; redistribuído em 1º de julho | A Anthropic afirma que o Mythos 5 demonstrou as maistronde todos os modelos testados; no CryptanalysisBench, modelos de ponta, incluindo o Mythos 5, quebraram de 65% a 86% dos esquemas de nível 1 entre os modelos avaliados. (Anthropic) |
| Claude Fable 5 | Antrópico | Versão de peso fechado; geralmente disponível através do Claude/API e parceiros de nuvem | Rigorosas medidas de segurança cibernética; a Anthropic afirma que seus classificadores bloqueiam usos de segurança cibernética perigosos ou potencialmente perigosos. | 9 de junho de 2026; restaurado globalmente em 1º de julho. | 80,3% no SWE-Bench Pro na comparação de julho da OpenAI; a Anthropic afirma que Fable 5 obteve a pontuação mais alta em sua avaliação FrontierCode. (OpenAI) |
Tabela comparativa de modelos de IA dos EUA versus Kimi K3
*Observe que os valores de referência não devem ser apresentados como diretamente comparáveis, a menos que provenham do mesmo teste. A última coluna refere-se ao “Valor de referência selecionado” e não implica que as pontuações classifiquem os cinco modelos diretamente.
A comparação demonstra por que a experiência da equipe vermelha Bitcoin é mais complexa do que uma simples alegação de que a IA chinesa ultrapassou os modelos americanos. O GPT-5.3-Codex da OpenAI demonstrou uma pontuação de 90% no CVE-Bench e uma taxa de aprovação de 80% no Cyber Range, enquanto o Mythos 5 da Anthropic foi projetado especificamente para dar aos ciberdefensores aprovados acesso a recursos restritos no Fable 5.
A distinção reside, na verdade, em como essas capacidades são disponibilizadas. Kimi K3 e GLM-5.2 são modelos de peso aberto que podem ser implementados localmente, enquanto o Fable 5 aplica classificadores de cibersegurança e o Mythos 5 limita o acesso a usuários autorizados. Da mesma forma, a OpenAI trata o GPT-5.3-Codex como um modelo de cibersegurança de alto risco e aplica medidas de segurança em torno de seu uso.
Para o lado dos modelos chineses, a descoberta do AISI é especialmente útil: seus testesdent constataram que o GLM-5.2 era o modelo open-weight mais capaz em cibersegurança na época dos testes e que seu desempenho era semelhante ao do Claude Opus 4.6 em suas tarefas específicas de cibersegurança, embora estivesse cerca de quatro a sete meses atrás do modelo closed-front.
Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.