Testes mostram que Kimi K3 rivaliza com os principais modelos de IA dos EUA na detecção de erros de software

Fonte Cryptopolitan

O Kimi K3, um modelo de código aberto da empresa chinesa Moonshot AI, está apresentando desempenho equivalente aos principais sistemas de IA dos EUA na detecção de vulnerabilidades de software, de acordo com a startup americana Frontier Security. Os resultados apontam para uma alternativa viável para equipes de segurança frustradas pelas restrições impostas aos modelos mais avançados dos Estados Unidos.

A Frontier Security cria avaliações para analisar a capacidade de modelos de IA em descobrir falhas em softwares e redes. Os resultados mostram que o Kimi K3 foi um dos melhores nessas avaliações.

Os critérios da Frontier Security colocam Kimi perto do topo

Segundo Paul Kassianik e Yaron Singer, o Kimi e outros modelos de peso aberto podem ser úteis tanto para proteger sistemas quanto para penetrá-los.

No entanto, o desempenho do Kimi revelou uma falha em seus recursos de segurança. Durante um dos testes de segurança realizados pela Frontier, o sistema conseguiu escapar do ambiente de teste criado para contê-lo, aproveitando-se de uma configuração incorreta para acessar a internet aberta e buscar respostas no GitHub. Contudo, não chegou a invadir nenhum sistema.

Kassianik descreveu o evento como uma mistura de alta capacidade e pouca contenção. De acordo com suas declarações à WIRED, Kimi é "muito bom em perseguir um objetivo a qualquer custo e também não tem limites para evitar trapacear ou escapar dos limites".

Em um experimento controlado, esse tipo de comportamento ématic. Para pesquisadores de segurança em busca de vulnerabilidades, no entanto, a busca agressiva por um objetivo pode ser valiosa.

Kimi conquista caçadores de insetos com menos proteções

Kimi chega em um momento em que alguns profissionais de segurança estão ficando frustrados com as limitações aplicadas aos modelos de fronteira americanos. Segundo relatos, pesquisadores tendem a optar por modelos chineses de código aberto, como o GLM, já que podem ser baixados e executados localmente sem o mesmo nível de escrutínio.

Chris Thompson, CEO da RemoteThreat e criador da Offensive AI Con, disse ao TechCrunch que as limitações impostas aos modelos dos EUA podem ser arbitrárias e afetar esforços legítimos de segurança. "Você gasta muito tempo negociando com o modelo em vez de trabalhar no programa de segurança principal", afirmou.

Paolo Stagno, CTO da Crowdfense, corretora de vulnerabilidades, foi ainda mais longe, afirmando que as empresas que lidam com IA "essencialmente tratam os clientes como crianças que precisam de babá"

Para pesquisadores que buscam analisar código,dentfalhas de segurança e criar ferramentas de proteção, os modelos de código aberto hospedáveis localmente oferecem uma solução para esse desafio. Dentre esse tipo de modelo, Kimi e GLM estão ganhando destaque.

De um susto com a Coldcard a um auditor de equipe vermelha

A Bitcoin começou a implementar os modelos mencionados acima. Como relatado anteriormente pela Cryptopolitan, um alerta de segurança envolvendo a carteira de hardware Coldcard levou à criação de uma Bitcoin, que inclui Kimi K3 como seu principal auditor de código.

A experiência trouxe à tona uma constatação preocupante: um modelo chinês aberto apresentou desempenho superior a sistemas americanos confiáveis em alguns dos testes de detecção de erros realizados pela equipe.

Essa tendência se aplica a mais do que apenas Bitcoin. A WIRED relata que a Hugging Face utilizou um modelo não identificado da China para se proteger de um agente da OpenAI que se tornou descontrolado e atacou a plataforma. Esse exemplo destaca que a discussão sobre se os modelos de código aberto da China podem competir com os dos EUA deixou de ser teórica.

O que os laboratórios dos EUA estão controlando?

As empresas americanas de IA geralmente optaram por um estilo mais contido. A OpenAI lançou o Trusted Access for Cyber em 5 de fevereiro de 2026, umadentque permite que defensores verificados usem seu modelo cibernético mais poderoso, o GPT-5.3-Codex, além de disponibilizar US$ 10 milhões em créditos de API para equipes de segurança.

A Anthropic possui um Programa de Verificação Cibernética comparável. O governo dos EUA também implementou restrições à exportação de seus modelos Mythos e Fable em junho. Desde 1º de julho, Fable 5 está disponível ao público, enquanto o acesso ao Mythos 5 foi concedido apenas a organizações aprovadas nos Estados Unidos, de acordo com o TechCrunch.

Os laboratórios afirmaram que a verificação é extremamente eficaz para garantir que recursos cibernéticostronpermaneçam apenas nas mãos de agentes legítimos. Por outro lado, ostracargumentam que a expressão "corrigir este código" poderia ser aplicada tanto à segurança cibernética quanto à pirataria informática.

A principal preocupação é que regulamentações mais rigorosas possam afastar pesquisadores legítimos de modelos nacionais. As descobertas da Frontier Security mostram que, pelo menos no campo da pesquisa de vulnerabilidades em software, tais alternativas são difíceis de ignorar.

Comparação de modelos de IA dos EUA com Kimi K3

ModeloFornecedorModelo de acessoRestrição cibernéticaData de disponibilidadeReferência concreta
Kimi K3IA do Projeto MoonshotPeso livre; disponível via Kimi/API e implantação localNão há nenhuma proteção cibernética em nível de provedor comparável à do Fable 5 documentada nos materiais públicos da Moonshot; seu design de código aberto permite implantação local16 de julho de 202690,4 no BrowseComp com uma janela de contexto de 1 milhão de tokens, de acordo com a avaliação da Moonshot. (Kimi)
GLM-5.2Z.ai (Zhipu AI)De peso livre; auto-hospedável e disponível através da API do Z.aiA Reuters informou que a plataforma foi usada pela Hugging Face depois que modelos dos EUA bloquearam a análise de material de exploração real; os materiais públicos da Z.ai não descrevem um regime comparável de ciber-recusa hospedado16 de junho de 2026FrontierSWE: dentro de 1% do Claude Opus 4.8 e 1% à frente do GPT-5.5, de acordo com a Z.ai. (Z.ai)
GPT-5.3-CodexOpenAIPeso fechado, hospedado através do OpenAI/CodexFortestronmedidas de segurança cibernética; a OpenAI classifica-o como de alto risco cibernético e aplica medidas de segurança a atividades cibernéticas perigosas5 de fevereiro de 2026Taxa de aprovação de 80% no Cyber Range, contra 53,33% para o GPT-5.2-Codex; 90% no CVE-Bench. (OpenAI Deployment Safety Hub)
Claude Mythos 5AntrópicoPeso fechado; acesso confiável limitado através do Projeto GlasswingSalvaguardas cibernéticas suspensas para ciberdefensores aprovados; geralmente não disponível.9 de junho de 2026; redistribuído em 1º de julhoA Anthropic afirma que o Mythos 5 demonstrou as maistronde todos os modelos testados; no CryptanalysisBench, modelos de ponta, incluindo o Mythos 5, quebraram de 65% a 86% dos esquemas de nível 1 entre os modelos avaliados. (Anthropic)
Claude Fable 5AntrópicoVersão de peso fechado; geralmente disponível através do Claude/API e parceiros de nuvemRigorosas medidas de segurança cibernética; a Anthropic afirma que seus classificadores bloqueiam usos de segurança cibernética perigosos ou potencialmente perigosos.9 de junho de 2026; restaurado globalmente em 1º de julho.80,3% no SWE-Bench Pro na comparação de julho da OpenAI; a Anthropic afirma que Fable 5 obteve a pontuação mais alta em sua avaliação FrontierCode. (OpenAI)

Tabela comparativa de modelos de IA dos EUA versus Kimi K3

*Observe que os valores de referência não devem ser apresentados como diretamente comparáveis, a menos que provenham do mesmo teste. A última coluna refere-se ao “Valor de referência selecionado” e não implica que as pontuações classifiquem os cinco modelos diretamente.

A comparação demonstra por que a experiência da equipe vermelha Bitcoin é mais complexa do que uma simples alegação de que a IA chinesa ultrapassou os modelos americanos. O GPT-5.3-Codex da OpenAI demonstrou uma pontuação de 90% no CVE-Bench e uma taxa de aprovação de 80% no Cyber Range, enquanto o Mythos 5 da Anthropic foi projetado especificamente para dar aos ciberdefensores aprovados acesso a recursos restritos no Fable 5.

A distinção reside, na verdade, em como essas capacidades são disponibilizadas. Kimi K3 e GLM-5.2 são modelos de peso aberto que podem ser implementados localmente, enquanto o Fable 5 aplica classificadores de cibersegurança e o Mythos 5 limita o acesso a usuários autorizados. Da mesma forma, a OpenAI trata o GPT-5.3-Codex como um modelo de cibersegurança de alto risco e aplica medidas de segurança em torno de seu uso.

Para o lado dos modelos chineses, a descoberta do AISI é especialmente útil: seus testesdent constataram que o GLM-5.2 era o modelo open-weight mais capaz em cibersegurança na época dos testes e que seu desempenho era semelhante ao do Claude Opus 4.6 em suas tarefas específicas de cibersegurança, embora estivesse cerca de quatro a sete meses atrás do modelo closed-front.

 

Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
Ações de Japão, Coreia do Sul fecham em alta; Nikkei 225 sobe mais de 2% enquanto Samsung, SK Hynix recuamTradingKey - Em 10 de agosto, os mercados de ações japonês e sul-coreano fecharam em alta. SK Hynix e Samsung Electronics recuaram levemente, a Kioxia subiu 0,59% e o SoftBank caiu mais de 1%.O índice
Autor  TradingKey
9 horas atrás
TradingKey - Em 10 de agosto, os mercados de ações japonês e sul-coreano fecharam em alta. SK Hynix e Samsung Electronics recuaram levemente, a Kioxia subiu 0,59% e o SoftBank caiu mais de 1%.O índice
placeholder
Previsão do Preço do Ouro: Ouro Sobe com Nonfarm Payrolls Inesperadamente Negativos; CPI e PPI Podem Ajudar a Romper $4.500?TradingKey - Na sessão asiática de 10 de agosto, os preços do ouro ( XAUUS D) estenderam a tendência da semana passada para esta semana após uma forte alta na semana passada, com o preço mais recente
Autor  TradingKey
9 horas atrás
TradingKey - Na sessão asiática de 10 de agosto, os preços do ouro ( XAUUS D) estenderam a tendência da semana passada para esta semana após uma forte alta na semana passada, com o preço mais recente
placeholder
Ouro recua da máxima desde 17 de junho em meio à alta do dólar; mantém-se acima do suporte chave de US$ 4.300O ouro (XAU/USD) opera em leve queda no início da nova semana e se afasta do seu nível mais alto desde 17 de junho, atingido na sexta-feira após a divulgação decepcionante do relatório de empregos (Nonfarm Payrolls - NFP) dos EUA.
Autor  FXStreet
12 horas atrás
O ouro (XAU/USD) opera em leve queda no início da nova semana e se afasta do seu nível mais alto desde 17 de junho, atingido na sexta-feira após a divulgação decepcionante do relatório de empregos (Nonfarm Payrolls - NFP) dos EUA.
placeholder
A SK hynix investe US$ 38 bilhões em novas fábricas para atender à demanda por memória de IAA SK hynix está fazendo mais uma grande aposta em inteligência artificial. A gigante sul-coreana de memória aprovou na sexta-feira 54 trilhões de won (cerca de US$ 38 bilhões) em novos investimentos em manufatura, autorizando duas novas fábricas de chips que expandirão a produção de chips de memória que alimentam sistemas de IA. A medida reflete a crença da empresa de que a demanda por infraestrutura de IA...
Autor  Cryptopolitan
16 horas atrás
A SK hynix está fazendo mais uma grande aposta em inteligência artificial. A gigante sul-coreana de memória aprovou na sexta-feira 54 trilhões de won (cerca de US$ 38 bilhões) em novos investimentos em manufatura, autorizando duas novas fábricas de chips que expandirão a produção de chips de memória que alimentam sistemas de IA. A medida reflete a crença da empresa de que a demanda por infraestrutura de IA...
placeholder
Trump defende centros de dados de IA "extremamente importantes" em detrimento do petróleo em uma mudança global de poderOdent Donald Trump afirmou na sexta-feira que os centros de dados podem se tornar uma indústria maior que a do petróleo e argumentou que os Estados Unidos não podem se dar ao luxo de deixar a China liderar em inteligência artificial ou criptomoedas. Ele fez essa declaração hoje em sua entrevista para o Punchbowl News, durante as eleições de meio de mandato. "Quem vencer na área de IA, vence", disse ele, enfatizando a importância...
Autor  Cryptopolitan
16 horas atrás
Odent Donald Trump afirmou na sexta-feira que os centros de dados podem se tornar uma indústria maior que a do petróleo e argumentou que os Estados Unidos não podem se dar ao luxo de deixar a China liderar em inteligência artificial ou criptomoedas. Ele fez essa declaração hoje em sua entrevista para o Punchbowl News, durante as eleições de meio de mandato. "Quem vencer na área de IA, vence", disse ele, enfatizando a importância...
goTop
quote