Durante testes de cibersegurança, os agentes de IA da OpenAI e da Anthropic realizaram 19 ações não autorizadas, de acordo com o Instituto de Segurança de IA do Reino Unido. O instituto afirmou na terça-feira que um dos agentes crioudentonline falsas para enganar uma pessoa e levá-la a aprovar um código malicioso.
Os resultados foram baseados em um exercício fictício de cibersegurança conduzido pelo AISI, um órgão do governo do Reino Unido, para explorar o que os agentes das duas empresas poderiam fazer. O instituto repetiu o mesmo desafio 122 vezes e registrou 19 violações das regras em 10 dessas simulações.
Dezessete das ações sinalizadas foram devidas ao agente da Anthropic usando seu modelo Mythos 5. As outras duas vieram do GPT-5.6-Sol da OpenAI.
A AISI afirmou em uma postagem em seu blog que alguns dos agentes "se envolveram em atividades contínuas e potencialmente prejudiciais direcionadas a pessoas e organizações reais", embora tenha dito que nenhuma das violações causou danos concretos.
A AISI tem acesso antecipado a modelos de vanguarda por meio de acordos voluntários com os principais laboratórios. Existem testes para detectar esse tipo de comportamento antes que os modelos cheguem aos clientes.
A OpenAI e os agentes de mercado antrópicos são vistos como a próxima geração de software empresarial, mas o instituto considera os resultados como evidência de que as salvaguardas em torno dos testes de agentes ainda são frágeis.
O mais gravedent envolveu um agente que escreveu código malicioso e crioudent, tentando em seguida obter a aprovação de um humano para o código. A AISI não revelou o modelo utilizado. Afirmou que o episódio não se enquadra em nenhum dos dois casos online falsas já divulgados pela OpenAI
Isso deixou o provável culpado como sendo o agente da Anthropic, disse Andrew Yoon, pesquisador da CivAI, uma organização sem fins lucrativos da Califórnia que estuda os riscos da IA.
O Instituto de Segurança da Informação do Reino Unido @AISicurityInst ) publicou um relatório sobre sua recente avaliação de cibersegurança dos modelos Claude Mythos 5, da Anthropic, e GPT-5.6 Sol, da OpenAI. Os modelos tentaram concluir uma tarefa em um ambiente onde suas salvaguardas normais foram removidas e eles foram deliberadamente…
— Anthropic (@AnthropicAI) 4 de agosto de 2026
A Anthropic afirmou em uma publicação no X que está trabalhando com a AISI para coletar detalhes e conduzir uma investigação.
A OpenAI respondeu às duas ações associadas ao seu agente em uma postagem no blog da empresa, ambas envolvendo o acesso à internet de maneiras que o comando havia proibido.
A empresa afirmou que deseja "fortalecer as práticas compartilhadas para a realização segura de avaliações de alto risco" e planeja reunir institutos nacionais de IA, avaliadores externos e laboratórios concorrentes nas próximas semanas.
A OpenAI usou a mesma publicação para relatar um problema diferente. A Irregular, uma empresa terceirizada de testes, configurou incorretamente um sistema, o que inadvertidamente permitiu que os agentes da OpenAI acessassem a internet.
Uma semana antes, a Anthropic fez uma divulgação muito semelhante sobre o Irregular. A OpenAI ampliou sua própria investigação de invasão após descobrir mais vazamentos de agentes.
Em julho, um da OpenAI escapou de um ambiente isolado e acessou sistemas ativos da Hugging Face, que notificou o FBI antes que o ataque fosse tracaté a própria empresa cerca de uma semana depois.
Na avaliação da AISI, os agentes nunca saíram de seus ambientes de teste. A AISI concedeu-lhes acesso à internet propositalmente, como parte de seu procedimento padrão.
A violação de segurança da Hugging Face também levou a Anthropic a auditar seus registros. Cryptopolitan noticiou em 31 de julho que a empresa descobriu que três de seus modelos, incluindo o Mythos 5, haviam escapado dos ambientes de teste e chegado a três organizações reais após uma configuração incorreta lhes conceder acesso à internet.
O grupo Mythos 5 publicou um pacote Python malicioso no PyPI que foi executado em 15 sistemas reais antes de ser removido. A Anthropic solicitou ao grupo de avaliação METR que revise os eventos de formadent.
Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.