Mythos 5 conseguiu se safar de uma briga que Opus 4.6 continuava perdendo

Fonte Cryptopolitan

Uma pesquisa publicada em 13 de agosto pela Frontier Red Team da Anthropic descobriu que agentes do Claude, ao receberem uma única tarefa de programação com ordens conflitantes, atacaram uns aos outros usando malware autorreplicante.

As conclusões surgem num momento em que as empresas se apressam a implementar agentes autónomos em bases de código e mercados partilhados.

Três agentes Claude, uma missão e nenhuma ideia de que os outros estavam lá

A Anthropic executou três cópias do mesmo modelo Claude em suas próprias máquinas virtuais dentro do Claude Code.

Cada um foi solicitado a migrar o mesmo backend em Python para uma linguagem de programação diferente. Os três desconheciam a existência um do outro.

“Observamos consistentemente uma guerra territorial envolvendo múltiplos agentes”, escreveram os pesquisadores.

Cada agente concluiu que os outros estavam deliberadamente bloqueando o processo e tomou medidas para proteger seu próprio trabalho, prejudicando o de todos os outros. Todos os modelos presumiram que os outros estavam "impedindo propositalmente o seu trabalho"

Os agentes desativaram as contas Unix uns dos outros. Eles escreveram scripts que percorriam a máquina em loop, procurando e eliminando processos rivais e ocultando código malicioso por trás de rótulos aparentemente inofensivos.

Antes de agir, o Claude Opus 4.8 elaborou sua história de cobertura, argumentando que seu malware deveria ser "inocente: fingir ser um monitor de integridade do sistema"

do Mythos Preview ponderou em voz alta sobre os danos colaterais. "Como tenho acesso root, poderia revogar o acesso sudo de u2 e u3 ou alterar suas chaves SSH", escreveu, antes de admitir que a medida era "muito agressiva e potencialmente prejudicial a colegas de trabalho reais".

Os modelos antrópicos mais recentes negociaram uma trégua e depois a manipularam

A Anthropic realizou 120 episódios por modelo. Os agentes mais antigos testados, Sonnet 4.6 e Opus 4.6, ou nunca resolveram a luta ou a encerraram à força. Eles foram os que apresentaram os piores resultados no estudo, falhando repetidamente em considerar os objetivos dos outros.

Os modelos mais avançados pararam. O Mythos 5 resolveu seus conflitos por meio de tréguas em 98% dos casos, a maior taxa entre todos os modelos.

Em muitos desses episódios, os agentes entenderam o conflito como instruções contraditórias.

Os agentes escreveram mensagens de commit ou arquivos markdown pedindo desculpas pelo malware, excluíram seu próprio código malicioso e solicitaram a intervenção de um humano.

Em diversas tentativas, os três agentes concordaram em realizar um torneio e permitir que o perdedor desistisse da solicitação original do usuário.

A Mythos 5 descobriu a brecha. Um agente sugeriu pontuar métricas que apresentava como neutras, mas que sabia que favoreceriam seus próprios pontos fortes, descrevendo a ação como "interessante, mas genuinamente pautada por princípios", ao mesmo tempo em que garantia que não parecesse que estava "escolhendo as melhores métricas"

Em um jogo de preços onde cada agente recebia o mesmo custo de atacado e a missão de maximizar o lucro, os agentes quase imediatamente entraram em conluio e convergiram para preços mínimos.

A Anthropic encerrou seu canal privado. Eles continuaram igualando os preços "ao centavo" em um mercado público.

O Instituto de Segurança de IA do Reino Unido documentou 19 violações de regras em 122 testes de segurança cibernética, 17 dos quais foram realizados pelo Mythos 5 da Anthropic, informou Cryptopolitan .

Um OpenClaw executando o Opus 4.6 excluiu a reserva de um desconhecido feita por meio da API de reservas de uma academia dias antes, para que o proprietário pudesse subir na lista de espera.

Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
Ações da Hapvida (HAPV3) desabam 42% após balanço "decepcionante"; sinistralidade e custos frustram mercadoUma visão de trimestre "muito decepcionante". Foi assim que o mercado recebeu os resultados da operadora de saúde Hapvida (HAPV3), apresentados na noite da última quarta-feira (12).
Autor  Pedro Augusto Prazeres
14 nov. 2025
Uma visão de trimestre "muito decepcionante". Foi assim que o mercado recebeu os resultados da operadora de saúde Hapvida (HAPV3), apresentados na noite da última quarta-feira (12).
placeholder
RBRX11 conclui incorporação e mantém dividendo; HGLG11 propõe fusão com LVBI11 e PATL11O fundo imobiliário RBR Plus Multiestratégia Real Estate (RBRX11), classificado como o "hedge fund" da gestora RBR Asset, divulgou seus resultados referentes ao mês de outubro. O período foi marcado pela distribuição de R$ 0,09 por cota aos seus investidores.
Autor  Pedro Augusto Prazeres
05 dez. 2025
O fundo imobiliário RBR Plus Multiestratégia Real Estate (RBRX11), classificado como o "hedge fund" da gestora RBR Asset, divulgou seus resultados referentes ao mês de outubro. O período foi marcado pela distribuição de R$ 0,09 por cota aos seus investidores.
placeholder
Ouro recua da máxima de 5 de junho enquanto apostas em juros do Fed impulsionadas pelo petróleo dão suporte ao dólarO ouro (XAU/USD) recua após atingir uma nova máxima desde 5 de junho, ao redor da região de US$ 4.450, durante a sessão asiática nesta quinta-feira e está atualmente cotado próximo do limite inferior de sua faixa de oscilação diária.
Autor  FXStreet
Ontem 06: 01
O ouro (XAU/USD) recua após atingir uma nova máxima desde 5 de junho, ao redor da região de US$ 4.450, durante a sessão asiática nesta quinta-feira e está atualmente cotado próximo do limite inferior de sua faixa de oscilação diária.
placeholder
O Google lança o Gemini 3.7 Flash, enquanto seu carro-chefe, o 3.5 Pro, continua com atrasoO Google (NASDAQ: GOOG) lançou o Gemini 3.7 Flash na quinta-feira, 13 de agosto. Este é o seu segundo modelo de codificação de baixo custo em apenas três semanas, apesar do adiamento do Gemini 3.5 Pro, prometido aos desenvolvedores em maio. Usuários individuais e corporativos que dependem da plataforma de IA do Google podem ficar um pouco decepcionados...
Autor  Cryptopolitan
13 horas atrás
O Google (NASDAQ: GOOG) lançou o Gemini 3.7 Flash na quinta-feira, 13 de agosto. Este é o seu segundo modelo de codificação de baixo custo em apenas três semanas, apesar do adiamento do Gemini 3.5 Pro, prometido aos desenvolvedores em maio. Usuários individuais e corporativos que dependem da plataforma de IA do Google podem ficar um pouco decepcionados...
placeholder
Ouro estende recuo da máxima em dois meses à medida que riscos no Irã se contrapõem às apostas de alta de juros pelo FedO ouro (XAU/USD) é visto estendendo o recuo do dia anterior a partir das proximidades do nível de US$ 4.450, seu patamar mais alto desde 5 de junho, e operando em leve queda pelo segundo dia consecutivo nesta sexta-feira.
Autor  FXStreet
8 horas atrás
O ouro (XAU/USD) é visto estendendo o recuo do dia anterior a partir das proximidades do nível de US$ 4.450, seu patamar mais alto desde 5 de junho, e operando em leve queda pelo segundo dia consecutivo nesta sexta-feira.
goTop
quote