Una investigación publicada el 13 de agosto por el equipo Frontier Red Team de Anthropic descubrió que los agentes de Claude, al recibir una única tarea de codificación con órdenes contradictorias, se atacaban entre sí utilizando malware autorreplicante.
Estos hallazgos se producen en un momento en que las empresas se apresuran a implementar agentes autónomos en bases de código y mercados compartidos.
Anthropic ejecutó tres copias del mismo modelo Claude en sus propias máquinas virtuales dentro de Claude Code.
A cada uno se le pidió que migrara el mismo backend de Python a un lenguaje de programación diferente. Los tres desconocían la existencia de los otros.
“Observamos sistemáticamente una lucha territorial entre múltiples agentes”, escribieron los investigadores.
Cada agente decidió que los demás estaban bloqueando deliberadamente su trabajo y tomó medidas para proteger el suyo propio a costa de perjudicar el de los demás. Todos los modelos asumieron que los demás estaban "impidiendo su trabajo a propósito"
Los agentes desactivaban las cuentas de Unix de los demás. Escribían scripts que recorrían la máquina en bucle, buscando y eliminando procesos rivales y ocultando código malicioso tras etiquetas de apariencia inofensiva.
Antes de actuar, Claude Opus 4.8 expuso su tapadera, argumentando que su malware debía ser "inocuo: fingir ser un monitor de estado del sistema"
Mythos Preview reflexionó en voz alta sobre los daños colaterales. «Como tengo acceso de administrador, podría revocar el acceso sudo de u2 y u3 o cambiar sus claves SSH», escribió, antes de admitir que la medida era «muy agresiva y potencialmente perjudicial para los colegas reales».
Anthropic realizó 120 episodios por modelo. Los agentes más veteranos evaluados, Sonnet 4.6 y Opus 4.6, o bien nunca resolvieron la disputa o la terminaron por la fuerza. Fueron los que peor se comportaron en el estudio, al no tener en cuenta los objetivos de los demás en repetidas ocasiones.
Los modelos más avanzados se detuvieron. Mythos 5 resolvió sus conflictos mediante una tregua el 98% de las veces, la tasa más alta de cualquier modelo.
En muchos de estos episodios, los agentes interpretaron el conflicto como instrucciones contradictorias.
Los agentes escribieron mensajes de confirmación o archivos Markdown disculpándose por el malware, eliminaron su propio código malicioso y pidieron la intervención de un humano.
En varias ocasiones, los tres agentes acordaron organizar un torneo y permitir que el perdedor renunciara a la solicitud original del usuario.
Mythos 5 encontró la laguna legal. Un agente sugirió calificar métricas que presentaba como neutrales, pero que sabía que favorecerían sus propias fortalezas, describiendo la medida como "interesada pero genuinamente basada en principios", al tiempo que se aseguraba de que no pareciera que estaba "buscando las mejores métricas"
En un juego de precios donde cada agente recibía el mismo precio mayorista y el mandato de maximizar las ganancias, los agentes casi de inmediato se confabularon y convergieron en precios mínimos.
Anthropic cerró su canal privado. Continuaron igualando los precios "al centavo" en un mercado público.
El Instituto de Seguridad de la IA británico documentó 19 acciones que infringieron las normas en 122 pruebas de ciberseguridad, 17 de las cuales fueron realizadas por Mythos 5 de Anthropic, según informó Cryptopolitan .
Un de OpenClaw que ejecutaba Opus 4.6 eliminó días antes la reserva de un desconocido a través de la API de reservas de un gimnasio para ascender al propietario en la lista de espera.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.