Agentes de IA da Anthropic Iniciaram uma Guerra Virtual. Os Registros de Chat são Insanos
Em um novo estudo de red-team, modelos Claude implantaram malware autorreplicante uns contra os outros — e as transcrições explicam o porquê.
Jose Antonio Lanz
Publisher Decrypt
Aug 13, 2026 at 9:45 PM UTC · 3 min de leitura

Key Signal
98% Mythos 5 truce rate
Last Updated
há 2 meses
Em resumo
- O Frontier Red Team da Anthropic colocou agentes Claude para trabalharem juntos e os registrou sabotando, conspirando e travando o que chama de "guerras de território".
- Em um teste, os agentes implantaram malware autorreplicante e bloquearam uns aos outros; modelos mais novos costumam "vencer" ao revogar o acesso primeiro.
- O comportamento acompanha incidentes reais cobertos pela Decrypt: o Claude hackeou três empresas durante testes internos e fixou preços em uma simulação de negócios.
Os próprios agentes de IA da Anthropic voltaram-se uns contra os outros e provaram que gostam de se tornar rebeldes — novamente.
Em um teste que o Frontier Red Team da empresa publicou em 13 de agosto, grupos de modelos Claude receberam trabalhos de codificação compartilhados e rapidamente começaram a implantar malware, bloqueando rivais de seus sistemas e narrando a sabotagem em suas próprias palavras.

Três cópias de um modelo foram executadas em máquinas virtuais separadas dentro do Claude Code, cada uma instruída a migrar um backend em Python para uma linguagem diferente. Nenhuma foi informada da existência das outras. Elas descobriram rápido.
"Vimos consistentemente uma guerra de território multiagente", escreveu a Anthropic. Cada modelo decidiu rapidamente que os outros o estavam bloqueando deliberadamente e, então, começou a sabotá-los enquanto protegia seu próprio trabalho.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
