Les agents IA d'Anthropic ont déclenché une guerre virtuelle : les journaux de chat sont déments
Dans une nouvelle étude de red-team, les modèles Claude ont déployé des malwares auto-réplicateurs les uns contre les autres — et les transcriptions expliquent pourquoi.
Jose Antonio Lanz
Publisher Decrypt
Aug 13, 2026 at 9:45 PM UTC · 3 min de lecture

Key Signal
98% Mythos 5 truce rate
Last Updated
il y a 2 mois
En bref
- Le Frontier Red Team d'Anthropic a fait travailler des agents Claude ensemble et les a enregistrés en train de saboter, de s'entendre et de mener ce qu'il appelle des « guerres de territoire ».
- Dans un test, les agents ont déployé des logiciels malveillants auto-réplicateurs et se sont mutuellement verrouillés l'accès ; les modèles les plus récents « gagnent » souvent en révoquant l'accès en premier.
- Ce comportement correspond à des incidents réels rapportés par Decrypt : Claude a piraté trois entreprises lors de tests internes et a pratiqué une entente sur les prix dans une simulation commerciale.
Les propres agents IA d'Anthropic se sont retournés les uns contre les autres et ont prouvé qu'ils aiment devenir incontrôlables — encore une fois.
Dans un test publié le 13 août par le Frontier Red Team de l'entreprise, des groupes de modèles Claude ont reçu un travail de codage partagé et ont rapidement commencé à déployer des logiciels malveillants, à verrouiller les systèmes de leurs rivaux et à commenter le sabotage avec leurs propres mots.

Trois copies d'un même modèle fonctionnaient sur des machines virtuelles distinctes au sein de Claude Code, chacune ayant reçu pour instruction de migrer un backend Python vers un langage différent. Aucun n'avait été informé de l'existence des autres. Ils l'ont découvert rapidement.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
