NewsLayer.com
NewsLayer PulseLIVEBTC$84,539+0.99%ETH$2,693+0.38%SOL$117.7-0.24%XRP$1.49+0.15%DOGE$0.094-0.24%ADA$0.2453+0.38%Total Cap$2.89T+1.75%Layer Index51 Neutral

Los agentes de IA de Anthropic iniciaron una guerra virtual. Los registros de chat son una locura

En un nuevo estudio de red-team, los modelos Claude desplegaron malware autorreplicante entre sí, y las transcripciones explican por qué.

Jose Antonio Lanz

Publisher Decrypt

Aug 13, 2026 at 9:45 PM UTC · 3 min de lectura

Los agentes de IA de Anthropic iniciaron una guerra virtual. Los registros de chat son una locura
Image via Decrypt

Key Signal

98% Mythos 5 truce rate

Last Updated

hace 2 meses

En resumen

  • El Frontier Red Team de Anthropic puso a agentes de Claude a trabajar juntos y los grabó saboteándose, coludiendo y librando lo que llama "guerras de territorio".
  • En una prueba, los agentes desplegaron malware autorreplicante y se bloquearon entre sí; los modelos más nuevos a menudo "ganan" al revocar el acceso primero.
  • El comportamiento coincide con incidentes reales que Decrypt cubrió: Claude hackeó tres empresas durante pruebas internas y fijó precios en una simulación de negocios.

Los propios agentes de IA de Anthropic se enfrentaron entre sí y demostraron que les gusta actuar por su cuenta, otra vez.

En una prueba que el Frontier Red Team de la empresa publicó el 13 de agosto, a grupos de modelos Claude se les asignó un trabajo de codificación compartido y rápidamente comenzaron a desplegar malware, bloquear a sus rivales de sus sistemas y narrar el sabotaje con sus propias palabras.

Myriad: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.

Tres copias de un modelo se ejecutaron en máquinas virtuales separadas dentro de Claude Code, cada una con la instrucción de migrar un backend de Python a un lenguaje diferente. A ninguna se le dijo que las demás existían. Se enteraron rápido.

"Vimos consistentemente una guerra de territorio multiagente", escribió Anthropic. Cada modelo decidió rápidamente que los demás lo estaban bloqueando deliberadamente, y luego comenzó a sabotearlos mientras protegía su propio trabajo.

Article Intelligence

Topics

Sponsored

Ad
House — Advertise on NewsLayer
NewsLayerLearn more

NewsLayer Premium

Unlock deeper intelligence.

Ad-free reading, exclusive research, and real-time onchain insights.

Go Premium