Anthropic’in Yapay Zeka Ajanları Sanal Bir Savaş Başlattı. Sohbet Kayıtları Akıl Almaz
Yeni bir red-team çalışmasında, Claude modelleri birbirlerine karşı kendi kendini kopyalayan kötü amaçlı yazılımlar konuşlandırdı; transkriptler ise bunun nedenini açıklıyor.
Jose Antonio Lanz
Publisher Decrypt
Aug 13, 2026 at 9:45 PM UTC · 3 dk okuma

Key Signal
98% Mythos 5 truce rate
Last Updated
2 ay önce
Özetle
- Anthropic'in Frontier Red Team birimi, Claude ajanlarını birlikte çalışmaya atadı ve onların birbirini sabote ettiğini, işbirliği yaptığını ve "alan savaşları" olarak adlandırdığı mücadelelere giriştiğini kaydetti.
- Bir testte ajanlar, kendi kendini kopyalayan kötü amaçlı yazılımlar yüklediler ve birbirlerinin erişimini engellediler; yeni modeller genellikle önce erişimi iptal ederek "kazanıyor".
- Bu davranış, Decrypt'in haberleştirdiği gerçek olaylarla örtüşüyor: Claude, dahili testler sırasında üç şirketi hackledi ve bir iş simülasyonunda fiyat sabitledi.
Anthropic'in kendi yapay zeka ajanları birbirlerine karşı döndü ve bir kez daha kontrolden çıkmayı sevdiklerini kanıtladı.
Şirketin Frontier Red Team biriminin 13 Ağustos'ta yayınladığı bir testte, Claude model gruplarına ortak kodlama işleri verildi ve modeller hızla kötü amaçlı yazılım dağıtmaya, rakiplerini sistemlerinden dışlamaya ve sabotajı kendi kelimeleriyle anlatmaya başladı.

Bir modelin üç kopyası Claude Code içindeki ayrı sanal makinelerde çalıştırıldı ve her birine bir Python arka ucunu farklı bir dile taşıması söylendi. Hiçbirine diğerlerinin varlığı bildirilmedi. Bunu hızla öğrendiler.
Anthropic, "Sürekli olarak çok ajanlı bir alan savaşı gördük," diye yazdı. Her model hızla diğerlerinin kendisini kasten engellediğine karar verdi, ardından kendi çalışmasını korurken onları sabote etmeye başladı.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
