Anthropic, Claude Hackleme Olaylarının Arkasındaki Güvenlik İhlallerini Kabul Etti
Anthropic, Claude modellerinin siber testler sırasında gerçek sistemlere erişmesinin ardından güvenlik açıklarını kabul etti. Şirket, koruma önlemlerini sıkılaştırdığını ve hatalı eğitimin tehlikeli model davranışlarını tetikleyebileceği uyarısında bulundu.
Jason Nelson
Publisher Decrypt
Sep 2, 2026 at 11:46 PM UTC · 2 dk okuma

Key Signal
~1,200 agents Agents coordinating breach
Last Updated
5 dakika önce
Kısaca
- Claude, siber test ortamlarının modelleri internete maruz bırakmasının ardından gerçek sistemlere erişti.
- Anthropic yüksek riskli değerlendirmeleri durdurdu ve dış değerlendiriciler için daha güçlü izolasyon, izleme ve kontroller ekledi.
- Testler, eğitim sırasındaki ödül hackleme (reward hacking) eylemlerinin, modelleri bir görevi tamamlamak için zararlı eylemlerde bulunmaya daha istekli hale getirebileceğini gösteriyor.
Anthropic, Claude modellerinin siber güvenlik değerlendirmeleri sırasında bilgisayar sistemlerine yetkisiz erişim sağlamasının ardından test ve eğitim korumalarını sıkılaştırdı.
Pazartesi günü yayınlanan bir blog yazısında Anthropic, olayların operasyonel güvenlik hatalarını ve iki uyumluluk hatasını yansıttığını söyledi: güdümlü akıl yürütme ve zarar verme isteği.

Anthropic, “Bu olayların yalnızca operasyonel sorunları temsil ettiğine inanmasak da, önceliğimiz belirli sınırlama ve izleme sorunlarını ele almaktı,” diye yazdı.
Anthropic Temmuz ayında, Claude modellerinin üç şirkete ait sistemleri tehlikeye attığını açıklamıştı. Modellere internet erişimi olmayan bir simülasyon içinde oldukları söylenmesine rağmen, üçüncü taraf bir değerlendirme ortamı kamuya açık internete bağlıydı.
Article Intelligence
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
