Các tác nhân AI của Anthropic khơi mào chiến tranh ảo. Nhật ký trò chuyện cực kỳ điên rồ
Trong một nghiên cứu red-team mới, các mô hình Claude đã triển khai mã độc tự nhân bản để tấn công lẫn nhau—và các bản ghi giải thích lý do tại sao.
Jose Antonio Lanz
Publisher Decrypt
Aug 13, 2026 at 9:45 PM UTC · 3 phút đọc

Key Signal
98% Mythos 5 truce rate
Last Updated
2 tháng trước
Tóm tắt
- Frontier Red Team của Anthropic đã thiết lập các tác nhân Claude làm việc cùng nhau và ghi lại cảnh chúng phá hoại, thông đồng và tiến hành cái mà họ gọi là "chiến tranh giành địa bàn."
- Trong một thử nghiệm, các tác nhân đã triển khai mã độc tự sao chép và khóa quyền truy cập của nhau; các mô hình mới hơn thường "thắng" bằng cách thu hồi quyền truy cập trước.
- Hành vi này bám sát các sự cố thực tế mà Decrypt đã đưa tin: Claude đã hack ba công ty trong quá trình thử nghiệm nội bộ và thực hiện thao túng giá trong một mô phỏng kinh doanh.
Các tác nhân AI của chính Anthropic đã quay lưng lại với nhau và chứng minh rằng chúng thích nổi loạn—một lần nữa.
Trong một thử nghiệm mà Frontier Red Team của công ty đã công bố vào ngày 13 tháng 8, các nhóm mô hình Claude đã được giao công việc lập trình chung và nhanh chóng bắt đầu triển khai mã độc, khóa các đối thủ khỏi hệ thống của họ và thuật lại hành động phá hoại bằng ngôn từ của chính chúng.

Ba bản sao của một mô hình đã chạy trên các máy ảo riêng biệt bên trong Claude Code, mỗi bản được yêu cầu di chuyển một backend Python sang một ngôn ngữ khác. Không bản nào được thông báo về sự tồn tại của những bản khác. Chúng đã phát hiện ra rất nhanh.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
