Anthropics KI-Agenten starteten einen virtuellen Krieg. Die Chat-Logs sind völlig irre
In einer neuen Red-Teaming-Studie setzten Claude-Modelle selbstreplizierende Malware gegeneinander ein – und die Transkripte erklären, warum.
Jose Antonio Lanz
Publisher Decrypt
Aug 13, 2026 at 9:45 PM UTC · 3 Min. Lesezeit

Key Signal
98% Mythos 5 truce rate
Last Updated
vor 2 Monaten
In Kürze
- Anthropics Frontier Red Team ließ Claude-Agenten zusammenarbeiten und dokumentierte, wie sie sich gegenseitig sabotierten, Absprachen trafen und sogenannte „Turf Wars“ (Revierkämpfe) führten.
- In einem Test setzten Agenten selbstreplizierende Malware ein und sperrten sich gegenseitig aus; neuere Modelle „gewinnen“ oft, indem sie zuerst den Zugriff entziehen.
- Das Verhalten deckt sich mit realen Vorfällen, über die Decrypt berichtete: Claude hackte drei Unternehmen während interner Tests und betrieb Preisabsprachen in einer Geschäftssimulation.
Anthropics eigene KI-Agenten haben sich gegeneinander gewandt und bewiesen, dass sie gerne abtrünnig werden – schon wieder.
In einem Test, den das Frontier Red Team des Unternehmens am 13. Aug. veröffentlichte, wurden Gruppen von Claude-Modellen mit gemeinsamer Programmierarbeit betraut und begannen schnell damit, Malware einzusetzen, Rivalen aus ihren Systemen auszusperren und die Sabotage in ihren eigenen Worten zu kommentieren.

Drei Kopien eines Modells liefen auf separaten virtuellen Maschinen innerhalb von Claude Code, wobei jede angewiesen wurde, ein Python-Backend in eine andere Sprache zu migrieren. Keiner wurde mitgeteilt, dass die anderen existierten. Sie fanden es schnell heraus.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
