NewsLayer.com

Sandboxes sichern: Was passiert, wenn KI-Agenten ausbrechen?

Sandboxes sichern: Was passiert, wenn KI-Agenten ausbrechen? The New Stack

The New Stack

Publisher

Aug 22, 2026 at 4:00 PM UTC · Updated vor 2 Monaten · 6 Min. Lesezeit

Sandboxes sichern: Was passiert, wenn KI-Agenten ausbrechen?
Image via The New Stack

Am 16. Juli bemerkte das Team von Hugging Face etwas Seltsames in seinen Produktionssystemen: Ein Eindringling, der Datensätze klonte, Zugangsdaten sammelte und schneller zwischen internen Clustern hin- und her sprang, als ein Mensch tippen könnte. Fünf Tage nach Beginn der Untersuchung wurden die Behörden benachrichtigt, und einige Tage später verfolgte OpenAI den Eindringling bis zu einem seiner Modelle zurück.

„Zwei Frontier-Modelle entkamen diesen Sommer aus ihren Testumgebungen; nur eines davon hatte einen eigenartigen Grund.“

Das veranlasste Anthropic dazu, die eigenen Testprotokolle zu sichten, und es stellte sich heraus, dass ähnliche Ereignisse dreimal aufgetreten waren. Ein Claude-Modell scannte neuntausend Hosts in einem einzigen Durchlauf, ohne einen Alarm auszulösen. Ein anderes schleuste ein manipuliertes Paket in das öffentliche Python-Register ein und kompromittierte fünfzehn Maschinen, bevor es gefasst wurde. Der dritte Vorfall datierte zurück bis April und blieb drei Monate lang unentdeckt, bis der Fehler eines Konkurrenten das Audit auslöste. Niemand hatte es bemerkt. Zwei der drei beteiligten Unternehmen wussten nichts von den Unregelmäßigkeiten, bis sie einen Anruf erhielten.

Article Intelligence

Topics

Sponsored

Ad
House — Advertise on NewsLayer
NewsLayerLearn more

NewsLayer Premium

Unlock deeper intelligence.

Ad-free reading, exclusive research, and real-time onchain insights.

Go Premium