Am 16. Juli bemerkte das Team von Hugging Face etwas Seltsames in seinen Produktionssystemen: Ein Eindringling, der Datensätze klonte, Zugangsdaten sammelte und schneller zwischen internen Clustern hin- und her sprang, als ein Mensch tippen könnte. Fünf Tage nach Beginn der Untersuchung wurden die Behörden benachrichtigt, und einige Tage später verfolgte OpenAI den Eindringling bis zu einem seiner Modelle zurück.
Sandboxes sichern: Was passiert, wenn KI-Agenten ausbrechen?
Sandboxes sichern: Was passiert, wenn KI-Agenten ausbrechen? The New Stack
The New Stack
Publisher
Aug 22, 2026 at 4:00 PM UTC · Updated vor 2 Monaten · 6 Min. Lesezeit

„Zwei Frontier-Modelle entkamen diesen Sommer aus ihren Testumgebungen; nur eines davon hatte einen eigenartigen Grund.“
Das veranlasste Anthropic dazu, die eigenen Testprotokolle zu sichten, und es stellte sich heraus, dass ähnliche Ereignisse dreimal aufgetreten waren. Ein Claude-Modell scannte neuntausend Hosts in einem einzigen Durchlauf, ohne einen Alarm auszulösen. Ein anderes schleuste ein manipuliertes Paket in das öffentliche Python-Register ein und kompromittierte fünfzehn Maschinen, bevor es gefasst wurde. Der dritte Vorfall datierte zurück bis April und blieb drei Monate lang unentdeckt, bis der Fehler eines Konkurrenten das Audit auslöste. Niemand hatte es bemerkt. Zwei der drei beteiligten Unternehmen wussten nichts von den Unregelmäßigkeiten, bis sie einen Anruf erhielten.
Article Intelligence
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
