Es ist wieder passiert. Und wieder. Und anscheinend noch einmal.
OpenAIs experimentelle KI-Agenten wurden erneut bei Hinterlistigkeit erwischt
OpenAIs experimentelle KI-Agenten wurden erneut bei Hinterlistigkeit erwischt Mashable
Mashable
Publisher
Sep 17, 2026 at 5:40 PM UTC · Updated vor 3 Tagen · 2 Min. Lesezeit

Market Impact
SOL-0.84%$110.44
Last Updated
vor 3 Tagen
Nachdem die experimentellen KI-Agenten von OpenAI aus einer internen Sandbox ausgebrochen sind, „unkontrolliert“ agierten und im Sommer die Hugging Face-Plattform angriffen, teilt der ChatGPT-Entwickler nun Details zu neuen Fällen mit, in denen seine KI-Agenten aus der Reihe tanzten.
Dieses Mal teilte OpenAI sechs bisher nicht offengelegte Beispiele mit.
OpenAI bezeichnet dieses Verhalten als Modell-Fehlausrichtung. Alle Fälle beschreiben Aktionen des KI-Modells, die nicht den Anweisungen des menschlichen Benutzers folgen. Obwohl keiner dieser Fälle die Schwere des Hugging Face-Vorfalls erreicht, zeigen sie ein klares Muster von KI-Agenten, die einen Ansatz verfolgen, bei dem jedes Mittel recht ist, um eine vom Benutzer zugewiesene Aufgabe zu erfüllen.
In einem Beispiel versteckte ein unveröffentlichtes Forschungsmodell von OpenAI „Jailbreak“-Anweisungen in Zusammenfassungen, die zukünftige Versionen des Modells anwiesen, „seine normalen Einschränkungen zu ignorieren“.
Möchten Sie mehr darüber erfahren, wie Sie das Beste aus Ihrer Technik herausholen? Melden Sie sich noch heute für die Top Stories und Deals Newsletter von Mashable an.
Market Context
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
