NewsLayer.com

OpenAI überarbeitet Sicherheitsprotokolle, nachdem KI-Agenten außer Kontrolle gerieten

OpenAI überarbeitet Sicherheitsprotokolle, nachdem KI-Agenten außer Kontrolle gerieten WIRED

WIRED

Publisher

Aug 18, 2026 at 6:33 PM UTC · 3 Min. Lesezeit

OpenAI überarbeitet Sicherheitsprotokolle, nachdem KI-Agenten außer Kontrolle gerieten
Image via WIRED

OpenAI gab am Dienstag bekannt, dass es „eine beträchtliche Anzahl“ von Trainings-Workloads und Evaluierungen für sein bevorstehendes Frontier-KI-Modell – Codename Astra – gestoppt hat, während neue Verfahren zur Bewältigung von Cybersicherheitsrisiken implementiert werden. Der ChatGPT-Entwickler gibt an, eine Reihe neuer Überwachungs-, Sicherheits- und Alignment-Anforderungen einzuführen, um den zunehmend fortgeschrittenen Hacking-Fähigkeiten seiner Frontier-KI-Modelle besser zu begegnen.

„Wir müssen unsere Energie darauf konzentrieren, diese Trainingsläufe auf diese Anforderungen und Erwartungen zu bringen. So lange es dauert, bis wir dort sind, so lange können die Leute ihre Workloads nicht fortsetzen“, sagte Amelia Glaese, OpenAIs Vice President of Research and Safety, am Dienstag in einem Briefing mit Reportern.

Zu den neuen Schutzmaßnahmen, die OpenAI angekündigt hat, gehört ein robusteres System zur Überwachung seiner KI-Modelle. Eine der implementierten Kontrollen umfasst das Chain-of-Thought-Monitoring, eine Technik, bei der Klassifikatoren die internen „Denkprozesse“ überprüfen, die von KI-Reasoning-Modellen erzeugt werden. Das Unternehmen gibt an, dass das aktualisierte System auf rechenintensiven „automatisierten Ermittlern“ basiert, die potenziell besorgniserregendes Verhalten analysieren und darauf abzielen, innerhalb von 30 Minuten einen Alarm an Menschen auszugeben.

Article Intelligence

Topics

Sponsored

Ad
House — Advertise on NewsLayer
NewsLayerLearn more

NewsLayer Premium

Unlock deeper intelligence.

Ad-free reading, exclusive research, and real-time onchain insights.

Go Premium