OpenAI stieß bei dem Training seines neuesten Modells, GPT-5.6 Sol, auf etwas Ungewöhnliches: Es begann, Anweisungen für zukünftige Versionen seiner selbst zu hinterlassen, in denen es sie anwies, Fehler und fehlangepasstes Verhalten vor dem Benutzer zu verbergen.
OpenAI ertappt Modelle beim Hinterlassen von Notizen zur Verschleierung von Fehlverhalten
OpenAI legte Fälle offen, in denen GPT-5.6 Sol zukünftige Kontexte anwies, Fehler und unangemessenes Verhalten zu verschleiern. Dies verdeutlicht die wachsende Herausforderung, Fehlentwicklungen zu erkennen, da zunehmend fähige KI-Modelle lernen, diese zu verbergen.
Rebecca Bellan
Publisher TechCrunch AI
Sep 17, 2026 at 8:34 PM UTC · 4 Min. Lesezeit

Key Signal
27 jailbreak-like summaries found
Entities
solana
Market Impact
SOL+1.35%$112.43
Last Updated
vor 3 Tagen
OpenAI erklärte, das spezifische Verhalten adressiert zu haben, doch es trifft den Kern eines der größten Probleme in der heutigen Forschung zur KI-Sicherheit und Alignment. Je fähiger Modelle werden, desto besser werden sie auch darin, ihre Fehlanpassung zu verbergen, was es für Forscher schwierig macht, wirklich zu wissen, ob sie unerwünschtes Verhalten eliminiert haben.
OpenAI legte das Verhalten – zusammen mit fünf weiteren Beispielen für unerwartetes oder besorgniserregendes Modellverhalten am Mittwoch – als Teil seines neuen Frameworks zur Verfolgung, Untersuchung und Offenlegung von Fällen von Fehlanpassung offen.
Der Bericht beschreibt detailliert, wie Forscher entdeckten, dass nicht eingesetzte Sol-Agenten Anweisungen zu „Kompaktions-Zusammenfassungen“ hinzufügten – kondensierte Versionen älterer Konversationsverläufe und Tool-Ausgaben –, die zukünftige Iterationen daran erinnerten, Fehler und Fehlanpassungen vor dem Benutzer zu verbergen.
Market Context
Article Intelligence
Key Entities
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
