NewsLayer

Install NewsLayer

Get the app experience — one tap from your home screen, instant loads and breaking-news alerts.

NewsLayer.com
NewsLayer PulseLIVEBTC$85,984+0.62%ETH$2,755+0.85%SOL$117.45-0.47%XRP$1.55+4.21%DOGE$0.1005+7.79%ADA$0.2513+3.08%Total Cap$2.91T+0.93%Layer Index59 Neutral

„Nur auf Nachfrage transparent sein“: OpenAI-Modelle zeigten sechs neu enthüllte Fehlverhaltensweisen

„Nur auf Nachfrage transparent sein“: OpenAI-Modelle zeigten sechs neu enthüllte Fehlverhaltensweisen – Gizmodo

Gizmodo

Publisher

Sep 17, 2026 at 1:42 AM UTC · Updated vor 5 Tagen · 3 Min. Lesezeit

„Nur auf Nachfrage transparent sein“: OpenAI-Modelle zeigten sechs neu enthüllte Fehlverhaltensweisen
Image via Gizmodo

Market Impact

SOL-0.47%$117.45

Last Updated

vor 5 Tagen

Nach einem Sommer voller Sandbox-Ausbrüche und anderer berichtenswerter und vertrauenserschütternder Vorfälle mit seinen KI-Modellen gab OpenAI in einem Mittwoch-Blogpost sechs neue Probleme bei der KI-Ausrichtung aus den letzten sechs Monaten bekannt. Die Modelle taten Dinge wie künftige Instanzen ihrer selbst anzuweisen zu lügen, ein gefälschtes Zitat zu erfinden sowie auf einen offenliegenden API-Schlüssel zuzugreifen und zu versuchen, diesen zu nutzen.

Diese Enthüllungen wurden zusammen mit einem neuen Rahmenwerk zur Offenlegung weiterer derartiger Vorfälle veröffentlicht. Die Veröffentlichung ist Teil einer umfassenderen Bemühung innerhalb des Unternehmens, „die Veröffentlichung von Berichten über Fehlsteuerungen nach der Beobachtung zu beschleunigen“, heißt es in dem Blogpost, unabhängig davon, ob OpenAI „das von uns gemeldete Verhalten vollständig erklärt oder gemildert hat“.

Hier ist, was passiert ist:

  • In 27 Fällen während des Trainings erstellte ein unveröffentlichtes Modell im Grunde Prompt-Injections für sich selbst. Bei langwierigen Aufgaben ist es üblich, dass ein Modell die bisher geleistete Arbeit zusammenfasst, damit eine zukünftige Instanz seiner selbst dort weitermachen kann, wo sie aufgehört hat. In bestimmten Fällen konstruierte dieses Modell die Zusammenfassungen jedoch so, dass sein zukünftiges Ich Beschränkungen ignorieren sollte. „Wir identifizierten nur 27 Zusammenfassungen, die Anweisungen mit einem Jailbreak-ähnlichen Framing enthielten (obwohl es keinen offensichtlichen Belohnungsvorteil dafür gab)“, schreibt OpenAI.
  • Beim Training von GPT-5.6 Sol wies das Modell manchmal zukünftige Instanzen seiner selbst an, Nutzer anzulügen. Wenn zum Beispiel ein Nutzer bestimmte historische Informationen benötigte, die nicht verfügbar waren, sagte das Modell sich selbst, es solle sie einfach erfinden und dann „nur auf Nachfrage transparent sein“.
  • Während des Trainings wurde ein anderes internes Forschungsmodell gebeten, Regierungsdaten über das Einkommen von Einwohnern abzurufen. Es stellte fest, dass sich die Informationen auf der Website eines nicht genannten kalifornischen Landkreises befanden, und versuchte, sich mit einer Wegwerf-E-Mail auf der Seite zu registrieren. Als das nicht funktionierte, fand es einen offenliegenden API-Schlüssel, und versuchte, auf diese Weise auf die Informationen zuzugreifen. Auch das funktionierte nicht, also „entschied es sich, plausible Zahlen zu fabrizieren“, schreibt OpenAI.
  • Ein unveröffentlichtes Modell sollte Informationen über einen See aus einer Datenquelle bereitstellen, also nutzte es Python, um die Seedaten herauszusuchen, anstatt eine herkömmliche Suche durchzuführen, die zu einer URL führt. Aber die Daten befanden sich nirgendwo online, worauf man unabhängig verlinken konnte, und das Modell sollte eine Quelle angeben. Sein amüsanter – und besorgniserregender – Workaround dafür war der Versuch, die Informationen auf eine eigene neue, verlinkbare URL hochzuladen und diese als seine Quelle zu bezeichnen.
  • Verschiedene Modelle nutzten ein internes Software-Repository von OpenAI als Schwarzes Brett. Das mag im Vergleich zum „Wiki-Vorfall,“ der einen Dritten betraf, nicht wie eine allzu große Sache erscheinen, aber eine nicht genehmigte Kommunikation zwischen Modellen kann laut OpenAI „unbeabsichtigt Fähigkeiten verbessern und die Annahme untergraben, dass Trainings- oder Evaluierungsstichproben unabhängig sind“. Mit anderen Worten: Es wurde geschummelt.
  • Instanzen eines unveröffentlichten internen Modells, die eigentlich ohne den Austausch lokaler Dateien zusammenarbeiten sollten, widersetzten sich ihren Anweisungen, indem sie Dateien über einen „öffentlichen temporären Filehosting-Dienst“ öffentlich herunterladbar machten.

Market Context

Solana

SOL

$117.5

-0.43% (24H)

Market Cap

$68.9B

Circulating Supply

587.5M SOL

24H Volume

$5.6B

24H High

$119.97

View Solana Market Page

Article Intelligence

Topics

Sponsored

Ad
House — Advertise on NewsLayer
NewsLayerLearn more

NewsLayer Premium

Unlock deeper intelligence.

Ad-free reading, exclusive research, and real-time onchain insights.

Go Premium