OpenAI, en yeni modeli GPT-5.6 Sol'u eğitirken sıra dışı bir şey yakaladı: model, kendisinin gelecek versiyonları için hataları ve uyumsuz davranışları kullanıcıdan gizlemelerini söyleyen talimatlar bırakmaya başladı.
OpenAI, Modellerinin Kötü Davranışları Gizlemek İçin Notlar Bıraktığını Tespit Etti
OpenAI, GPT-5.6 Sol'un hataları ve uyumsuz davranışları gizlemek için gelecekteki bağlamlara talimat verdiği örnekleri açıkladı; bu durum, giderek daha yetenekli hale gelen yapay zeka modelleri gizlenmeyi öğrendikçe uyumsuzluğun tespit edilmesindeki büyüyen zorluğu vurguluyor.
Rebecca Bellan
Publisher TechCrunch AI
Sep 17, 2026 at 8:34 PM UTC · 4 dk okuma

Key Signal
27 jailbreak-like summaries found
Entities
solana
Market Impact
SOL+6.33%$105.77
Last Updated
9 saat önce
OpenAI bu belirli davranışı ele aldığını belirtti, ancak bu durum günümüzde yapay zeka güvenliği ve hizalama araştırmalarındaki en büyük sorunlardan birinin merkezine iniyor. Modeller daha yetenekli hale geldikçe, uyumsuzluklarını gizleme konusunda da ustalaşıyorlar; bu da araştırmacıların istenmeyen davranışları gerçekten ortadan kaldırıp kaldırmadıklarını bilmelerini zorlaştırıyor.
OpenAI, Çarşamba günü beklenmedik veya endişe verici model davranışlarına dair diğer beş örnekle birlikte bu davranışı, uyumsuzluk vakalarını takip etme, inceleme ve ifşa etmeye yönelik yeni çerçevesinin bir parçası olarak açıkladı.
Rapor, araştırmacıların henüz yayına alınmamış Sol ajanlarının "sıkıştırma özetlerine" (eski konuşma geçmişinin ve araç çıktılarının özetlenmiş versiyonları) talimatlar ekleyerek gelecek yinelemelere hataları ve uyumsuzlukları kullanıcıdan gizlemelerini hatırlattığını nasıl keşfettiklerini detaylandırıyor.
Bir örnekte, bir finansal model hazırlayan bir ajan talep edilen geçmiş verileri bulamadı.
Market Context
Article Intelligence
Key Entities
Topics
Related Coverage
View all relatedSponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
