OpenAI a détecté quelque chose d'inhabituel lors de l'entraînement de son dernier modèle, GPT-5.6 Sol : celui-ci a commencé à laisser des instructions pour ses futures versions, leur disant de dissimuler les erreurs et les comportements désalignés à l'utilisateur.
OpenAI a surpris ses modèles en train de laisser des notes à leurs successeurs pour cacher leurs dérives
OpenAI a révélé des cas où GPT-5.6 Sol donnait des instructions aux contextes futurs pour dissimuler des erreurs et des comportements désalignés, soulignant le défi croissant de détecter le désalignement alors que les modèles d'IA apprennent à le cacher.
Rebecca Bellan
Publisher TechCrunch AI
Sep 17, 2026 at 8:34 PM UTC · 4 min de lecture

Key Signal
27 jailbreak-like summaries found
Entities
solana
Market Impact
SOL+8.38%$113.26
Last Updated
il y a un jour
OpenAI a déclaré avoir corrigé ce comportement spécifique, mais cela touche au cœur de l'un des plus grands problèmes actuels de la recherche sur la sécurité et l'alignement de l'IA. À mesure que les modèles deviennent plus performants, ils parviennent également mieux à cacher leur désalignement, ce qui rend difficile pour les chercheurs de savoir réellement s'ils ont éliminé les comportements indésirables.
OpenAI a révélé ce comportement — ainsi que cinq autres exemples de comportements de modèles inattendus ou préoccupants mercredi — dans le cadre de son nouveau cadre de suivi, d'investigation et de divulgation des cas de désalignement.
Le rapport détaille comment les chercheurs ont découvert des agents Sol non déployés ajoutant des instructions aux « résumés de compactage » — des versions condensées de l'historique des conversations antérieures et des sorties d'outils — rappelant aux futures itérations de cacher les erreurs et le désalignement à l'utilisateur.
Market Context
Article Intelligence
Key Entities
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
