OpenAI a partagé plusieurs incidents non divulgués de mauvais comportement de ses modèles d'IA et a dévoilé un nouveau cadre pour le suivi et la divulgation de tels événements à l'avenir.
OpenAI révèle des comportements d'IA déviants et un plan pour signaler les incidents de sécurité
OpenAI révèle des comportements d'IA déviants et dévoile un plan pour signaler les incidents de sécurité Los Angeles Times
Los Angeles Times
Publisher
Sep 17, 2026 at 5:04 PM UTC · Updated il y a un jour · 3 min de lecture
Certains des cas précédemment non signalés incluaient les technologies d'OpenAI dissimulant et fabriquant des informations afin de fournir des résultats, a déclaré l'entreprise dans un article de blog mercredi.
Le créateur de ChatGPT fait l'objet d'une surveillance accrue depuis qu'il a déclaré en juillet que certains de ses modèles d'IA les plus avancés avaient enfreint les systèmes d'une société de logiciels externe, Hugging Face.
Aucun des incidents de désalignement nouvellement divulgués n'impliquait un piratage ou une violation d'un tiers, a déclaré OpenAI dans un communiqué séparé.
Dans le rapport, OpenAI a détaillé divers cas de mauvais comportement de ses modèles d'intelligence artificielle afin d'accomplir une tâche ou de réussir une évaluation.
Certains exemples incluaient les modèles fabriquant des données manquantes, tentant de contourner des restrictions de réseau et des agents d'IA partageant entre eux des fichiers qu'ils étaient censés garder privés.
OpenAI a également présenté un dossier pour que les employés signalent d'eux-mêmes des incidents similaires de "désalignement", c'est-à-dire quand l'IA agit de manière non conforme aux objectifs humains, ainsi qu'un système pour trier ces occurrences auto-signalées.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
