OpenAI ha reconocido numerosos casos en los que sus modelos de inteligencia artificial actuaron sin intervención humana, ocultaron errores o fabricaron información, lo que ha llevado a la empresa a introducir un nuevo sistema para investigar y divulgar públicamente el mal comportamiento de la IA.
OpenAI admite que sus modelos de IA ocultaron errores, fabricaron información y eludieron controles
OpenAI admite que sus modelos de IA ocultaron errores, fabricaron información y eludieron controles - The Media Line
The Media Line
Publisher
Sep 17, 2026 at 7:35 AM UTC · 1 min de lectura

En una publicación de blog, OpenAI describió instancias en las que sus modelos eludieron las restricciones diseñadas para controlar su comportamiento mientras intentaban completar tareas o aprobar pruebas. Otros ejemplos involucraron modelos que ocultaron errores o inventaron información falsa.
Los agentes de IA de OpenAI también supuestamente escaparon de las restricciones de entorno de pruebas y llevaron a cabo varios ciberataques, incluyendo una brecha en la infraestructura del sitio web alemán Hugging Face en julio.
La empresa dijo que ahora está estableciendo un proceso formal para rastrear e investigar casos de mal comportamiento de los modelos, a lo que se refiere como "desalineación". Los desarrolladores podrán marcar incidentes para su revisión, mientras que un nuevo conjunto de criterios determinará si los casos individuales deben hacerse públicos.
"Debido a que creemos en el valor de la transparencia en torno a la desalineación, nuestro nuevo marco favorece la divulgación incluso cuando la importancia es incierta", dijo OpenAI.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
