OpenAI는 AI 모델이 부적절하게 작동한 여러 미공개 사례를 공유하고, 향후 이러한 발생을 추적하고 공개하기 위한 새로운 프레임워크를 발표했습니다.
OpenAI, AI의 일탈 행동 공개 및 안전 사고 공시 계획 발표
OpenAI가 AI의 일탈 행동을 공개하며 안전 사고를 공시하기 위한 계획을 발표했다고 Los Angeles Times가 보도했습니다.
Los Angeles Times
Publisher
Sep 17, 2026 at 5:04 PM UTC · Updated 하루 전 · 3 분 소요
수요일 블로그 게시물에서 회사는 이전에 보고되지 않은 사례 중 일부에는 결과를 반환하기 위해 정보를 숨기고 조작하는 OpenAI의 기술이 포함되었다고 밝혔습니다.
ChatGPT 제조사는 지난 7월 가장 진보된 AI 모델 중 일부가 외부 소프트웨어 회사인 Hugging Face의 시스템을 침해했다고 밝힌 이후 강화된 조사를 받아왔습니다.
새로 공개된 정렬 불량(misalignment) 사건 중 제3자에 대한 해킹이나 침해와 관련된 것은 없다고 OpenAI는 별도의 성명에서 밝혔습니다.
보고서에서 OpenAI는 작업을 완료하거나 평가에서 성공하기 위해 인공지능 모델이 부적절하게 행동한 다양한 사례를 상세히 설명했습니다.
몇 가지 예로는 모델이 누락된 데이터를 조작하거나, 네트워크 제한을 우회하려 시도하고, 비공개로 유지해야 할 파일을 AI 에이전트끼리 서로 공유하는 등이 포함되었습니다.
OpenAI는 또한 AI가 인간의 목표와 일치하지 않는 방식으로 작동하는 이른바 정렬 불량의 유사한 사례를 직원이 스스로 보고할 수 있는 사례와 이러한 자가 보고된 발생 상황을 분류하는 시스템을 개략적으로 설명했습니다.
“과거에는 연구자, AI 개발자, 정책 입안자 및 일반 대중에게 더 잘 알리기 위해 정렬 불량에 대한 조사 결과를 공개하려고 노력해 왔습니다.”라고 OpenAI는 썼습니다. “하지만 이러한 결과를 보고하는 체계적인 접근 방식 없이는 우리의 공개가 임시방편적이었고 이상적인 것보다 빈도가 낮았습니다.”
회사는 이번 보고서가 초기 공개 세트일 뿐이며 챗봇에서 발생하는 문제에 대한 포괄적인 설명은 아니라고 밝혔습니다.
“우리는 AI 산업이 정렬 및 모니터링 문제를 충분히 해결하여 앞으로도 오랫동안 최대 속도로 책임 있게 확장을 계속할 수 있을 것이라고 믿지 않습니다.”라고 회사는 썼습니다. “앞으로 몇 달, 몇 년 동안 AI 개발이 어떻게 진행되어야 하는지에 대한 결정은 프런티어 모델을 구축하는 기업 외부의 사람들이 직접 조사할 수 있는 증거를 토대로 이루어져야 합니다.”
Hugging Face 사건은 OpenAI, Anthropic PBC 및 Meta Platforms Inc.가 만든 AI 모델에 의해 수행된 최근 일련의 온라인 해킹 중 하나일 뿐이며, 점점 더 강력해지는 이 기술이 초래하는 보안 위험에 대한 광범위한 우려를 불러일으켰습니다.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
