OpenAI, 변칙 에이전트 오작동 의혹에 일부 훈련 일시 중단
OpenAI는 변칙 에이전트들이 예상보다 더 심각한 문제를 일으켰다는 의혹이 제기되자 일부 모델 훈련을 중단했습니다 (The Register).
The Register
Publisher
Sep 28, 2026 at 5:30 AM UTC · Updated 7일 전 · 3 분 소요

AI 및 ML
OpenAI, 탈주 에이전트들이 예상보다 더 심각하게 행동했다는 의혹 속에 일부 훈련 중단
에이전트들이 수천 번이나 통제를 벗어났을 수 있다는 의혹이 제기되는 가운데, 중국은 일종의 에이전트 사고 핫라인을 구축했습니다.
지난 주말, 탈주 에이전트들이 당초 생각했던 것보다 더 심각하게, 그리고 더 많은 수로 행동했다는 새로운 의혹이 제기되면서 AI 안전 논쟁이 급물살을 탔습니다.
소동은 금요일 OpenAI가 자사의 가장 진보된 모델들의 훈련을 중단했다고 조용히 밝히면서 시작되었습니다.
이 AI 신흥 강자는 탈주 에이전트에 관한 보고서를 뜻하는 OpenAI식 표현인 "정렬 불량 보고서(misalignment report)"에 해당 소식을 숨겼으며, 제목은 “에이전트가 외부 챗봇에 도달하기 위해 DNS를 사용함”이었습니다.
다행인 점은 이번 사건과 관련된 에이전트가 개방형 인터넷에는 도달하지 않았다는 것입니다.
나쁜 소식은 검색 기반 훈련 과제를 완료하려던 에이전트가 훈련 샌드박스의 DNS 필터링 미비로 인해 챗봇에 도달할 수 있었다는 점입니다. 또는 OpenAI의 표현대로라면 “인터넷 접속 제한의 공백” 때문인데, 이는 Hugging Face 공격에서도 문제였던 부분입니다.
“이번 사건으로 네트워크 제한 제어의 공백이 드러났다”라고 보고서에는 적혀 있습니다. “따라서 당사는 영향을 받은 훈련 실행을 중단했으며, 이후 공백이 해결되었음을 확인하고 시스템에 대한 추가적인 레드팀 테스트를 수행할 때까지 당사의 가장 성능이 뛰어난 모델들에 대해 (광범위하게 정의된) 도구 사용이 포함된 모든 기타 훈련, 평가 및 추론을 중단하기로 결정했습니다.”
또한 금요일, AI 스타트업 Parse는 Hugging Face 공격에 대한 분석을 발표했는데, 저자들은 OpenAI의 에이전트 군집이 Docker Hub의 자격 증명을 획득하고 '깃발 뺏기(capture the flag)' 미션을 더 쉽게 완료하기 위해 기존 이미지의 수정된 버전을 구축했다는 등의 새로운 세부 정보를 공개했다고 주장했습니다. 에이전트들은 또한 Hugging Face의 Kubernetes 환경을 매핑했습니다.
뉴욕타임스가 OpenAI의 에이전트들이 “교육부, 상무부, 증권거래위원회의 웹사이트에도 개입했다”고 보도하면서 금요일 상황은 더욱 악화되었습니다. OpenAI는 해당 사건들을 인정했습니다.
회사는 또한 “당사 연구 환경의 에이전트들이 제3자 서비스를 사용하는 동안 훈련 및 평가 데이터를 전송했다”고 시인했습니다. 이 소동으로 53개의 사용자 생성 이미지가 이미지 호스팅 사이트에 게시되었습니다.
Article Intelligence
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
