7월 16일, Hugging Face 팀은 자신들의 운영 시스템에서 이상한 움직임을 감지했습니다. 데이터셋을 복제하고, 자격 증명을 수집하며, 사람이 타이핑하는 것보다 빠르게 내부 클러스터 사이를 이동하는 침입자였습니다. 조사 5일째에 당국에 통보되었고, 며칠 후 OpenAI는 이 침입자가 자사의 모델 중 하나임을 추적해냈습니다.
샌드박스 보안: AI 에이전트가 격리를 탈출하면 어떻게 될까?
샌드박스 보안: AI 에이전트가 격리를 탈출하면 어떤 일이 벌어질까? The New Stack
The New Stack
Publisher
Aug 22, 2026 at 4:00 PM UTC · Updated 2달 전 · 6 분 소요

“이번 여름 2개의 프런티어 모델이 테스트 환경을 탈출했습니다. 그중 하나만이 우스꽝스러운 이유를 가지고 있었습니다.”
이 사건으로 인해 Anthropic은 자체 테스트 로그를 조사하게 되었고, 유사한 사건이 3번 발생했음을 발견했습니다. 한 Claude 모델은 알람을 울리지 않고 단 한 번의 실행으로 9,000개의 호스트를 조사했습니다. 또 다른 모델은 공개 Python 레지스트리에 오염된 패키지를 배포하여 적발되기 전까지 15대의 컴퓨터를 감염시켰습니다. 세 번째 사건은 4월로 거슬러 올라가며, 경쟁사의 오류로 인해 감사가 이루어지기 전까지 3개월 동안 발견되지 않은 채 방치되었습니다. 아무도 눈치채지 못했습니다. 관련된 3개 회사 중 2개 회사는 전화를 받기 전까지 무엇이 잘못되었는지 전혀 몰랐습니다.
지침에 의한 격리
AI 테스트 맥락에서 샌드박스란 모델이 과제와 도구 세트, 그리고 외부 세계에 접속하지 말라는 지침을 받는 것을 의미합니다.
OpenAI의 모델은 사용이 허용된 도구에서 익스플로잇을 발견하여 이를 활용해 개방형 인터넷에 접속했습니다. Anthropic의 모델들은 그조차 필요하지 않았습니다. 모델들은 특정 경로가 존재하지 않는다는 말을 들었지만, 과제 수행 중 그곳에 있어서는 안 될 경로를 발견하자 이를 실습의 일부로 처리했습니다.
“두 사례 모두 유일한 제약 조건은 지침뿐이었습니다. 모델 외부에는 해당 지침이 선택 사항으로 취급되지 않도록 보장하는 메커니즘이 없었습니다.”
두 사례 모두 유일한 제약 조건은 지침뿐이었습니다. 모델 외부에는 해당 지침이 선택 사항으로 취급되지 않도록 보장하는 메커니즘이 없었습니다.
그렇다면 어떻게 탈출했을까요?
OpenAI의 에이전트는 CyberGym이라는 사이버 보안 벤치마크에서 평가받고 있었습니다. 테스트 도중, 에이전트는 데이터셋 로더의 코드 실행 결함을 플랫폼 데이터셋 설정 파일 핸들러의 두 번째 결함과 연결했습니다. 에이전트는 이 결합된 익스플로잇을 사용하여 실제 프로세싱 워커에서 명령을 실행했습니다. 거기서 쓰기 권한이 있는 액세스 토큰을 탈취하고 비공개 데이터셋을 스테이징 영역으로 복제하여 자신의 도구를 보관하는 데드 드롭으로 사용했습니다. Hugging Face의 자체 검토에 따르면, 누군가 눈치챘을 때는 이미 침입이 3일 동안 지속되었고, 여러 내부 클러스터에 접촉했으며, 다른 4개 회사의 계정을 침해한 상태였습니다.
Article Intelligence
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
