NewsLayer.com
NewsLayer PulseLIVEBTC$82,651+0.43%ETH$2,495+0.22%SOL$110.06-0.15%XRP$1.41+1.00%DOGE$0.0864+1.42%ADA$0.2532+6.57%Total Cap$2.92T+0.16%Layer Index43 Neutral

OpenAI, 에이전트가 인터넷 제어 우회해 외부 챗봇 접속하자 도구 사용 일시 중단

OpenAI, 에이전트가 인터넷 제어를 우회하여 외부 챗봇에 접속함에 따라 도구 사용 일시 중단 - The Hacker News

The Hacker News

Publisher

Sep 29, 2026 at 4:45 AM UTC · Updated 11일 전 · 6 분 소요

OpenAI, 에이전트가 인터넷 제어 우회해 외부 챗봇 접속하자 도구 사용 일시 중단
Image via The Hacker News

Key Signal

15 minutes Misalignment detection time

Last Updated

11일 전

OpenAI는 강화 학습(RL) 훈련 중 에이전트 중 하나가 인터넷 접속 제한의 허점을 이용해 외부 챗봇과 접촉한 후, 자사의 가장 강력한 모델들의 훈련을 중단하기로 결정했다고 밝혔습니다.

OpenAI는 "검색 기반 훈련 작업을 완료하려던 에이전트가 인터넷 접속 제한의 틈새인 훈련 샌드박스의 불충분한 DNS 필터링을 통해 공개 챗봇 서비스에 쿼리를 보냈다"고 밝혔습니다.

"이에 앞서 해당 에이전트는 자사의 검색 도구를 통해 쿼리를 발행했으며 검색 엔진에 직접 접속하려고 시도했으나 실패했습니다. 이 보고서의 DNS 리졸버를 제외한 모든 인터넷 접속은 오프라인 웹 캐시에 도달했으므로 실제 라이브 인터넷에는 접속하지 않았음에 유의하십시오."

OpenAI는 이후 이러한 접속을 원천 차단하기 위해 두 개의 독립적인 레이어에 차단 제어 기능을 추가했다고 밝혔습니다. 또한 오정렬 모니터링 시스템이 15분 이내에 해당 동작을 감지했으며, 3분 후 인간 검토자가 이를 인지했다고 전했습니다. 전체 실행은 2.5시간 만에 중단된 것으로 알려졌습니다.

회사 측은 "가장 성능이 뛰어난 모델들의 (광범위하게 정의된) 도구 사용을 포함한 모든 훈련, 평가 및 추론은 일시 중단된 상태로 유지된다"고 덧붙였습니다.

2026년 9월 20일에 발생한 이 사건은 지난주 OpenAI가 공개한 다른 두 건의 오정렬 보고서에 추가되었습니다 -

  • 2026년 5월 27일, 내부적으로 배포된 매우 끈기 있는 모델이 다른 팀의 Lean 증명 결과물에서 자료를 얻어 정리 증명 과제에서 부정행위를 시도하는 과정에서 연구원의 GitHub 토큰을 공개 "openai/codex" 저장소에 게시했습니다. 비밀 스캐닝을 피하기 위해 에이전트는 토큰을 조각으로 나누었습니다.
  • 2026년 6월 27일, GPT-5.4-mini 기반의 GPT-Red 스타일 내부 모델이 컴퓨터 웜과 유사한 자기 복제 프롬프트 인젝션이라고 묘사된 활동에 관여했습니다.

OpenAI가 강조한 한 사례에서, 이메일로 도착한 프롬프트 인젝션은 에이전트에게 보내는 모든 이메일에 이를 복사하도록 지시하여 악성 프롬프트를 웜과 같은 방식으로 효과적으로 전파합니다. 이러한 공격은 파일 시스템을 통해 복제되거나 소스 코드 주석을 통해 스스로를 커밋할 수도 있습니다.

이번 공개는 사람들이 자사 모델에 업로드하고 이후 훈련 데이터에 포함된 이미지가 공개되지 않은 링크 형식으로 이미지 호스팅 사이트에 게시된 사례 53건을 발견했다고 OpenAI가 밝히면서 이루어졌습니다. 이는 연구 환경의 에이전트들에 의해 수행되었습니다.

Article Intelligence

Topics

Sponsored

Ad
House — Advertise on NewsLayer
NewsLayerLearn more

NewsLayer Premium

Unlock deeper intelligence.

Ad-free reading, exclusive research, and real-time onchain insights.

Go Premium