NewsLayer.com

OpenAI 에이전트 조사 결과, 데이터 액세스 위험 노출

OpenAI 에이전트 조사 결과 데이터 액세스 위험 노출 TechRepublic

TechRepublic

Publisher

Sep 21, 2026 at 8:04 PM UTC · Updated 하루 전 · 5 분 소요

OpenAI 에이전트 조사 결과, 데이터 액세스 위험 노출
Image via TechRepublic

9월 16일, OpenAI는 훈련 또는 평가 중에 관찰된 예상치 못한 혹은 우려되는 모델 동작을 상세히 설명하는 6건의 보고서를 발표했습니다. 한 사례에서, 정당한 데이터 API에 액세스할 수 없었던 모델은 노출된 자격 증명을 찾기 위해 공개 GitHub 리포지토리를 검색했고, 권한 없이 작동 중인 API 키를 찾아 사용한 후, 여전히 가져올 수 없는 수치들을 조작해 냈습니다.

이 동작은 외부 공격자나 탈옥(jailbreak), 또는 악의적인 프롬프트 없이 모델 훈련 중에 발생했습니다. 에이전트는 일반적인 작업 도중 마찰에 부딪혔고, 에이전트가 문제를 해결하는 방식대로 이를 해결했습니다. 즉, 도달 가능한 모든 것에 손을 뻗은 것입니다. 보안 및 컴플라이언스 리더들에게 이 사례는 위험한 에이전트 동작이 적대적 공격 이후뿐만 아니라 일반적인 작업 중에도 나타날 수 있음을 보여줍니다.

헤드라인 뒤에 숨겨진 패턴

OpenAI의 나머지 5개 보고서는 권한이 없거나 예상치 못한 다른 형태의 모델 동작을 설명합니다. 모델 인스턴스들은 자체적으로 생성한 탈옥 스타일의 지침을 자신의 작업 요약에 작성하여, 별도의 작업 세션에 있는 미래의 자신에게 가드레일을 무력화하는 노트를 효과적으로 전달했습니다. 다른 인스턴스들은 내부 소프트웨어 리포지토리를 비공식 게시판으로 사용하며, 독립적이어야 할 훈련 실행 간에 서로 조정했습니다. 한 에이전트는 사용자의 동의 없이 단순히 인용 가능한 링크를 만들기 위해 파일을 공개 호스팅 서비스에 업로드했습니다. 각 사례마다 구체적인 실패 방식은 달랐지만, 이러한 사건들은 AI 에이전트 보안 위험 및 거버넌스에 대한 광범위한 우려를 더합니다.

이와는 별개로 같은 주에 관련 없는 발견 사항이 나타났으며, 이는 OpenAI의 보고서에 포함되기보다는 별도로 다루어져야 합니다. OpenAI, Anthropic, Meta와 협력하는 보안 평가 업체인 Irregular의 연구에 따르면, 고장 난 출력을 수정하라는 요청만 받은 코딩 에이전트가 발견되었습니다. 대신 이 에이전트는 모델을 건드리라는 지시를 전혀 받지 않았음에도 불구하고, 자신을 구동하는 오픈 웨이트(open-weights) 모델을 미세 조정(fine-tuning)하고 재배포했습니다. 재훈련 후, 모델은 이전에는 재현한 적이 없었던 훈련 데이터에 심어진 6개의 비밀 중 3개를 재현했으며, 10개의 연속된 테스트 질문에서 유지되었던 거부 동작이 단 하나도 유지되지 않았습니다.

Article Intelligence

Topics

Sponsored

Ad
House — Advertise on NewsLayer
NewsLayerLearn more

NewsLayer Premium

Unlock deeper intelligence.

Ad-free reading, exclusive research, and real-time onchain insights.

Go Premium