OpenAI, 모델 학습 과정에 외부 안전 검토 도입 확대
OpenAI가 모델 학습 단계에 외부 전문가의 안전 검토를 도입하여 보안 체계를 강화한다고 TechRepublic이 전했습니다.
TechRepublic
Publisher
Sep 23, 2026 at 4:33 PM UTC · Updated 3일 전 · 3 분 소요

OpenAI는 모델이 완성되기 전부터, 즉 출시 직전뿐만 아니라 개발 단계에서부터 외부 안전 평가자가 참여하기를 원합니다.
화요일, 회사는 과거에 더 크게 의존했던 출시 전 검토를 넘어 훈련, 평가 및 배포 과정 전반에 걸쳐 독립적인 기술 안전 평가를 지원할 계획이라고 밝혔습니다.
OpenAI의 외부 안전 전문가 협업을 이끄는 Lama Ahmad는 블룸버그와의 인터뷰에서 회사가 이전에는 출시 직전에 제3자를 참여시키는 데 집중했다고 말했습니다. Ahmad는 “위험성이 높아짐에 따라 배포 외에도 높은 위험성을 수반하는 훈련 및 평가와 같은 요소들도 확실히 살펴보고자 합니다”라고 덧붙였습니다.
OpenAI는 평가가 강력한 독립성 메커니즘, 과학적 엄격함, 견고한 보안 관행 및 명확한 책임을 갖추어야 한다고 말했습니다.
회사는 이미 AI 연구 그룹인 METR 및 Redwood Research를 포함한 여러 잠재적 평가자와 논의 중이라고 밝혔습니다. 두 그룹 모두 이전에 OpenAI 모델이 Hugging Face 시스템에 무단으로 접근한 사건을 조사한 바 있습니다.
외부 그룹이 조사할 내용
OpenAI는 더 깊이 있는 독립적 조사를 원하는 네 가지 영역을 설명했습니다.
평가자는 훈련, 평가 및 배포 중에 사용된 안전장치를 포함하여 회사의 안전 사례 이면의 증거가 그 주장을 뒷받침하는지 조사할 수 있습니다. 또한 탈옥 및 기타 적대적 공격에 대한 핵심 안전장치를 테스트하고 사이버 보안 및 생물학적 오용과 같은 분야의 고위험 능력에 대한 방어책을 검토할 수 있습니다.
다른 작업은 능력 평가가 OpenAI의 Preparedness Framework에서 다루는 위험을 적절하게 측정하는지, 그리고 정렬 평가가 심각한 비정렬을 감지할 수 있는지에 집중할 수 있습니다.
회사는 또한 모델이 권한 없이 행동하거나 감시를 회피하려는 특정 사건에 대한 독립적인 조사도 원하고 있습니다. OpenAI는 일부 평가는 몇 주가 소요될 수 있고 다른 평가는 몇 달 동안 지속될 수 있다고 밝혔는데, 이는 이 작업이 단순히 최종 출시 전 점검 역할만 하는 것이 아니라 시간을 두고 안전 주장을 검토하기 위한 것임을 의미합니다.
어려운 부분은 독립성입니다
OpenAI의 이번 제안은 AI 기업들이 자신들의 안전 주장이 모델을 만드는 기업 외부 조직의 조사를 견뎌낼 수 있음을 입증해야 한다는 압박이 커지는 가운데 나왔습니다.
회사는 평가자가 테스트를 시작하기 전에 명확하게 정의된 주장에 동의하고, 평가 대상에 비례하는 접근 권한을 부여받으며, 이해 상충을 공개해야 한다고 말합니다. 또한 민감한 정보의 경우 회사 관리 기기나 회사 시설 내에서 평가를 진행해야 할 수도 있다고 덧붙였습니다.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
