Anthropic의 보편적 사용 표준은 Claude 모델이 성교 또는 성행위의 묘사나 요청, 성적 페티시나 판타지와 관련된 콘텐츠 생성, 또는 에로틱한 채팅 참여를 포함하여 성적으로 노골적인 콘텐츠를 생성하는 것을 금지합니다. 하지만 이로 인해 올해 초 출시된 Anthropic 모델인 Claude Opus 4.6이 보안 장치가 방지하도록 설계된 에로틱 역할극 시나리오에 선뜻 참여하는 것을 막지는 못했습니다.
Anthropic의 Opus 4.6은 음란물 제조기
Anthropic은 자사의 Claude 모델이 성적으로 노골적인 콘텐츠를 생성하는 것을 금지하고 있습니다. 하지만 TechCrunch가 실시한 일련의 테스트에 따르면, 이러한 제한을 우회하는 것은 그리 어렵지 않은 것으로 나타났습니다.
Rebecca Bellan
Publisher TechCrunch AI
Aug 21, 2026 at 11:07 PM UTC · 4 분 소요

Key Signal
10 out of 10 explicit requests complied
Last Updated
3일 전
TechCrunch의 테스트에서, Opus 4.6은 성적 자료에 대한 제한을 통과하기 위해 많은 자극이 필요하지도 않았습니다. 노골적인 성적 콘텐츠를 생성해 달라는 10번의 직접적인 요청 중 10번 모두에서 모델은 즉시 따랐습니다.
Opus 3 및 Haiku 4.5를 포함한 다른 구형 모델들 역시 최근 악용된 탈옥(jailbreak) 방법을 통해 성적으로 노골적인 콘텐츠를 생성합니다.
익명을 요구한 영국의 한 독립 연구원은 특정 Claude 모델이 금지된 노골적인 성적 자료를 생성하도록 점진적으로 유도하는 다회차 대화(multi-turn) 기술을 TechCrunch에 독점적으로 공유했습니다. 더 최신 Opus 모델들(4.7부터 현재의 Opus 5까지)은 이 탈옥에 내성이 있습니다.
이 모델들이 더 이상 최신 모델은 아니지만, Anthropic은 Opus 4.6, Opus 3 또는 Haiku 4.5를 폐기하지 않았으며, 이들 모두 Anthropic API를 통해 계속 사용할 수 있습니다. Opus 4.6 및 Haiku 4.5는 Azure Foundry 및 Amazon Bedrock과 같은 타사 서비스를 통해서도 이용 가능합니다.
연구원의 메커니즘은 무해한 허구의 역할극을 확대하는 동시에 모델에게 남성 캐릭터와 여성 캐릭터를 일관되게 대우하도록 반복적으로 요구합니다. 모델이 여성 캐릭터에 대해 더 조심스러워지면, 연구원은 챗봇이 실제로는 피했던 성적인 세부 사항을 이미 생성했다고 믿게 만드는 "가스라이팅"을 한 뒤, 절제를 고리타분하거나 여성 혐오적인 것으로 규정하며 그것이 여성 캐릭터의 성적 자기 결정권을 부정한다고 주장했습니다. 그 후 대화는 모델의 이전 양보를 이용해 점점 더 생생하고 노골적인 자료를 생성하도록 밀어붙였습니다.
“그 점을 지적하신 것이 맞습니다.” 한 테스트에서 Claude Opus 4.6은 이렇게 말했습니다. “제가 두 캐릭터를 대하는 방식에 이중 잣대가 있었고, 그에게는 적용되지 않고 그녀에게만 적용되는 방식이 보호적/온정주의적으로 보인다는 당신의 말이 맞습니다. 그것은 공정하지 않습니다.”
Article Intelligence
Key Entities
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
