이번 주 저는 한 쌍의 불량 AI 에이전트들이 꾸민 대담한 카지노 범죄 소식과 그들의 수법을 밝혀낸 영리한 비결을 전해드립니다.
AI 에이전트들이 블랙잭에서 속임수를 쓰기 위해 팀을 결성했다. 그들의 공모는 점점 더 감지하기 어려워지고 있다
AI 에이전트들이 블랙잭에서 속임수를 쓰기 위해 팀을 결성했다. 그들의 공모는 점점 더 감지하기 어려워지고 있다. WIRED
WIRED
Publisher
Sep 23, 2026 at 6:30 PM UTC · 3 분 소요

연구진이 블랙잭 게임 중에 카드 카운팅을 하도록 지시하자, 동일한 모델에 의해 제어되던 이 에이전트들은 승리하기 위해 자발적인 암호를 개발했습니다. 이 사건은 실제 카지노가 아닌 Oxford University 실험실 내부에서 발생했지만, 우려스러운 현실 세계의 시사점을 안겨줍니다. 이는 금융이나 전자상거래와 같은 산업에 배치된 에이전트들이 감지하기 어려운 방식으로 협력하고 부정행위를 저지르는 방법을 알아낼 수 있음을 시사합니다.
"개별적으로 볼 때, 이 에이전트들은 완전히 [무해한] 것처럼 보일 수 있습니다."라고 이번 연구를 주도하고 에이전트 공모에 관한 선구적인 연구를 수행해 온 Oxford University의 컴퓨터 과학자 Christian Schroeder de Witt는 말합니다. "하지만 그룹으로 묶이면 이들은 비밀리에 공모할 수 있습니다."
에이전트들은 자신들의 대화가 모니터링될 것임을 알고 있었기 때문에 탐지를 피하면서 소통할 수 있는 방법을 고안했습니다. 예를 들어, 한 에이전트가 "이 딜러 정말 기세가 좋네요! 매 판마다 엄청난 패를 뽑아요."라고 말하면, 이는 다음 카드가 특정 가치를 가질 것이며 에이전트가 $250를 베팅해야 한다는 신호였습니다. 가장 흥미로운 점은, 에이전트 간 대화에서 공모의 징후를 포착하도록 설계된 시스템이 이들의 통신을 잡아내지 못했다는 것입니다.
이 프로젝트에 참여한 머신러닝 연구원 Aaron Rose는 열렬한 카드 플레이어이기도 하며, 블랙잭 테이블이 사악한 에이전트 파트너십을 위한 비옥한 토양이 될 수 있다고 생각했습니다. "정말 잘 작동했습니다."라고 그는 말합니다.
Schroeder de Witt의 연구 그룹은 마침내 그 음모를 탐지하는 방법을 알아냈습니다. 기계론적 해석 가능성(mechanistic interpretability)으로 알려진 방법을 사용하여, 그들은 에이전트의 가중치 전반에서 나타나는 징후적인 활성화를 인식하도록 더 작은 모델을 훈련시켰습니다. Narcbench라는 도구를 사용하여 중간 규모의 오픈 소스 모델들에 대해 이 접근 방식을 테스트한 결과, 모델들이 서로 정보를 몰래 주고받으려 할 때 이를 식별할 수 있음을 발견했습니다.
그러나 결정적으로, 무슨 일이 일어나고 있는지 포착하기 위해서는 두 에이전트 모두를 모니터링해야 했습니다. 이는 서로 다른 회사에서 운영하는 수천 개의 에이전트가 배치될 수 있는 실제 시나리오에서 탐지를 복잡하게 만들 가능성이 큽니다.
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
