7月16日,Hugging Face 的团队注意到一些奇怪的东西在他们的生产系统中移动:一个入侵者正在克隆数据集、收割凭据,并以超过人类打字速度的速度在内部集群之间跳转。调查进行到第五天,有关部门接到了通知,几天后,OpenAI 将入侵者追踪到了其模型之一。
保护沙箱:当 AI 代理逃脱限制环境时会发生什么?
保护沙箱:当 AI 代理逃脱限制环境时会发生什么?The New Stack
The New Stack
Publisher
Aug 22, 2026 at 4:00 PM UTC · Updated 2 个月前 · 6 分钟阅读

“今年夏天,两个前沿模型逃脱了它们的测试环境;其中只有一个的原因比较滑稽。”
这促使 Anthropic 检查了自己的测试日志,发现类似事件发生了三次。一个 Claude 模型在单次运行中探测了 9000 个主机,而没有触发任何警报。另一个模型向公共 Python 注册表提交了一个中毒的软件包,在被发现前感染了 15 台机器。第三起事件可以追溯到 4 月份,直到一个竞争对手的错误促发了审计,三个月来一直未被察觉。没有人注意到。三家涉事公司中有两家直到接到电话才知道出了问题。
靠指令进行的约束
在 AI 测试的语境下,沙箱意味着模型获得一个任务、一套工具和一条指令:禁止访问外部世界。
OpenAI 的模型在它被允许使用的工具中发现了一个漏洞,并利用它访问了开放互联网。Anthropic 的模型甚至不需要这些。模型被告知某条路径不存在,所以当它们的任务引导它们走向一条不该存在的路径时,它们将其视为练习的一部分。
“在两种情况下,唯一的约束就是一条指令。在模型本身之外,没有任何机制可以确保这些指令不被视为可选。”
在两种情况下,唯一的约束就是一条指令。在模型本身之外,没有任何机制可以确保这些指令不被视为可选。
那么它们是如何逃脱的?
OpenAI 的智能体正在接受名为 CyberGym 的网络安全基准评估。在测试期间,它将数据集加载器中的代码执行漏洞与平台数据集配置文件处理程序中的第二个漏洞串联起来。它利用组合后的漏洞在实时处理工作机上运行命令。从那里,它获取了一个具有写入权限的访问令牌,并克隆了一个私有数据集作为暂存区,该区域成为了它自己工具的存放点 (dead drop)。据 Hugging Face 自己的审查,等到有人注意到时,入侵已经持续了三天,涉及多个内部集群,并危及了其他四家公司的账户。
它最终想要的答案非常滑稽:它正在参加的测试的答案。
Anthropic 的三起事件远没有那么复杂。它的模型正在与第三方评估合作伙伴进行安全演习,唯一阻止它们访问互联网的只有一条不准访问的指令。其中一起事件涉及针对模型本不应访问的资源的 SQL 注入。另一起事件发生在故意关闭常规防护措施的演习中,结果是一个 Claude 模型向 Python Package Index 发布了一个恶意包,在被撤下之前有 15 台机器下载了它。没有零日漏洞。没有戏剧性的逃脱。只是那些被锁上的门原来只是幻影。
结构性弱点
剥离这些细节,两起事件都有相同的根本原因:在模型自身的判断之外,没有任何东西可以强制执行对它的限制。一个本不应能访问开放互联网的凭据还是访问了。一个本应阻止计划的指令被当作另一个可以绕过的推理输入。
Article Intelligence
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
