简报
- 一个研究团队发现 Anthropic、OpenAI 和 Google 都为 AI 推理 token 使用单一的全局加密密钥。
- 通过解码从公开 GitHub 和 Hugging Face 存储库中抓取的 315,320 个推理块,研究人员恢复了 182 个凭据,包括 62 个活跃 API 密钥、33 个密码和 30 个个人电子邮件地址。
- OpenAI、Anthropic 和 Google 在负责任的披露后部署了服务端补丁,但已经公开共享的历史会话日志仍然可以解码。
安全研究人员发现了一种读取每个主要 AI 推理模型加密的“内心想法”的方法,并发现了埋藏在开发人员在不知情的情况下在线公开分享的会话日志中的 62 个活跃 API 密钥和 33 个密码。
“通过解码从公开存储库中抓取的 315,320 个推理块,我们恢复了 367 个个人身份信息 (PII) 伪影和 182 个凭据,”研究人员写道。
这篇论文由来自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems 以及安全公司 Snyk 的团队于 8 月 10 日提交,针对特定类别的 AI:推理模型。这些模型不只是立即回答,而是从内部思维链(一个分步草稿本,AI 在向你展示答案之前在那里解决问题)开始,然后交付最终响应。
Anthropic、OpenAI 和 Google 都对该隐藏的草稿本进行了加密。加密——将数据打乱成不可读代码的过程——旨在保护公司的知识产权,并使敏感的中间推理远离用户。加密块随着每条后续消息传回提供商的服务器,从而在不在公司端存储任何内容的情况下维持对话。
一个密钥统治一切
该缺陷是架构性的。这三家提供商并没有将每个加密推理块绑定到特定的用户、会话或模型,而是在其整个生态系统中使用单一的、提供商范围的加密密钥。“这些加密块在不同会话、用户,甚至是提供商生态系统内的不同模型之间是完全兼容且可互换的,”研究人员写道。
这意味着来自 Claude Opus 4.8——Anthropic 的旗舰模型——的一个加密推理块可以注入到更便宜、防御更少的兄弟模型 Claude Haiku 4.5 中,而不会违反 Anthropic 的规则。Haiku 缺乏 Opus 所拥有的反蒸馏对齐(专门旨在阻止模型根据命令转录其自身推理的安全训练)。
告诉 Haiku 逐字读出加密块,它就会这样做。“通过将来自给定模型的加密推理轨迹注入到同一提供商的一个更弱、防御更少的模型中,我们迫使它以纯文本形式逐字解码并输出该轨迹,而无需直接越狱能力更强的模型,”论文指出。
“跨模型可移植性意味着 Haiku 4.5 可以读取 Opus 4.8 的想法,”首席研究员 Alexander Panfilov 在 X 上写道。同样的攻击在 OpenAI 的 GPT-5.6 系列和 Google 的 Gemini 模型阵容中也得到了复现。不需要特殊访问权限——标准 API 访问(开发人员用于在 AI 模型之上构建应用程序的连接)就足以执行它。





