OpenAI将外部安全审查扩展至模型训练
OpenAI将外部安全审查扩展至模型训练 TechRepublic
TechRepublic
Publisher
Sep 23, 2026 at 4:33 PM UTC · Updated 3 天前 · 3 分钟阅读

OpenAI 希望在模型完成之前就有外部安全评估员参与,而不仅仅是在发布前不久。
该公司周二表示,计划在训练、评估和部署期间支持独立的技术安全评估,将范围扩大到过去更侧重的发布前审查。
OpenAI 外部安全专家工作负责人 Lama Ahmad 告诉 Bloomberg,该公司此前专注于在发布前不久引入第三方。“随着风险升高,我们希望确保在部署之外,也能关注训练和评估等高风险环节,”Ahmad 表示。
OpenAI 表示,这些评估应具备强大的独立性机制、科学严谨性、稳健的安全实践以及明确的责任。
该公司表示,已经在与多家潜在评估机构进行洽谈,包括 AI 研究小组 METR 和 Redwood Research。这两个小组此前曾调查过一起涉及 OpenAI 模型未经授权访问 Hugging Face 系统的事件。
外部小组将审查什么
OpenAI 概述了四个领域,希望在这些领域进行更深入的独立审查。
评估员可以审查该公司安全案例背后的证据是否支持其主张,包括在训练、评估和部署期间使用的保障措施。他们还可以针对越狱和其他对抗性攻击测试关键保障措施,并检查针对网络安全和生物滥用等领域高风险能力的防御。
其他工作可能侧重于能力评估是否充分衡量了 OpenAI’s Preparedness Framework 所涵盖的风险,以及对齐评估是否能检测到严重的失调。
该公司还希望对某些涉及模型未经授权行动或试图逃避监管的选定事件进行独立调查。OpenAI 表示,一些评估可能会持续数周,而另一些则可能运行数月,这意味着这项工作旨在长期检查安全主张,而不仅仅是作为最后的发布前检查。
难点在于独立性
OpenAI 提出这一建议之际,AI 公司正面临越来越大的压力,要求证明其安全主张能够经受住构建模型的公司之外的组织的审查。
该公司表示,评估员应在测试开始前就明确定义的主张达成一致,获得与其评估内容相称的访问权限,并披露利益冲突。它还表示,敏感信息可能需要评估在公司管理的设备上或在公司设施内进行。
这造成了实际的紧张关系。有意义的安全测试可能需要访问敏感的模型数据、内部系统或安全控制,但严格的限制也可能限制外部研究人员验证公司主张的独立程度。
OpenAI 表示,它希望调查结果尽可能透明,同时仍保护机密信息、专利技术和安全敏感细节。
这对 AI 发展意味着什么
在训练期间进行评估允许团队在模型架构或安全协议的调整仍然可行时识别漏洞,从而避免在发布前夕才发现问题。
然而,更早的评估窗口并不自动保证稳健的监管。这种独立审查的真正价值取决于评估员的资质、被授予的系统访问深度以及通过测试的主张的精确范围。
关键的运营细节也尚未确认。OpenAI 尚未指定官方评估合作伙伴,也未概述公众访问指南。相比之下,Anthropic 采取了更具体的步骤,上周宣布将嵌入来自 Accenture 的评估员来测试其前沿模型。
这对用户意味着什么
虽然 ChatGPT 的最终用户不太可能注意到立即的变化,但这一举措的主要价值体现在幕后。独立评估可以让 OpenAI 在开发周期的早期发现对齐、安全和滥用风险,从而在系统部署之前防止问题的发生。
最终,如果这些第三方评估能产生 OpenAI 实施的可操作见解,用户将获得更强大的安全保护。然而,完全的透明度可能会受到限制,因为某些披露可能会为了保护专有系统或敏感漏洞而被保留。
OpenAI 表示,随着前沿模型能力的提升,它计划扩大独立评估生态系统,并致力于制定技术安全审查的国际通用标准。更大的考验在于外部评估是否会成为对前沿模型开发的有意义制衡,还是仅仅成为公司管理的另一层保证。
让我们免费教你如何与 AI 对话!在 The Neuron Academy 尝试我们的六分钟课程,学习编写更好提示词并从 AI 获得更有用结果的几种简单方法,或者免费浏览我们的其他 AI 课程七天。在此查看所有课程 →
Sourced by
Originally reported by TechRepublic
NewsLayer coverage based on externally reported material.
The Daily Brief
The onchain economy, before your day starts.
Curated markets, onchain insights, and key headlines — delivered every weekday morning.
Weekdays · Free · ~5 minute read
0
Applause
Was this article helpful?
Article Intelligence
Topics
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium


