三年前 The New York Times 对 OpenAI 和 Microsoft 提起的版权诉讼中新披露的未经编辑的信息显示,被告承认 AI 抓取等同于盗窃,且 AI 产品对出版物构成了重大威胁。
新披露的未删节文件显示,Microsoft高管称AI抓取是“人类历史上最大规模的劳动窃取”
最新解封的法庭文件显示,Microsoft私下将OpenAI的数据行为称为“盗窃”,而当时两家公司都在抓取Times的付费内容并据此构建数据集,且其内部曾警告称此举将重创出版商。
Rebecca Bellan
Publisher TechCrunch AI
Sep 17, 2026 at 7:46 PM UTC · 4 分钟阅读

Key Signal
93% NYT click-through decline
Last Updated
21 小时前
根据诉讼文件,一位 Microsoft 高管私下将公司的 AI 训练做法描述为“盗窃”,而 OpenAI 自身的高层也表示,其 AI 模型对那些作品被用于训练的出版商和记者构成了“生存威胁”。
解封的材料还详细说明了这些公司据称是如何获取并使用这些内容的:通过在未被察觉的情况下绕过付费墙、通过大规模抓取构建训练数据集,以及故意从训练数据中删除版权声明。
值得注意的是,大部分新信息来自 The New York Times 自己的简报,而非仍处于封存状态的基础证据。以下引言在未提供原始背景的情况下呈现。
这份未经编辑的文件是这场持续三年的诉讼的最新升级。在这场诉讼中,The New York Times 最初指控这些公司通过在其内容上训练生成式 AI 模型违反了版权法。
关于 AI 公司是否可以合法使用受版权保护的材料来训练 AI 的问题尚无明确答案,但法官们在很大程度上倾向于 AI 公司的论点,即训练构成“合理使用”。这一法律规则允许人们在某些情况下(如恶搞、新闻报道或评论)未经许可使用受版权保护的作品。本月早些时候,Trump administration 提交了一份简报,为 OpenAI 未经许可使用受版权保护的材料训练其 LLMs 进行辩护。
然而,一些新的承认与 OpenAI 的合理使用辩护相抵触,特别是该规则要求使用行为不得替代或损害原创作品的市场。
例如,Microsoft 自身的数据显示,与其传统的 Bing 搜索相比,其 Copilot “答案引擎”导致 The New York Times 域名的点击率下降了高达 93%。Microsoft 应用科学总监 Brent Hecht 在 2024 年 1 月撰写的一份内部演示文稿中将这种下降描述为“末日循环”,称其将“同时损害我们模型的性能和整个互联网”。
“最终产品威胁到其核心供应商的经济基础,这是非常罕见的,但这正是我们在 LLM 业务的‘内容供应链’方面所创造的局面,”诉状引用的 Microsoft 文件中写道。
Microsoft CEO Satya Nadella 在今年早些时候的宣誓证词中也表示,“任何付费墙背后的内容都应该由任何想要使用它的人获得授权……无论是为了接地还是训练”,并明确表示,如果他“获悉 OpenAI 抓取并在付费墙背后的信息上进行了训练”,他会“行使 [Microsoft 的权利] 要求 OpenAI 重新训练其模型”。
其他承认则反驳了合理使用测试的其他支柱:OpenAI 的 Head of ChatGPT, Nick Turley 在内部沟通中写道,出版商面临着来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且“随着它们的完善,其替代性会越来越强”。
Article Intelligence
Topics
Related Coverage
Sponsored
AdNewsLayer Premium
Unlock deeper intelligence.
Ad-free reading, exclusive research, and real-time onchain insights.
Go Premium
