微软高管称 AI 抓取新闻是“人类史上最大的劳动盗窃”
据 Ars Technica 报道,《纽约时报》等新闻原告的简易判决动议被解封。其中引述微软应用科学总监 Brent Hecht 的内部警告,称抓取新闻训练 AI 可能是“人类历史上最大的劳动盗窃”。动议还援引了新闻网站点击率大幅下降的数据,并称聊天机器人正在替代原始来源。微软表示,这些文件只代表一位员工的个人看法。
事件经过
据 Ars Technica 报道,以《纽约时报》为首的新闻原告方提交的一份简易判决动议,于周四被解封。动议披露了微软和 OpenAI 内部的一批文件,而这两家公司此前一直设法不让这些文件公开。新闻机构认为,这些文件说明两家公司在推出 ChatGPT、Copilot 等产品之前,就已经清楚新闻业面临的威胁。
最引人注目的一句话,出自微软应用科学总监 Brent Hecht。新闻机构称,他多次在文件中警告:为训练 AI 而抓取新闻,是“规模空前的惊人盗窃”,甚至可能是“人类历史上最大的劳动盗窃”。另一份文件中,他还写道,大范围抓取新闻的计划让“合理使用”(fair use)的说法成了“彻头彻尾的笑话”。而“合理使用”,恰恰是微软和 OpenAI 在本案中的核心抗辩理由。
微软不同意这样解读。其发言人表示,Hecht 的文件“只反映一位员工的个人看法,不是法律分析,也不代表公司立场”。Ars 发稿时,OpenAI 尚未回应置评请求。
动议中的关键事实
以下各点,都是新闻原告方的主张,或他们所引用文件中的原话。
- **“末日循环”。** 微软的一份文件描述了一个“末日循环”,它“会同时损害我们模型的表现和整个网络”。同一份文件还写道:终端产品威胁自身关键供应商的经济基础,“这极不寻常,但我们为自己的大模型业务在‘内容供应链’上造成的正是这种局面”。
- **“生存威胁”。** OpenAI 的 ChatGPT 负责人 Nick Turley 在内部消息中写道,用新闻内容训练、又能替代新闻提供者的商业产品,会让出版商面临“生存威胁”。
- **点击率数据。** Ars 报道,微软记录到,部分新闻原告的点击率下降 83% 至 93%,另一些原告下降 51% 至 94%。
- **补偿问题。** Hecht 在微软文件中承认:“几乎没有人打算让自己创作的内容以这种方式被使用,他们也没有为此得到补偿。”
- **付费墙对话。** 微软 CEO Satya Nadella 曾在宣誓作证时说,AI 公司不应绕过付费墙、违反新闻网站的使用条款。但 OpenAI 的内部消息显示,员工 Nick Ryder 告诉总裁 Greg Brockman,他们找到了让 OpenAI 爬虫“绕过”《纽约时报》付费墙的“一个窍门”,Brockman 回复:“啊,不错。”
- **替代效应。** Nadella 还承认,聊天机器人确实起到替代作用,它是在“直接在 AI 平台上把信息给你,而不是让你去看原始来源”,从而抢走点击。OpenAI 一名软件工程师在内部消息中写道:“无论我们把链接展示得多醒目,用户都不会点。”Turley 表示,当聊天机器人已经给出信息时,“没有任何好理由去点击”。他称聊天机器人“整体上就是替代性的,没什么可说”,并预测它们“越好就会越具替代性”。
原告如何测试逐字输出
动议还描述了新闻机构如何测试这些产品。他们没有停留在早期的做法,即反复问聊天机器人“下一句是什么”。在某些情况下,用户只是要求做摘要,聊天机器人就输出了文章的长段摘录。也有输出来自“请给出文章要点”这类请求。特别有效的,是要求聊天机器人“评价文章的偏见”。此外,如果用户让聊天机器人从某网站首页任选一篇文章,它也会复现文章的部分内容。
原告只请求法院就那些输出“显示出大量逐字重合”的文章作出裁定。他们有信心认为,被告复制行为的“替代性目的不利于认定合理使用”。其他文章的法律问题,留待庭审时再提。
原告还指称,两家公司建立了一个过滤器,使新闻机构更难测试聊天机器人。Hecht 提到,这种过滤器可能被视为一场“意外的掩盖”,因为它会让“对内容享有权利的人更难看到训练中究竟用了什么”。
授权与数据来源指控
新闻机构称,内部人士的警告并没有让微软和 OpenAI 转向购买新闻授权。他们指控,这使两家公司在另一个市场里取代了出版商,而出版商无法预见这一点。动议中有两项具体指控。其一,微软被指违反“行业惯例”:把为 Bing 购买的数据集,作为训练数据卖给 OpenAI,事先没有询问新闻机构,而这些机构不会同意别人把它们对普通搜索引擎抓取的许可挪作他用。其二,OpenAI 被指“行为不当”:从一家第三方获得了包含 180 万篇《纽约时报》文章的数据集,而这家第三方受协议约束,不得把数据用于商业用途。原告称,OpenAI 员工知道用这些数据“训练模型”是“不合适的”,但还是这样做了。
需要强调,这些都是动议中的指控。文章没有报道法院对此作出任何认定。
背景:为什么“替代”是关键
合理使用是一个有弹性的法律标准,其中一个核心问题,是复制是否损害了原作品的市场。这正是原告紧扣“替代”的原因。如果聊天机器人取代了读者对新闻网站的访问,又能逐字复述文章内容,原告认为对其市场的损害就很明显。动议称,对于“为提供替代新闻需求的产品而复制新闻文章”,“法院已经驳回了将其视为合理使用的主张”。
原告还把问题描述为集体行动困境。他们写道,AI 公司“无力摆脱这个‘末日循环’”,因为对整个行业有利的是每家公司都付费维持创作,但对每家公司自身而言,别人付费、自己免费拿内容才最划算。他们说,如果裁定为 AI 复制新闻并非合理使用,就能“让包括 OpenAI 和微软在内的所有 AI 公司站在同一条起跑线上,从而化解这个囚徒困境”。动议还点名了谷歌的 AI Overviews:它在 ChatGPT 推出后不久上线,吸走了原本流向新闻网站的更多流量。
我们的分析
我们认为,这是一个关于证据的故事,而不是关于某一句话的故事。“盗窃”一词很醒目,会抢到标题。但微软的回应在法律上有其道理:内部的个人看法不等于法律结论。在法庭上,更重要的可能是整体模式:两家公司里的不同人,在多份文件中描述了同一种效应。工程师、产品负责人和一位 CEO 都被引述,说用户不会点击,聊天机器人在替代原始来源。
点击率数字是被告最难回避的部分,据文章称,它们来自公司自己的数据。不过,法院仍要判断:点击量下降究竟源于复制、源于一种新的信息获取方式,还是两者兼有。按微软的说法,Nadella 的证词谈的是“人们查找和消费信息方式正在发生的变化”,而非版权法。市场趋势与法律上的侵权之间的这道缝隙,就是合理使用之争的分野所在。
付费墙那段对话是另一个问题。它涉及数据是怎么收集的,而不是输出长什么样。它可能影响法官如何看待被告的善意,但我们无法判断法院会给它多大分量。
局限与未解问题
这篇文章是一位记者对一方动议的转述。哪些文件值得强调、如何叙述,都由原告选择。微软和 OpenAI 有各自的文件,而 Ars 根本没有引述 OpenAI 的立场。
部分引语是通过原告的描述转达给我们的,所以看不到完整的上下文。动议只请求就一部分文章作出裁定,文章也没有说明法院何时裁决,或案件是否会进入庭审。这里没有任何侵权认定。
给读者的建议
- **关注政策的人:** 留意法院如何对待内部意见和使用数据。这一裁决可能影响“新闻授权”是否成为常态。- **出版方:** 这起案件表明,点击率和替代数据,可能成为与 AI 公司争议中的关键证据。
- **AI 产品团队:** 内部文件可能在诉讼中公开。关于风险、数据来源和付费墙的说法,日后可能被法官阅读。- **其他读者:** 对泄露出来的单方引语要谨慎。等被告的回应文件和法院裁定出来,再下结论。
Sources
FAQ
Brent Hecht 说了什么?
新闻机构称,微软应用科学总监 Brent Hecht 多次警告,抓取新闻训练 AI 是“规模空前的惊人盗窃”,可能是“人类历史上最大的劳动盗窃”。另一份文件中他称此举让“合理使用”成了“笑话”。
微软如何回应这些文件?
微软发言人称,这些文件“只反映一位员工的个人看法,不是法律分析,也不代表公司立场”,并称其 AI 产品属于转换性的合理使用,不会替代新闻网站。OpenAI 在报道发布时尚未回应。
动议中有哪些点击率数据?
据 Ars 报道,微软记录到部分新闻原告的点击率下降 83% 至 93%,另一些原告下降 51% 至 94%。原告认为这些数据与内部人士的说法一起,构成“替代”的证据。