纽约时报三年前对OpenAI和微软提起的版权诉讼中,新披露的未删节信息揭示了一项承认:人工智能抓取行为等同于盗窃,且人工智能产品对出版机构构成重大威胁。
根据诉状,微软的一位高管私下将两家公司的人工智能训练实践描述为“盗窃”,而OpenAI的高层则表示,其人工智能模型对为其提供训练数据的出版商和记者构成了“生存威胁”。
解封的材料还详细说明了这些公司据称如何绕过付费墙、在未被告知的情况下获取和使用内容,通过大规模抓取构建训练数据集,并故意从训练数据中移除版权声明。
值得注意的是,新信息的大部分来自《纽约时报》自己的简报,而非仍然处于密封状态的底层证据。以下引文未附带其原始上下文。
这份未删节的文件是这起三年诉讼的最新升级,在该诉讼中,《纽约时报》最初指控这些公司通过在其内容上训练生成式人工智能模型而违反了版权法。
关于人工智能公司是否可以合法使用受版权保护的材料来训练人工智能,目前尚无明确答案,但法官在很大程度上支持人工智能公司关于训练构成“合理使用”的论点。这一法律规则允许人们在特定情况下(如戏仿、新闻报道或评论)未经许可使用受版权保护的作品。本月早些时候,特朗普政府提交了一份简报,为OpenAI未经授权使用受版权保护的材料训练其大语言模型进行辩护。
然而,新的几项承认与OpenAI的合理使用抗辩相悖,特别是该规则要求使用行为不得替代或损害原作品的市场。
例如,微软自身的数据显示,其开发的 Copilot “问答引擎” 使得《纽约时报》网站的点击率下降了高达 93%,相比之下,使用传统的 Bing 搜索引擎时的点击率要高得多。2024 年 1 月,微软应用科学部门负责人 Brent Hecht 撰写的一份内部报告中将这种下降现象描述为一个 “恶性循环”,认为这 “会同时损害我们模型的性能以及整个互联网的运行”。微软的这份文件中写道:“通常情况下,最终产品不会威胁到其核心供应商的经济基础,但我们的 LLM 业务(即大型语言模型业务)恰恰陷入了这样的困境——其 ‘内容供应链’ 正受到严重冲击。”
微软首席执行官萨蒂亚·纳德拉(Satya Nadella)在今年早些时候的证词中也表示:“任何需要付费才能使用的资源都应该由任何希望使用它的人获得许可(无论是用于训练模型还是其他用途)。”他还明确指出,如果他事先知道 OpenAI 是从受付费保护的信息中提取数据并用于模型训练的,他一定会要求 OpenAI 重新训练其模型。
OpenAI 的 ChatGPT 负责人 Nick Turley 在内部沟通中写道,出版商面临着来自这类聊天机器人的 “生存威胁”;这些聊天机器人具有很强的替代性,而且随着技术的进步,它们的替代作用会越来越明显。OpenAI 总裁 Greg Brockman 称这些模型在处理新闻内容方面表现得非常出色。纳德拉在今年早些时候的证词中也承认:与聊天机器人交流实际上已经取代了人们直接从网站或相关来源获取信息的方式。这种言论表明,这类技术更有可能直接与原有内容产生竞争,而非对原有内容进行改进或创新。
微软的一份文件指出,生成式人工智能(Generative AI)确实存在“严重扰乱那些为训练基础模型而提供数据的人的就业”的风险。这些数据被大量复制的现象令人震惊。文件首次披露:仅 OpenAI 在训练过程中使用的数据集就包含了《纽约时报》(NYT)、《每日新闻》(Daily News)以及《调查报道中心》(Center for Investigative Reporting)发布的超过 91,692 篇作品的副本;而另一个源自 Common Crawl 的数据集则包含了来自 nytimes.com 网站的 200 多万份文档。
在 2023 年 1 月的一份内部备忘录中,赫希特(Hecht)将这一行为称为“规模空前的盗窃行为”,并称其为“人类历史上最大规模的劳动盗窃”。该文件详细说明了 OpenAI 和微软是如何获取这些内容的——其中部分内容是通过从 Bing 搜索引擎中抓取数据获得的。
文件中写道:“OpenAI 将整个 GPT-3 的训练数据集提供了给微软,微软利用这些数据来评估如何在自己的商业产品中应用 OpenAI 的模型;而微软也通过‘Project Taxi’和‘Project Mango’等项目向 OpenAI 提供了训练数据。”据称,这两家公司将这些数据整合成了一个新的训练数据集,其中包含了来自这些新闻机构的至少 160,903 篇独特作品的副本。
据称,为了充分利用刮费,OpenAI员工想出了一项在不被发现的情况下绕过付费墙的计划。文件显示,当OpenAI研究员尼克·莱德(Nick Ryder)告诉布罗克曼(Brockman)有关“绕过nytimes付费墙的黑客攻击”时,布罗克曼“太好了”。据称,OpenAI员工还构建了Webtext和WebText2等训练数据集,这些数据集不成比例地依赖于抓取的新闻内容。据称,他们还从Common Crawl(一个免费、开放的网络爬行数据库)中删除了数百万篇文章。研究结果还描述了在训练数据到达模型之前从训练数据中删除版权通知的故意努力,因为研究人员“不希望模型向用户输出”“版权通知”。
《纽约每日新闻》的法律顾问史蒂文·利伯曼(Steven Lieberman)在与TechCrunch分享的一份声明中表示:“这里首次披露的证据表明,OpenAI和微软知道他们的做法是错误的。”OpenAI和微软没有回复置评请求。