周四公开的一份为期92页的法律简介一开始就引用了同一名微软员工的两段话。海克特博士(Brent Hecht)是该公司的应用科学总监,他写道,人们将会看到大型模型吸取他们的作品,这是“前所未有的惊人盗窃”。在第二份文件中,他称之为“或许是人类历史上最大的劳动盗窃”。
海克特是一位研究科学家。他不是董事会成员,也不是首席执行官,这一点在传播过程中很重要。
新闻原告们的联合摘要判决简介现已提交给联邦地区法官西德尼·H·斯坦(Sidney H. Stein),该案是一起针对OpenAI的版权诉讼。直到周四,这份简介中大部分有损内容都被打上了红笔。
数字内容下一步(Digital Content Next)的杰森·金特(Jason Kint)发现了未经红笔编辑的版本。乔治·哈默(Hammond)和斯蒂芬·莫里斯(Stephen Morris)当天为《金融时报》报道了这一消息,斯科特·诺弗(Scott Nover)和格里格·德·温克(Gerrit De Vynck)为《华盛顿邮报》报道,杰森·科布勒(Jason Koebler)为404媒体报道,卡伦·韦斯(Karen Weise)和迈克·艾萨克(Mike Isaac)为《纽约时报》报道,后者也是原告之一。以下引述均来自该诉讼文件本身。
原告不仅仅是《纽约时报》。他们还包括《每日新闻》集团和调查性报道中心。他们还包括Ziff Davis,该公司旗下出版物包括CNET、ZDNET、PCMag和Mashable。换句话说,起诉方正是本出版物的直接同行。
微软自己的数据显示,“厄运循环”正在发生。该简介引用了一份微软内部文件,描述了该公司所构建的内容。该文件称,该公司的AI内容战略“已经开始了‘厄运循环’”,这将损害其自身的模型以及整个网络。该文件称这种立场很不寻常。现在的成品已经威胁到了其自身供应商的经济基础。
这些数据来自微软本身。该简介引用了公司关于点击率下降的数据:《纽约时报》网站下降了87%至93%,《每日新闻》集团下降了83%至91%,Ziff Davis下降了51%至94%。这次比较是Copilot与传统的Bing搜索。
海克特在这起诉讼文件提交后不久撰写了该文档。他解释说,这些系统的运作方式是通过复制其训练内容中的模式。没有办法将经济价值传导回供应链下游。这意味着,他写道,“必然威胁到那些创造内容的人的经济稳定”。他补充说,如果就自己的雇主作出裁决,无异会“完全嘲弄‘合理使用’这一概念”。
简报中其他微软材料更进一步。一份文档警告称存在“真实风险”,即这种技术可能会“显著扰乱那些为基础模型训练提供数据的人们的就业”。另一份则用八个字概括道:“LLMs是一种摧毁其供应链的产品。”“用户不会点击”这份诉讼中最犀利的一句话来自一位OpenAI软件工程师,简报并未透露其姓名。“无论我们多么突出地展示这些链接,用户都不会点击。”负责ChatGPT的尼克·图利(Nick Turley)表示,出版商面临“生存威胁”。他说,这些产品“从本质上来说 largely substitutive,period”,并且随着技术的改进,这种替代性还会更加明显。OpenAI的政策总监杰克·克拉克(Jack Clark)用另一种方式表达了这一观点。他说,该公司的工作日益意味着要构建替代那些定义社会文化的人们劳动的系统。
萨蒂亚·纳德拉(Satya Nadella)在宣誓作证时同意了这一观点,认为聊天机器人已经取代了直接查阅原始来源。OpenAI内部文件将ChatGPT称为“现代报摊”。
他们所知道的训练内容OpenAI的研究副总裁为这份简报提供了一条律师们会喜欢的句子。“我们训练我们的网络去记忆训练数据。这就是它们的目标。”到了2019年11月,该公司已开始内部担忧会再次生成受版权保护的作品。
简报用具体数字量化了这种复制行为。OpenAI的中期训练数据集中包含超过91,692份原告作品的副本。WebText2中至少有6,552份来自纽约时报的作品,18,609份来自每日新闻集团的作品,以及66,780份来自Ziff Davis的作品。
OpenAI通过合法许可单独获取了《纽约时报》的注释语料库(该语料库包含1987年至2007年间发布的180多万篇文章),但该许可仅限于非商业研究用途。
大约在2017年,Greg Brockman表示他对通过商业化OpenAI的技术来获取巨额利润充满期待。
随后,相关报道多次提及一段对话:Nick Ryder向Brockman提到了“一种绕过《纽约时报》付费墙的方法”,Brockman回应称“很好”。OpenAI自己的产品列表中确实存在名为“Bypass Paywall”和“Remove Paywall”的定制GPT模型。Nadella也曾表示:“任何被设置为付费墙的内容都应该被许可使用。”
关于数据交换的问题,相关文件中有一个专门的部分被命名为“数据交换”。文件指出,微软曾从《纽约时报》获取数据并将其提供给OpenAI;随后OpenAI又将整个GPT-3训练数据集交给了微软。另外两个合作项目(Taxi和Mango)也将数据交回了OpenAI,其中Mango数据集包含了至少160,903篇原创文章。
在文件公开前的16天,美国政府在同一诉讼案中提交了自身的意见书,认为使用受版权保护的文章进行模型训练属于“合理使用”(即不构成侵权行为)。当时《TNW》杂志对此进行了报道,但如今这份20页的政府意见书的内容已经发生了变化。
美国政府的核心论点是:模型训练过程与最终生成的内容属于两种不同的使用方式;将作品复制用于模型训练并不会向公众透露任何信息,因此这种行为不能被视为对原作品的侵权。只有当模型生成的内容与原始作品高度相似时,才会构成侵权;单纯的市场竞争并不构成侵权行为。
政府还将许可问题视为一个反垄断问题,认为只有大型科技公司才能承担高昂的许可费用,而这实际上相当于对传统主流媒体的巨额补贴。
需要注意的是:这份文件属于原告的诉讼材料;律师们在构建诉讼案时自行挑选了其中的引文,而文件中提到的所有证据资料仍处于保密状态(即尚未公开)。
微软已对中标报价做出回应。该公司告诉《金融时报》,海克特的言论“反映了一位员工的个人观点,不构成法律分析”,并表示纳德拉的证词涉及的是广泛的原则,而非对版权问题做出结论。OpenAI未回复《金融时报》的采访请求。它此前称该案是“以损害惠及全人类进步的行为为代价的不应得的丰厚回报”。
被告方也未承认这一法律观点。微软的简介引用了自己的经济学专家托克博士的意见,勾画出其律师将依赖的论点。搜索引擎返回按排名排序的链接列表。而奠基在检索结果上的模型则从获取的来源中综合提取信息。关键问题在于:这种综合提取是否构成版权法所认定的替代性使用。
目前法院倾向于支持人工智能公司。Anthropic在解决其盗版书籍诉讼时选择了15亿美元的和解方案,而不是接受审判。针对谷歌Gemini的出版商诉讼仍在进行中。
欧洲提出了相反的问题。本月欧洲委员会询问了出版商,认为谷歌的AI选择退出机制是否有效运作,前提是出版商应有权拒绝。而华盛顿已告诉法院,允许出版商拒绝会构成反垄断伤害。
这场“恶性循环”在大西洋两岸都带着薪酬。《每日镜报》的出版商瑞奇公司本月裁减了220个编辑职位,并指责AI摘要侵蚀了其流量。
斯坦因法官现已收到了双方的文档。一份文档称训练行为具有变革性,且其造成的伤害不符合版权法所认定的类型。而另一份文档则是被告方用自己的话将其称为“盗窃”。这份关于是否作出即决判点的裁决,将决定法律所接受的解释。