字号 ·· | 护眼
thenextweb

程序员在针对 GitHub Copilot 和 Codex 的 DMCA(数字千年版权法案)诉讼中败诉了。

“我们拒绝原告将普通版权侵权诉求转化为DMCA诉求的邀请,”埃里克·米勒法官为全体一致的第九巡回法庭写道。

该判决于周三在Doe诉GitHub案(案号24-7700)中发布。匿名的开源代码发布者起诉GitHub、微软和OpenAI,指控其Copilot和Codex。

他们主张这些工具在未注明出处的情况下复制了他们的代码。他们表示,这违反了《数字千年版权法》第1202(b)条。法庭确认驳回了该主张。判决仍允许他们继续提出两项违约主张。

Copilot不是搜索引擎,这一点决定了第1202(b)条禁止故意删除或更改版权管理信息。版权管理信息包括作者姓名、版权声明和许可条款。在开源代码中,它位于文件顶部的头部。

米勒认为,删除必须是从已有作品中删除。“未在新作品中包含CMI的人,不能被认为是‘删除’或‘更改’任何内容,”判决书写道。

法庭的比较是判决中最清晰的部分。搜索引擎检索并显示已存储的信息,即复制已存在的内容。

“If Copilot functioned like a search engine and produced outputs that were identical to plaintiffs’ code but did not contain CMI, then plaintiffs might have a stronger claim,” Miller wrote. “But that is not what plaintiffs have alleged.” By the programmers’ own account Copilot predicts a likely completion from statistical patterns. The court took that as describing generation rather than retrieval.

法庭承认该法案对AI适用不当。认证问题是第1202(b)条是否包含相似性要求。法庭认为该标签是错误的。

米勒写道:“‘相同性’这个概念其实有点名不副实。”《数字千年版权法案》(DMCA)并不要求两部作品在内容上完全一致;米勒认为,将“相同性”作为判断作品是否侵权的标准,其实只是对法律条文的一种表面化解释,而非一个真正的法律要素。

这一点对后续的诉讼案件至关重要:被告们自己也承认,两部作品并不一定需要完全相同。

法院也同意这一观点。那些细微的、表面的修改并不能成为保护原创作品的依据——因为如果有人实质性地复制了原作品,却故意隐藏了相关的版权声明,那么他们仍然需要承担侵权责任。

该判决还揭示了该法律条款本身的模糊性:米勒指出,判决中引用的例子都来自印刷媒体(例如在书籍的扉页上涂改内容),而这些例子并不能很好地适用于人工智能等新兴数字技术;《数字千年版权法案》的保护措施同样适用于这些新技术。

更重要的争议点在法庭上被公开讨论了程序员们提出了两种理论:

  1. “输出理论”:认为Copilot只是简单地输出了预先存储的训练数据,而这些数据本身并未附带任何版权声明;

  2. “输入理论”:认为被告在将代码输入训练系统之前,故意删除了其中的版权声明。

法庭只讨论了“输出理论”,并认定程序员的主张成立(即Copilot只是简单地复制了预先存储的训练数据)。至于“输入理论”(即被告在训练过程中删除了版权声明),法庭决定不予讨论——因为程序员们并未正确地提出这一争议点。

在第一次驳回诉讼的听证会上,地方法院直接询问:“将训练数据复制到Copilot中是否违反了许可证中对版权归属的要求?”

程序员的律师回答:“也许不会。”法官随即指出:“原告的投诉其实与训练过程本身无关。”后来的法庭裁决中也明确表示:“原告并未声称自己因被告将授权代码用作训练数据而受到损害。”

第九巡回上诉法院最终认定“输入理论”不成立;由于程序员们未能正确提出这一争议点,法庭也就没有讨论关于人工智能训练过程中的版权问题。

程序员在诉讼资格问题上胜诉被告辩称:真正面临风险的应该是程序员自己的代码,而非其他人的代码。但法庭并不认同这一观点。

投诉中引用了学术研究,发现大型语言模型有时会“逐字输出已记忆的训练数据”,这一现象“随着模型规模的扩大,可能会变得更糟”。

它还指出了 GitHub 自己的重复检测功能,该功能允许用户阻止与公开代码完全匹配、长度为 150 个字符或以上的片段的建议。法院将该过滤器的存在视为 Copilot 确实输出相同副本的一些证据。

在起诉阶段这已经足够。法庭明确表示,在简易判决阶段,程序员必须提供实际证据。

为什么 DMCA 路线值得争取 该意见书清晰地列出了计算。DMCA 允许每次侵权最高 25,000 美元。普通版权法的法定赔偿上限为每件作品 30,000 美元。

一个回答数百万个提示的工具会产生侵权,而不是作品。Miller 写道,允许此主张通过将取代普通版权法,并使被告面临“可能毁灭性的责任”。

Courthouse News 报道程序员寻求超过 90 亿美元。法庭明确拒绝说明 Copilot 的输出是否以普通方式侵权。

出版商与 AI 公司对峙 友好方文件显示谁认为这个问题重要。作者公会、美国出版商协会、新闻/媒体联盟以及国际科学技术与医学出版商协会都提交了文件,作者联盟和一组知识产权法教授也同样如此。

另一方则是电子前沿基金会和公共知识组织,以及进步商会、计算机与通信行业协会和 ACT 应用协会。

美国电子前沿基金会(EFF)认为,如果对相关法律进行广义解释,那么版权所有者将能够起诉以下几类人:基于旧作品进行混音创作的艺术家、为课堂教学而改编作品的教师、通过逆向工程来理解代码的工程师,以及帮助我们浏览互联网的搜索引擎。

乔·穆林(Joe Mullin)以“胜利”为标题发布了该组织的回应。通常情况下,开源开发者与数字版权保护组织是站在同一边的,但这次他们却持相反立场。

仍悬而未决的问题目前仍有两起合同纠纷案件正在加利福尼亚州北区的乔恩·蒂加尔(Jon Tigar)法官审理中。这些案件的争议焦点在于开源许可证本身,而非联邦版权法。

开源法律专家希瑟·米克尔(Heather Meeker)指出,许可证中的相关条款通常仅适用于作品的再分发行为,而不适用于培训或学习目的;那些允许作品被用于任何用途的许可证可能提供的保护力度比开发者原本认为的要弱。

早在今年7月,类似的法律争议就已经出现过:当时一家法院裁定,在谷歌提起的诉讼中,第三方仍有权抓取谷歌网站上的数据。事实上,第1202条(Section 1202)在打击人工智能系统侵权行为方面一直显得力不从心。

在其他地区的判决结果则有所不同:德国一家法院认定人工智能音乐工具Suno侵犯了版权,这是欧洲首例此类判决。

本月,美国司法部在出版商与OpenAI之间的版权纠纷中支持了OpenAI的立场。正如围绕Linux操作系统长达28年的法律争斗所显示的那样,软件代码本身就蕴含着复杂的法律问题。

事件经过2022年,约瑟夫·萨维里律师事务所(Joseph Saveri Law Firm)的律师马修·巴特里克(Matthew Butterick)在加利福尼亚州北区提起了这起集体诉讼(案件编号:22-cv-06823)。经过两轮诉讼程序的撤销和修改后,最终只剩下三项核心指控。

博伊斯·席勒·弗莱克斯纳律师事务所(Boies Schiller Flexner)的杰西·帕努奇奥(Jesse Panuccio)代表程序员一方出庭辩护;威廉姆斯与康诺利律师事务所(Williams and Connolly)的丽莎·布拉特(Lisa Blatt)以及奥里克律师事务所(Orrick)的克里斯托弗·卡里埃洛(Christopher Cariello)则代表相关公司出庭应诉。

该法庭于2月11日在旧金山听取辩论,并在七个月后作出裁决。米勒与高级巡回法官西德尼·托马斯和来自加利福尼亚中部地区的指定地区法官斯坦利·布鲁门费尔德二世一起坐席。