字号 ·· | 护眼
财新

《纽约时报》指控OpenAI和微软侵权 举证称其承认“AI偷窃人力劳动”

当地时间2026年5月6日,美国纽约,纽约时报大楼外观。图:视觉中国

当地时间2026年5月6日,美国纽约,纽约时报大楼外观。图:视觉中国

  【财新网】新闻出版商的版权诉讼,再度暴露AI公司的技术伦理争议和法律风险。9月17日,《纽约时报》、每日新闻(The Daily News)等五家新闻出版商向美国纽约南区联邦地区法院提交举证文件,请求法院判决OpenAI与微软的AI模型违法使用新闻内容,侵犯其版权。

  文件引述微软应用科学总监布伦特·赫克特的原话称,“全球数百万人很快就会意识到,大模型吞掉他们的作品是一场规模空前的盗窃行为。”而盗取的对象是人力劳动,“几乎没有人会想到自己的作品被如此使用,也没有人因此获得报酬。”

  《纽约时报》等原告认为,上述言论证明OpenAI与微软知晓自己正在侵权,在AI模型的所有环节:数据获取、模型训练、输出内容等阶段均违法使用新闻报道,且科技公司之间已形成盗版新闻内容的数据交易市场。

  这桩诉讼可追溯至三年前,2023年12月27日,《纽约时报》起诉微软和OpenAI,指控OpenAI使用了数百万篇《纽约时报》的文章来训练AI模型,要求赔偿数十亿美元的损失。此后,美国多家新闻出版商也以同样理由起诉微软和OpenAI。

  《纽约时报》称,OpenAI和微软试图利用《纽约时报》内容,在未经许可或付费的情况下开发替代产品,比如微软和OpenAI的大模型能逐字背诵、总结《纽约时报》稿件,模仿其表达风格写作,还将幻觉信息归咎于《纽约时报》。(详见:《GPT革命|谈判数月未果 《纽约时报》起诉OpenAI和微软侵权》)

  《纽约时报》是美国严肃新闻机构之一,线上版本自2011年3月开启付费订阅模式。

  文件中的证据显示,OpenAI越过《纽约时报》付费墙爬取内容,并用此构建了用于模型训练的数据集,OpenAI和微软在拿到数据时对这种违规行为视而不见,训练模型时也不做合规筛查,OpenAI曾在内部讨论中称,其数据集包含《纽约时报》近206.4万篇文章。

  原告们指控,OpenAI和微软还互相分享这些数据,比如OpenAI把完整的GPT-3训练数据集交付给微软,微软也通过名为“出租车计划”“芒果计划”的项目把包含新闻内容的训练数据转给OpenAI,其中一些数据是以网页副本的形式提供的。

  模型大量学习新闻报道,会记住原报道的内容、写作手法和风格,模型输出时还会从《纽约时报》等新闻网站粘贴内容,作为向用户生成回复的来源。《纽约时报》等原告举证,ChatGPT会回吐报道原文,还会改写原文。

  据该文件,OpenAI联合创始人格雷格·布罗克曼曾在内部夸奖GPT在处理新闻时的表现出色,尤其擅长新闻文本,“每次我用它就《纽约时报》内容做生成任务时,它对下一句话的推测效果都相当不错。”他还称,“只要给到一段《纽约时报》报道的半句话,模型就能精准补全后面的内容。”

  这造成用户阅读原文的意愿下降,影响了新闻网站流量。据该法庭文件,截至2026年2月,OpenAI内部数据显示,用户每周向ChatGPT提交约100万次关于检索本地新闻内容的提示词;由原告提供的一项调查报告显示,36%的受访者表示,使用ChatGPT后“完全不再需要《纽约时报》的新闻了”。

  原告认为,AI聊天机器人与传统搜索引擎截然不同,因为AI输出的结果不仅减少用户访问新闻网站的需求,“同时还向市场倾倒低质量内容,破坏了新闻出版商的商业模式。”

  基于美国版权法“合理使用”的要素,原告认为OpenAI和微软的行为属于商业性、替代性使用,并不属于合理使用范畴,违反了《数字千年版权法》(DMCA)。

  《纽约时报》等原告主张,要按每一篇被侵权的新闻稿件单独计算赔偿金额,他们同时向法院提交了装载证据的硬盘,包含大量报道原文和模型训练数据副本的对比。

  原告提交该文件,是为了向法院请求简易判决(Summary Judgment),若不存在能影响判决结果的重要事实,法院无需经过陪审团庭审,简化案件后续庭审的争议范围,直接作出对举证方有利的判决。

  在《纽约时报》发起诉讼后,2024年8月,三名美国作家以个人名义代表其余当事方联合起诉Anthropic,指控其在未经授权的情况下使用其作品训练Claude大语言模型,在Anthropic承认使用过的开源数据集中有一个子集,装满了从网上下载的盗版书。

  7月20日,经美国法院批准,AI巨头Anthropic将向其发起集体诉讼的作家赔付15亿美元,达成和解。(详见:《Anthropic以15亿美元和解作家诉讼 创美国版权赔金最高纪录》)

  为了反击AI公司拿现成作品训练AI,过去三年,包括图书作者、新闻媒体和影视、音乐行业的版权所有者向Anthropic以及OpenAI、谷歌等科技巨头与Midjourney等模型公司发起了多项诉讼,大部分都还没有判决结果或和解。