字号 ·· | 护眼
theregister

开放权重并非开源:为何 AI 最爱的标签正引发争议

"A genuinely open source system should grant the freedom to do all of the above."一个真正开源的系统应当赋予使用者进行上述所有操作的自由。

  1. "Weights are the learned numerical你可以下载一个开放权重模型,将其自托管,用内部文档进行微调,并避免通过专有接口路由提示。开放权重是公开可用的。它们之所以重要,是因为在本地运行它们可以更好地控制数据、隐私、成本、供应商变更和供应商锁定。它们还帮助建立了一个庞大的生态系统,包括本地模型运行时、推理提供商、微调工具和专门的下游模型。开源促进会(OSI)是开源定义(OSD)的管理者,它做出了区分:“开放权重指的是训练好的神经网络的最终权重和偏置。”这些值决定了模型如何解释提示并产生输出。发布它们可以让其他人对模型进行微调、调整或部署。

但开源促进会(OSI)补充道,仅凭权重只能披露“实现完全问责所需信息的一小部分”。正如斯坦福人本人工智能研究院(HAI)主任詹姆斯·兰代(James Landay)所言:“开放权重是一种进步。你可以下载模型,在自己的机器上运行它,无需将其纳入别人的数据管道。但你依然无法了解这个模型是如何构建的、是用什么数据训练的,或者它为什么会产生这样的行为。那不是开放模型,那只是开放分发。”如果没有训练数据或足够详细的文档,外部人员就无法确定使用了哪些数据源、可能包含哪些受版权保护或私密的内容、数据是如何筛选或删除的、哪些语言和群体未得到充分代表、基准测试数据是否泄露到了训练集中,以及预训练后有哪些对齐与安全方法对模型产生了影响。

兰代表示:“开放权重的人工智能与开源人工智能之间存在巨大差距。”他主张,除非开发者公开训练数据或提供“详尽记录、可供审计的说明”,否则你无法在最完整的意义上测试、复现或质疑这项工作。开源促进会(OSI)有自己的开源定义,即《开源人工智能定义》(OSAID 1.0)。它要求模型参数(包括权重)在经OSI批准的条款下提供,但并未规定具体的法律机制。Lightning AI首席技术官、知名PyTorch贡献者卢卡·安蒂加认为,OSAID对权重的处理留下了“一个巨大的漏洞,将使许可证在判断经OSI许可的人工智能系统能否在现实场景中采用时效果大打折扣”。其他开源界人士也批评了OSAID。原版《开源定义》的作者布鲁斯·佩伦斯于2024年公开谴责了OSAID。

他后来表示:“这不是开源!……不幸的是,开源促进会本身现在也卷入了‘开源洗白’。”他绝非孤例。软件自由保护协会(SFC)的政策研究员兼驻场黑客布拉德利·库恩,以及红帽高级商业法律顾问理查德·丰塔纳,已呼吁废除 OSAID:“OSI 行动太快,把一项野心过大的政策妥协强加给社区。不可否认,OSAID 在 FOSS 社区中造成了裂痕;这道裂痕严重损害了 OSI 的声誉、权威和影响力。与此同时,OSAID 没有任何迹象表明其对机器学习从业者、FOSS 社区或监管机构产生了积极的政策影响。”OSI 在 2024 年 10 月发布 OSAID 1.0 时承认,该定义将继续演变。批评者认为,其核心缺陷尚未得到解决。

话虽如此,Linux 基金会的 Mike Dolan 已向 OSI 提交了开放模型、数据和权重(OpenMDW)许可证。该许可证自 2025 年起就已存在,其贡献者名单包括亚马逊、Meta、IBM、微软和英伟达,因此拥有雄厚的行业支持。传统开源围绕源代码展开。LLM 则完全是另一回事:它们将代码、架构以及源自训练数据集的数值权重结合在一起,而这些数据集可能是专有的、受版权保护的或未公开的。OpenMDW 的解决之道是为模型的架构、训练数据和权重分别定义条款,将许可方提供的各组成部分纳入同一份协议。这在我看来很合理,但该提交在 OSI 的许可证审查邮件列表中遇到了反对意见。

正如在OSAID制定期间领导该组织的OSI前执行董事斯特凡诺·马富利所说:“我一直觉得,对OpenMDW的审查被一种意识形态污染了。因为我们现在不喜欢大型科技公司,而AI如今就是大型科技公司,所以我们就不喜欢AI;因此,我们会不惜一切阻止它。”现在再把头埋进沙子里已经太晚了。正如斯坦福大学的兰代所说:“开放权重回答的是‘我能运行这个吗?’开源回答的是‘我能信任它、改进它,并在它之上构建下一个东西吗?’眼下,几乎所有人——无论是美国实验室还是中国实验室——都在回答第一个问题,但离回答第二个问题还差得远。”

除非有人成功,否则“开放人工智能”有可能成为一个矛盾修辞——或者仅仅是另一个空洞的科技营销术语。®