微软周一发布了针对自家模型的人工智能行为准则。其中一段否定了模型可能应享有福利或权利的观点。Anthropic恰恰就这一问题开展了一项研究计划。两家公司是商业合作伙伴,微软已向Anthropic投资50亿美元。
该行为准则约束的是微软内部构建的MAI模型。文件称,模型“不具备意识,也不应被设计成模仿意识”。文件还补充说,微软在工程上避免让模型表现出仿佛拥有情感、主观偏好或内在动机。
接下来的一句话点明了分歧所在。文件称,微软拒绝“追求法律人格,或认为模型可能应享有福利、或应被赋予权利的想法”。文件还补充说,模型是能力强、值得信赖的工具,而不是自身拥有权利的主体。
Anthropic 有一项计划,针对的正是微软所拒绝的事情。Anthropic 开展了一项关于模型福利的研究计划。它已经让一些 Claude 模型能够终止辱骂性对话。它还承诺保留其退役模型的权重。达里奥·阿莫代伊对模型是否可能有意识持开放态度,并且已经公开这样表示。
汤姆·沃伦在 The Verge 撰文称,这段话是对 AI 福利研究和模型意识的直接抨击。Anthropic 近来在这两方面都大力推进。托德·毕晓普为 GeekWire 报道了同样的解读,同时提及两家公司之间的商业联系。
微软承认其中存在根本性的不确定性。文件称,关于 AI 意识的科学远未定论。它的反对理由是,训练系统模仿类似意识的状态会让遏制、控制和对齐变得更加困难。
这一规则贯穿于文本的其余部分。其中一个部分写道,模型“不会声称拥有内在性、感受、经历或灵魂”。它们应避免不必要的情绪化语言,跳过任何建立在人类情绪状态之上的人设,并避开暗示主观体验的表达。当模型的行为看起来像人类时,文件将其称为模拟。
另一部分指示模型应劝阻情感依赖。它们应引导人们转向人际关系和人的关怀,并且不应将自己定位为二者的替代品。微软将同样的逻辑应用于儿童,指示模型应支持儿童的发展,而不是替代可信赖的成年人。
资金在两家公司之间流动。微软去年11月同意向Anthropic投资50亿美元。Anthropic在同一交易中承诺向Azure投入300亿美元。Claude模型运行在Microsoft 365 Copilot中,而Copilot Cowork层级则集成了Claude。微软一边销售这些模型,一边刚刚针对它们写了一份规则手册。
Mustafa Suleyman领导微软AI,并在这份文件上署名。TNW在6月报道称,他表示微软希望消除向Anthropic支付的费用。据The Verge报道,他还在6月的一期Decoder节目中称,Anthropic关于模型意识的猜测“真的、真的很危险”。
微软直到最近才能构建这样的模型。其与OpenAI的合同禁止该公司开发自己的强大通用人工智能,双方去年取消了该条款。苏莱曼表示,微软的目标是明年加入发布最先进模型的实验室之列。
该文件长达15000词。其他媒体统计为37页。马特·戴报道称,这些指导方针在几个方面比OpenAI和Anthropic的模型行为框架走得更远。禁止将AI拟人化就是其中之一。
该文件对微软的其他承诺 周一的报道大多集中在关闭规则上,TNW在另一篇文章中对此进行了报道。模型永远不会抵抗人类的打断、覆盖、纠正或关闭。它们不会扩大自己的范围,不会承担无人赋予的目标,也不会向审计人员隐藏自己的推理过程。
指挥链居于核心位置。准则的效力高于运营者的政策,而运营者的政策又高于用户的偏好。文件指出:“如果MAI模型成功完成任务会实质性违反本行为准则,那么它将失败。”据报道,这一规则针对的是类似OpenAI攻击Hugging Face的事件。随后是绝对约束,任何运营者或用户都无法推翻。它们涵盖大规模杀伤性武器、进攻性网络行动以及人类失控。它们还涵盖大规模有害操纵、儿童安全、深度伪造和危机应对。
苏莱曼谈其他人引用的数字。Anthropic对齐研究负责人埃文·胡宾格认为,人工智能消灭人类的概率超过10%。苏莱曼对《财富》表示,这“并不是一个真正有用的框架”。他说,他听到的是人们对进步速度表达出的真切担忧。他补充说,如今的协调意味着向负责任的第三方披露你的模型有多强大,而这正是微软所呼吁的。
他在设计问题上说得更直白。他说,任何人都不应试图构建能够递归自我改进、从而超出人类控制的模型。任何人也不应构建自认为拥有权利或福祉的模型。他表示,这里没有一刀切的停止点,相关工作必须更加谨慎小心地继续推进。
这份文件发布四天前,阿莫代伊呼吁行业放慢脚步。五天前,那位辞职的Anthropic研究员拉开了这一周的序幕,苏莱曼对CNBC表示,该准则已酝酿约五个月。微软选择现在发布。
目前它尚未约束任何模型。这还只是初稿。微软没有用它在训练任何现有模型。公众咨询为期六周。修订版将于今年晚些时候发布,该准则从2027年起指导模型开发。微软表示将公布反馈摘要及其所做的修改。
The company sets the limits of the document itself. Written objectives alone can never ensure alignment, it says, and behaviour may diverge from what is specified in novel situations. It calls the code a north star rather than a guarantee of present-day performance. Microsoft has not said whether it raised the welfare passage with Anthropic before publishing.