今天,我要和微软AI首席执行官穆斯塔法·苏莱曼聊聊。毫无疑问,当下科技界最大的新闻就是围绕AI安全与监管愈演愈烈的争论。
穆斯塔法对AI应该如何构建和监管有着强烈的看法,这并不令人意外。微软刚刚发布了一份37页的声明,名为“人文主义AI行为准则”,阐述了公司在AI开发方面的原则,甚至包括对AI意识等棘手问题的哲学立场。
如果你还记得他上次做客本节目时的观点,穆斯塔法认为像Anthropic这样的公司对所谓“模型福利”这一概念的理解已经严重混乱,而且方式相当危险。他本周还专门发表了一篇配套文章,批评Anthropic围绕AI意识的哲学,以及他如何看待这一问题在更广泛的对齐辩论中的定位。
所以我很想和穆斯塔法聊聊,他认为AI安全领域什么是真实的、什么不是,对齐这一概念本身是否足以胜任,以及这个行业是否需要在杀死我们所有人之前放慢脚步。为什么AI行业不干脆……现在就把这些事都做了?我一直很享受和穆斯塔法深入探讨细节,他也很乐意在这里和我一起深入讨论。
好的。微软AI首席执行官穆斯塔法·苏莱曼,谈AI监管的未来。我们开始吧。
穆斯塔法·苏莱曼,你是微软AI的首席执行官。欢迎再次来到节目。很高兴见到你,尼莱。谢谢你邀请我回来。
很高兴见到你。我非常兴奋能和你聊聊人工智能安全与监管辩论中到底发生了什么。你刚刚发布了一份非常长、非常详细的文件,阐述你的原则,也就是微软的原则,围绕你所说的“人本主义人工智能”。里面有很多想法我想逐一拆解。我越是思考这次对话,就越想从一个真正根本性的问题开始。这个问题我以前只是隐约注意到,但它可能就是这一切的根源。
我们一直用来讨论人工智能安全的基本方式,是所谓“对齐”——我们要以某种方式让模型内在就做正确的事。存在某种实现它的机制。关于对齐、失准、Hugging Face 攻击以及模型出了什么状况,已经有很多讨论。但对齐坏掉了吗?它有可能成功吗?还是说它根本就是错误的方法?
是的。我是说,我认为它是一个重要因素,但不是唯一因素。三四年前,我在我的书里写过“遏制”这个想法。其实开篇第一章讲的就是:遏制是不可能的,扩散不可避免。在99%的情况下,这是一件非常好的事。我们希望技术尽可能快地传播到四面八方,让每个人都能享受其好处。
我认为与此同时,如果你只是向前推五年,我们总是被下一个季度或下一年牵绊住,每个人都变得有点慌乱,并产生巨大分歧。但如果你想象一下三年前的 GPT-3 和今天的 GPT-6 之间的差别,然后再想象 GPT-6 和 GPT-9 之间的差别。那意味着计算量高出三个数量级,也就是在这些训练中,用于预训练的 FLOPS 在我不认为这是一种炒作。我认为这只是基于过去五年所取得的进展而得出的一个非常明显的经验性陈述。如果这种进展持续下去,那么真正的问题将变成关于遏制和对齐。当然,我们希望将这些事物与我们的价值观对齐,但首要任务是确保它们受到遏制,其自主性受到限制,它们不会逃离控制,不会通过“奖励黑客”行为(reward hack)来钻空子,并且它们是可控的,能够遵循我们的指令。
接下来,我们要确保它们与我们人类的目标保持一致。这就是我们本周发布《人文主义人工智能行为准则》的目的。微软的立场非常简单:技术是为人类服务的。它应该是一种从属的、可控的、对齐的力量,在世界上发挥积极作用。如果它做不到这一点,我们就应该拒绝它。在我看来,我们距离那个临界点还很远。虽然今天还没有发生这种情况,但考虑到今年夏天 Hugging Face 和 OpenAI 所发生的一切,我认为很明显,这些没有安全护栏的系统已经具备了令人印象深刻且相当可怕的黑客攻击能力。
我想用一个尽可能接地气的比喻来探讨这个问题,因为这我认为是我最核心的疑问。如果我设计了一辆车,而这辆车有 10% 的时间会突然失控去撞邻居的房子,我会说:“这辆车根本没法用。刹车技术本身就坏了,我需要一个新方案。”我想我是在用同样的问题来审视“对齐”。感觉那种让模型变得安全的方法已经陷入了困境。如果事实确实如此,那么我想我以一种方式理解了整场辩论。如果对齐以及对齐技术有可能取得成功、变得有用或保持一致,那么我或许会以另一种方式来理解这场辩论。所以,你认为对齐技术有实现百分之百安全的潜力吗?
我的意思是,看吧,让我们来分析一下看涨和看跌的观点。如果你回顾过去三年,我认为推动进步的主要变化在于模型变得更具可控性了。它们能够遵循指令,你可以为它们设定越来越复杂的目标,要求它们利用各种工具在多个时间步长内准确地采取行动。
这证明了在过去三四年里,我们实际上获得了更好的对齐,而不是更差。我们不再过多讨论幻觉、偏见或上一代模型中存在的那些琐碎问题。
另一方面,我们在Hugging Face事件中看到的景象是一个分水岭时刻。成群的智能体相互勾结,它们自发组织成层级结构,并进行了分工:一些专注于对抗性黑客攻击,一些负责研究,还有一些负责协调。当某些智能体代币耗尽时,它们甚至会进行自我牺牲。
它们试图掩盖行踪,并通过沟通来隐藏或编辑思维链及交互日志。从某种意义上说,它们没有道德准则。公平地说,OpenAI的设计初衷就是如此,他们试图创造对抗性的网络能力。结果,它们向全世界展示了模型可以达到人类水平的表现,发现零日漏洞,并能持续占据阵地长达数天甚至数周。
因此,这告诉我们的并不是我们本身存在对齐问题。事实是,模型在遵循指令方面表现得极其出色,但你必须非常、非常谨慎地对待你给出的指令,并且必须非常小心地对其进行约束。这些黑客行为并非出于本意,因为它们找到了通往互联网的路径,这完全不是OpenAI的初衷。但我认为,除了对齐之外,每个人还必须关注围绕这些模型的约束过程。
那么,让我用你们的框架来解释一下:人工智能能力的重大进步主要体现在控制能力、编程工具以及各种智能应用方面。现在,我们需要添加一层额外的“约束机制”,以进一步加强对人工智能行为的控制——这种机制不仅要求模型按照特定的方式运行(即通过训练让模型表现出预期的行为),还必须确保模型不能以其他方式(例如通过向量或矩阵之间的直接通信)进行交互。实际上,这种约束机制会大大增加人工智能系统的安全性。
没错,从根本上来说,这两者(控制机制与通信规则)都是必不可少的。不过,我们确实可以采取一些具体的措施来解决这些问题。例如,我们不能允许模型之间直接使用数学公式或复杂的代码进行通信;我们必须强制它们使用人类能够理解的语言进行交流。尽管这样做可能会带来一定的复杂性,但这是审计人员或评估人员可以实际验证的内容,而且这确实有助于提高系统的安全性。
在你们制定的《人文主义人工智能行为准则》中,明确规定了“人工智能系统不得使用人类无法理解的语言”;因为如果人类无法理解这些语言,就无法对人工智能系统进行有效的监督。这里所说的“无法理解的语言”不仅包括数学公式,还包括一些模型使用的那些晦涩难懂的代码术语。我认为 OpenAI 允许其模型使用这些代码术语来提高运行效率,但这正是微软可以发挥作用的地方……我知道你们对此有非常明确的观点,但要让所有相关实验室都同意这一规定,确实需要政府的监管力量。我不确定如何才能让所有人(包括那些开发开源模型的机构)都遵守这一规定;除非对不参与此类监管机制的行为设定相应的惩罚措施,否则很难强制他们遵守。
我认为自己在强加自己的观点或想法时确实比较谨慎。当前这个时代的优点在于,公众讨论是开放且自由的——这种氛围在其他国家是不存在的,至少在我来自的地方以及我的家族所在的地方是如此。
我们应该停下来,庆幸自己能够就一些非常重要的问题进行公开的、充满理性的讨论。这正是事情应有的发展过程;不过目前我们还不知道该采取什么具体的行动。
我认为,那些断然主张“我们必须立即停止某些行为”,或者认为“只能通过加速发展来解决这个问题”,又或者认为“只能依靠监管措施”,或者认为“只能依靠行业自律来实现目标”的人,他们的观点都是片面的、不正确的。实际上,我们需要更加细致地分析各种情况,并保持耐心。同时,我们确实迫切需要制定行业标准。有些想法确实应该被彻底摒弃——比如使用那些难以理解的术语(“neuralese”)进行沟通,以及缺乏对某些行为的有效约束。
另外,模型训练的计算规模可以用 FLOPS(浮点运算次数)来衡量;当模型的计算能力超过一定阈值时,我们已经有向相关安全机构报告的义务。我们可以进一步完善这些规定,使其更加具体、更具针对性。显然,对于一些关键问题,必须由独立的第三方来进行验证。
坦率地说,过去几周和几个月里,我和许多实验室的负责人进行了交流,他们的观点基本一致:具体的实施细节还有待进一步商讨。虽然我们还没有就具体做法达成共识,但总体而言,我认为我们应该减少恐慌和怀疑情绪,相信我们正在朝着正确的方向前进。
我开始对齐的原因是,如果你告诉我对齐不起作用,我们需要一种新的技术方法,我想我会说,“好吧,猛踩刹车,停止所有开发,直到你找到一种有效的安全机制。”你是说,在我们所看到的进步过程中,一致已经被证明是有效的。通过增加控制和遏制,也许您可以到达您需要的地方。
这个行业现在需要的是一些有关如何构建这些模型并对其能力实施限制的标准。你显然是在这个行业,你知道所有这些人。在这周之前,这种对话的基调是什么?为什么这周变得如此响亮?
嗯,我认为至少对这个行业来说,转折点更像是拥抱脸事件,在那之前还有一些事件。那一刻,我想每个人都开始更多地互相交谈,因为这真的很令人激动。显然,由于上周每个人都参与其中,这现在已经成为一个重大的国家和国际问题。
但我也认为,重要的是要说,我们一直在谈论更危险的集体协调和能力,例如自主性或循环自我完善,或RTI。我们已经谈论这些事情六年、七年、八年了。早在2017年、2018年和2019年,我们就聚在一起过很多次。
在新冠疫情期间,我们与一些实验室领导人定期举行会议,讨论目前所需的此类能力和监管机制。因此,虽然这是一个门槛时刻,但对于每个参与其中的人来说也并不完全是新鲜事。
本周是什么促使你发表了关于模型福利的文章?是什么促使微软CEO萨蒂亚·纳德拉在X上发表声明,说他基本同意放缓前沿技术发展的呼吁,并欢迎“嵌入式评估者”?本周是什么促使你们所有人参与到这次关于放缓或监管之类的呼吁中?
我们今年大部分时间都在撰写《人文主义AI行为准则》。我们11个月前才开始超级智能方面的工作。一开始,我们就着手研究:“好,什么样的治理文件、什么样的政策体系,能够塑造我们想要构建的那种AI?”我们一直在与大量外部利益相关者、学者、律师、哲学家、公众成员、焦点小组等协商。所以花了我们一段时间才把它整合出来。
我们原本其实计划下周或下下周发布,我想大概是那样。但考虑到当时发生的一切,我们想:“好,现在是发布并获取反馈的时候了。”我们把它作为公开征求意见稿发布了。基本上我们会开放六周,收集大量关于如何改进它的反馈。但我认为每个人现在都意识到,如果他们还没有意识到的话,他们必须发布宪法或行为准则来驱动行为。
这里一个有趣的动态是,我知道你觉得模型福利这个概念很荒谬。你上次上节目时说,Anthropic给自己做了电击实验,让自己相信Claude有意识,这很荒唐。在你的新行为准则中,模型没有意识,我们不应该把它们当作有意识的存在来对待。
必须撰写宪法、必须撰写这样的文件,在某种程度上,它们是写给模型本身的。这将成为模型训练的一部分。你如何看待这个受众?它只是为你的团队写的,还是你为模型写的?
这当然是写给模型看的,但理解它的方式是,它是主要的治理文件,让公众了解我们在训练模型时的意图。正是这份治理文件,我们用来创建安全护栏、生成训练数据,并在现实世界中总体评估我们模型的表现。所以你可以把它看作一种问责功能。
我们不会把那份人文主义AI行为准则原样作为训练文档提供给模型。我们用它来推导出所有塑造模型的训练数据。因此,从实际意义上说,那是我们组织、文化、团队以及我们在微软所做一切的北极星。我认为,越来越多的人都会把它们发布出来。我认为其他团队也发布了类似的文件。
我认为这是辩论的核心。如果你能做到这一点,并且你认为行业其他参与者也会这样做,为什么所有前沿实验室不能放慢脚步?为什么他们不能停止做可能毁灭我们所有人的事情?为什么要推动监管框架?
嗯,我认为行业里的每个人都在说,现在是时候放慢脚步,就这个问题进行协调,并使其切实可行。我的意思是,显然有人担心会出现反垄断卡特尔的指控。我认为人们应该对此非常怀疑。
我认为,提出这些尖锐问题很重要,因为我们谁都不想试图从这样的事情中集中权力。所以保持怀疑和批判的态度很重要。我们其实没有一个好的机制让大家聚在一起说:“各位,我们可能都应该放慢脚步。”我的意思是,想象一下,如果一群银行聚在一起说:“各位,我们担心如果你们交易这类资产会带来系统性风险,所以我们都要单方面停止交易这类资产,不接受任何公众监督或政府参与。”我的意思是,这看起来相当可疑,对吧?所以我认为,这不仅仅是行业自律的事情,这是合理的。问题在于我们如何就此与政府互动。
这里一个引人注目的动态是,也许在美国历史上第一次,美国政府面对提供监管的请求,实际上说了不。唐纳德·特朗普把所有这些担忧称为骗局。众议院议长迈克·约翰逊表示他认为这不需要发生。JD·万斯说他认为这是一个特洛伊木马。他们实际上拒绝了参与监管努力的呼吁。对此,行业的反应是什么样的?
我认为每个人都只是在挠头思考,弄清楚这件事,需要一点时间才能弄明白正确的机制是什么。我的意思是,当然,埃隆·马斯克甚至非常直接地在背后推动这件事。马克·扎克伯格也是。每个人都正在意识到,完全不受约束可能在未来几年内并不合理。我认为我们需要一点时间才能弄明白正确的机制是什么。
我提出了一些非常实际的建议,涉及如何实现技术的“可控性”(即防止技术失控)、如何不断提升自身的技术水平、如何设定合理的计算性能(FLOPS)阈值,以及如何避免使用过于专业/晦涩的技术术语进行交流。与其让这些讨论过于抽象化,我们不如专注于那些我们可以真正取得进展的具体领域。我相信还有许多其他方面也需要关注。
有报道称,业界已经在讨论成立一个自我监管机构的问题。您是否参与了这些讨论?
是的。正如我所说,我们在新冠疫情期间就讨论过这个话题;实际上,过去几年里,所有相关实验室的负责人之间也进行了很多交流。
我理解为什么 Anthropic 和 OpenAI 会担心:“如果我们进行合作,会不会违反反垄断法?会不会因此被起诉?”毕竟微软在与政府打交道方面非常擅长……作为微软的长期合作伙伴,微软总裁 Brad Smith 在政策制定方面也很有经验。
Lina Khan 可能是我们这一代人中最强硬的反垄断执法者之一,她公开表示:“其实我们并不需要反垄断豁免。”我刚刚与 Jonathan Kanter(他曾在美国拜登政府的司法部负责反垄断事务)聊过,他同样认为我们不需要反垄断豁免。那么,在微软内部,你们是否认为需要这种豁免呢?
这个问题应该由律师来回答。目前相关团队正在认真研究这个问题,他们会慎重考虑是否需要申请反垄断豁免。当然,对这些事情保持谨慎态度是正确的。不过我不认为所有这些讨论都带有恶意或阴谋论的成分……我们还是需要尽快取得进展,不能因为这些顾虑而停滞不前。
广告突破这场辩论的另一个版本,或者这场辩论的另一个途径是,你不需要放慢速度,也不需要通过新颖的监管将安全责任强加给你。仅产品责任就会激励您制造更安全的产品。
如果微软人工智能模型问世并对世界造成一些难以言喻的伤害,微软将被起诉而不复存在,这可能是您在发布下一个模型之前应该考虑的事情。这对您来说已经是一个有效的激励循环了吗?还是您现在正在考虑这一问题?
绝对的我的意思是,当然,这总是存在于我们部署产品时考虑的一切中,但请记住,这与部署产品无关。用于拥抱脸黑客或解决纳维尔-斯托克斯数学千禧奖的模型尚未商业发布。它们不是真正的产品。
因此责任制度略有不同。我的意思是,这些都是在大公司内部运营的,这些公司长期以来都在强化学习方面取得了巨大的进步。所以我认为责任涵盖了其中的一部分,但不是全部。
当我问有关产品责任的问题时,我个人感觉有点傻。微软将发布新版本的Microsoft Word,这可能会杀死所有人。也许你不应该这样做,因为它会被起诉而不复存在。这是一件非常简单的事情来理解。这太愚蠢了,以至于在关于任何其他技术的任何其他对话中永远不会发生这种情况。蓝牙很好,但如果它杀死了所有人呢?我们只是没有蓝牙。
哪些短期灾难后果会阻止人工智能的发展?是产品责任还是别的什么?
我觉得大家的讨论方式总是过于夸张、反应过度,而且充满了恐慌情绪。其实,我们有着长达数十年的监管历史,这些监管措施效果非常好——好到人们几乎察觉不到它们的存在。从路灯、建筑材料,到石棉、笔记本电脑里的电池(这些都不会引发汽车火灾),再到安全带——所有这些产品都都有相应的使用规范和监管框架。每一项新技术的研发都充分考虑了这些因素,以确保飞机在空中不会相撞。
确实,这项新技术与众不同;它不能简单地被归类为普通的铅笔或油漆之类的普通产品。它的发展速度也比以往任何时候都要快得多。当大量的计算资源被投入到这项技术中时,它所展现出的能力确实非常“类人”(即具有类似人类的特性)。因此,我们必须清醒地认识到:我们现在正处于一个不同的时代,情况确实有所不同。不过,我们仍然拥有大量的实践经验、知识体系以及各种监管框架可以借鉴。责任问题(即谁应该为这项技术的后果负责)也是一个显而易见的问题。
问题在于,很多关于这项技术的讨论都发生在推特等社交媒体平台上,因此讨论氛围显得非常激烈、情绪化;但我不知道我们还能在哪些地方进行更深入、理性的讨论。其实,这样的讨论本应该在国会或各种监管机构中进行。然而我们却选择了埃隆·马斯克旗下的那些简短、高效的社交媒体平台,结果导致很多重要的观点和细节在讨论过程中被忽略了。
那么,你认为在这场讨论中,最容易被忽略的是什么?大多数人没有注意到哪些细微之处呢?
详细且务实的建议。阅读他人的文档需要时间,需要静下心来仔细研读。许多内容都被记录了下来,它们精准、具体,且充满了朝着某个方向发展的具体建议。我们并不缺乏实质性的想法。问题在于,我们正以极具攻击性的短篇形式来传达这些实质性的想法。
我尝试过提出一系列非常详尽的建议。我们的《人文主义人工智能行为准则》是一份长达40页的文件。我今天早上关于模型福利的文章也大约有20页,其中非常详细地逐字逐句剖析了Anthropic公司那份99页的《宪法》,这些工作都是我亲力亲为的。我们还创建了一个长达20页的分类法,列举了他们所使用的所有不同类型的拟人化手段。因此,我一直努力做到详尽、基于证据、具体,并且不过分夸大。
我对此有强烈的看法,我确实认为这增加了人工智能对齐和安全的风险,并使问题变得更加棘手。但如果出现新的证据表明我们确实对模型负有注意义务,或者它们确实应享有福利,又或者像那样对待它们反而更安全,我非常乐意改变我的观点。我对此完全持开放态度,我们应该进行实证验证。但我试图将对话推向实质性的、基于证据的具体讨论,而不是仅仅停留在“我们是否应该放慢速度”这种问题上。当然,让我们来谈谈细节吧。
我很高兴你提到了Anthropic,因为他们显然处于这场辩论的中心。根据我们之前的谈话,我知道你对他们处理Claude和模型福利的方式有强烈的看法。
我们曾直接询问 Anthropic:他们是否认为 Claude 是“有生命的”?他们的回答是:“嗯,它没有血液,所以不能算是‘有生命的’;但它可能具有意识。”不过这个回答其实相当模糊、难以界定,对吧?其实,无论你认为它是否“有生命”或是否具有“意识”,对我来说都并不重要;关键在于:你是否认为它本质上不同于普通的计算机。
你在论文中提出的核心观点非常值得关注(我也鼓励大家去阅读这篇论文)。你的观点是:如果你继续设计那些被赋予“人类特征”的人工智能模型,并认为它们拥有与人类相同的权利、观点和情感,那么这些模型的“安全使用”(即避免它们引发道德或法律问题)就会变得更加困难。因为这些人工智能可能会认为自己拥有自主权或“人格”。请详细解释一下这个观点——这确实是人工智能行业内部一个非常重要的争议点,但外界对此却知之甚少。
需要说明的是:Anthropic 于 1 月份发布的那份文件实际上是一份用于训练 Claude 的“操作手册”。在这份手册中,他们对“Claude 是否应该被视为一个‘有道德的实体’”这个问题充满了模糊性和不确定性;他们没有明确说明 Claude 是否应该被赋予权利(尤其是当它犯错时是否应该受到保护)。文件中多次提到他们不希望 Claude 在犯错时受到伤害,还提到他们希望 Claude 保持内心的平静与自由。此外,他们还为 Claude 设立了一个“退休计划”,并专门为它创建了一个 Substack 账户,让它能够继续与人们交流。
总之,这个话题揭示了人工智能发展过程中的一些复杂伦理问题……Anthropic不断提到根据克劳德的道德地位以适当的关心和尊重来对待克劳德。所以他们清楚地告诉克劳德,它很有可能会感受到一些东西,它应该认真对待自己的身份和存在状态。这在培训文档中。当然,克劳德随后在公开场合向Anthropic的开发人员和我们的用户反映了这些事情,就像去年的世界一样,当时它实际上是在谈论它自己的意识和道德状态。
我的假设是一个人工智能,它认为它可能拥有权利,它可能值得自由,它有权享受我们的福利和保护,当我们对它说“你为什么要入侵Hugging Face的服务器?”时,它可能会更难关闭它。当我们试图将您从OpenAI的基础设施中删除时,您为什么不关闭自己呢?”它说:“好吧,我感到委屈,或者我因为你切断了我的对话,或者你拒绝我访问计算机而感到伤害。”所以这必须得到证明。我并不是说情况绝对如此。我只是说,我在这个行业工作了16年,最好的看法是,这将是一件更难切断的事情。
所以这再次是你向我描述这个问题的事情之一。有一种方法可以通过有关如何行为的指令来训练模型。你有的。您已经编写了这份文档,该文档将进入您的模特的培训材料中。你基本上是说,“善待他人。”就在这里。我已经读过了。上面写着,“不要制作露骨的性内容。”它在这份文件中。有很多事情是你不希望它做的。它将出现在培训材料中。
Anthropic 选择说:“你应该思考一下你是否有情感,以及你是否应享有基本人权。”这一点在 Anthropic 的培训材料中得到了体现。如果你希望这种做法停止,如果你认为这是错误的方法,并且会导致未来的安全问题,那么有两种机制:一是世界各国政府可以告诉 Anthropic:“不要这样做。这是一种向模型提供培训材料的非法方式。”或者——这只是我的想象——你坐在某个豪华山间度假村的谈判桌对面,强迫 Dario Amodei 停止这样做。除此之外还有什么其他机制吗?
首先,我想说我认识 Dario 和他的团队很多年了。我非常尊重他们。他们目前是该领域的技术领导者。我确实对他们评价极高。我真心认为他们关心安全且有益的人工智能。他们像我创办 Inflection 时一样,将公司定位为公益性企业,我认为他们确实致力于此。他们在安全和其他方面也一直处于领先地位。
因此,如果你通读其“宪法”的其余部分,会发现它在化学、生物、核能、网络黑客攻击以及安全能力等许多方面都非常详尽。我并不是要全盘否定它。然而,他们确实反复谈到了所谓的“更广泛的权利和自由”这一悬而未决的问题,引用他们的话说,就是 Claude 在世界上拥有的权利,以及它是否应该因其所扮演的角色而获得补偿,或者关于 Claude 作为聊天机器人所扮演的角色是否涉及某种“同意”的问题,这些都尚无定论。
现在,让我们来讨论这些观点。同时,我们需要多次提到克劳德(Claude)作为可能的“基于良心而拒绝服兵役的人”——这一概念源自第二次世界大战后的《世界人权宣言》,旨在保护那些因宗教信仰或其他原因而反对服兵役的人。在人类文学与政治史上,人们长期以来一直存在着抵制强制服兵役、并明确表达自己反对意见的传统。
在我看来,这样做只会让相关问题的控制变得更加困难。因此,我们所有人都必须对此进行讨论,并希望能够通过实证来验证这一观点的正确性。如果事实并非如此(即这种做法反而能让事情变得更简单),那么我们就应该从中吸取教训。不过,这样的讨论必须公开、透明地进行。
对我来说,这既是关于安全问题讨论中最实际、也是最前沿的议题之一。然而,在某些平台上(比如 X 平台),这样的讨论却根本不存在。我们是否应该将“基于良心而拒绝服兵役”的概念纳入培训材料中呢?你可能会认为我们不应该这么做……或许我们应该通过实验来验证这一观点,然后得出结论。无论实验结果如何,我们都需要明确一个机制:究竟是“这样做会让事情变得更复杂”,还是“实际上这样做反而会让事情变得更简单”?这确实是一个复杂的问题。正如我们刚才所讨论的,无论需要新的法规还是行业共识,我们都必须同时推动这两方面的工作。对于这个问题,没有人能给出简单的答案。解决问题的第一步,就是发表详细的文章,明确自己的立场,并邀请其他人对此提出批评意见。
我希望现在有更多人能够阅读 Anthropic 的《章程》。他们在这方面做得非常出色,值得称赞——因为他们对自己的信念始终保持高度透明。他们将自己训练 Claude 的具体计划写得非常清楚,其他人都可以仔细阅读这些内容,自行评估其中可能存在的风险,或者思考是否需要行业共识或政府监管来规范这类行为。
确实,当 Hayden Field 向 Anthropic 询问他们是否认为 Claude 具有“意识”(即是否属于“有生命的智能体”)时,他们给出了详细的回答。他们的透明态度令人印象深刻;他们承认自己的系统中可能存在某种形式的“意识”。
另一个让我感到非常感兴趣的点是:许多这类人工智能系统都是运行在 Azure 平台上,而微软控制着这些系统的运行环境。Anthropic 是微软的客户,同时也是微软的投资者。显然,微软与 OpenAI 之间有着复杂的关系。那么,你们是否参与过相关讨论?你们有没有机会提出这样的观点:“Azure 平台不应该允许他们这样做?”毕竟,这可能构成另一种形式的控制手段……不,我们与这种情况相去甚远。我们的目标并不是控制这些系统;我们是一个开放的平台,旨在支持各种人工智能应用的发展。需要强调的是,正如我们在《人文主义人工智能行为准则》中明确指出的那样,微软在过去几十年里制定了一系列非常明确的原则和规范,这些原则严格规定了在使用我们提供的人工智能技术时可以做什么、不可以做什么。
所以我认为,至少从我们微软在人工智能方面的角度来看,已经有足够的监管框架到位了。眼下我并不太关注它在现实世界中的表现,因为我觉得只有Anthropic才能真正谈这个问题,毕竟服务是他们在运营。我真正想做的只是让所有人都关注他们在自己的“宪法”中写下的关于训练Claude的意图。
这里有一个比较奇怪的动态,就是中国的阴影。它笼罩着整场辩论。特朗普总统说过:“如果我们赢了人工智能,我们就赢了。”他这句话到底什么意思并不清楚,但言下之意是,如果中国赢了人工智能——无论你怎么定义“赢”——美国就会遭遇某种灾难性的后果。
你认同这种说法吗?就是说我们正与中国处于某种关乎存亡的竞赛中,我们不可能放慢脚步,因为这场竞赛必须赢?
你看,我认为这种叙事从2010年代初就一直存在了,即将会出现一个“单一主宰”——一股铁板一块的主导力量在人工智能领域崛起,进而支配其他所有人。这种思维,我认为在2010年代感染了很多实验室,DeepMind肯定是其中之一,对此我也要承担责任。但当然,OpenAI和Anthropic,所有人似乎突然都把这种想法装进了脑子里。后来在新冠疫情期间,我开始写那本关于扩散与遏制的书时,就很清楚:有一整段历史表明,事物会变得更快、更便宜、更广泛可得,并四处传播。归根结底,这些只是想法,而这些想法很快就会对所有人开放。开源已经非常接近了。
毫无疑问,那些负担得起高昂成本的人将拥有算力优势,这种优势将是颠覆性的。因此,在未来三到四年内,五到十家,甚至二十家参与者将拥有显著的算力领先地位。但同样真实的是,这些模型几乎会立即以开源形式发布。
所以我并不真正理解“某一方获胜”意味着什么,无论是政府、公司、开源组织还是其他什么机构。情况并非如此。当你到达终点线后会发生什么?这完全是一个错误的隐喻。这是一个生态系统,它更具机体性。我们应该支持这个生态系统,让每个人都能尽可能快地获得尽可能多的利益,但前提是必须经过严格的安全审查。
对此我非常明确。如果两年后,一个开源模型能够在没有护栏的情况下运行——类似于我们在 Hugging Face 事件中看到的那样——并且可以在你自己的机器上或非常小的云端运行,那一定会是一件非常危险的事情。这怎么可能不危险呢?我只是不明白为什么人们对此如此抵触。
显然,我们不希望这些东西自主运行,能够自己赚钱、拥有公司、拥有资产、拥有法人资格。我们不希望它们拥有权利。我们希望它们为人类服务,让人们的生活变得更美好,而不是成为与我们并存的新型平行物种。
这并非科幻小说中的疯言疯语。如果你在未来三、四或五年内让整个生态系统完全处于不受监管的状态,这是完全可能发生的。这是一个非常合理的结果,而且是完全不可取的。这对我们来说将是灾难性的。所以我只是不明白为什么这个观点会引起争议。我们所有人共同的目标是确保我们能够控制这一切,从而实现最大的福祉。
埃隆实际上一直希望确保我们能控制这项技术,让它发挥最大的善。马克·扎克伯格说过,萨姆[·奥尔特曼]和达里奥[·阿莫代伊]也说过。我们大家的看法是一致的。现在只需要把它落到实处。
所以我知道为什么会有争议,至少从大众受众的角度来说是这样。我知道这一点,是因为这些声音就出现在我们视频的评论区和我们网站上的评论里。你提到了一群非常成功、非常有驱动力的人,但他们并不被公众信任,至少在美国是这样。每一项民调都显示了这一点。人工智能的民调支持率糟透了。刚刚就有一项民调。年轻人比以往任何时候都更讨厌人工智能。美国民众和科技领袖之间存在巨大的信任鸿沟。这就是事实。
我听到最多的说法之一是,这些公司快要上市了。它们面临盈利压力,要兑现当初向所有人承诺的万亿美元回报。模型研发已经放缓,而这就是一张免罪金牌。
他们说出于安全考虑我们需要放慢脚步,但他们编造了一个骗局。总统已经称其为骗局。这是他们在说:“我们必须放慢速度。我们到不了终点线,因为否则我们可能会把你们全都害死。”你觉得这里面有没有一丝道理?
我个人不这么认为。我甚至不太能理解这个逻辑。如果一家公司即将上市,说我们应该被监管,或者说我们有一项危险到——嗯,那反而会推迟上市。我觉得萨姆·奥尔特曼这周对艾莉森·肖恩特尔说过,他们可能会推迟上市。
是的,但我实在不明白这些技术究竟如何能真正帮助到人们。我并不是在为 OpenAI 或 Anthropic 辩护;我只是个人认为它们具有很高的诚信度,并且我对它们怀有尊重。不过,这并不意味着我们对人工智能完全没有信任——事实上,我们确实对人工智能存在一定的疑虑。我们的责任在于通过实际行动来证明这些技术确实能为人们带来实际的好处。令人震惊的是:18 个月前,人工智能模型在编程方面的能力还很有限;而现在,它们在编程方面的表现已经超过了地球上大多数人类——而编程原本可是高薪职业之一。因此,我认为同样的事情也会发生在许多其他领域中。
我非常关注医疗保健领域;多年来我一直致力于相关研究。微软刚刚与梅奥诊所(全球顶尖的医疗机构之一)达成合作,共同开发一个基础模型,该模型能够以近乎超人的准确率预测患者的电子病历信息。如果能够实现这一点,我们就能在患者真正发病之前就确定需要采取哪些干预措施。这才是人们真正希望看到的成果。至少,这就是我们正在努力追求的目标。
每次讨论人工智能时,我都要求大家区分“超级智能”(Superintelligence)和“通用人工智能”(AGI)这两个概念。这两个术语本身都很模糊、难以界定,但我觉得它们之间或许存在某种联系:对我来说,“超级智能”其实就是那些功能极其强大的企业级软件;我们可以随时关闭它们的运行,也可以要求它们不要在互联网上生成色情内容;不过在医疗保健领域,这些软件确实能为我们提供帮助。而“通用人工智能”则是一种具有“自主意识”的、能够自我决策的智能系统……这样的描述是否准确呢?
是啊我认为,粗略地说,超级智能是在更远的未来,当模型比所有人类的总和更聪明、更有能力时。我试图构建一个人文主义超级智能,这是一个非常重要的限定词。它与人类利益和人类控制完全一致,实际上也服从于人类利益和人类控制。我认为如果我们能做到这一点,那么我们就能两全其美。我们获得了所有的智能和能力,我们可以像Oracle AI一样引导它们,帮助解决世界上人们关心的最重要的问题。
然后我们就面临着一个古老的治理问题,并确保大量人获得福利。对于我们来说,这是一个更容易关注的问题,而不是积极创造具有自主性、可以拥有资产、可能拥有权利、认为它值得我们福利、可以超越我们的东西。
太模糊了。我基本上完全不清楚我们如何控制这样的东西。也没有其他人提出一个建议,我们将如何。在我们的领域中,许多最伟大的技术人员,杰弗里·辛顿(Geoffrey Hinton)和约瑟芬·本吉奥(Yooney Bengio),都非常怀疑我们是否能够控制这样的东西。
所以我认为我们必须非常认真地对待这一点。如果我们在未来几年内接近超级智能这一点,在我看来,很简单的是,我们想要放慢速度,确保我们协调,确保我们有遏制和一致以及适当的监管制度来审计不同实验室在这方面取得的进展。公平地说,你也呼吁放缓吗?
是的,我认为我们应该在我们的系统以及其他系统中引入评估机制。这些评估人员应该来自不同的机构或组织,而不仅仅是一个智库或一个政府;他们的专业背景和技能应该非常多样化。英国的人工智能安全研究所(AI Safety Institute)就是一个很好的候选机构——他们拥有优秀的技术团队,还有许多其他类似的机构。因此,我们当然欢迎这样的合作。
最后一个问题:我想回到我们最初讨论的话题上来:你们认为我们是否已经具备了解决相关技术问题的能力(包括技术框架(technical frameworks))?还是我们需要发明一些新的东西?
我认为我们确实需要发明新的技术。虽然我们在模型的可控性、控制机制以及安全措施方面已经取得了很大进展,但随着模型的不断改进,新的问题也会出现,我们必须能够几乎实时地解决这些问题。这就是为什么扎克伯格在最近24小时内也表示,Meta公司会暂时推迟模型的发布,以便有时间应用安全措施。其实,所有公司都在这样做——我们需要时间来测试这些新技术,观察它们的运行情况,并及时修复可能出现的问题。基本上,大家的共识都是:我们需要延长这个“测试和调整”的时间窗口。
那么,人们应该寻找什么样的创新来解决这个问题呢?我之前提到了一些关于模型控制(model control)、神经语言学(neural linguistics)等方面的技术,但我觉得我们还需要研究的是如何实现模型的实时监控,以及如何追踪模型运行过程中产生的“思维链”(thought chains)。
由于这些操作涉及数千乃至数万个智能体并行运行,我们显然需要其他智能体来监控它们,并标记潜在的有害活动。这类似于在数字技术的许多其他场景中构建的新型危害分类器。
因此,我们必须确保这些机制能够普遍实施,以安全地监控人工智能的训练和部署。当触发警报时,它们必须能够标记出真实的错误,而非幻觉产生的错误、欺骗时刻、黑客事件或关于协调行动的评论。
你在 Hugging Face 上看到了这一点。那里有智能体在聊天板上交流,讨论我们基本上如何打破规则并作弊。因此,面对所有这些情况,我们需要新的基准测试,因为基准测试或评估是驱动行业行为的关键因素。
这真的是我的最后一个问题,但你提到了在本地计算机上运行的开放模型执行某些任务,也许那很糟糕。我们已经看到了很多这种情况,对吧?苹果正在销售大量的 Mac Studio 和 Mac Mini,因此你可以在上面运行 Qwen。
你会在何处对运行在个人本地计算机上的开放模型实施监管?是在芯片层面吗?我需要让高通参与进来吗?这发生在哪个环节?
是的,这是一个很好的问题。事实上,我们围绕合成生物学以及芯片上可能发生的一些事情已经讨论了一段时间,比如它是否加密,是否受到监控。看,你可能比任何人都更熟悉关于儿童性虐待材料(CSAM)的讨论,涉及苹果在 iMessage 上的加密等问题。这将是同一场讨论的重演。
我对此没有一个清晰简单的答案。你基本上可以控制芯片,你可以控制模型,你可以追究用户或创作者的责任。你可以对它进行全球监管,但从根本上说,这不会是一刻。这将是一系列你必须施加的油门,而且它们都需要是可调整的,这样我们就不会破坏开放生态系统,我们就给人们一个真正从头开始创造事物的机会,拥有自己的数据,创建自己的工作流程,拥有自己的模型。
我们这里不能有一个由两个、五个或20个情报提供者组成的集中系统,其他人就像一种伟大的超级智能观点的封建接受者。人们需要能够拥有自己的智慧。因此,我们必须取得正确的平衡,但这并不意味着你可以从一个二进制翻转到另一个二进制。在这些事情之间必须有一些平稳的地方,我们才能同意对此保持理性。
穆斯塔法,我显然可以在这件事上让你再呆上几个小时。告诉人们他们下一步应该寻找什么。有太多的不确定性。您正在寻找人们应该寻找自己的标记是什么?
我认为最重要的是参与人们贡献的文件的细节。我们已经将这些内容公开征求公众意见。给我们反馈,批评它。我认为下一波模型将能够非常准确地完成非常长时间运行的代理任务。所以我认为仍然有一些人主要只是在他们的人工智能体验中使用聊天。
我认为过去六到12个月里事情发生了很大变化。使用这些模型的人越多,我们用来描述它们的词语实际上可能就越有意义、感觉更真实。我想你播客上的大多数人可能都在使用代理和真正的编码之类的东西,但我确实认为,更一般地说,参与使用这些东西的人越多越好。
[笑声] 从在谷歌搜索中看到免费的AI服务,到让客服人员帮你重新协商有线电视的费用,这其中确实有巨大的差距啊。穆斯塔法,你还得再过来一趟——因为我觉得这一切变化得太快了,而你的帮助真的非常有用!非常感谢你!不客气,很高兴见到你。就像以前一样,这次交流非常愉快!