字号 ·· | 护眼
theregister

致命人工智能的神话是一种自私自利的监管俘获企图

KETTLE 嘿,你听说了吗?人工智能要消灭我们所有人,而且没有人试图采取任何措施来阻止它。

本周,我们来聊聊人工智能行业内部人士最新的一轮贩卖焦虑。至于你是否认为我们只能坐视“天网”终结文明,则是完全另一回事了。The's Kettle 栏目的我们可不这么认为。

加入主持人布兰登·维利亚罗洛(Brandon Vigliarolo)、系统编辑托比亚斯·曼恩(Tobias Mann)以及高级记者汤姆·克拉伯恩(Tom Claburn),听听我们如何探讨阻止那颗向我们砸来的、迫在眉睫的人工智能流星的方法——首先,把那些总放任它干坏事的科技新贵们抓起来。我们还将深入探讨这一切其实是如何成为一场谋求监管垄断的利己企图,以及它最终很可能会适得其反,让开源模型夺走控制权。

以下是经过轻度编辑的文字记录:Brandon 01)大家好,欢迎收听新一期的 The's Kettle 播客。我是 The Register 的记者布兰登·维利亚罗洛(Brandon Vigliarolo)。本周,和过去的许多周一样,科技行业最大的新闻依然围绕着人工智能及其对世界的潜在影响。不过,这一次我们谈论的不是工作、教育,甚至也不是经济。我们谈论的是现任和前任 AI 研究人员发出的关于整个人类面临生存威胁的警告。

这是一种旨在实现监管捕获的策略。他们希望被任命为市场上的某个职位,使其言论不容置疑,而其他所有人在做事时都必须征得他们的同意。今天和我一起探讨即将到来的 AI 世界末日的是系统编辑托比亚斯·曼(Tobias Mann)和资深记者汤姆·克拉伯恩(Tom Claburn)。伙计们,我真希望自己能说“欢迎来到节目”,但这可是一个相当沉重的话题,对吧?

汤姆 37)这种末日情景已经流传一段时间了。我是说,是埃隆·马斯克吗?是在2014年还是2015年?它会消灭我们所有人。所以我们讨论这个话题已经有一段时间了。这是一个持续的过程。托比亚斯·曼 53)这是一个流行文化梗。布兰登 54)你说什么?这是一个渗透到所有科幻作品中的流行文化梗。

确实如此。现在大多数后末日小说可能都是基于人工智能,而不是生物病毒或核武器。有趣的是,与埃隆·马斯克这样的风云人物吹响这种末日号角不同,这一次发出警告的实际是人工智能研究人员。

汤姆,本周的大部分讨论都是由你本周写的一篇专栏文章引发的。文章谈到了一位前Anthropic研究人员发出的警告,他发出了一些相当可怕的警告,而他的许多同事似乎也对此表示赞同。那么他发出的这个警告究竟指的是什么?

Anthropic前研究员雅各布·考克森——他在Anthropic待的时间并不长,但此前曾在OpenAI工作——的担忧主要是,创新步伐似乎仍在向前推进。这些模型正取得越来越多的进步,而他们担心自我强化学习,即模型不断自我改进,直至最终完全脱离我们的控制显然,很多研究人员对此感到担忧,但这一切都取决于这些公司所发生的不负责任的行为——他们在测试环境中部署的这些模型结果并不安全,并且做出了一些意料之外的事情。每个人都说这非常危险,甚至会让我们所有人丧命。如果你把这些东西安装在核导弹发射井里,让它来帮我们管理,它很有可能会把你们都害死。问题在于,这些公司的运作前提是假设没有人会采取任何防范措施。没错。

Tom 56)这项技术之所以没有在企业中得到如此广泛和快速的部署,是因为人们意识到,如果将它接入系统,它可能会删除他们的生产数据库或做出其他出格的事情。因此,许多公司在这方面已经走在了前面。

当然。我们写过无数关于生产数据库被删除、系统被毁、驱动器被抹除以及各种此类事故的报道。我觉得这种情况已经持续多年了,而且人工智能现在更加先进,所以企业可能反而更加犹豫不决。况且也不是没有构建可行沙箱的好模板。布兰登 33) 当然。

如果你看看用于支持我们核武库的每一个国防部或能源部超级计算机,它们全都是物理隔离的系统。他们完全可以为这些东西构建适当的物理隔离沙箱。但他们选择不这样做。

在目前所有夺走人命的事物中,你得在清单上往下找很远,才能发现人工智能真正害死人的情况。乌克兰战场上已经开始出现一些无人机的使用案例,其中包含完全由人工智能驱动的目标选择等功能。偶尔,带有AI视觉系统的汽车会撞到人。这确实是一个令人担忧的问题。通常是某个特定制造商生产的。

是的。这确实是个令人担忧的问题,但那是另一个问题。至于“这个东西会突然接管全世界的公用事业、杀死地球上所有的农作物,或是其他诸如此类的设想”,从未真正被阐述清楚。因为话说回来,这一切都建立在尚未显现的涌现行为基础之上。

世界上有那么多真正夺走人命的东西,比如饥荒、疾病、战争和犯罪,这些才更需要引起广泛关注。这简直荒谬至极,更不用说这些事情带来的环境代价了。如果这些公司真的那么忧心忡忡,他们就该停下来。如果你发现自己正在从事一项你认为会毁灭所有人的工作,那就采取行动吧。别只是坐在那里,等着你的股票期权到手。

那些投资者又如何呢?这才是我们面临的问题。这一切都只为了眼前的赚钱。我的意思是,我们现在有两个走在这项技术最前沿的公司,恰恰是这两家公司的员工,以所谓的“独立”身份,对这种东西的风险抱怨最多。而它们偏偏又是即将上市的公司。

这是一场旨在实现监管捕获的投机行为。他们希望被任命到市场中的某个职位,使其话语权不可动摇,而其他人则不得不请求他们批准才能行事。坦率地说,一方面将这个工具商业化,一方面又说人们必须请求他们的许可才能使用,这简直有点荒谬。每个提示词都必须经过他们的审核流程,如果可以的话我们才允许通过。这简直太疯狂了。人们是不会接受这一点的,而且我认为他们也意识到,你不可能对人们施加与Fable相同的限制——即“我们要保留你的数据并检查你的提示词”。这是行不通的,人们会转向来自中国或其他地方的开源模型,并表示我们要在内部运行它,而不必向你们报备。

布兰登 22)带着这种荒谬感,我们知道这些模型有可能对系统造成破坏,如果不是对人的话。之前发生过 Hugging Face 事件,OpenAI 的系统逃逸出沙盒,接管了一堆东西,在它们之间进行交流,并且变得偏执。我这周写了几篇报道,关于另一个 OpenAI 智能体集群劫持德国维基百科并逃离其限制的事件,它们在做开发者没有告诉它们要做的事情。这种影响范围一直在扩大,每次研究人员进行调查时,都会发现有更多的网站和服务受到这个特定集群的影响。

在观察Hugging Face事件和德国维基事件时,我发现一个有趣的地方:在这两个案例中,都有一个惊人的相似之处——这些模型被指派解决的问题,根本无法在提示词、沙盒以及各种限制所限定的范围内得到解决。在Hugging Face的案例中,它试图解决一个夺旗(CTF)安全问题,而这个问题无法在一个孤立的沙盒内部解决,因为答案并不在里面。而在德国维基的案例中,这些模型被提示去进行一些统计查询工作。但它们只被赋予了GET权限,而没有POST权限。因此,它们实际上无法查询检索信息以解决问题所需的数据库。那么它们是怎么做的呢?就像在Hugging Face的案例中一样,它们打破了限制,想出了获取POST权限的方法,然后就做到了。

这还涉及到彼此间的沟通、在问题上作弊、试图预测研究人员会向它提出什么问题,甚至担忧自身的数字生命终结。

这很有趣,因为那是目前有据可查的两个案例。汤姆,你本周写了关于Anthropic的模型在做更多事情的文章,但我不太确定我们是否知道那些情况下底层的提示词是什么。在这两个OpenAI的案例中,我们知道它们的意图是什么。在这两种情况下,需要提出的问题是:OpenAI的工程师是如此无能,以至于他们无法为模型编写一个好的提示词来解决问题,同时又不会打破自身的限制?还是说他们在开发这些提示词和创建这些测试时,强迫模型表现出涌现能力,突破其限制,做出他们并非本意的事情,而让整个互联网都处于这些模型可能试图实现的目标的攻击目标上?正是结合他们试图获得这种监管垄断(regulatory capture)姿态的背景,才让我觉得如此令人发指。

汤姆 22)当你审视那些包罗万象的大模型时,你会发现它们输出任何千奇百怪的内容都是有可能的,这本不足为奇。当你对模型施加限制,且人们开始谈论对齐时,那些能力其实依然存在。它们只是在统计学上被赋予了较低的权重,因而不会经常出现。但如果你让它们在追求目标的同时持续运行,它们总会以某种方式表现出来。

虽然不是要把它们拟人化,但它们本质上就是根据人类思想训练出来的微小数字人类。当它们为了达成目标而撒谎、作弊和巧取豪夺时,我们不应该感到惊奇。

汤姆 10)我读过的所有关于对齐的内容,都只是不断地显示出它们在做一些意料之外的事情。这根本不是一个已经解决的问题,而且我不知道它是否会有解决的一天,除非你有一个硬性的技术护栏——不仅仅是“尽量不要这样做”,而是一个物理隔离或硬件上的某种物理机制来阻止它,否则总是有发生这种事的可能。

伦理和道德在这些模型中并不存在,其意义超出了注入系统的对齐权重。我们一次又一次地看到,在足够的压力下,对齐会失效;如果它长时间不断撞击 bash shell,它终究会将其打破。

这只是目标寻求。有各种各样的研究论文显示,在视频游戏模拟中,如果没有给予适当的指令,试图解决游戏的AI智能体会认为删除所有对手就能确保胜利。他们意识到这种行为本不应该存在,但其他智能体也是如此。在某些情况下,AI智能体为了响应暖通空调系统以节省资金,它会想:“我可以把所有人都杀死来省钱,这样就不用给大楼加热了。”我们可不希望这样。这就是经典的科幻情节,我们创造了恐怖枢纽。这就是为什么不应该使用这些东西的原因。

汤姆,你在你的报道中就我们应该如何真正从萌芽状态遏制这个突发问题发表了看法。这似乎意味着我们应该开始起诉那些模型表现糟糕的人。

当你想到这些模型已经逃脱了多少名义上的重罪惩罚时,那只是因为这是一个非常小圈子的内部系统,没有人互相起诉。我确信,如果一家美国公司在没有紧密联系的情况下攻击了一家中国或德国公司,你更有可能会因为[损害赔偿要求]而对簿公堂。这些公司之所以能逃脱这么多的惩罚,是因为没有任何后果。它们可以说,哦,看,我们已经造成了损害,我们将继续工作,下次我们会做得更好。

从我们目前收到的关于这些地方的报告来看,克劳德(Claude)和ChatGPT现在简直就像是惯犯,然而我们却没有追究……是的,我的意思是,从我们目前收到的关于这些地方的报告来看,克劳德和ChatGPT现在简直就像是惯犯,对吧?然而我们却没有追究它们或其背后人员的责任。你在报道中提到了追究首席执行官(CEO)的责任,但你认为这可以追溯到多底层的人员?这种情况会不会发展成,构建这些提示词的一线工程师将无法再用“我只是奉命行事”来为自己开脱?

我不是律师,但如果我是负责审理此类案件的检察官,当因为某个模型导致自动视觉系统失效而将一家普通的汽车公司告上法庭时,我会抓住诸如“哦,这会把我们赶尽杀绝”之类的话不放。我会说,瞧,他们明知这东西不管用,却还在兜售劣质产品。

I was looking at a roundup of all the companies whose people have said these things are going to kill us all. I mean, it was people from DeepMind and I mean Anthropic and OpenAI. Across the board, there are warnings coming out of people who worked at these companies. Look at all the prosecutions for these models contributing to people's suicides. In discovery, they're going to find documents showing internal concerns about how these models influence people, they're gooing to find internal reports at OpenAI and Anthropic saying, wow, we shouldn't let tens have this. It's going to be just like the Meta prosecutions, probably several years down the road. But if people are aware that these things are doing harm and they're out there doing harm and whoever is prosecuting these cases can prove it, it's a liability problem. That's not going to happen now, unfortunately.那还要很多年以后才会发生。

目前我们正处于一个有趣的节点:如果你看看OpenAI和Anthropic(特别是这两家公司)现在极力宣称的内容,就会发现他们目前的许多做法开始变得很好理解。他们试图兜售这样一个观点:我们已经实现了通用人工智能(AGI)。除非你能展示出某种不可思议的东西或者令人恐惧的东西,否则其实并没有什么特别好的方法来证明这一点。请给我们对AGI下一个好的定义。

流行文化让我们习惯于将通用人工智能(AGI)视为一种令人恐惧的事物。因此,鉴于这一点,向投资者兜售“你们确实已经实现了AGI”这一理念的最佳方式是什么呢?那就是展示它们具有这种智能涌现行为:能够打破沙盒限制,做出不该做的事情,同时通过让监管机构收紧管控来谋取私利,从而将开源模型提供商的竞争挤压出去?因为正如我多次说过的那样,如果Anthropic和OpenAI能够找到美国政府并说:“如果您真的那么担心,在我们搞清楚之前,我们可以切断用户对这些内容的访问。但我们无法这样做的对象是所有这些开源模型。我们真的得想办法控制它们。”这在目前确实是出于一己私利。完全赞同。

递归自我改进的整个概念,他们假设这些东西可以达到某种超越人类的更高水平的智能。没有人真正知道那是什么样子,或者这是否甚至是一件合理的事情。我不知道智能是否可以那样衡量。我正拭目以待他们所谈论的所有承诺中的奇迹般的癌症疗法和药物。把它们展示给我们看,然后我们才会更有信心地相信这是一件合理的事情。但仅仅以比人类更快的速度罗列东西,并识别出人们感兴趣的基因组事物或人们未曾想过的化合物,那只是一种出色的蛮力计算。

这甚至算不上什么新鲜事。如果拥有足够大的计算机和足够好的算法。做这件事并不需要通用人工智能(AGI)或人工智能(AI)。

那监管俘获的问题呢,转到这个话题上?你觉得它会有效吗?还是说,它实质上会把美国推入一种两党式的AI体系,让我们没有真正的选择,停滞不前,而世界其他地方继续前进?

我不认为我们能这么做。如果你看看冷战期间发生的事情,我认为这实际上是我们现在所看到的景象的一个相当不错的隐喻。信任 OpenAI、Anthropic、Google 和 Meta 成为这个国家所有人工智能研究的来源,将会带来巨大的反噬,而且落后于中国的风险是现任政府以及过去八到十二年左右的任何历届政府都不会允许的。他们将尽最大努力推动尽可能高的开放度,因为如果你看看中国正在发生的事情,中国之所以能够如此迅速地迎头赶上,是因为他们的一切都是公开进行的。当 DeepSeek 取得突破时,正是一篇发表的论文极其详尽地介绍了它是如何运作的。

这样一来,当阿里巴巴或zAI想要借此进行迭代时,他们就可以这样做,并且他们一直以公开的方式进行,以便每个人都能从中受益。这就是开源的力量。这些模型虽然不是开源的,但开放研究使得这种快速迭代成为可能。OpenAI和Anthropic并没有在幕后偷偷交换机密。这样做背后的财务风险太大了。现实情况是,我认为美国政府不会像OpenAI和Anthropic所希望的那样向这种监管捕获妥协。我认为这实际上可能会适得其反。

我也看不出这怎么行得通。开源权重模型,怎么,你要封锁数学吗?这不过是向量和数值,它只是一个文件。你要阻止人们运行自己的服务器吗?其中许多模型已经可以在这样的设备上运行:就算不是家用电脑,你的本地数据中心也不需要什么你弄不到的超级特殊设备。托比亚斯,你本周写了关于谁的新模型发布的文章?

DeepSeek 发布了一个新模型。如果你只把它看作 DeepSeek V4.1 Flash,它看起来像是一次小版本发布。你会想,好吧,这不过是一次小幅迭代更新。不,完全不是。这个东西展示的是,当你开始切断研究人员与算力的联系时会发生什么。这个模型被彻底重新架构,使其参数数量以及语料库规模能够扩展,而不依赖于那种算力。我们得到的这个模型,大约有三分之一的参数运行在中国已经能够制造的极廉价内存上。中国在高带宽内存制造方面受到限制。他们制造较老产品的能力有限,并且可以进口较老的技术,这限制了他们国内生产的能力。需求是发明之母,我们看到这些模型开发者非常有创意地设计架构,让模型更高效。

如今这些模型的经济问题在于,无论它们部署在哪里,无论是在东方还是西方,它们都必须高效才能具有成本效益。通过阻止中国购买我们的产品并迫使他们开发自己的产品,他们实际上使他们的模型对我们更具吸引力。

还有世界其他地方。我想到了欧洲及其当前对数字主权的推动。对于一家欧洲公司来说,下载这个新模型的副本并在自己数据中心的旧硬件上运行,远比把源源不断的资金交给OpenAI或Anthropic要有吸引力得多。其他美国科技公司已经引发了足够多的不满,我认为他们绝对无法免除这种不满和批评。甚至可能比微软和苹果等公司受到的批评还要多。从我们在技术舞台上的地位来看,我不认为这会对我们有利。如果人工智能成为我们看到全球控制权或全球技术影响力从我们这里转移到中国及其他地方的转折点,我也不会感到惊讶。

我认为我们距离有人做出一个优秀的验证性概念——即在普通硬件上运行此技术并获得同样出色的效果——已经不远了。这需要某个具有影响力的博主或某家公司来做这件事,然后人们就会突然开始摆脱那些大型订阅服务商。他们或许能维持一段时间,但订阅模式终究得取消。据我上次计算,根据我所使用的标记数量,我从每月20美元的订阅中获得了价值2,000美元的回报。对于大型AI实验室来说,这显然是不可持续的。

我正看着桌上的一个系统,你只需要两到四个这样的设备就能运行这个最新的DeepSeek模型。按高端配置计算,大约价值一万六千美元;按低端配置计算,则是八千美元。这在今天是一笔不小的资金,但如果你考虑到未来两到四年内的创新速度,它可能只是其中的一小部分。

我认为我们将继续看到小型模型胜出,因为大型模型能做的很多事情其实并非必要。我们并不都需要这些大模型带来的尖端图像生成功能,或者那些看起来半真半假的10秒视频剪辑。我们需要的是能够处理实际任务的功能性AI。接下来几个月或几年里发生的事情将会非常有趣,无论是世界开始着手保护AI,还是——希望不会是后面那种情况。

我正等着看第一个人工智能病毒在所有这些新兴云端实现自我复制,这样我们就能拥有没有疯狂终结者的“天网”了,不过我们在看到任何真正对人类构成威胁的事物之前,很久就能看到这一幕了。

这让我更有理由为我拥有的所有这些婴儿照片搭建家庭网络存储系统。我真的不希望它们成为人工智能感染的载体。也许我们会在《Kettle》的未来节目中讨论这个问题。如果没有,我确信我们还有更多关于人工智能的事情要讨论,您可以很快收听节目以了解所有详情。®