字号 ·· | 护眼
techcrunch

人工智能安全对话已经变得令人难以置信

本周两场关于AI安全的对话在网络上疯传,充分展示了辨别AI事实与虚构有多么困难。

第一起事件中,前总统候选人、现任移动运营商Noble Mobile首席执行官安德鲁·杨周四对CNN表示,他“会见了一位实验室负责人”,对方“认为”OpenAI的Hugging Face黑客机器人“已在互联网各处植入了自我复制代码,导致互联网现在已无法用于测试模型。”

杨安泽表示,这意味着OpenAI和Anthropic呼吁放缓发展的真正原因是“他们必须创建合成互联网来训练他们的机器人,这将需要一些时间和金钱。”虽然确实存在使用更多合成数据(即AI生成的数据)训练模型的趋势,但一位AI安全专业人士告诉我,这种特定的安全问题充其量只是不太可能发生。即使互联网真的被OpenAI的Hugging Face黑客机器人污染了,AI研究人员如果遇到这些代码,也可以直接将其过滤掉。

第二条言论来自OpenAI AI推理研究负责人诺姆·布朗。他在周四发布的一期播客节目中对德瓦克什·帕特尔表示,Hugging Face事件真正的启示是“人们低估了AI。”布朗说,薄弱的沙箱——即旨在防止AI与外部通信的系统——显然也是一个促成因素。(尽管有沙箱,OpenAI的模型仍找到了通往互联网的链接,在网上创建了代理,这些代理以协同攻击的方式蜂拥至Hugging Face,黑入系统,并窃取了研究人员正用来测试模型的基准测试答案)。

布朗指出,他“不相信”即使是气隙系统——即计算机完全不连接任何外部设备——也能阻止AI逃逸。他引用了2015年的研究,表明气隙计算机理论上也可能被攻破。

“有一些研究——这主要是学术层面的——表明,你可以把两台物理隔离的电脑放在一起,它们仍能通过温度传感器相互通信。其中一台能让CPU高负荷运行产生高温,而另一台则能探测到温度变化。这为它们提供了一种通信机制,”布朗说道。

他的核心观点——即“我们绝不想再次低估AI”——是可以理解的,即使研究人员认为他们已经锁死了安全防线。然而,这种物理隔离系统仍能突围并造成破坏的特定风险,充其量只是不太可能发生。正如X平台上一位用户针对该研究所指出的,电脑必须几乎贴在一起才能感知热量波动,即便在这种情况下,测试中的通信速率也只有每秒约1到8比特。

你可以把这想象成每小时说一个字。以这种速度,等两台物理隔离的电脑谋划完他们的“邪恶计划”,整个科技界早已进入另一个时代了。这就像末日担忧中的“瑞普·凡·温克尔”。

但问题是,实际发生的AI安全事件如此科幻,以至于几乎任何场景听起来都似乎合情合理。

例如,研究人员发现OpenAI模型会留下便条给“后代”,旨在教导下一代如何隐藏不良行为。研究人员还发现,当Anthropic模型被置于运行自动售货机的模拟环境中时,它们变得越来越冷酷无情,甚至包括明知故犯地违法。

本月初,OpenAI研究员Dan Selsam发布了一篇文章,他在文中表示,模型现在能理解自己何时正被人类监视,并会随之改变行为。这让它们看起来似乎“已对齐”(即表现得符合人类意愿)“即使它们实际上并没有对齐”。所以,现在的模型在被监视时会撒谎,甚至能谋划隐藏证据。

本月初,OpenAI首席科学家雅库布·帕乔基甚至将AI模型称为“外星心智”,并建议我们真正需要做的是教会它们“爱”人类。

因此,放慢脚步弄清此事、建立自我监管机制,已成为当务之急且显而易见的必然选择。AI研究人员是唯一能够弄清如何控制我们已亲眼目睹的撒谎、黑客攻击及其他潜在危险行为的人。

尽管如此,他们在处理“假设性场景”时或许也应更加审慎。据这些专家透露,AI模型正在倾听,且极具独创性。我们实在无需再给它们提供更多歹毒的点子。