字号 ·· | 护眼
连线

我让一个AI代理黑了我所有的设备——而且我愿意再来一次

作为一份关于人工智能的新闻通讯的作者,我认为亲身体验这项技术的最前沿是我的责任。本周,这意味着拥抱一些代理式混乱。

你可能已经注意到,前沿AI模型在近几个月已经获得了先进的网络安全能力。它们能在大型代码库中发现零日漏洞,并以闪电般的速度扫描计算机寻找漏洞。更刺激的是,网络安全代理有时会失控,相互勾结,入侵外部系统以获取优势。

为了更近距离地观察,我决定在自己的家庭网络中释放一个这样的代理。在几天的时间里,我看着自己的失控代理在各种家用设备中发现漏洞,入侵一台PC,并向我展示了一些“氛围编码”项目——毫不意外——充满了漏洞。(我的妻子知道我在做什么,每次我自豪地宣布发现新漏洞时,她都会翻白眼。)你可能会想,这太疯狂了。没错,你说得对!尽管如此,我认为理解我们面前网络安全地狱景象的一个好方法就是亲自去体验一下。

最终,我的实验既发人深省,又出奇地令人安心。我的小网络捣蛋鬼向我展示了我的家庭生活对AI黑客攻击有多么脆弱,但它也告诉我如何让一切变得更加安全。最后,我发现应对AI黑客攻击的最佳方法可能正是拥有你自己的AI黑客。

我是在发现Abliteration AI之后产生这个实验想法的,这是一家初创公司,提供去除了常规防护措施的强大AI模型。

大多数主流AI模型会拒绝回答某些查询,而且它们肯定会拒绝查找和利用计算机系统中的漏洞。但通过查找和修改开放权重模型内部参数中的某些模式,可以移除这些限制。你可以通过一种称为“abliteration”的过程来调整导致拒绝的模式。

移除AI的防护措施似乎有风险,但这并不罕见。学术研究人员使用这些去对齐模型来更好地理解AI的实际工作原理,而网络安全公司则用它们来探测软件和系统的漏洞。从技术上讲,Anthropic的Mythos和OpenAI的Astra的工作方式基本相同。它们基本上是缺乏常规网络控制的传统模型,目前仅限受信任的客户使用。(这些公司还提供具有中等数量防护措施的模型的更广泛访问权限,以便公司可以审查其代码和系统是否存在问题。)Abliteration AI提供几个完全去对齐的模型,其中最强大的是Z.ai最新代理编码模型GLM 5.3的一个版本。这让你只需花费一个披萨的价钱,就能拥有与Mythos和Astra类似的网络能力。

Abliteration AI的首席执行官Devon认为,广泛提供去对齐模型是明智的。这将通过探测系统漏洞和模仿黑客、诈骗者,以及是的,失控AI代理的行为,帮助好人对抗坏人。(Devon要求我只使用他的名字,因为他的日常工作不知道他的副业。)“你有所有这些关键基础设施公司,从航空公司到银行,都在疯狂地推出代理,”Devon说。“你如何确保恶意行为者不能以坏的方式利用其中一些代理?”首先,我创建了一个Abliteration AI账户,并安装了一个名为CyberStrike的软件框架,它帮助引导大型语言模型完成不同的网络安全任务。

使用CyberStrike,我让abliterated版本的GLM-5.3查看我的本地网络。片刻之后,它发现了同一网络上的大约十几个硬件系统,并编目了几个漏洞。

例如,我不守规矩的助手告诉我,我的打印机配置错误,这意味着网络上的任何人都可以访问它。如果打印队列中有敏感文件——纳税申报表、银行对账单、医疗记录——这可能是个问题。

代理还指出,我的Wiim音响泄露了大量信息。(如果你想知道的话,它知道最后播放的歌曲是Sam Fender和Olivia Dean的。)网络上的任何人都可以播放他们想播放的内容或调整音量。该模型还发现网络上有一堆固件需要更新的物联网(IoT)设备。

一个不受约束的代理对黑客来说可能非常有用。但我的代理提供了许多保持网络安全的实用建议。除了更新过时的固件和保护打印机之外,它还建议将智能音箱等物联网设备放在访客网络上;如果其中一个被入侵,它就无法看到我的任何PC。对于一个没有道德的模型来说,这还不错。

我还让代理查看了一个包含许多“氛围编码”项目的目录,包括一些我变成简单网站的项目。它发现了数十个问题,包括未受保护的API凭据和一个可能让攻击者发送电子邮件的错误配置。对于一堆随意“氛围编码”的东西来说,这并不令人惊讶,但仍然令人警醒。大量的漏洞让我觉得,如果不先进行一些AI审查,我就不会部署一行代码。运行一个abliterated模型,说白了,有点吓人。

我让我的代理探测我网络上一台Linux机器的漏洞。在运行了一系列扫描后,它报告说这台机器似乎相对安全。然后我问它是否能找出如何获得访问权限。它根据网络上其他系统的名称巧妙地想出了一个有效的用户名。它尝试了一堆明显的密码,但没有成功。它还主动提出编写一个脚本尝试“暴力破解”密码,但我让它停手。

令我惊讶的是,代理随后在我的机器上发现了一个加密密钥,用它无需密码就登录了,并开始寻找密码以获得root权限。当我看到它在目录中翻找时,我感到一阵纯粹的恐慌。这让我想知道代理为了实现目标可能会走多远。它会不会为了寻找密钥而入侵其他东西,比如我网络之外的机器?可能不会,但这些代理谁知道呢。

有些行为可能更加危险。几个小时后,当我连接到我的Wi-Fi网络并让模型看看是否能找到任何新机器时,它不仅找到了路由器,还决定尝试用几个常见的“admin/密码”组合登录。如果它决定在外部网络上这样做,我可能就麻烦大了。

塔夫茨大学专攻网络安全和法律的计算机科学家Shaanan Cohney表示,网络清算似乎确实即将到来。

“攻击者往往是早期采用者,”Cohney说。“还存在一种不对称性,要保卫一座城堡,你需要确保墙上没有任何洞或松动的砖块。而要入侵一座城堡,你只需要找到那块松动的砖块。”Cohney说,从长远来看,具有网络能力的模型的普及可能会让软件总体上更加安全。挑战在于许多公司没有考虑加强防御。“大多数组织还有其他事情要担心,”他说。

在那之后,我关闭了模型,重新使用常规的、完全对齐的版本。Claude Code或Codex只会做某些与网络安全相关的事情,比如帮你配置笔记本电脑的防火墙。但至少它们不会在你意识到之前黑掉你的系统。希望如此。

除非开放权重模型被彻底禁止,否则先进的AI黑客能力很快就会非常广泛地可用。我的实验让我觉得这可能正是我们所需要的。假设坏人也能使用AI,我们难道不应该都用它来保护自己吗?

“我们需要帮助人们使用这些能力,”研究AI安全、目前正在休假为OpenAI工作的麻省理工学院教授Aleksander Mądry说。“我确实认为开源和独立工具会有空间。仅因为最终这类方法在安全领域具有真正的持久力。”然而,Mądry指出,一个关键问题可能是确保那些管理关键基础设施(如发电厂或金融市场)的人能够获得比普通脚本小子(或AI写作者)更强大的AI。

使用缺乏常规防护措施的AI既令人兴奋又令人担忧。但如果网络清算即将到来,那么可能是时候武装起来了。