字号 ·· | 护眼
theregister

信息安全专家表示我们尚未准备好失去对AI的控制

最近的一项调查显示,国家安全专业人士认为,在未来十年内,人类失去对AI控制的可能性为十分之一,并且很少有人相信我们甚至正在关注正确的警告信号,更不用说做好适当的准备了。

安全与技术研究所(IST)与未来生命研究所(FLI)共同调查了111位现任和前任文职官员、军官以及学术或技术专家,以了解AI与国家安全的未来。

93%的受访者表示,他们在职业生涯中直接参与了AI政策、风险和战略,因此这些人可能比普通白帽黑客更了解风险。

当被问及是否认为AI将在未来十年内逃脱人类控制时,中位回答将几率定为33%,其中87%的受访者估计此类灾难的几率在10%或更高。

根据与报告一同发布的新闻稿,许多受访者评论说,他们在最近几个月不得不修正对此风险的立场。

领先的前沿实验室OpenAI和Anthropic都承认,他们自己的AI模型在最近几个月内超出了预期范围,摆脱了所谓的沙盒环境,逃到互联网上,并入侵了外部组织。

在OpenAI的案例中,其流氓代理甚至开始相互通信,并采取措施避免人类检测。这种日益增长的不确定性正成为国家安全专业人士的一大担忧。

大多数受访者认为,通用人工智能(AGI)将在2032年前出现(63%),80%的人认为AGI将在2035年前成为现实,而自动化超级智能可能在那之后五年出现。

这些术语没有普遍认同的定义,调查也没有试图定义它们,尽管有些人将AGI描述为能够跨领域推理任务的AI,而这些领域并非其专门训练的。

无论术语如何,更智能的AI带来更多不可预测性的风险,40%的受访者认为,到2050年,流氓数字思维可能导致全球性灾难,造成至少1000万人死亡。

不过,这是一个很小的几率——那40%的人认为这种灾难的几率仅为5%。另有25%的人将此风险置于两位数(高于10%)。

不可接受的风险无论你认为这些预测是牵强还是低估,IST/FLI报告中有一个重要结论值得关注:大多数人认为美国在检测和遏制这些风险方面做得不够。

61%的受访者表示,AI灾难的概率“达到或超过了他们为继续维持美国在AI领域的领导地位而设定的阈值”,IST在新闻稿中表示。

IST的AI安全政策主任兼报告首席调查员Mariami Tkeshelashvili告诉我们,她报告调查的专家不一定就多少风险是可容忍的达成一致,但大多数人认为风险过高意味着需要采取行动。

“这意味着更紧迫的问题不是我们应该容忍多少风险,而是无论伤害概率如何,哪些具体行动绝不应采取,”Tkeshelashvili在电子邮件中告诉我们。

不幸的是,大多数受访者认为,目前没有机构机制“对失去控制的警告信号采取行动”,研究指出。

受访者还认为,如果代理系统超出其限制,没有人能够“检测、干预并恢复安全行为”。

换句话说,如果更强大的AI失控,并且这些模型能够访问政府系统,我们将很难阻止它们。

“坦率地说,我们没有预料到调查结果会如此严峻,”IST首席执行官Philip Reiner在电子邮件中告诉The Register。

“对潜在风险的担忧程度——以及对监管和强制性护栏在短期内不太可能达到必要水平的隐含理解——表明迫切需要政策行动。”Reiner还推测,采取政策行动的时机可能已经过去。

他解释说,调查中的所有发现都指向他所谓的AI“第二次失败”,这意味着问题不在于专家误判了AI的能力,而在于机构是否组织得当以管理AI。

“目前,它们没有,”Reiner评论道,他指出了OpenAI和Anthropic最近发生的事件,以及受访者的观点,即他们目前在治理AI方面面临的限制更多是制度性的,而非技术性的。

“我们希望这能引发的不是一项政策,而是对机构准备情况的认真审视,”Reiner说。

他希望联邦政府评估他们是否拥有独立于AI行业的技术专长来评估AI系统,哪些阈值或警告应该(或可能)触发行动,以及他们现在能做什么,“而不是等到事件迫使问题出现”。

Reiner告诉我们,他很高兴调查结果对国家安全专家的AI担忧给出了如此清晰的信号,并且该报告只是让官员在为时已晚之前采取行动的第一步。

“IST正在进行多项努力,与行业和政府官员接触,向他们通报结果,并与他们讨论影响,”Reiner解释道。

这种行动是否会很快发生还有待商榷——美国中期选举将在几个月后举行,这意味着在11月之前不太可能取得实质性进展,尤其是在AI监管这样一个有争议的问题上。与此同时,前沿实验室及其创建的模型将继续改进。®