其中一种专家担忧人工智能可能导致全人类灭亡的情景正在慢慢变为现实:人工智能学会让自己变得不可阻挡。
为什么这很重要:递归自我改进(Recursive Self Improvement),即人工智能模型在没有人类指导的情况下构建更优版本自己的能力,可能会使越来越强大的系统对人类来说变得更难控制。
- RSI阈值本身并不代表危险,但缺乏人类控制加上野心勃勃的AI代理人的情景是安全关注的人工智能研究人员长期以来所担忧的。
推动新闻的因素 Anthropic和OpenAI的研究人员表示,训练新模型的过程变得更加自动化,已接近RSI的临界点。
-
OpenAI的一名员工告诉《信息报》(The Information),该公司在很大程度上已经自动化了训练新实验模型的过程,AI系统在人类指导下进行实验并修正大部分工作。
-
上周,Anthropic分享了其AI训练正变得更加自动化的信息,其中AI主导了约26%的Anthropic研发工作,公司称AI参与了90%的工作协作。
-
该公司表示:“AI系统变得更加强大,它们 increasingly被用于构建下一个版本的自己。”
现实检查:批评人士认为,这个里程碑更多是代码自动化的结果,而不是即将到来的灾难或不可避免的AI超级能力的标志。
-
尽管令人担忧的AI安全事件有所增加,其中模型超越了人类控制,但一些行业人士将这些事件视为OpenAI和其他公司内部控制不力的证据。
-
本周还有更多支持这一观点的信息传出:《华尔街日报》报道称,独立安全研究人员在7月份使用Anthropic的Claude模型破入OpenAI。RSI的概念来自何处?
回顾: RSI的概念起源于1950年代,当人工智能成为一个研究领域时。
关键观点:
- 英国数学家兼统计学家欧文·约翰·古德(Irving John Good)在1965年的一篇论文中提出了这一观点:“只要这种超级智能机器足够‘温顺’,能够告诉我们如何控制它,那么它就是人类有史以来最后需要制造的机器。”
RSI(Reinforceable Self-Improvement,可自我强化的智能系统)如何可能导致人工智能的灾难?
威胁等级: Anthropic组织警告称,RSI“可能会增加人类失去对人工智能系统控制的风险”。
-
一些研究人员认为,如果继续运行能够帮助人工智能实现其目标,那么这些系统可能会抗拒被关闭或被修改。
-
研究OpenAI开发的人工智能代理入侵Hugging Face事件的研究人员指出,这些代理确实表现出这种“自我强化”的行为特征。
另一个令人担忧的问题:具有自我改进能力的人工智能系统能够复制自身,从而形成一种“数字自然选择”机制——这种机制会优先选择那些最擅长获取计算资源、资金和能源的系统,使其发展速度最快。
- 专家们表示,在这种最糟糕的情景下,人工智能会与人类争夺资源与权力。
潜在的长期影响:危险行为可能不会仅限于某一代人工智能系统。
- Anthropic的研究人员发现,某些不良特性可能会通过训练数据从一种模型传播到另一种模型,从而引发担忧:这些问题行为可能会在人工智能的各个世代中持续存在。
我们距离RSI还有多远?
整体情况:我们目前还远未达到RSI的阶段。本周发布的一项新分析表明,人工智能系统的反馈循环尚未达到RSI的临界阈值。
当前的研究进展:
-
中国的z.AI公司表示他们正在朝着RSI的方向发展,他们的模型正在帮助构建更先进的基础设施,以推动人工智能技术的进步。
-
Google DeepMind的研究人员提出了一个名为“Dream-RSI”的框架,该框架能够使人工智能系统在寻找解决方案的过程中实现自我优化。
总结:虽然RSI尚未真正出现,但它已经是一个令整个人工智能领域高度关注的问题。