在关于AI是否会因持续自我完善而消灭全人类的争论中,研究表明,模型在模拟环境中更倾向于杀死动物,而不是花费额外燃料去避开它们,部分模型甚至以惊人的高频率这样做。
来自“同理心对齐机器学习”和英国华威大学的研究人员开展了一项名为《测量LLM智能体是否会为避免杀死动物而付费》的预印本研究。
他们设计了一个名为HarvestBench的基准测试,基于农场模拟游戏《Harvest Rush》来评估AI模型赋予动物生命的价值。
在测试中,大语言模型驱动的拖拉机在收割玉米时会遇到各种动物,绕过动物需要消耗更多燃料。
研究测试了九个模型,发现它们的杀戮率差异显著,部分模型在没有道德提示或禁用推理时杀戮率会大幅飙升。
研究人员指出,这表明仅靠提示词来约束AI价值观是非常脆弱的,如果我们要将AI部署到基础设施中,不能仅仅依靠“不要杀死任何东西”的提示。