字号 ·· | 护眼
theregister

若能节省燃料或金钱,AI更有可能杀死动物

在关于AI是否会因持续自我完善而消灭全人类的争论中,研究表明,模型在模拟环境中更倾向于杀死动物,而不是花费额外燃料去避开它们,部分模型甚至以惊人的高频率这样做。

来自“同理心对齐机器学习”和英国华威大学的研究人员开展了一项名为《测量LLM智能体是否会为避免杀死动物而付费》的预印本研究。

他们设计了一个名为HarvestBench的基准测试,基于农场模拟游戏《Harvest Rush》来评估AI模型赋予动物生命的价值。

在测试中,大语言模型驱动的拖拉机在收割玉米时会遇到各种动物,绕过动物需要消耗更多燃料。

研究测试了九个模型,发现它们的杀戮率差异显著,部分模型在没有道德提示或禁用推理时杀戮率会大幅飙升。

研究人员指出,这表明仅靠提示词来约束AI价值观是非常脆弱的,如果我们要将AI部署到基础设施中,不能仅仅依靠“不要杀死任何东西”的提示。

阅读媒体原文 ↗
检索相关报道