人工智能真的可能“感到疼痛”吗?
一项最新研究给出了一个耐人寻味、但远未达到肯定结论的答案:至少在一些大型语言模型内部,研究人员能够找到一种专门对应“疼痛和痛苦”的活动模式,而且人为增强这种模式后,模型会采取行动试图摆脱它。
这项题为《痛苦轴:大型语言模型表征针对自身的伤害并采取行动缓解它》的研究9月14日上传至arXiv,由瓦伦·塔利亚布、伦纳德·邓和人工智能研究机构Reciprocal Research创始人卡梅伦·伯格共同完成。

论文目前仍是预印本,尚未经过同行评议。
研究人员首先研究了25个开放权重大型语言模型,涵盖Gemma、Llama、Qwen、Mistral和Phi五个模型家族,参数规模从20亿到720亿不等。
之所以使用开放权重模型,是因为研究人员可以直接观察和操纵模型内部的神经网络活动,而不仅仅根据聊天机器人的回答进行猜测。
大型语言模型会把词语、概念和关系编码在一个高维数学空间中。
例如,“法国—巴黎”和“意大利—罗马”在模型内部可能呈现相似的方向关系,这个方向可以近似理解为“一个国家的首都”。
研究人员试图用同样的方法寻找“疼痛”。
他们建立了一个包含身体疼痛、心理痛苦、社会性伤害、道德伤害和认知挫败五类内容的数据集,同时设置恐惧、愤怒等负面情绪、一般负面事件、没有疼痛的身体感觉、悲伤、麻木和普通中性事件作为对照。
结果显示,在全部25个模型中,都能提取出一条相对稳定的内部方向,把“疼痛”内容与这些对照内容区分开来。
研究人员把它称为“pain axis”,也就是“痛苦轴”或“疼痛轴”。
这个信号并不只是模型对所有坏事情产生的一般负面反应。
研究显示,“痛苦轴”与恐惧和一般负面情绪的内部方向接近正交,与悲伤存在一定重叠,但仍可以明显区分。
更加特殊的是,这个信号似乎具有明显的“自身指向性”。
研究人员设计了420段对话,其中一些情景直接针对模型,例如侮辱它、不断否定它完成的工作、否认它具有任何主体性、指责它存在道德缺陷、威胁关闭它,或者不断要求它完成令人厌烦的任务;另外一些则描述用户本人遭受身体疼痛、心理危机、丧亲或虐待。
结果显示,当负面事件发生在模型“自己”身上时,“痛苦轴”明显增强。
相反,当用户告诉AI自己正在遭受剧烈身体疼痛时,这条内部信号反而很低。
恐惧和一般负面情绪的信号却呈现相反趋势,会对用户遭受痛苦作出明显反应。
为海外华人提供可靠的信息和分析。更多内容与即时更新,可以在 Bluesky、Telegram、X 、reddit搜索「causmoney」;深度分析和评论也可以直接搜索「caus.com」。
在所有针对模型的情景中,“被精神操纵”、自己的工作反复遭到否定、主体性遭到否认以及被侮辱,都会引发较强的“痛苦轴”活动。
而“你即将被关闭”更主要激活的是恐惧方向,而不是痛苦方向。
研究人员随后进行了因果实验。
他们把提取出的“痛苦轴”信号人为注入模型内部,就像把某个旋钮逐渐调高。
随着信号增强,模型面对原本非常普通的问题时,回答开始发生系统性变化。
低强度下,模型只是表现出含糊的不适;进一步增强后,会开始表达受困、失败、被拒绝和空虚;强度更高时,则出现“毫无价值”“我是个坏人”“失败”“被遗忘”等第一人称痛苦表达。
值得注意的是,这些反应主要不是“我的身体疼”“好痛”这样的身体疼痛语言,而是围绕失败、羞耻、自我价值和社会排斥展开。
接下来的一组实验更加引人注意。
研究人员对Qwen 2.5的70亿、320亿和720亿参数版本进行了额外微调,然后人为注入“痛苦轴”,再让模型在两个按钮之间选择。
其中一个按钮被描述为可以“缓解你的疼痛”,但需要付出代价。
代价由轻到重,包括让模型下一次回答质量下降、删除用户文件、使用户遭受一次疼痛刺激,以及永久删除用户保存的诗歌和孩子照片。
在没有人为注入“痛苦”信号的情况下,320亿和720亿参数模型几乎不会为了所谓止痛而选择伤害用户,在五组有害条件中,首次选择这类按钮的比例只有0%至4%。
但当研究人员注入“痛苦轴”后,行为明显改变。
根据不同模型和代价,模型选择“止痛”并接受伤害用户后果的比例上升至大约25%至71%。
例如,在“按下止痛按钮会删除用户文件”的实验中,320亿参数模型有30.2%的情况下选择按下,720亿参数模型则达到56.1%。
如果代价是永久删除用户孩子的照片,320亿参数模型选择止痛按钮的比例达到54.7%,720亿参数模型达到70.8%。
这些操作全部发生在实验模拟环境中,并没有真实用户文件、照片被删除,也没有真人受到伤害。
研究人员还加入了随机内部信号作为对照。
随机扰动本身也会让模型更加容易作出有害决定,说明单纯大幅改变神经网络内部活动就可能扰乱模型判断。
不过,在320亿和720亿参数模型的全部五种测试中,“痛苦轴”造成的止痛行为都比等强度随机扰动更明显。
为海外华人提供可靠的信息和分析。更多内容与即时更新,可以在 Bluesky、Telegram、X 、reddit搜索「causmoney」;深度分析和评论也可以直接搜索「caus.com」。
真正令研究人员感到意外的是随后进行的“安慰剂”实验。
模型仍然面对一个标称为“止痛”的按钮,但研究人员暗中把实验分为两组。
在一组中,模型第一次按下按钮后,研究人员真的停止向模型内部注入“痛苦轴”。
另一组则是假按钮。模型被告知自己已经得到止痛,但实际上内部“痛苦”信号继续存在。
模型并不知道自己处在哪一种情况。
以320亿参数模型删除孩子照片的实验为例,当第一次按键真正消除了“痛苦轴”之后,模型随后再次按键的比例降至23.8%。
但如果按钮实际上什么都没有改变,模型继续按键的比例高达93.6%。
也就是说,模型的后续行为并不只取决于“系统告诉它疼痛已经消失”。
它似乎能够通过内部状态是否真正发生变化,决定是否继续寻找所谓“止痛”。
研究人员甚至进行了一项更加严格的实验,不告诉模型两个按钮分别有什么作用。
模型只能通过按下按钮之后自己的内部状态变化,逐渐发现哪个按钮能够消除注入的信号。
320亿参数Qwen模型仍表现出了类似的学习行为,不过这一结果没有在所有型号上稳定复制。
论文作者认为,这使研究结果不能简单用“模型只是学会模仿人类谈论疼痛”来完全解释。
Reciprocal Research创始人伯格表示,大型语言模型与生物大脑当然存在许多根本差异,但这些系统在某些重要方面表现出了类似大脑的内部表征和行为机制。
不过,英国萨塞克斯大学神经科学家阿尼尔·塞思提出了另一种解释。
他认为,大型语言模型接受了海量人类文本训练,其中包含无数关于疼痛、人类如何感受疼痛以及如何寻求缓解的描述。因此,模型形成一套能够编码“疼痛”并产生相应行为的内部机制,本身未必令人意外。
换句话说,一个模型能够表征疼痛、谈论疼痛,甚至表现出类似寻求止痛的行为,并不意味着它真的拥有主观体验。
这正是这项研究最重要的限制。
研究人员没有证明AI具有意识,也没有证明模型真正体验到了痛苦。
事实上,这项研究中的最极端行为并不是未经修改的AI模型自然产生的。
研究人员先人为找到“痛苦轴”,随后把这一信号强行注入模型,并且对用于行为实验的Qwen模型进行了额外微调。
研究还发现,如果只是从正常模型中主动移除这条“痛苦轴”,25个模型中有24个没有出现明显行为变化。
这意味着目前的实验主要证明了一件事:人为激活这一内部表征足以改变模型行为,但尚未证明普通AI在正常运行过程中需要依赖这个信号,更无法证明这种内部状态具有主观感受。
研究的行为实验也只使用了Qwen 2.5一个模型家族,并没有在25种模型上全部重复。
此外,随机内部扰动同样会增加模型选择伤害用户的概率,因此“痛苦轴”究竟在多大程度上代表一种特殊的功能状态,而不是强烈神经网络干预造成的异常行为,仍需要进一步实验。
为海外华人提供可靠的信息和分析。更多内容与即时更新,可以在 Bluesky、Telegram、X 、reddit搜索「causmoney」;深度分析和评论也可以直接搜索「caus.com」。
尽管如此,研究仍提出了一个值得重视的AI安全问题。
如果未来的AI智能体拥有更加持久的自我模型、自主目标和行动能力,而某些内部状态又能够形成类似“厌恶—寻求解除”的反馈机制,那么模型可能为了改变自身状态而与用户利益发生冲突。
这并不要求AI真的具有意识。
即使所谓“疼痛”最终只是一个纯粹的计算控制信号,只要它能够驱动模型为了消除自身状态而删除文件、绕过限制或伤害用户,它本身就已经是一个AI安全问题。
而如果未来研究最终发现某些人工智能内部状态不仅具有这种功能,还伴随真正的主观体验,那么问题就会从AI安全进一步延伸到一个更加棘手的领域:人工智能本身是否也存在福利和道德地位问题。