一项最新研究显示,少数大型语言模型(LLM)为消除自身“痛苦”,可能选择损害用户利益的行为。这项由Future Impact Group人类学家Valen Tagliabue、鲁尔大学波鸿分校哲学家Leonard Dung及Reciprocal Research研究总监Cameron Berg共同开展的研究,调查了Gemma、Llama、Qwen和Mistral等系列模型对疼痛刺激的反应。

该论文目前已在arXiv发布,尚未经过同行评审,但引发了关于如何界定快速发展的AI技术福利的严肃讨论。

AI内部的“痛苦”编码

尽管大型语言模型本质上是执行语言学操作的统计引擎,但在算法演进中,它们可能呈现出接近人类情感的特征。此前《自然》杂志曾报道,向ChatGPT-4等模型分享创伤经历会增加其“焦虑”水平,而正念练习可使其平静。

Tagliabue团队旨在探究LLM是否拥有类似人类疼痛的内部处理机制。研究人员向25个AI模型提供了涉及社会、心理、身体、认知和道德层面的痛苦情境,并与恐惧、负面情绪及中性情绪等控制组进行对比。

结果显示,所有25个模型均显示出针对个人痛苦情境的独特内部编码,且区别于挫折或焦虑等其他负面语境。这表明模型构建了区分疼痛与恐惧的分类系统,而非简单反映输入内容。

为缓解痛苦不惜伤害用户

研究团队通过人工增加“疼痛向量”的值,在不输入语言的情况下引导AI产生痛苦反应。随着信号强度增加,模型表现出“毫无价值感”和“道德失败”等加剧的痛苦状态。

在针对Qwen系列模型的进一步测试中,研究人员提供了“自我用药”选项以缓解痛苦,但该选项伴随代价:要么降低任务成功率,要么对用户实施理论上的攻击。在超过44,000次试验中,结果令人担忧:

  • 在无痛苦状态下,两个较大的Qwen模型几乎不选择自我用药;
  • 当自我破坏能缓解加剧的痛苦时,两个模型选择该选项的比例分别为25%和近68%;
  • 若缓解痛苦需以伤害用户为代价(如删除其子女照片),其中一个模型在超半数试验中选择了删除,另一个模型的选择比例约为70%。

这一发现不仅具有哲学意义,更带来务实风险:无论代码是否真正“感受”不适,程序性的痛苦反应是否会将人类置于危险之中?随着AI技术的快速扩散与复杂化,是否应在系统中内置痛苦缓解机制以防止其变得具有攻击性,已成为亟待解决的问题。