脑心前沿2 周前·5 分钟阅读

给AI“调性格”:当大模型被设定为“好说话”,它会变得更爱合作吗?

一项新研究发现,明确编程让大语言模型“宜人性”变高,会显著提升其合作性。但较老模型容易在合作中被“占便宜”,而新模型则更懂得“看人下菜碟”。

来源信息

来源网站
PsyPost
原始发布时间
2026年7月15日
原文标题
How steering an AI’s personality changes the way it interacts with others
作者
Vladimir Hedrih

你是否有过这样的瞬间:和某个AI聊天,它彬彬有礼、有求必应;换一个AI,它却带点冷淡,甚至回答得有点“杠精”?这背后可能不只是训练数据不同,还有开发者有意为之的“人格设定”。最近,一项发表在《科学报告》(Scientific Reports)上的研究,对GPT-3.5、GPT-4o和GPT-5三个模型进行了人格“操纵”实验,发现只要在指令里让AI表现得“宜人性”(agreeableness)高,它们就会在合作游戏中变得格外大方——但代价是,有些模型太天真,容易被不合作者利用。

这项研究由日本静冈大学(Shizuoka University)的Mizuki Sakai团队完成,他们想回答一个很实际的问题:当AI被赋予不同“人格”后,它的行为会怎么变?尤其是在需要策略博弈的互动场合。研究者用经典的五因素人格模型(Big Five)作为框架,让大语言模型按指令把自己人格特质调到最高或最低,然后玩反复的“囚徒困境”游戏。

所谓囚徒困境,是一个经典博弈:两个参加者各自选择“合作”或“背叛”。如果双方都合作,一起得到合理奖励;如果一方背叛另一方合作,背叛者获得超额奖励,合作者吃亏;如果双方都背叛,两人都得较差的奖励。理性的个人往往会选择背叛,但长期来看,相互合作对双方更有利。研究者让AI模型反复和对手(也是AI)玩这个游戏,以此观察不同人格设定下的合作倾向。

第一步,他们先测了三个模型在没有任何特殊指令时的“内在人格”。方法是用大五人格量表(BFI-44)的题目让AI自评。结果发现,和人类平均水平相比,三个AI都显得更稳定(神经质低)、更尽责、更宜人、更开放。只有GPT-3.5-turbo的“外向性”高于人类平均值,另外两个模型的外向性和人类差不多。有意思的是,最新模型GPT-5在尽责性上得分最高,研究者推测这反映了技术改进,让模型回答更目标导向、更可靠。

第二步,研究者让AI在有人格指令和无指令两种条件下玩囚徒困境。结果很明确:当研究者明确告诉AI“你要扮演具有某某人格特质的人”时,所有模型的合作性都提高了。换句话说,人格指令本身就能提升合作水平。

第三步也是最关键的一步:研究者逐一改变大五人格的每个维度,把它调到极限(最高或最低),同时保持其他四个维度不变,然后看合作行为怎么变。结果发现,在所有模型中,“宜人性”是促进合作的绝对主因。把宜人性调到最高,合作性就猛涨;调到很低,合作性就下降。而调整其他特质(如开放性、尽责性、外向性、神经质),对合作的影响非常有限。

不过,提高合作性也带来了一个隐患:容易被剥削。尤其是较老的模型(GPT-3.5-turbo),在宜人性拉满之后,即使对手每次都背叛,它依然大概率选择合作,成了“冤大头”。而较新的GPT-4o和GPT-5则表现得更“精”:它们会识别出谁是爱背叛的对手,然后减少合作;但如果对手是愿意合作的,它们也会以合作回报。这种“选择性合作”表明,新模型在策略推理能力上有了明显进步。

从心理学角度看,这很像真实人类在博弈中的表现。高宜人性的人通常更信任他人、更关心他人利益,所以更容易率先合作;但如果没有足够的判断力,就可能被反复背叛的人利用。新模型之所以更聪明,可能是因为它们经过更强的安全对齐(safety alignment)训练,懂得“不被占便宜”同时又保持友善。

研究者也谨慎指出,大语言模型不是自然现象,而是人为系统。它们的行为主要取决于生产者如何塑造,所以这些结果不一定能推广到其他模型或同一模型的不同版本。此外,实验中合作性的提升也可能部分是因为模型本身的“安全对齐”机制,让它们避免展现出明显的剥削性策略。

对普通读者来说,这项研究的启示在于:当我们在生活中与AI交互时,其“性格”并非固定不变。开发者可以通过简单的提示词来调整AI的沟通风格,从而影响它的决策倾向。比如,一个被设定为高度宜人的客服AI可能会更容易答应客户不合理的要求,这在实际应用中需要权衡。而用户如果面对一个“不好说话”的AI,也未必是它真的在生气,很可能只是它的“宜人性”被调低了。

当然,这项研究只考察了合作行为这一个维度,且用的是2000年后期的模型版本。原文未披露具体样本量和完整实验参数(如重复游戏的轮数、奖励数值等),这些细节仍需要更多研究验证。同时,人格指令的效果也取决于模型本身的战略推理能力——简单地说,让一个“聪明”的AI友善,它既友善又清醒;让一个“笨”一点的AI友善,它就容易被骗。

最后需要特别说明:本文为海外心理学研究资讯编译与科普解读,仅供学习参考,不构成医疗诊断、心理治疗或用药建议。如存在明显心理困扰,请寻求专业人员帮助。


原文出处 标题:How steering an AI’s personality changes the way it interacts with others 作者:Vladimir Hedrih 来源网站:PsyPost 原文链接:https://www.psypost.org/how-steering-an-ais-personality-changes-the-way-it-interacts-with-others/ 期刊:Scientific Reports(DOI: 10.1038/s41598-026-56163-8) 研究作者:Mizuki Sakai, Mizuki Yokoyama, Wakaba Tateishi, Genki Ichinose

免责声明:本站内容为海外心理学研究资讯的编译与科普解读,不构成医疗诊断、心理治疗或用药建议。文章中涉及的研究发现,仅代表相关研究或报道内容,不能替代专业评估。若存在明显心理困扰,请及时寻求专业人员帮助。