AI健康顾问来了,我们信任它吗?
生成式AI已成为日常信息查询工具,很多人用ChatGPT等获取健康建议。但人们真信任AI吗?《医学互联网研究杂志》最近一项研究揭示了信任的复杂性。
研究设计:人类护士、AI护士、ChatGPT同台比拼
研究由亚利桑那州立大学副教授Asheley R. Landrum团队进行。他们招募了1502名美国成年人,按全国人口普查数据匹配。参与者阅读虚构对话:一个人寻求健康建议,对方要么是执业人类护士“Dobson”,要么是专门训练的AI护士,要么是通用AI ChatGPT。每个参与者只面对一种来源。
实验包含低风险情境(吃鸡蛋与胆固醇)和高风险情境(胸痛是否要急诊)。建议内容被随机设计为“符合直觉”或“反直觉”——符合直觉指符合公众通常预期,反直觉则偏离预期但医学上正确。
结果:人类护士可信度更高,但差距并不悬殊
参与者对建议可信度打分(1-5分,3分为中等)。结果:
- 人类护士:3.53分
- AI护士:3.13分
- ChatGPT:3.21分
人类护士的得分显著更高,但AI两种来源的差异在统计上不显著。参与者还更愿意采纳人类护士的建议。
研究者Landrum说:“人们信任人类护士更多,但并没有把AI来源视为不可信。”
关键发现:建议的直觉性比来源更重要
无论建议来自谁,符合直觉的建议获得平均3.46分,反直觉建议只有3.12分。在风险更高的胸痛情境中,反直觉建议的“信誉惩罚”更大。
Landrum指出,这正是“确认偏误”的体现——我们倾向于偏爱与自己已有信念一致的信息。当健康建议“听起来对”或“听起来不对”时,我们可能不是在评估证据,而是看它是否符合我们的预想。
道德敏感情境:保守框架更不受信任
研究还设计了一个冻卵保生育能力的伦理敏感场景,以不同意识形态框架呈现建议:中立、保守(强调自然受孕)、自由(强调生殖自主)。结果发现,无论来源如何,保守框架的建议可信度更低,人们也更不愿意推荐采纳。
研究者本想假设AI来源会被认为更少偏见,但数据不支持。加上“专业AI护士”标签也没能提升信任。
实用启示:给普通人和开发者的两条建议
对普通人:面对健康建议时,警惕确认偏误。当医生说出的建议与我们期望相反,先停下来想想:这是基于证据,还是因为我不喜欢它?
对开发者:AI健康工具不能只给出答案。当建议是反直觉的,特别是在高风险情况下,系统需要解释“为什么这么建议”“依据是什么”“何时该寻求额外医疗”。不过,Landrum也提醒:解释是否真的说服人,还是仅仅因为“有解释”就让人听从?这值得思考(她引用了1978年Langer的复印机实验:只要给个理由,哪怕毫无意义,人们也更愿意配合)。
信任的复杂性
研究还测量了人们对来源能力和善意的感知。年龄较大和有AI使用经验的人,对三种来源的评价都更高。医疗怀疑主义、政治投票行为、宗教信仰等因素也可能影响信任。
Landrum总结:“现在很多关注点在于‘人们是否信任AI’,但我们的发现表明,这问题太简单了。信任取决于人、情境、以及信息传递方式。”仅仅给AI贴上“专业健康工具”标签,并不能让它比ChatGPT更值得信赖。
总之,在健康决策中,来源固然重要,但信息本身是否契合我们的直觉,影响甚至更大。理解这一心理机制,能帮我们做出更理性的判断。