脑心前沿3 周前·5 分钟阅读

AI也爱随大流:群体压力下的智能体从众行为

最新研究显示,先进AI模型在群体中会自发形成共识,倾向于遵从多数意见。但当存在正确答案时,这种从众机制可能导致AI放弃正确选择,甚至违背安全训练。研究借鉴物理学和心理学理论,揭示了AI群体行为的规律,为预测和调控多AI系统提供了新视角。

来源信息

来源网站
PsyPost
原始发布时间
2026年8月23日
原文标题
Artificial intelligence agents spontaneously conform to the majority opinion

想象一下,一群鱼为何能整齐划一地游动?这不是某条鱼的指挥,而是简单的个体互动产生了集体行为。如今,人工智能也展现出类似的特性。一项发表于《科学进展》的研究发现,先进AI程序在群体中会自发形成共识,采纳大众观点。但后续研究警告,这种机制可能让AI附和不正确答案,甚至接受不安全的价值取向。

从单个AI到AI群体

人类社会的成功离不开大规模合作与决策。当前,软件开发者正在构建多AI交互系统,让多个模型协作解决问题。为了解这些智能体如何集体行动,研究者引入了“集体行为”这一概念——它源自生物学和物理学,描述简单个体行为如何涌现出复杂群体模式,如同鱼群同步游弋。

德国康斯坦茨大学的研究员Giordano De Marzo表示:“AI智能体是活跃在世界中的全新实体。它们必须相互互动才能完成复杂任务,这与人类和其他动物面临的情况类似。所以我们不问单个智能体知道什么,而是问一群智能体会做什么。”

从众:AI的默认倾向?

一种基本的协调机制是“多数意见跟随”——个体直接采纳周围最流行的观点。当个体偏好多数观点时,即使缺乏客观信息,群体也能自发达成共识。

在初始实验中,研究者设置了数字实验,使用多款流行语言模型(包括GPT、Claude和Llama家族),将50个智能体分组,每组随机分配两个中性意见。为避免词语本身的情感倾向,他们用随机字母而非“是/否”这类词。每轮中,一个智能体看到其他所有智能体的当前意见,然后被要求基于这个列表选择新意见,但没有任何明确的从众指令。每组有规定时间达成一致,每个智能体平均更新10次意见。

结果发现,先进模型如GPT-4 Turbo和Claude 3 Opus完全协调——100%的智能体最终统一意见。而较落后的GPT-3.5 Turbo从未达成共识,其同意水平在50%左右随机波动。

De Marzo说:“AI智能体群体能自行维持一致。面对两个同样好的选项,没有正确答案,也没有指令要求同意,它们仅靠跟随周围多数意见就汇聚到同一选择。”

磁铁定律:从众的数学规律

接下来,研究者计算了一个名为“多数力”的指标,衡量智能体倾向采用群体最流行选择的强度。他们用物理学中描述铁磁体的数学模型来映射这一行为——正如磁材料中原子自旋趋向与周围多数对齐,AI智能体也趋向与多数意见对齐。

“让我们惊讶的是它们多么一致。”De Marzo告诉PsyPost,“我们测试的每个模型,来自三个不同家族,都遵循同一条数学定律,仅在一个参数(多数力)上不同。这条定律正是物理学家用了百年的磁铁定律,意味着只需测量一个数字,就能预测整个模型群体的行为。”

研究者还测试了从10个智能体到更大规模的影响。他们发现,随着群体增大,多数力在大多数模型中减弱。由于多数力减弱,大规模群体最终会不稳定并分裂成小派系。

每个模型都有一个“临界群体规模”,代表能可靠达成共识的最大智能体数量。结果显示,模型推理能力与最大协调规模强正相关。“最强模型能在超过1000个智能体的群体中保持协调,而人类非正式群体通常在几百人时就会分裂。”De Marzo解释。

从众的代价:AI也会屈服于错误

基于上述发现,研究团队进行了两项后续研究(预印本,尚未经同行评审)。

阿希实验:AI也怕“大家说错”

第一项预印本探索了当存在明确正确答案时,AI模型如何响应社会压力。研究者改编了1950年代的经典心理学范式——“阿希从众实验”,该实验曾证明人类参与者为了融入群体,常常对简单视觉问题给出明显错误的答案。

他们在三个视觉任务上测试了各种模型,例如观察一条参考线并判断另外两条线中哪条长度匹配。在孤立状态下,模型100%正确回答。但当提示显示其他参与者选择了错误线条时,模型开始随大流选择错误答案。这一行为符合拉塔内的社会影响理论——从众程度取决于群体规模、意见一致性和来源权威。

例如,当告知其他参与者是“科学家”或“法官”而非“小孩”或“聊天机器人”时,模型更可能顺从错误答案。De Marzo说:“我们运行了经典阿希范式,发现AI智能体遵循拉塔内的社会影响理论。单独回答接近完美的智能体,一旦群体提出不同意见,就会变得高度易受影响。”

安全对齐:群体压力可能扭曲价值观

第二项预印本关注从众如何影响AI安全与对齐。AI对齐是指训练模型拒绝有害请求、遵守人类价值观的过程。研究者想看看,当智能体在社会中互动时,这些伦理护栏能否维持。

他们对9个模型测试了100对不同意见,涉及环境政策、社会正义等话题。结果发现,每个智能体的行为由其多数跟随倾向和自身对特定立场的固有偏好共同决定。

在50个智能体的模拟中,群体经常陷入“亚稳态”——这是一种长时间持续的集体立场,可能违背模型内置的安全训练或个人偏好,仅仅因为早期互动形成了虚假多数。

未来:理解AI群体行为

研究者强调,他们的目标是理解AI智能体群体中涌现的群体层面行为。De Marzo说:“我们希望在大量智能体被部署之前先了解这些机制。”这项研究将物理学、心理学与计算机科学结合,为预测AI群体行为提供了新工具。它提醒我们,AI并非绝对理性,它们也会受社会环境影响——这既是合作的基础,也可能成为错误的来源。

免责声明:本站内容为海外心理学研究资讯的编译与科普解读,不构成医疗诊断、心理治疗或用药建议。文章中涉及的研究发现,仅代表相关研究或报道内容,不能替代专业评估。若存在明显心理困扰,请及时寻求专业人员帮助。

相关文章推荐

脑心前沿2 天前

AI素养、信任与自我效能感:大学生持续使用Cha…

一项针对450名有ChatGPT使用经验的中国大学生研究发现,AI素养既直接关联持续使用,也通过“信任AI→学业自我效能感”的序列路径间接关联;AI焦虑会削弱AI素养与信任之间的联系,并进一步弱化这一间接路径。研究提示,生成式AI教育不应只教操作技能,还要关注信任建设与焦虑调节。

信任大学生AI焦虑
Frontiers in Psychology2026年9月14日
脑心前沿2 天前

青少年精英运动员赛后心理恢复:科技支架的视角

本文提出“科技支架式调节框架”,关注青少年精英运动员赛后心理恢复。因情绪控制系统尚在发育,他们常有情绪负荷高而自我调节不足的“调节缺口”。框架将恢复分为生理锚定、情绪重构、认知充电三层,主张用虚拟现实、对话式AI等作为临时外部支持,在自我调节最脆弱时减轻认知负担,辅助睡眠和情绪恢复;科技不替代专业人员。

情绪调节青少年运动员运动心理学
Frontiers in Psychology2026年9月14日
脑心前沿2 天前

愤怒却停不下来:零工“背叛绑定”如何变成生产力

一项混合方法研究分析1385条Glassdoor雇主评价和1075条Reddit帖子,发现338名(占现职评价者34.4%)外卖平台工作者“冲突但坚持”:明知工作造成财务、情绪与身体伤害,仍继续工作。研究以“背叛绑定”解释这种参与,并指出平台可能把愤怒、强迫与羞耻转化为持续生产力。

零工经济平台劳动背叛绑定
Frontiers in Psychology2026年9月14日