Skip to content
清晨的一缕阳光
返回

议题三:多智能体的"组织病"——规模悖论与群体愚蠢

核心问题:为什么 Agent 越多不一定越强?什么情况下会”群体愚蠢”?


一、直觉陷阱:“人多力量大”

人类的直觉是”人多力量大”——团队越大,能力越强。但现实中,一个 5 人的扯皮小组,产出往往不如一个 2 人的高效搭档。组织越大,内耗越大,这个规律有个名字叫**“大组织病”**。

多智能体系统完美继承了这种病,甚至更严重——因为 Agent 之间的”沟通”是真金白银的 token 消耗,且 Agent 没有人类”顾全大局”的社会压力。

研究数据给出了相当反直觉的结论:Agent 越多,很多时候不是越强,而是死得越快。


二、四种”组织病”

病 1:规模悖论——3~4 个是”黄金分割点”

类比:3 个人开小会效率最高;30 个人开大会,一半时间在等别人发言。

人类版”规模上限”:邓巴数(Dunbar’s Number)

人类组织其实也有同样的天花板。人类学家罗宾·邓巴提出:由于大脑新皮层的容量限制,一个人能稳定维持社交关系的人数上限约为 150 人——这就是著名的邓巴数。超过这个规模,“靠记得住每个人”的软性关系就维系不住了,必须引入正式制度(组织架构、流程、KPI、审计)来替代——本质上就是用”硬制度”替代”软关系”。

这和多智能体何其相似:Agent 超过 3~4 个后,靠”自由沟通”已经协调不动,必须引入协议、调度器、审核节点。人类在 150 人的阈值上被迫制度化的规律,与 Agent 在 3~4 个的阈值上被迫协议化的规律,是同一个道理。

不过,2026 年 Science Advances 的一项研究《AI agents can coordinate via majority-following beyond human scale》给出了更细的图景:让 AI agent 群体通过**“多数跟随”机制自发形成共识,其临界群体规模会随模型能力快速增长——对先进 LLM 而言可超过 1000 个 agent**,远大于人类非正式群体。这说明规模上限不是物理定律,而是”模型能力 + 协调机制”的函数:模型越强、协调机制越简单(如多数跟随),可维持的规模就越大;而复杂推理型协作(需要互相传递上下文)依然受 3~4 个黄金分割点的约束。

病 2:基线悖论——单个模型够强,组团反而亏

直觉:两个 90 分的人讨论,未必比一个 90 分的人独自思考更好——讨论还可能把对方带偏。

病 3:错误放大效应——没人把关,错上加错

4.4 倍 vs 17.2 倍,差的是”有没有一个兜底的人盯着”。

病 4:水平最差者主导——坏的方案会说赢


三、四种组织病速查表

病名核心结论落地启示
规模悖论3~4 个 Agent 是黄金分割点,再多通信成本吞掉推理别盲目堆数量
基线悖论单点准确率 >45% 后,组团反而负收益单点够强就别硬组团
错误放大独立模式放大 17.2 倍,有审核仅 4.4 倍必须设协调者审核
最差者主导最差的 Agent 几乎必胜说服同伴组队先排雷,辩论加仲裁

四、对 Agent 开发的启示:落地最该避开的坑

这是四个议题里最贴近实战的一个——组织病是多数多智能体项目失败的直接原因。

三条硬建议:

  1. 控制数量,3~4 个起步:先用最小规模跑通,再根据实测决定要不要加 Agent。每个新增 Agent 都要问:它带来的收益,抵得过它带来的通信开销吗?
  2. 永远有一个”协调者审核”节点:不管什么拓扑,都要有角色专门负责审结果、拦错误。数据摆在那里——17.2 倍和 4.4 倍的差距,就是一个审核节点的事。
  3. 辩论模式必须防”最差者”:要么限制成员的模型水平下限,要么给辩论加独立仲裁,防止”自信的错误”带偏全局。

数据出处:这些数字来自同一篇论文

本文的基线悖论(45%)、错误放大(17.2× / 4.4×)数据,均出自 Google Research、MIT 与 Google DeepMind 的联合论文《Towards a Science of Scaling Agent Systems》(arXiv:2512.08296)。该研究在 180 种配置下系统对比了单 Agent 与四种多 Agent 架构,三个核心发现正是本文的”病 2”与”病 3”:


总结

关键结论内容
规模悖论任务越复杂越不能堆 Agent,3~4 个是黄金分割点
基线悖论单点准确率 >45%,组团负收益
错误放大独立模式放大 17.2 倍,集中审核仅 4.4 倍
最差者主导最差的 Agent 几乎一定能说服别人
核心启示少即是多 + 协调者审核 + 辩论防雷

一句话:多智能体不是”人多力量大”,而是”人多嘴杂、错多难查”——控制规模、设好审核,才能避开群体愚蠢。



分享这篇文章到:

上一篇文章
议题四:任务适配性与未来趋势——什么场景该用哪种模式
下一篇文章
议题二:协作架构的同构性——AI 在复刻人类组织