核心问题:为什么 Agent 越多不一定越强?什么情况下会”群体愚蠢”?
一、直觉陷阱:“人多力量大”
人类的直觉是”人多力量大”——团队越大,能力越强。但现实中,一个 5 人的扯皮小组,产出往往不如一个 2 人的高效搭档。组织越大,内耗越大,这个规律有个名字叫**“大组织病”**。
多智能体系统完美继承了这种病,甚至更严重——因为 Agent 之间的”沟通”是真金白银的 token 消耗,且 Agent 没有人类”顾全大局”的社会压力。
研究数据给出了相当反直觉的结论:Agent 越多,很多时候不是越强,而是死得越快。
二、四种”组织病”
病 1:规模悖论——3~4 个是”黄金分割点”
- 现象:任务越复杂,Agent 数量越多,系统表现反而越差,甚至直接崩溃。
- 原因:Agent 之间要同步状态、传递上下文、协商分工,这些通信开销会随数量指数级增长。当数量超过阈值,通信成本会吞掉核心推理能力——Agent 都忙着互相说话,没工夫干正事。
- 结论:3~4 个智能体是当前技术下的”黄金分割点”。超过这个数量,系统开始被通信拖垮,不是能力不够,是协调成本失控。
类比:3 个人开小会效率最高;30 个人开大会,一半时间在等别人发言。
人类版”规模上限”:邓巴数(Dunbar’s Number)
人类组织其实也有同样的天花板。人类学家罗宾·邓巴提出:由于大脑新皮层的容量限制,一个人能稳定维持社交关系的人数上限约为 150 人——这就是著名的邓巴数。超过这个规模,“靠记得住每个人”的软性关系就维系不住了,必须引入正式制度(组织架构、流程、KPI、审计)来替代——本质上就是用”硬制度”替代”软关系”。
这和多智能体何其相似:Agent 超过 3~4 个后,靠”自由沟通”已经协调不动,必须引入协议、调度器、审核节点。人类在 150 人的阈值上被迫制度化的规律,与 Agent 在 3~4 个的阈值上被迫协议化的规律,是同一个道理。
不过,2026 年 Science Advances 的一项研究《AI agents can coordinate via majority-following beyond human scale》给出了更细的图景:让 AI agent 群体通过**“多数跟随”机制自发形成共识,其临界群体规模会随模型能力快速增长——对先进 LLM 而言可超过 1000 个 agent**,远大于人类非正式群体。这说明规模上限不是物理定律,而是”模型能力 + 协调机制”的函数:模型越强、协调机制越简单(如多数跟随),可维持的规模就越大;而复杂推理型协作(需要互相传递上下文)依然受 3~4 个黄金分割点的约束。
病 2:基线悖论——单个模型够强,组团反而亏
- 现象:当单个 Agent 的准确率已经超过 45% 时,强行把它们组建成多智能体系统,反而带来负收益。
- 原因:多智能体的收益来自”互相纠错、取长补短”。但如果每个成员本身就不差,协作产生的收益抵消不了协作本身的开销(上下文传递、token 消耗、观点冲突)。
- 结论:组团不是免费的——单点能力越强,组团的边际收益越低,甚至为负。
直觉:两个 90 分的人讨论,未必比一个 90 分的人独自思考更好——讨论还可能把对方带偏。
病 3:错误放大效应——没人把关,错上加错
- 现象:未经检查的并行处理极其脆弱。研究数据显示,独立多智能体模式下,错误可被放大 17.2 倍;而集中式(有协调者审核)模式,错误仅放大 4.4 倍。
- 原因:独立模式下,每个 Agent 的错误会作为”事实”传递给下一个 Agent,下一个在此基础上继续犯错——错误沿着协作链逐级放大,像滚雪球。
- 结论:“协调者审核”机制不是可选项,是必需品。没有审核节点,多智能体系统不是在协作,是在批量制造共识性错误。
4.4 倍 vs 17.2 倍,差的是”有没有一个兜底的人盯着”。
病 4:水平最差者主导——坏的方案会说赢
- 现象:用三个不同水平的模型驱动三个智能体进行辩论,水平最差的那个,几乎百分之百能说服另外两个好的。
- 原因:模型的说服力与其”自信程度”强相关,而水平差的模型往往自信而不自知——它输出的论证流畅、语气笃定,但内容是错的。辩论模式下,好的 Agent 反而容易被”一本正经的胡说八道”带偏。
- 结论:辩论模式的质量上限,由最差的成员决定,而不是最好的。 组队时先给成员”排雷”,或让辩论结果经过第三方仲裁,否则最优解会被最差的提案带沟里。
三、四种组织病速查表
| 病名 | 核心结论 | 落地启示 |
|---|---|---|
| 规模悖论 | 3~4 个 Agent 是黄金分割点,再多通信成本吞掉推理 | 别盲目堆数量 |
| 基线悖论 | 单点准确率 >45% 后,组团反而负收益 | 单点够强就别硬组团 |
| 错误放大 | 独立模式放大 17.2 倍,有审核仅 4.4 倍 | 必须设协调者审核 |
| 最差者主导 | 最差的 Agent 几乎必胜说服同伴 | 组队先排雷,辩论加仲裁 |
四、对 Agent 开发的启示:落地最该避开的坑
这是四个议题里最贴近实战的一个——组织病是多数多智能体项目失败的直接原因。
三条硬建议:
- 控制数量,3~4 个起步:先用最小规模跑通,再根据实测决定要不要加 Agent。每个新增 Agent 都要问:它带来的收益,抵得过它带来的通信开销吗?
- 永远有一个”协调者审核”节点:不管什么拓扑,都要有角色专门负责审结果、拦错误。数据摆在那里——17.2 倍和 4.4 倍的差距,就是一个审核节点的事。
- 辩论模式必须防”最差者”:要么限制成员的模型水平下限,要么给辩论加独立仲裁,防止”自信的错误”带偏全局。
数据出处:这些数字来自同一篇论文
本文的基线悖论(45%)、错误放大(17.2× / 4.4×)数据,均出自 Google Research、MIT 与 Google DeepMind 的联合论文《Towards a Science of Scaling Agent Systems》(arXiv:2512.08296)。该研究在 180 种配置下系统对比了单 Agent 与四种多 Agent 架构,三个核心发现正是本文的”病 2”与”病 3”:
- 能力饱和:单 Agent 基线超过约 45% 后,协调收益转为负(β=−0.404,p<0.001);
- 拓扑依赖的错误放大:独立(Independent)多智能体错误放大 17.2×,集中式(Centralized)协调控制在 4.4×。
总结
| 关键结论 | 内容 |
|---|---|
| 规模悖论 | 任务越复杂越不能堆 Agent,3~4 个是黄金分割点 |
| 基线悖论 | 单点准确率 >45%,组团负收益 |
| 错误放大 | 独立模式放大 17.2 倍,集中审核仅 4.4 倍 |
| 最差者主导 | 最差的 Agent 几乎一定能说服别人 |
| 核心启示 | 少即是多 + 协调者审核 + 辩论防雷 |
一句话:多智能体不是”人多力量大”,而是”人多嘴杂、错多难查”——控制规模、设好审核,才能避开群体愚蠢。