跳转至

Agent 集群 Scaling:能靠堆 Agent 无限提升能力吗?

更新日期:2026-04-16


这个话题的核心矛盾

直觉上,多个 Agent 协作应该比单个 Agent 强——就像一个团队比一个人强。但真实实验告诉我们事情远没这么简单:Multi-Agent Debate 在 9 个 benchmark 上经常输给简单的 Self-Consistency(多次采样+投票),而且贵 15 倍。

那多 Agent 什么时候才真正有用?Anthropic 用它把研究任务性能提升了 90%。这两个事实怎么调和?


故事线

理论:Agent 数量 vs 性能是什么关系?

不是幂律(无限增长),是 S 形饱和。MacNet (ICLR 2025) 给出了 logistic scaling law:16-32 个 agent 就接近饱和。拓扑结构比数量更重要——随机连接比精心设计的树形结构效果更好。而且 Agent 集群本质上是 Test-Time Scaling 的一种形式,和 CoT、BoN、MCTS 是同一条谱的不同位置。

详见 H3.1 Agent Scaling Law 与 TTS 关系

工业:Anthropic 怎么做到 +90%?

Orchestrator-Worker 架构:Opus 做 Lead(规划+分派),Sonnet 做 Worker(3-5 个并行执行)。关键不是"多个 Agent 辩论",而是多个 Agent 并行探索不同子问题。Token 用量是单 Agent 的 15 倍,但 token 用量本身解释了 80% 的性能方差——多 Agent 的本质是"花更多推理算力"。

详见 H3.2 Anthropic 多 Agent 系统工业实现

工程:哪些坑你会踩?

MAD 的五大失败模式(错误聚合、不 scale、表面讨论...)、Anthropic 生产中遇到的 7 类问题(over-spawning、SEO 陷阱、任务重叠...)、以及"什么时候不该用多 Agent"的决策框架。

详见 H3.3 MAD vs Self-Consistency 实验与工程问题


上级 · H. 应用层