Agent 集群 Scaling:能靠堆 Agent 无限提升能力吗?¶
更新日期:2026-04-16
这个话题的核心矛盾¶
直觉上,多个 Agent 协作应该比单个 Agent 强——就像一个团队比一个人强。但真实实验告诉我们事情远没这么简单:Multi-Agent Debate 在 9 个 benchmark 上经常输给简单的 Self-Consistency(多次采样+投票),而且贵 15 倍。
那多 Agent 什么时候才真正有用?Anthropic 用它把研究任务性能提升了 90%。这两个事实怎么调和?
故事线¶
理论:Agent 数量 vs 性能是什么关系?¶
不是幂律(无限增长),是 S 形饱和。MacNet (ICLR 2025) 给出了 logistic scaling law:16-32 个 agent 就接近饱和。拓扑结构比数量更重要——随机连接比精心设计的树形结构效果更好。而且 Agent 集群本质上是 Test-Time Scaling 的一种形式,和 CoT、BoN、MCTS 是同一条谱的不同位置。
详见 H3.1 Agent Scaling Law 与 TTS 关系
工业:Anthropic 怎么做到 +90%?¶
Orchestrator-Worker 架构:Opus 做 Lead(规划+分派),Sonnet 做 Worker(3-5 个并行执行)。关键不是"多个 Agent 辩论",而是多个 Agent 并行探索不同子问题。Token 用量是单 Agent 的 15 倍,但 token 用量本身解释了 80% 的性能方差——多 Agent 的本质是"花更多推理算力"。
详见 H3.2 Anthropic 多 Agent 系统工业实现
工程:哪些坑你会踩?¶
MAD 的五大失败模式(错误聚合、不 scale、表面讨论...)、Anthropic 生产中遇到的 7 类问题(over-spawning、SEO 陷阱、任务重叠...)、以及"什么时候不该用多 Agent"的决策框架。
详见 H3.3 MAD vs Self-Consistency 实验与工程问题
↑ 上级 · H. 应用层