跳转至

Agent 集群 Scaling:理论、工业实现、与 TTS 的关系

更新日期:2026-04-15

本文彻底重写,覆盖:Agent Scaling Law 数学形式、Agent 集群与 Test-Time Scaling 的谱系关系、多 Agent Debate 的真实 benchmark(何时有效何时崩坏)、Anthropic 多 Agent 研究系统深度剖析、Manus/AutoGen/Swarm 工业实现、失败模式与客观指标。

一、核心问题:Agent 集群到底是什么

1.1 从单次推理到 Agent 集群——一条连续谱

flowchart LR
    l0["L0: Single CoT<br/>1× compute"]
    l1["L1: Self-Consistency<br/>k× sample + vote"]
    l2["L2: Long CoT<br/>推理模型"]
    l3["L3: BoN / Best-of-N<br/>选最优"]
    l4["L4: Multi-Agent Debate<br/>多视角辩论"]
    l5["L5: Orchestrator + Workers<br/>分解 + 并行"]

    l0 --> l1 --> l2 --> l3 --> l4 --> l5

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class l0,l1,l2,l3,l4,l5 stage

关键洞察:Agent 集群不是独立范式,而是 Test-Time Compute Scaling 的一种形式。所有上述 Level 都在"用更多推理算力换更好的结果"。真正的问题是:给定固定 compute 预算,哪种形式最划算? 参考 Revisiting MAD as Test-Time Scaling (Smit et al., 2025)

1.2 TTS(Test-Time Scaling)四大策略

参考 Scaling Test-time Compute for LLM Agents (2025)


二、Agent Scaling Law

2.1 MacNet 的协作 Scaling Law(ICLR 2025)

清华 Chen 等人在 Scaling LLM-based Multi-Agent Collaboration (2406.07155) 中首次给出 Agent 数量 vs 性能的数学形式

\(f(x) = \frac{\alpha}{1 + e^{-\beta(x-\gamma)}} + \delta\)

其中 \(x\) 为 agent 数量(log scale),\(\alpha, \beta, \gamma, \delta\) 为拓扑特定参数。这是一条 logistic / sigmoid 曲线(不是幂律!)。

与模型 scaling law 的关键区别: - 模型 scaling:幂律,\(\log L \propto -\log N\),持续下降 - Agent scaling:S 形饱和,在 \(2^4 \sim 2^5\) 个 agent(16-32)就接近饱和

2.2 拓扑结构的量化对比

MacNet 在 MMLU 上对比不同拓扑: 最佳实践:不规则/随机拓扑 > 规则拓扑。原因:随机连接引入更多样的"对话路径",每个 agent 见到的上下游组合更多元。

2.3 Collaborative Emergence vs Neural Emergence

Agent 集群的大多数能力提升实际上是用推理算力换的,不是涌现出的新能力。

2.4 最新研究:Agent Scaling 的系统性分析

Towards a Science of Scaling Agent Systems (2512.08296, 2025) 用 260 配置 × 6 基准 × 3 LLM 家族做了系统性分析:


三、MAD vs Self-Consistency:真实 Benchmark 对比

3.1 残酷的真相——MAD 常常输给 Self-Consistency

Multi-LLM-Agents Debate 挑战 (ICLR 2025) 的核心发现:

当前 MAD 框架在 9 个基准上无法一致性地超越简单的单 agent TTS 策略(CoT、Self-Consistency)。MAD 消耗更多 compute,但结果常常更差。

3.2 具体数字(GPT-4o-mini)

关键:token 预算对等的情况下,Self-Consistency 在多数任务上与 MAD 持平或更好。

3.3 MAD 的五大失败模式

3.4 MAD 真正有效的条件

经过反复实验,MAD 有价值的严格条件: 参考 Revisiting MAD (2505.22960): "MAD becomes more effective with increased problem difficulty and decreased model capability."



参考文献

  • [1] Qian et al. Scaling LLM-based Multi-Agent Collaboration (MacNet). ICLR 2025. 论文

  • [2] Smit et al. Revisiting MAD as Test-Time Scaling. 2025. 论文

  • [3] Scaling Test-time Compute for LLM Agents. 2025. 论文

  • [4] Towards a Science of Scaling Agent Systems. 2025. 论文

  • [5] Multi-LLM-Agents Debate Challenges (ICLR 2025 Blog). 博客

  • [6] The Art of Scaling Test-Time Compute. 2025. 论文

  • [7] Voting or Consensus in MAD. 2025. 论文

  • [8] Inference Scaling Laws. 2024. 论文


上级 · H3. Agent 集群 Scaling 与多 Agent 协作