优化器:Adam → Muon → Scheduler → Per-Layer LR → 调参理论¶
更新日期:2026-04-16
四、LR Schedule 深入:Cosine vs WSD vs Linear Decay¶
4.1 为什么不能全程恒定 lr¶
训练初期需要大 lr 快速下降 loss。但后期大 lr 导致参数在最优值附近"震荡"无法收敛。所以 lr 必须最终下降。
4.2 Cosine Decay¶
\(\eta(t) = \eta_{\min} + \frac{1}{2}(\eta_{\max} - \eta_{\min})\left(1 + \cos\frac{\pi t}{T}\right)\)
为什么 cosine 好?
-
平滑:没有突变点,梯度动力学稳定
-
前期慢衰减:大部分训练时间 lr 还在高位,充分探索
-
后期快衰减:最后 20% 加速收敛
-
经验上效果好于线性衰减
Cosine 的问题:
-
必须预设总步数 \(T\)。如果训练想延长或中断重启 → cosine 不灵活
-
后期 lr 衰减到 0 → 对最后注入的高质量 annealing 数据"学不动"
4.3 WSD (Warmup-Stable-Decay)¶
flowchart LR
warmup["Warmup<br/>0 → peak_lr<br/>(0-2% steps)"]
stable["Stable<br/>peak_lr 不变<br/>(70-90% steps)"]
decay["Decay<br/>peak_lr → 0<br/>(10-30% steps)"]
warmup --> stable --> decay
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class warmup,stable,decay stage
WSD vs Cosine 的关键区别:
- Cosine 全程衰减,stable 阶段不存在
- WSD 把"长时间稳定"作为主体,最后才衰减
- WSD 允许中途切换数据 mix(stable 阶段用通用,decay 阶段用 annealing 高质量)
为什么 WSD 越来越受欢迎?(参考 River Valley Loss Landscape (Wen et al., ICLR 2025))
River-Valley 框架解释了 WSD 的数学直觉: Loss landscape 有两种方向:
-
River 方向(平坦):对应确定性知识(事实、语法规则)。高 lr 在这个方向上快速推进
-
Mountain 方向(陡峭):对应随机性知识(歧义表达、罕见用法)。高 lr 让模型在这些方向上"震荡"
在 Stable 阶段:
-
River 方向持续进步(但被 mountain 方向的震荡"遮盖"了,所以 loss 看起来不降)
-
Mountain 方向上来回弹跳(贡献高 loss)
在 Decay 阶段:
-
lr 下降 → mountain 方向震荡被抑制 → loss 突然陡降
-
这不是"突然学到了新东西",而是之前 stable 阶段已经积累的 river 进步终于显现出来
直觉:想象你沿着一条蜿蜒的河谷走路。高 lr = 大步快走但左右摇晃(loss 高)。低 lr = 小步稳走(loss 低)。Stable 阶段你已经走了很远,但一直在摇晃。Decay 阶段你停止摇晃,位置突然显示你已经到了很远的地方。
4.4 WSD vs Cosine:实验数据¶
参考 Optimal LR Schedules under Functional Scaling Laws (2025):在 hard-task regime,最优 schedule 就是 WSD 结构——尽可能长时间维持最大可用 lr,最后才衰减。
4.5 Linear Decay-to-Zero (D2Z)¶
最新研究 (Straight to Zero, ICLR 2025) 发现:在最优 peak lr 下,简单的线性衰减到 0 一致性地超越 cosine,compute 节省高达 60%。
为什么?AdamW 可被解释为权重更新的指数移动平均。线性衰减到 0 在理论上最优地平衡了"早期远离初始点"和"后期降噪"两个需求。
4.6 新范式:无衰减 + 模型平均 (WSM)¶
2025 年新方向:完全不做 lr 衰减!改为在 stable 阶段的多个 checkpoint 上做加权平均,等效于"离线衰减"。 WSM (Warmup-Stable-Merge) 的结果:MATH +3.5%, HumanEval +2.9%, MMLU-Pro +5.5%(相对 WSD)。参考 Tian et al. (2025)。
这意味着 lr 衰减可能根本不需要在训练时做——后处理 checkpoint 平均就够了。
4.7 Scheduler 选型决策¶
flowchart TB
start["要选 LR schedule"]
q1{"训练规模"}
start --> q1
q1 -->|"短训 / 充分 data"| cosine["Cosine<br/>(经典稳健)"]
q1 -->|"长训 / 数据有限"| wsd["WSD<br/>(stable 阶段久 + 短 decay)"]
q1 -->|"想要 compute 最优"| d2z["Linear Decay-to-Zero<br/>(D2Z)"]
q1 -->|"想 post-hoc 调整"| wsm["WSM (no decay + checkpoint avg)"]
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
classDef decision fill:#f5f3eb,stroke:#bdb9ab,color:#1a1a1a;
class start,cosine,wsd,d2z,wsm stage
class q1 decision
| 场景 | 推荐 | 理由 |
|---|---|---|
| 充分 data + 一次性训完 | Cosine | 经典稳健 |
| 想中途加 annealing 数据 | WSD | stable / decay 切分点天然适合数据切换 |
| compute 最优 | D2Z | ICLR 2025 实证最优 |
| 想后期决定衰减强度 | WSM | 训练时不衰减,后处理 checkpoint 平均 |
实操:DeepSeek-V3 + Llama-3 都用 WSD 变体,Qwen 用 cosine。WSD 在 2025 后是主流。
九、LR Schedule 与 Curriculum Learning 的冲突¶
2025 最新发现 (How LR Decay Wastes Your Best Data, 2025):课程学习(先简单后困难的数据顺序)和 cosine decay 相互矛盾。 课程学习把最好的数据放在最后(annealing),但 cosine decay 在最后 lr 最低 → 模型在最好的数据上学习最慢。 解决方案:
-
用 WSD 代替 cosine(stable 阶段不衰减,到 annealing 时再 decay)
-
或用恒定 lr + 模型平均(WSM)
-
或 Pre-training without LR Decay Enhances SFT (2025):干脆不 decay,SFT 效果反而更好
十、追问与深入方向¶
| 问题 | 追问 | 深入方向 |
|---|---|---|
| 为什么 \(\beta_2=0.95\) 不是 0.999? | 0.999 对应 ~1000 步记忆窗口,但 LLM 训练中数据 domain 频繁切换(代码→网页→数学),旧统计 \(v\) 需要快速"忘记" | 测试 0.9/0.95/0.99/0.999 的 loss 曲线差异 |
| Warmup 到底需要多少步? | 经验 1-2K,但理论上需要 \(\sim 1/(1-\beta_2)\) 步让 \(v\) 有意义 | 关注 LionAR 等不需要 warmup 的优化器 |
| WSD 的 decay 要多长? | ~10% 总步数。过短→不够收敛,过长→浪费 stable 的探索时间 | 自适应 decay length 是开放问题 |
| 为什么 embedding 不用 Muon? | Embedding 是 lookup table,不是矩阵乘法,正交化无意义 | 探索 embedding-specific 优化器 |
| Cosine 还是 WSD? | 如果你能预设总步数 → cosine 安全;否则 → WSD 必选 | WSD-S, WSM 是新前沿 |
| lr decay 到 0 还是 min_lr? | 最新研究说 D2Z(衰减到精确 0)最优 | 但如果要 continual training,不能到 0 |
参考文献¶
-
[1] Wen et al. River Valley Loss Landscape (WSD). ICLR 2025. 论文
-
[2] Straight to Zero (Linear D2Z). ICLR 2025. 论文
-
[3] How LR Decay Wastes Best Data. 2025. 论文
-
[4] Pre-training without LR Decay Enhances SFT. 2025. 论文
-
[5] Optimal LR Schedules under Functional Scaling Laws. 2025. 论文
-
[6] Beyond Cosine Decay. 2025. 论文