压缩即智能:信息论视角与 Scaling Laws 推导¶
更新日期:2026-04-16
三、Scaling Laws 完整公式¶
3.1 Kaplan (2020) vs Chinchilla (2022)¶
3.2 Chinchilla 公式详解¶
Chinchilla 的核心公式:
\(L(N,D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}\)
-
\(E\):不可约误差(数据本身的熵,即使完美模型也无法降到 0)
-
\(A/N^{\alpha}\):模型能力不足的误差(欠拟合项)
-
\(B/D^{\beta}\):数据不足的误差(过拟合/泛化项)
给定计算预算 \(C = 6ND\),最优分配:
\(N_{\text{opt}} \propto C^{\beta/(\alpha+\beta)}, \quad D_{\text{opt}} \propto C^{\alpha/(\alpha+\beta)}\)
当 \(\alpha \approx \beta\) 时,\(N\) 和 \(D\) 按相同比例增长。Chinchilla 的 \(\alpha=0.34, \beta=0.28\) → \(N:D \approx 1:20\)。
3.3 后 Chinchilla 的修正¶
3.4 Chinchilla 在实际中的使用¶
概念上广泛使用,实践上几乎没人遵循。 - LLaMA-3 8B 训练了 15T tokens(Chinchilla 建议 ~160B,差 100x)
-
原因:推理成本远大于训练成本。部署时更小但训练更充分的模型更经济
-
不同架构/优化器需要重新拟合 — 没有万能的 Chinchilla
四、推理时计算 Scaling (Test-Time Scaling)¶
4.1 新的 Scaling 维度¶
传统 scaling 只增大 \(N\) 和 \(D\)。推理时 scaling 增大推理计算量 \(C_{\text{infer}}\)。
4.2 关键发现¶
小模型 + 大量推理计算 > 大模型 + 少量推理计算 例如:GPT-4o-mini + CoT + Best-of-64 可达到 GPT-4 + greedy decoding 的水平——而成本可能更低(小模型每 token 便宜)。
这改变了 scaling 的经济学:
-
传统:训一个更大的模型 → 所有请求受益,但训练贵
-
新:训一个中等模型 + 对困难问题投入更多推理 → 更灵活
DeepSeek-R1 用 37B 激活参数(远小于 GPT-4 估计的 ~220B)但在推理任务上接近甚至超越 GPT-4,靠的就是推理时 scaling(长 CoT)。
五、数据质量与 Loss 曲线¶
5.1 同样训练 100B tokens,不同质量数据的对比¶
参考 FineWeb (Penedo et al., 2024) 和 Phi-1 (Gunasekar et al., 2023)。
5.2 信息论解释¶
数据中每 token 的条件信息量决定了 loss 下降速度。 - 高质量数据:信息密度高,每 token 携带更多"知识"→ \(\alpha\) 大
-
噪声/重复:不含可学习信息,但消耗 token quota → \(\alpha\) 小
-
合成数据:如果质量好可以提高 \(\alpha\),但重复模式会导致 model collapse
5.3 Loss ≠ 下游能力¶
同样 loss=2.0 的两个模型,能力可能差异巨大。在噪声数据上训到 loss=2.0,模型学到的是噪声;在高质量数据上训到 loss=2.0,模型学到的是真正的知识。Loss 只能在同一数据集内比较。
六、从理论到实践¶
6.1 用 Scaling Laws 指导训练的流程¶
-
小规模实验:用 100M-1B 模型跑多个 \((N, D)\) 配置(通常 5-10 个点)
-
拟合 Scaling Law:\(L(N,D) = E + A \cdot N^{-\alpha} + B \cdot D^{-\beta}\)
-
外推到目标规模:预测 70B 模型需要多少 \(D\)
-
注意:每次换架构/优化器/数据 → 需要重新拟合
小规模 Scaling 拟合的外推在大规模上通常有 5-10% 偏差,但足以指导训练决策。参考 Scaling Laws Revisited (2025)。
6.2 实用经验法则¶
七、追问延伸¶
| 问题 | 方向 | 详见 |
|---|---|---|
| 合成数据怎么影响 Scaling Law? | 好的合成提高有效 \(D\),但 model collapse 风险 | B4 |
| 多模态的 Scaling Law 是什么样? | 图像和文本 scaling 行为不同,联合训练更复杂 | F2 |
| 能否预测最终 benchmark 分数? | 部分可以(loss → ppl → 部分基准),涌现行为难预测 | I1 |
| loss plateau 怎么诊断? | 数据耗尽/重复、lr 太低、架构瓶颈 | C6 |
参考文献¶
-
[1] Kaplan et al. Scaling Laws for Neural Language Models. 2020. 论文
-
[2] Hoffmann et al. Training Compute-Optimal LLMs (Chinchilla). 2022. 论文
-
[3] Pu et al. Understanding LLM Behaviors via Compression. 2025. 论文
-
[4] Compression Laws for Large Language Models. 2025. 论文
-
[5] Penedo et al. FineWeb. 2024. 论文
-
[6] Gunasekar et al. Textbooks Are All You Need (Phi-1). 2023. 论文
-
[7] Muennighoff et al. Scaling Laws Revisited. ACL 2025. 论文
-
[8] Wolfe. Scaling Laws for LLMs: GPT-3 to o3. 博客