Claude / GPT / DeepSeek 训练方法论还原¶
更新日期:2026-04-15
本文基于公开论文、泄露的源码(Claude Code)、技术博客、员工访谈、社区逆向分析。涉及大量推测,具体细节以官方为准。
四、DeepSeek 路线¶
4.1 DeepSeek-V3 训练全程¶
DeepSeek 是唯一完整公开训练细节的前沿模型。参考 DeepSeek-V3 Technical Report。
flowchart LR
pre["Pretrain<br/>14.8T tokens<br/>FP8 全栈"]
mid["Mid-train<br/>YaRN 32k→128k<br/>多语言增强"]
sft["SFT<br/>1.5M conversation<br/>+ 推理 + 代码"]
rl["RL<br/>GRPO + RLVR"]
final["DeepSeek-V3"]
pre --> mid --> sft --> rl --> final
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class pre,mid,sft,rl,final stage
关键创新:
-
MLA (Multi-head Latent Attention)
-
Aux-Loss-Free 负载均衡
-
FP8 混合精度训练(首个大规模验证)
-
细粒度专家 (256 个)
-
Multi-Token Prediction 辅助 loss
4.2 DeepSeek-R1 训练(推理模型)¶
flowchart LR
base["DeepSeek-V3 Base"]
rzero["R1-Zero<br/>(纯 RL,无 SFT)"]
cold["R1 Stage 1<br/>Cold-start SFT"]
rl1["R1 Stage 2<br/>Reasoning RL"]
reject["R1 Stage 3<br/>Rejection SFT"]
final_rl["R1 Stage 4<br/>Final RL"]
r1["DeepSeek-R1"]
base --> rzero
base --> cold --> rl1 --> reject --> final_rl --> r1
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
classDef io fill:#f5f3eb,stroke:#bdb9ab,color:#1a1a1a;
class base,r1 io
class rzero,cold,rl1,reject,final_rl stage
R1-Zero 的发现是 2025 年 AI 界最震撼的事:不用任何 CoT 标注数据,仅靠 RLVR,模型自发学会了推理、自我验证、回溯。这改变了推理模型训练范式。
4.3 R1-Distill 系列¶
DeepSeek 开源了 R1-Distill 小模型(Qwen/LLaMA 的 1.5B、7B、14B、32B 版本)。
训练方法:
-
用完整 R1 模型采样大量带 CoT 的推理过程
-
将这些 CoT 作为 SFT 数据训练小模型
-
不需要 RL,纯 SFT 就能获得强推理能力
效果: 关键结论:推理能力可以通过蒸馏转移到小模型。
五、关键技术对比¶
| 技术 | OpenAI | Anthropic | DeepSeek |
|---|---|---|---|
| 对齐核心 | RLHF (PPO) | Constitutional AI (RLAIF) | GRPO + RLVR |
| 偏好数据 | 人类标注 | AI 生成 (宪法) | 题目+验证器 (自动) |
| 推理模型 | o1/o3 (RL) | Claude 4 Extended Thinking | R1 (纯 RL) |
| 可解释性 | 少 | 多 (SAE、Circuit) | 少 |
| 开源程度 | 少 (部分数据公开) | 中 (论文多) | 多 (模型+论文+代码) |
六、各家对行业的贡献¶
| 厂商 | 主要贡献 |
|---|---|
| OpenAI | 开创 GPT 时代、RLHF、推理模型 (o1)、Scaling Laws 实证 |
| Anthropic | Constitutional AI、可解释性研究、Claude 安全优势 |
| DeepSeek | MoE 效率革命、FP8 训练、纯 RL 推理、开源大模型 |
| Transformer、BERT、MoE (Switch)、Gemini 多模态 | |
| Meta | LLaMA 开源生态、Scaling Laws、Chinchilla |
七、可复现性评估¶
如果你想复现这些模型的训练,可行性如何?
八、2026 趋势¶
观察:三家越来越收敛到同一套范式:Base Pretrain → SFT → RL (with verifiable rewards)。差异主要在: - Base model 的架构选择 (Dense vs MoE, MHA vs MLA) - RL 阶段的 reward 设计 (人类 / AI / 可验证) - 数据选择和合成策略
参考文献¶
-
[1] Bai et al. Constitutional AI: Harmlessness from AI Feedback. 2022. 论文
-
[2] OpenAI. GPT-4 Technical Report. 2023. 论文
-
[3] OpenAI. o1 System Card. 2024. 论文
-
[4] DeepSeek-V3 Technical Report. 2024. 论文
-
[5] DeepSeek-R1. 2025. 论文
-
[6] Ouyang et al. InstructGPT. 2022. 论文
-
[7] Claude's Constitution. Anthropic. 链接