Claude / GPT / DeepSeek 是怎么训出来的?¶
更新日期:2026-04-16
这个问题为什么值得深入¶
三家头部 AI 公司走了三条不同的路线到达类似的终点。理解差异等于理解"训 SOTA 模型有哪些可行路径"——哪些选择是必须的,哪些是风格偏好,哪些是资源约束下的妥协。
故事线¶
OpenAI:规模优先,推理时 scaling 的先驱¶
从 GPT-3 到 GPT-5,OpenAI 的核心信念是"足够大的模型+足够多的数据=足够强的能力"。但 o1/o3 系列标志着范式转变——不再只增大模型,而是增大推理时的计算量。长思维链 + 可能的 MCTS 搜索让小模型也能解决难题。
详见 E8.1 OpenAI 路线:GPT → o 系列
Anthropic:安全不是附加功能,是训练的核心¶
Constitutional AI 用"宪法原则"替代人类标注,RLAIF 用 AI 反馈替代人类反馈。这不只是省钱——它让对齐可以大规模扩展。Constitutional Classifiers 将越狱率从 86% 压到 4.4%。Claude 的训练方法论本质上是"把安全作为第一类训练目标"。
详见 E8.2 Anthropic 路线:Constitutional AI → Claude
DeepSeek:效率革命,证明"不需要最大预算也能做最好的模型"¶
\(5.5M 训出 671B MoE 模型(GPT-4 估计 >\)100M)。关键创新不是一个,而是一串:MLA 压缩 KV Cache 57x、Aux-Loss-Free 路由、FP8 训练、细粒度 256 专家。更震撼的是 R1-Zero:不用任何 SFT 数据,仅靠 RLVR,模型自发学会了推理、自我验证和回溯。
详见 E8.3 DeepSeek 路线:V3 → R1
↑ 上级 · E. 后训练与对齐