Claude / GPT / DeepSeek 训练方法论还原¶
更新日期:2026-04-15
本文基于公开论文、泄露的源码(Claude Code)、技术博客、员工访谈、社区逆向分析。涉及大量推测,具体细节以官方为准。
一、三家训练哲学对比¶
飞书 add-on(待手动转 mermaid / 图)
component: blk_631fefbbae02400430b8f9f4
| 维度 | OpenAI | Anthropic | DeepSeek |
|---|---|---|---|
| 核心哲学 | 规模优先 + 广覆盖 | 安全优先 + 诚实 | 效率 + 开源 |
| 架构偏好 | 传闻 MoE (GPT-4) / MoE (GPT-5) | 未公开, 推测 Dense | MoE + MLA |
| 对齐方法 | RLHF + PPO | Constitutional AI + RLAIF | GRPO + RLVR |
| 推理训练 | o1/o3 系列, RL-based | Claude 4 thinking, 延伸 CoT | R1-Zero → R1 纯 RL |
| 数据策略 | 大规模多样化 | 高质量筛选 + 宪法过滤 | Annealing + 合成数据 |
| 成本效率 | 不公开,估计极高 | 高 | 已公开:$5.5M for V3 |
二、OpenAI 路线(推测)¶
2.1 GPT-4 时代¶
基于泄露和论文推测:
-
架构:8 × ~220B 专家的 MoE,每次激活 2 个专家
-
训练数据:13T tokens(混合 web + code + 数学)
-
对齐:SFT → RLHF (PPO) → 大量安全微调
-
算力:估计 ~25,000 A100 训练 90 天
2.2 o1 / o3 / o4 推理模型¶
OpenAI 的关键突破:推理时 scaling。让模型在回答前"思考"更长时间。参考 o1 System Card (OpenAI, 2024)。 o1 的推测机制(非官方):
-
内部 thinking 阶段:模型生成长 CoT(可能对用户隐藏)
-
推理预算:用户可以选择 low/medium/high 思考时间
-
RL 训练使模型学会何时深入思考
-
可能涉及 Process Reward Model (PRM) 或类似机制
o3 可能的改进:
-
更长的思考链(数小时级任务)
-
工具使用整合(搜索/计算器/代码执行)
-
Agent 风格的多步推理
2.3 GPT-5¶
推测:
-
1M 上下文窗口
-
更强的多模态原生集成
-
更大的模型 + 推理时 scaling 的结合
-
可能使用了新的架构优化(未公开)