跳转至

Claude / GPT / DeepSeek 训练方法论还原

更新日期:2026-04-15

本文基于公开论文、泄露的源码(Claude Code)、技术博客、员工访谈、社区逆向分析。涉及大量推测,具体细节以官方为准。

一、三家训练哲学对比

飞书 add-on(待手动转 mermaid / 图)

component: blk_631fefbbae02400430b8f9f4

维度 OpenAI Anthropic DeepSeek
核心哲学 规模优先 + 广覆盖 安全优先 + 诚实 效率 + 开源
架构偏好 传闻 MoE (GPT-4) / MoE (GPT-5) 未公开, 推测 Dense MoE + MLA
对齐方法 RLHF + PPO Constitutional AI + RLAIF GRPO + RLVR
推理训练 o1/o3 系列, RL-based Claude 4 thinking, 延伸 CoT R1-Zero → R1 纯 RL
数据策略 大规模多样化 高质量筛选 + 宪法过滤 Annealing + 合成数据
成本效率 不公开,估计极高 已公开:$5.5M for V3

二、OpenAI 路线(推测)

2.1 GPT-4 时代

基于泄露和论文推测:

  • 架构:8 × ~220B 专家的 MoE,每次激活 2 个专家

  • 训练数据:13T tokens(混合 web + code + 数学)

  • 对齐:SFT → RLHF (PPO) → 大量安全微调

  • 算力:估计 ~25,000 A100 训练 90 天

2.2 o1 / o3 / o4 推理模型

OpenAI 的关键突破:推理时 scaling。让模型在回答前"思考"更长时间。参考 o1 System Card (OpenAI, 2024)o1 的推测机制(非官方):

  1. 内部 thinking 阶段:模型生成长 CoT(可能对用户隐藏)

  2. 推理预算:用户可以选择 low/medium/high 思考时间

  3. RL 训练使模型学会何时深入思考

  4. 可能涉及 Process Reward Model (PRM) 或类似机制

o3 可能的改进

  • 更长的思考链(数小时级任务)

  • 工具使用整合(搜索/计算器/代码执行)

  • Agent 风格的多步推理

2.3 GPT-5

推测:

  • 1M 上下文窗口

  • 更强的多模态原生集成

  • 更大的模型 + 推理时 scaling 的结合

  • 可能使用了新的架构优化(未公开)



上级 · E8. Claude / GPT / DeepSeek 训练方法论还原