跳转至

OpenAI 工程深读

更新日期:2026-04-26

OpenAI 公开技术诚意比 Anthropic 弱,比 DeepSeek 弱很多。但有几条线可以从 System Card、blog post、partner 公开声明、GPT-OSS 开源权重 + 庭审文件 / 访谈拼出来。

主要参考:


一、GPT-4 / GPT-4o 架构推测

OpenAI 不公开架构细节。社区拼图:

1.1 GPT-4 (March 2023)

来源
总参数 ~1.76 T SemiAnalysis 报告 (待核实)
MoE 结构 8 expert × ~220B + top-2 routing SemiAnalysis (Dylan Patel)
激活参数 ~280 B 2 experts active
训练 token ~13 T 推测
上下文 8k → 32k → 128k 多次扩展
Context window 32k 之后用 dialing-up

注意:以上数字全部是 leak / 推测,OpenAI 从未官方确认。

1.2 GPT-4o (May 2024)

GPT-4o 的关键进化是原生多模态

  • Omni 设计:单一模型处理文本 / 图像 / 音频,不是 cascade 多个专门模型
  • Audio tokenizer:声音 → discrete token(类似 Whisper 但训练时和 LM 联合优化)
  • Image tokenizer:图 patch → discrete token(类似 CLIP 但训练时联合)

1.3 GPT-OSS 提供的实证

2025 OpenAI 开源 gpt-oss-20b 和 gpt-oss-120b。这是第一次能直接看到 OpenAI 的真实架构

gpt-oss-20b gpt-oss-120b 备注
总参数 20.9 B 116.8 B
Active 参数 3.6 B 5.1 B MoE
Layers 24 36
Hidden 2880 2880 同 d_model 不同深度
Heads 64 (8 KV) 64 (8 KV) GQA(8)
Context 128 k 128 k
Routing top-4 / 32 expert top-4 / 128 expert
Activation SwiGLU SwiGLU

观察:

  • GQA 而非 MLA(更保守)
  • standard MoE + top-4(不是 DeepSeek 的 256-expert 极端稀疏)
  • 没有 shared expert(不像 DeepSeek-V3)
  • 训练 token 量 / 数据来源全没公开

GPT-OSS 是 OpenAI 历史上唯一开源的非顶级模型,可能不能完全代表 GPT-4 / o 系列,但是最接近的实证参考


二、o1 / o3 推理时 RL

2.1 公开信息

  • 2024.09 发布 o1-preview / o1-mini
  • 2024.12 o1 / o1 pro
  • 2025 o3 / o3-mini / o3-pro
  • 2026 GPT-5(猜测整合 o-line 推理能力)

OpenAI 对 o 系列的工程细节比 GPT-4 更保密。已知:

  • 训练时 RL 加 chain-of-thought:模型在回答前生成"思考"序列
  • reward 来自答案正确性(数学 / 代码 / 推理)
  • reasoning token 隐藏给用户(API 不返回),只给 summary

2.2 跟 DeepSeek-R1 对比

维度 OpenAI o1 DeepSeek-R1
公开度 极低(System Card 只有 high-level) 高(完整 paper)
Reward 类型 推测 RM-based + 规则验证 规则验证为主
Reasoning 是否暴露 隐藏(summary only) 完全暴露(<think>
Pricing 高(推理时长)
数学 benchmark AIME ~74-83% (o1) AIME ~71-79% (R1)

关键问题:OpenAI 是怎么训出 o1 的?

社区推测路线(待核实):

  1. Self-play RL with verifier rewards(类似 R1)
  2. Process Reward Model (PRM):除了答案 reward 还奖励中间步骤(OpenAI 之前发过 Let's Verify Step by Step 用 PRM)
  3. Search at training time:MCTS-like exploration during RL training(类似 AlphaZero 但应用到语言)

OpenAI 的博客只说 "we use large-scale reinforcement learning",无具体算法名。

2.3 OpenAI 历史 PRM 工作

Let's Verify Step by Step (Lightman et al. 2023) 是 OpenAI 公开的 PRM 工作:

  • 收集 800k 个step-level human label("这一步推理对吗?")
  • 训 PRM 给中间步骤打分
  • 推理时用 PRM 做 best-of-N selection

2023 PRM 是 inference-time tool(best-of-N),不是 training-time signal。o1 把 PRM 信号引入训练是合理推测但未公开证实。

2.4 GPT-5 / Reasoning 整合(2025-2026)

GPT-5(2025-2026 释出,待核实具体日期)整合了 reasoning + chat:模型自动决定何时"思考"。

工程推测:

  • 单一模型,包含两种行为模式
  • Router / classifier 决定 thinking budget
  • Latency-quality tradeoff 通过 budget 控制

三、训练 infra

3.1 硬件 stack

公开(partner 声明):

  • Microsoft Azure:主合作伙伴,提供大部分训练算力
  • Stargate:2024-2025 OpenAI + Microsoft + Oracle + SoftBank 联合数据中心计划,~$500B 投资
  • NVIDIA H100 / B200:主要 GPU
  • TPU 也用了(GPT-3.5 时代部分训练)

3.2 GPT-4 训练故事(来自 Sutskever / Karpathy 访谈)

知名公开细节:

  • 训练失败次数多:GPT-4 training run 不是一次成功,多次重启
  • Hardware failure 是常态:千卡集群每周丢几张
  • Loss spike:训练曲线不是平滑下降,有 spike 需要回退
  • 预测 loss 曲线:OpenAI 用 scaling law 预测最终 loss 偏差 < 1%(GPT-4 paper)

Sutskever Lex Fridman 访谈 2024 透露:

  • "we didn't know GPT-4 would work until we ran it"
  • 工程团队需要 24/7 watch checkpoint,hand-tune 处理 spike

3.3 失败模式(Stochastic Parrots / Karpathy)

Karpathy 在 Microsoft 2023 talks 提及 GPT-4 训练的 fail mode(推测,不是 verbatim):

  • Loss spike → 回退 100 step + LR / data shuffle 重训
  • NaN gradient → batch 跳过
  • 单机 OOM → expert 重新分配
  • IB 网络抖动 → 整轮重启

这些跟 DeepSeek tech report 第 9 节描述的 fail mode 高度一致,说明业界训练大规模 LLM 的 fail mode 是普适的。


四、Inference 优化

4.1 Speculative Decoding 贡献

OpenAI 团队发表过 Fast Inference from Transformers via Speculative Decoding (Leviathan et al. 2022) — 投机解码奠基论文。

核心:

  • Draft model(小) 提议下 K 个 token
  • Target model(大)一次 forward 验证 K 个 token
  • 接受 prefix(rejection sampling 保证分布等价)

实际加速:1.5-3× 取决于 draft model 质量。

4.2 Batching / Continuous batching

OpenAI 推理 stack 不公开,但 ChatGPT 服务上千万用户的工程需求推测:

  • Continuous batching(vLLM 那种)—— 不同 user 的 prompt 在同一 GPU 上 mix
  • PD 分离:prefill workers + decode workers 不同硬件配置(推测)
  • KV Cache pooling:相同前缀的 prompt(system prompt)共享 KV

4.3 Reasoning token caching (o-series)

o 系列推理时长是问题(长 reasoning chain)。OpenAI 推测优化:

  • Reasoning prefix caching:相似 prompt 的 reasoning 起步可复用
  • Adaptive thinking budget:根据问题难度动态分配 reasoning 长度
  • Prompt-aware draft model:投机解码的 draft 也有 reasoning 能力

具体细节不公开。


五、API 工程

5.1 Function Calling

OpenAI 2023.06 推出 function calling,是工业上最早的 LLM 工具调用标准。

# 标准 OpenAI function calling
response = client.chat.completions.create(
    model="gpt-4",
    messages=[{"role": "user", "content": "What's the weather in Beijing?"}],
    tools=[{
        "type": "function",
        "function": {
            "name": "get_weather",
            "parameters": {
                "type": "object",
                "properties": {"city": {"type": "string"}}
            }
        }
    }]
)
# response.tool_calls[0] = {"name": "get_weather", "arguments": '{"city": "Beijing"}'}

设计取舍:

  • JSON Schema 表达 tool signature(类型化好,但表达力有限)
  • 单轮 model 输出 ≤1 个 tool call(早期)→ 多 call 同时(2024 后)
  • 不支持 streaming tool call(直到 2025 才加)

5.2 Assistants API(已 deprecate)

2023.11 OpenAI 推 Assistants API(带状态管理 + thread + tool 的"管家")。但 2025 宣布 deprecate(社区反馈太复杂、慢、贵),改推 Responses API(更简洁)。

5.3 跟 MCP / Anthropic 对比

OpenAI tooling 是封闭生态(function calling 是 OpenAI-specific schema),跟 Anthropic 的 MCP 走开放协议不同。但 GPT-5 时代 OpenAI 可能也支持 MCP(待核实)。


六、模型代际对比

模型 发布 上下文 主要能力 gain 备注
GPT-3 2020.05 2k scale dense, 175B
GPT-3.5-turbo 2022.11 4k → 16k RLHF InstructGPT 衍生
GPT-4 2023.03 8k → 32k → 128k reasoning MoE 1.76T (推测)
GPT-4 Turbo 2023.11 128k 速度 / 成本
GPT-4o 2024.05 128k omni-modal 文本+图+音
o1-preview / o1 2024.09-12 128k reasoning 推理时 RL
o3 2025 128k+ reasoning ++ ARC-AGI 突破
GPT-4.5 (Orion) 2025.02 128k scale base model 大版本
GPT-5 2025-2026 待核实 推理整合 可能 reasoning 内生
GPT-OSS 20B/120B 2025 128k open weights 唯一开源

七、复现度自评

组件 公开度 复现难度
GPT-4 架构 leak only ❌(不知道真假)
Function calling ✅ Schema 公开 ✅ 完全可实现
Speculative decoding ✅ Paper
PRM (step-level reward) ✅ Paper ✅(数据贵)
o1 reasoning RL ❌(自己摸)
Reasoning RL alternatives (R1 路线) ✅(不是 OpenAI 但 DeepSeek 公开)
GPT-OSS 实际架构 ✅ 开源

给 读者实操建议

  1. 想要 GPT-4 级别 base,路径:自己 scale dense 模型(开销巨大),或者用开源 MoE 替代(V3 / K2)
  2. 想要 o1 级别 reasoning,路径:用 DeepSeek-R1 路线(完全公开),不要纠结 OpenAI 的细节
  3. 想要 function calling 能力,路径:MCP 标准(更现代)+ 自己微调 schema 输出
  4. GPT-OSS 是好的参考实现 —— 看真实生产 LLM 的架构选择(GQA over MLA, top-4 over top-8 等)

总结

  1. OpenAI 公开度低,但 GPT-OSS 提供了实证参考 —— 看他们没用 MLA、没用 shared expert,可能反映了他们的工程取舍
  2. o 系列 reasoning RL 黑箱,复现得用 R1 路线 —— DeepSeek 的工作降低了 OpenAI 在这个赛道的护城河
  3. Function calling / Assistants 设计是产业级 lessons,但不是 unique tech;MCP / Anthropic 协议更开放
  4. 训练 fail mode 普适:跟 DeepSeek 报告对照,可以拼出"千卡 LLM 训练的统一 fail-mode 清单"
  5. 不应过度神化 OpenAI 工程 —— 公开材料看,他们的 stack 跟 NVIDIA + PyTorch 主流路径接近

参考文献

  1. OpenAI. GPT-4 Technical Report. 2023. arXiv:2303.08774
  2. OpenAI. GPT-4 System Card. 2023. openai.com
  3. OpenAI. GPT-4o System Card. 2024.
  4. OpenAI. Learning to Reason with LLMs (o1). 2024. openai.com/index/learning-to-reason-with-llms
  5. OpenAI. o1 System Card. 2024.
  6. Lightman et al. Let's Verify Step by Step (PRM). 2023. arXiv:2305.20050
  7. Leviathan et al. Fast Inference from Transformers via Speculative Decoding. 2022. arXiv:2211.17192
  8. gpt-oss — OpenAI 开源 20B / 120B 模型权重
  9. Ouyang et al. InstructGPT (RLHF for LLMs). 2022. arXiv:2203.02155
  10. SemiAnalysis (Dylan Patel). GPT-4 Architecture leak analysis. 2023.

上级 · OpenAI