E. 后训练与对齐¶
预训练只学到"压缩",后训练教会模型"如何回答"。本章覆盖 SFT/RFT/RL/Pretrain 的关系(数据效率梯度上升 vs. 数据规模指数下降)、偏好对齐全链路(RLHF → DPO → SimPO → GRPO)、RLVR 在数学/代码/搜索/research 各方向的深入,以及 OpenAI / Anthropic / DeepSeek 三家训练方法论的还原。
章节¶
- E1. SFT / RFT / RL / Pretrain 的关系与数据效率
- E2. 偏好对齐全链路:RLHF → DPO → SimPO → GRPO
- E3. RLVR 深入:数学推理方向
- E4. RLVR 深入:代码生成方向
- E5. RLVR 深入:Search & Tool Use 方向
- E6. RLVR 深入:Research / Report / 开放域
- E7. Instruction Following 能力提升
- E8. 前沿训练方法论还原
↑ 上级 · 大语言模型/多模态大模型 LLM/MLLM