跳转至

E. 后训练与对齐

预训练只学到"压缩",后训练教会模型"如何回答"。本章覆盖 SFT/RFT/RL/Pretrain 的关系(数据效率梯度上升 vs. 数据规模指数下降)、偏好对齐全链路(RLHF → DPO → SimPO → GRPO)、RLVR 在数学/代码/搜索/research 各方向的深入,以及 OpenAI / Anthropic / DeepSeek 三家训练方法论的还原。

章节


上级 · 大语言模型/多模态大模型 LLM/MLLM