跳转至

G. 推理与部署

模型训练完,怎么把推理成本压下去。量化全景(GPTQ / AWQ / SmoothQuant / FP8)、PD 分离与推理架构设计、vLLM vs SGLang 深入对比、主流模型的部署配置、投机解码与 KV Cache 优化、解码策略(Beam Search / 采样 / KV Cache)。

章节


上级 · 大语言模型/多模态大模型 LLM/MLLM