跳转至

C. 分布式训练基础设施

万卡集群的训练栈:Megatron 6D 并行(TP/PP/DP/EP/CP/SP)+ ZeRO,集群拓扑感知的并行策略,MFU 优化(profiling → 诊断 → 提升),GPU kernel 编程(Triton / TileLang / CUDA),训练稳定性(loss spike、NaN、梯度异常诊断),万卡运维(容错、checkpoint、健康检查),以及开源训练/推理基础设施生态。

章节


上级 · 大语言模型/多模态大模型 LLM/MLLM