C. 分布式训练基础设施¶
万卡集群的训练栈:Megatron 6D 并行(TP/PP/DP/EP/CP/SP)+ ZeRO,集群拓扑感知的并行策略,MFU 优化(profiling → 诊断 → 提升),GPU kernel 编程(Triton / TileLang / CUDA),训练稳定性(loss spike、NaN、梯度异常诊断),万卡运维(容错、checkpoint、健康检查),以及开源训练/推理基础设施生态。
章节¶
- C1. Megatron 架构与 6D 并行完整指南
- C2. 集群拓扑感知的并行策略设计
- C3. MFU 优化:Profiling → 诊断 → 提升实战
- C4. GPU Kernel 编程:Triton vs TileLang vs CUDA
- C5. 6D 并行下的 Attention Kernel 与通信重叠
- C6. 训练稳定性:Loss Spike、NaN、梯度异常诊断
- C7. 万卡集群运维:容错、Checkpoint、健康检查
- C8. 开源训练/推理基础设施
↑ 上级 · 大语言模型/多模态大模型 LLM/MLLM