ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

MindSpeed LLM高可用与断点续训:512卡大规模训练如何不掉线

MindSpeed LLM高可用与断点续训:512卡大规模训练如何不掉线 MindSpeed LLM高可用与断点续训512卡大规模训练如何不掉线【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLMMindSpeed LLM 是昇腾大模型分布式训练框架其**高可用训练High Availability与断点续训Checkpoint Resume**两大能力专为千卡级大规模集群而生训练过程中硬件故障发生时无需中断重跑可在线修复、弹性缩扩容并自动恢复断点把机时损失降到最低。本文带你快速看懂 512 卡甚至更大规模训练不掉线的完整机制。为什么大规模训练必须关注高可用512 卡以上的集群里单卡内存故障、节点宕机的概率随规模线性上升。传统做法是一卡故障 → 整个训练任务崩溃 → 从最近一次 checkpoint 恢复几十甚至上百个迭代步的训练成果瞬间清零。MindSpeed LLM 的高可用特性给出了一套故障不停机方案核心目标只有一个让故障从训练事故降级为可忽略的小抖动。副本优化器一切高可用能力的基石高可用功能的底层机制是副本优化器Replica Optimizer。Megatron 原生的分布式优化器会把优化器状态切分到各数据并行DP卡上以省内存——省是省了但状态一旦随某张卡故障而丢失恢复代价极高。MindSpeed LLM 的巧妙设计是把 DP 组再切成两个副本 DP 组让每一份优化器状态都天然存在双份备份。任何一张卡故障其状态都能从副本卡上找到。代价是片上内存占用略有增加如 bf16 参数 fp16 梯度下从4 16/d增至4 32/d的比例因此官方推荐千卡及以上集群优先启用性价比最高。三大核心功能TTP、UCE 修复与弹性训练1️⃣ TTP 临终遗言故障瞬间抢救checkpoint训练发生故障时TTP 会实时校验优化器中间状态数据的完整性和一致性生成一次临终 checkpoint——恢复时可以直接回到故障前一刻的状态几乎零迭代损失而不是回退到上一次定期保存的 checkpoint。2️⃣ UCE Step 级重计算内存坏了也能继续跑昇腾芯片支持 NPU 卡内存 UCE不可修复错误的实时检测。检测到 UCE 故障后基于副本优化器状态对故障卡做在线重计算修复训练流程无需中断。3️⃣ 弹性训练没空闲资源缩着继续训集群没有空闲卡可替换故障节点时弹性训练可以按数据并行粒度缩掉故障 DP 域先小规模继续训练待集群腾出资源后再自动扩容回原有规模。当前支持 DP 粒度的缩容与一次性扩回原规模。断点续训崩溃兜底的最后防线高可用负责少崩断点续训负责崩了也能秒恢复。配置好--save与--save-interval如每 500 步一次后系统会定期保存完整检查点包括✅ 模型权重model weights✅ 优化器状态momentum、variance 等✅ 训练步数iteration✅ 随机状态random states恢复时只需加上--load ${CHECKPOINT_PATH}系统自动读取latest_checkpointed_iteration.txt找到最新迭代步无缝续训。⚠️ 注意三个不可设置--finetune、--no-load-optim、--no-load-rng都会导致优化器/随机状态丢失让续训变重训。快速上手四个开关搞定高可用在预训练启动脚本中加入参数即可参数定义见 high_availability.py参数作用--enable-high-availability高可用总开关 TTP 临终遗言--enable-hbmfault-repair片上内存故障 Step 级重计算--enable-worker-reboot一般性故障的进程级空中加油重启--enable-elastic-training弹性缩扩容训练更省事的方式是设置环境变量优先级高于参数HIGH_AVAILABILITYdump / retry / recover / elastic-training四档分别对应不同开关组合一键开启。完整的特性源码位于 mindspeed_llm/core/high_availability/ 目录官方文档见 高可用特性 与 断点续训指南。使用约束开启前先看这三点DP 必须大于 1副本机制要求 Data Parallel Size 1MoE 场景下稠密层与稀疏层 DP 均需 1长序列并行要求dp_cp_size 1需安装 mindio_ttp 包高可用特性依赖 MindIO 提供的 whl 包未安装时启动会直接报错部分特性暂不兼容如 swap attention、LoRA target modules、use-dist-ckpt等与高可用互斥详见官方约束说明。总结MindSpeed LLM 用副本优化器 临终 checkpoint 在线修复 弹性缩扩容 断点续训五件套把 512 卡规模训练从一颗老鼠屎坏一锅粥变成了故障无感、训练不止。对于千卡级用户只需在启动脚本加一个开关就能显著降低大规模训练的机时损耗。【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表