ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

3 步完成 DeepSpeed Windows 安装:pip 预编译、ds_report 验证与报错排查

3 步完成 DeepSpeed Windows 安装:pip 预编译、ds_report 验证与报错排查 3 步完成 DeepSpeed Windows 安装pip 预编译、ds_report 验证与报错排查【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeedDeepSpeed 是一个深度学习优化库核心能力是分布式训练与推理ZeRO把模型优化器状态、梯度切分到多卡上以省显存、3D 并行和 MoE混合专家都出自它。过去这些功能只能在 Linux 上用Windows 用户只能绕道 WSL。现在 DeepSpeed 0.14.5 起原生支持 Windows且关键差异是Windows 包的算子已预编译安装全程不需要 CUDA SDK也不需要 C 编译器。按下面顺序操作三步内就能跑通训练和推理。动手前 30 秒环境自查DeepSpeed Windows 安装硬性要求先确认以下条件不满足先补环境再往下走项目要求Python3.xPyTorch带 CUDA 支持且必须在安装 DeepSpeed之前装好Windows官方验证环境为 Windows 11 Version 23H2单 GPU 机型GPUNVIDIA 单卡DeepSpeed0.14.5 及以上版本才有 Windows 支持检查 PyTorch 是否带 CUDApython -c import torch; print(torch.__version__, torch.version.cuda)看到形如2.3.0cu121 12.1的输出说明 CUDA 可用None说明装的是纯 CPU 版 PyTorch先重装 PyTorch 再安装 DeepSpeed。一条命令装好 DeepSpeedpip 预编译免编译器打开命令提示符或 PowerShell执行pip install deepspeedWindows 下 pip 下载的是预编译 wheel如deepspeed-0.14.5-cp311-cp311-win_amd64.whl算子全部包含在包里所以这一步不会触发编译也没有 CUDA SDK 或 C 编译器的依赖。看到Successfully installed deepspeed-x.y.z即下载完成接下一步验证。跑一次 ds_report 验证 DeepSpeed Windows 安装是否成功装完立刻执行ds_report输出包含两部分上半部是 C/CUDA 算子兼容性报告表下半部是通用环境信息。看到环境信息区列出显卡型号示例为 NVIDIA RTX A2000和torch cuda version即代表 DeepSpeed Windows 安装成功。表中的[WARNING]和[NO]不必紧张它们只表示个别可选算子当前未启用[YES]表示该算子可用[OKAY]表示按需在运行时编译均不影响训练和推理。进阶什么时候才需要从源码编译 build_win.bat常规使用不需要源码构建。只有以下两种情况才走这条路需要尚未发布的最新代码或要自定义/裁剪算子集合。先克隆仓库再运行仓库根目录的 build_win.batgit clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed build_win.bat该脚本会关闭一批 Windows 下暂不支持的算子AIO、CUTLASS、Evoformer、稀疏注意力、DeepCompile 等的编译然后在dist目录生成 wheel用pip install dist\xxx.whl安装即可。更细节的编译问题对照 高级安装文档 排查。DeepSpeed Windows 安装卡住了按阶段对照报错排查阶段报错症状原因处理动作构建阶段cl.exe not found、ninja报错源码构建缺 C 工具链常规 pip 安装不编译、不会遇到确需源码构建时安装 Visual Studio 2019 的C 桌面开发工作负载或参考 advanced-install.md 提供的 conda 环境版本匹配阶段torch.version.cuda输出None或 CUDA 初始化失败装的是 CPU 版 PyTorch或显卡驱动过旧先重装带 CUDA 的 PyTorch再更新 NVIDIA 驱动版本匹配阶段RuntimeError: CUDA error: no kernel image is available for execution on the device算子未针对当前显卡架构编译构建时设置TORCH_CUDA_ARCH_LIST如8.6再重新构建查法详见 advanced-install.md⚠️ 版本匹配阶段DeepSpeed 的 CUDA 版本与 PyTorch 的torch.version.cuda不一致版本错配让 DeepSpeed 的 CUDA 版本对齐 PyTorch 报告的 CUDA 版本后重装运行阶段进程崩溃、CUDA out of memory显存不足减小 batch size或启用 CPU offload 把权重换出显存运行阶段训练中途卡死后台程序占用显存任务管理器确认无残留训练/推理进程占卡训练实战一条命令跑通 CIFAR-10 图像分类示例脚本来自 DeepSpeedExamples 仓库本仓库 examples/ 为示例目录索引获取脚本后在脚本所在目录执行deepspeed cifar10_deepspeed.py --deepspeed--deepspeed是唯一必需参数。训练结束时看到Accuracy of the network on the 10000 test images和逐类别准确率以及exits successfully说明训练链路完整跑通。推理实战CPU Offload 跑 Llama-2-7B 生成这条命令用 ZeRO-Inference 做 token 生成它把模型权重换出到 CPU 内存CPU offload让 4GB 显存的机器也能推理 7B 模型。脚本同样来自 DeepSpeedExamples 仓库zero-inference 目录deepspeed run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload参数含义--batch-size批量条数--prompt-len提示词长度--gen-len每条生成 32 个 token--cpu-offload开启权重重量换出到内存。看到生成的文本块Paris is the capital city of …以及末尾的 model size、decode throughput 等统计说明推理正常。现在能做什么、还不能做什么可用单 GPU预训练、LoRA 微调配合 HuggingFace Transformers 集成、CPU offload 推理使用方式与 Linux 一致。在路上多 GPU 运行、权重量化、性能优化。反馈与参与问题直接提 Issues贡献流程见 CONTRIBUTING.md。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表