ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

DeepSeek-R1 模型下载指南:3 种方式,从选型到本地部署

DeepSeek-R1 模型下载指南:3 种方式,从选型到本地部署 DeepSeek-R1 模型下载指南3 种方式从选型到本地部署【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1DeepSeek-R1 是 DeepSeek 开源的推理模型6710 亿总参数激活 370 亿采用 MoE 混合专家架构官方上下文 128K。这个体量的 DeepSeek-R1 模型下载不是几分钟的事——全量权重被切成 163 个分片总容量约 688GB对磁盘和网络稳定性都是实打实的考验。本文用先选型、再下载、后校验、最后跑起来的顺序把三种下载方式、完整性和常用推理参数一次讲清帮你避开大文件下载里最常见的坑。下载 DeepSeek-R1 模型前先想清楚两个问题大多数人在第一步就踩坑直接开始拉 688GB 的全量权重然后发现显存不够跑、硬盘不够放、或者transformers加载后报错。所以动手之前先回答两个问题。问题一你用的是哪一代模型官方开源了两个核心模型DeepSeek-R1加入冷启动数据 两阶段强化学习效果对标 o1和 DeepSeek-R1-Zero纯强化学习训练行为更原始。另外还有一套蒸馏模型用 DeepSeek-R1 生成的推理数据微调出的 6 个中小规模模型1.5B / 7B / 8B / 14B / 32B / 70B它们在普通硬件上就能跑性价比最高。问题二你的硬件扛得住吗全量模型是 FP8 权重 MoE 结构单机消费级显卡基本没有部署空间需要多卡集群个人电脑和服务器更现实的路线是选蒸馏版。蒸馏模型底座模型权重约需空间 (BF16)大致硬件门槛DeepSeek-R1-Distill-Qwen-1.5BQwen2.5-Math-1.5B约 3GB单张 8GB 显卡DeepSeek-R1-Distill-Qwen-7BQwen2.5-Math-7B约 15GB单张 24GB 显卡DeepSeek-R1-Distill-Llama-8BLlama-3.1-8B约 16GB单张 24GB 显卡DeepSeek-R1-Distill-Qwen-14BQwen2.5-14B约 28GB单张 48GB 或双卡DeepSeek-R1-Distill-Qwen-32BQwen2.5-32B约 64GB双卡 24GB 起量化可更低DeepSeek-R1-Distill-Llama-70BLlama-3.3-70B-Instruct约 140GB多卡服务器结论很简单想本地跑先下蒸馏版本文以 32B 为例做研究复现才去下 688GB 的全量 R1。磁盘建议留 1.5 倍余量——下载过程会有临时文件。3 种下载方式对比与选择三种方式的取舍如下按最省事 → 最可控排列方式适合场景断点续传并行加速备注git clone Git LFS想要完整仓库含 README、LICENSE、代码文件支持受 LFS 限制需要预装 Git LFShuggingface_hub 库只下权重可编程控制支持可调并发数推荐可筛选文件手动下载单个文件只要一两个小文件如 config.json需自行处理多线程自行实现适合临时取文件方式一git clone 拉取完整仓库先安装 Git LFS大文件版本控制工具没有它克隆下来只有几百字节的占位文件sudo apt-get install git-lfs git lfs install然后克隆镜像仓库命令会后台拉取全部 LFS 文件可以挂长连接跑git clone https://gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1克隆完成后目录结构大致如下config.json模型结构配置、generation_config.json生成参数、configuration_deepseek.py和modeling_deepseek.py远程推理代码trust_remote_codeTrue时会用到、tokenizer.json/tokenizer_config.json分词器、163 个model-XXXXX-of-000163.safetensors权重分片以及model.safetensors.index.json分片索引。方式二用 huggingface_hub 下载推荐官方模型发布在 HuggingFace 平台snapshot_download是官方提供的下载入口支持断点续传和多文件并发。这段代码做什么把整个 DeepSeek-R1 仓库下载到当前目录下的./DeepSeek-R18 个并发线程拉取。from huggingface_hub import snapshot_download path snapshot_download( repo_iddeepseek-ai/DeepSeek-R1, local_dir./DeepSeek-R1, max_workers8, ) print(下载完成:, path)如果只下蒸馏版把repo_id换成对应的仓库名如deepseek-ai/DeepSeek-R1-Distill-Qwen-32B即可思路完全一致。中途断网后重新运行同一段代码会跳过已完成的分片继续下载。方式三只取单个文件偶尔只需要config.json看结构或者拿某个分片补传直接用浏览器或curl从仓库的原始文件地址下载即可注意把resolve后的文件名写对。取完文件后建议和本地已有文件做大小比对防止传输截断。怎么确认下载是完整的688GB 的文件传一半很难用肉眼发现。仓库里自带model.safetensors.index.json它记录了每个参数张量位于哪个分片正好可以当清单来核对。这段代码做什么读索引文件检查它引用的每个分片是否都真实存在于本地目录。import json, os model_dir ./DeepSeek-R1 index json.load(open(os.path.join(model_dir, model.safetensors.index.json))) shards set(index[weight_map].values()) # 应恰好 163 个 missing [f for f in shards if not os.path.exists(os.path.join(model_dir, f))] print(分片总数:, len(shards), | 缺失:, missing if missing else 无)核对标准有两条分片数等于 163没有任何缺失文件。另外提醒一个隐蔽坑——如果你用 git 克隆但没装 Git LFS分片会只有几百字节且内容是 LFS 指针文本以version https://git-lfs.github.com开头此时每个分片大小应该在 GB 量级一比对就能发现异常。官方基准成绩这个模型值不值得下DeepSeek-R1 的推理能力是它被大量下载的原因。下面是官方报告中的几项代表性成绩Pass1可以直观看出和闭源模型的差距基准测试DeepSeek-R1o1-miniGPT-4oMATH-500数学97.390.074.6AIME 2024奥数79.863.69.3LiveCodeBench代码65.953.834.2MMLU综合知识90.885.287.2蒸馏版同样能打32B 版本在 AIME 2024 上拿到 72.6超过 o1-mini 的 63.6Llama-70B 版的 MATH-500 达 94.5是稠密模型里的第一梯队。所以如果你的硬件只够 32B能力损失并没有硬件差距看起来那么大。拿到权重后怎么跑起来先说一个容易误解的点全量 R1/R1-Zero 目前官方尚未支持直接用 transformers 加载官方指引是参考 DeepSeek-V3 仓库的部署方案门槛是多机多卡。而蒸馏版是标准结构vLLM 一条命令起服务vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \ --tensor-parallel-size 2 \ --max-model-len 32768 \ --enforce-eager这条命令做什么以 2 卡张量并行方式启动 32B 蒸馏版的推理服务最大上下文 32768--enforce-eager关闭 CUDA graph 以保证首次部署稳定。SGLang 路线同理python3 -m sglang.launch_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B --trust-remote-code --tp 2。显存紧张时可以考虑量化加载如 8-bit / 4-bit以少量精度损失换容量但官方基准成绩都是在未量化下测得严肃评测请保留原始精度。关键参数不设置对效果会打折扣仓库里的generation_config.json已经给出了官方采样参数实际使用时务必对齐这几条来自官方使用建议temperature 取 0.5~0.7推荐 0.6top_p 0.95。温度开太高会陷入无限重复或输出乱码。不要加 system prompt。这类模型的指令要全部放在用户消息里加了系统提示反而影响推理质量。数学题提示词里加一句Please reason step by step, and put your final answer within \boxed{}.强制以think\n开头部分提问会让模型跳过思考过程直接答在输出开头固定加think前缀可以保证它进入完整推理。评估能力时多跑几次取平均单次结果波动较大。常见问题排查磁盘不够全量约 688GB 临时空间先df -h确认个人机器请改下蒸馏版。克隆下来的分片只有几百字节没装 Git LFS执行git lfs install后重新克隆或用git lfs pull补拉。下载中途断网三种方式都支持续传——git 重新 clone 会跳过已有对象huggingface_hub 重跑同一命令自动续传手动下载用带Range请求头的补传。加载时报错找不到远程代码确认configuration_deepseek.py、modeling_deepseek.py都在模型目录里并开启trust_remote_codeTrue。输出开始复读或跑题优先检查 temperature 是否超出 0.5~0.7 区间。下一步如果你只是想尽快看到效果选 32B 蒸馏版用上面的 huggingface_hub 或 git 方式下完vLLM 起服务按temperature 0.6、无 system prompt、think开头三件套提问。如果你要复现官方成绩或做研究再规划 688GB 磁盘和多卡集群去拉全量权重。模型许可为 MIT允许商用和衍生使用蒸馏版各自沿用 Qwen / Llama 底座的附加条款见仓库LICENSE。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表