ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Edge0-35B-A3B Preview 技术解析:如何在 3 GiB 活跃内存下以 4-bit 量化运行 35B 稀疏 MoE

Edge0-35B-A3B Preview 技术解析:如何在 3 GiB 活跃内存下以 4-bit 量化运行 35B 稀疏 MoE 人工智能大模型模型量化LoRA本地部署【免费下载链接】Edge0-35B-A3B-preview项目地址https://ai.gitcode.com/hf_mirrors/Edge0/Edge0-35B-A3B-preview点击查看免费下载本文以 Edge0-35B-A3B PreviewEdge0-35b-a3b下称 Edge0-35B模型仓库为对象系统讲解其SSD 专家卸载SSD expert offload 前置路由预测Prerouter Recover-LoRA 蒸馏恢复三大机制如何协同工作并给出从仓库结构、量化细节到快速部署运行的完整实操指南。读完本文你将理解 edge0 流式推理框架在这份模型仓库中的落点、4-bit 模型各分片与适配器的组织方式以及如何在 Apple Silicon 上把该模型跑起来或通过 OpenAI 兼容 API 对外服务。项目定位为内存受限场景设计的 35B 稀疏 MoEEdge0-35B 是一个基于 Qwen3.6-35B-A3B 的 35B 级稀疏 MoEMixture-of-Experts大语言模型其核心卖点非常明确在低于 3 GiB 的活跃内存active memory内以可交互的速度运行完整模型。它由 edge0 流式推理框架驱动采用 MLX 后端。需要强调的是这一仓库当前处于Preview早期预览状态checkpoint 以 int4 量化 LoRA 适配器 Prerouter 适配器的形式发布均为该框架专门训练。模型的主要特征来自 README.md包括手机级内存运行完整的 4-bit checkpoint 常驻存储storage专家权重按需流式加载只有活跃权重进入 RAM——低于 3 GiB无需分片sharding也无需将权重预先整体载入内存可交互的推理速度解码约 15 tok/s长提示词的 prefill 填充速度约 140 tok/s量化后质量保持Recover-LoRA 蒸馏使 int4 模型与 fp16 基座的平均差距控制在3.9 分以内开箱即用基础权重、LoRA 与 Prerouter 适配器随仓库一起发布由edge0自动加载。三大核心机制Edge0 的三板斧README 明确指出这一切由三个机制共同支撑。理解这三者是理解整个仓库的前提。1. SSD 专家卸载SSD expert offload内存有界而非参数有界MoE 模型的特点是参数量巨大但每次前向只激活一小部分专家。Edge0-35B 共 40 层、256 个专家详见 config.json 中num_experts: 256而每 token 只路由少量专家。SSD 专家卸载正是利用这一点专家权重从存储NVMe SSD、内置闪存等按需流式读取只有被路由到的专家才会被取出RAM 中仅保留活跃权重active weights因此峰值内存由活跃集合决定而不是由参数量决定——这是3 GiB 跑 35B的根本原因。从 model.safetensors.index.json 可以看到权重被组织为switch_mlp.gate_proj / up_proj / down_proj的专家三投影结构并附带biases与scales字段量化仿射参数这些正是按层、按专家可独立流式取用的最小单元。2. Prerouter用提前一步的路由预测掩盖存储延迟如果专家是实时从 SSD 拉的那么等待 I/O 就会卡住前向计算。Prerouter 解决的是这个问题它是一个经过训练的前置路由头trained head负责提前一步预测下一时刻下一个 token / 下一层的专家路由结果预测结果使专家加载与前向传播**重叠overlap**进行——在计算当前步的同时预取下一步所需的专家而不是让前向传播干等存储官方给出的收益为解码吞吐最高 59%且增益随存储延迟、模型规模与路由宽度 K 的增大而增大。仓库中的 prerouter_edge0_35b.safetensors 正是这份预训练路由头的权重文件与基础 checkpoint 同仓发布、自动加载。3. Recover-LoRA蒸馏恢复 4-bit 量化损失量化到 4-bit 必然带来精度损失Recover-LoRA 用于补偿int4 基础模型被冻结frozenLoRA 适配器通过从 FP 教师fp16 基座蒸馏的方式训练目标是把量化损失找回来适配器**保持未合并unmerged**状态一个只读的基础模型可以同时服务多套适配器这正是批量多租户服务的关键。仓库中的 lora_edge0_35b.safetensors 就是这套 LoRA 适配器权重。模型规格与仓库构成网络结构与关键超参数依据 config.jsonconfig.json中记录了完整的模型结构text_config关键项如下配置项值说明model_typeqwen3_5_moe架构Qwen3_5MoeForConditionalGenerationnum_hidden_layers4040 层hidden_size2048隐藏维度num_attention_heads/num_key_value_heads16 / 2多头注意力GQAhead_dim256注意力头维度num_experts256专家总数num_experts_per_tok8transformers 侧每 token 路由数见下文说明moe_intermediate_size512单个专家中间维度shared_expert_intermediate_size512共享专家中间维度max_position_embeddings262144最大上下文长度vocab_size248320词表大小router_aux_loss_coef0.001路由辅助损失系数mtp_num_hidden_layers1多 token 预测MTP层数值得注意的架构特征可从配置文件直接确认混合注意力结构layer_types显示 40 层中每 4 层插入一层full_attention其余为linear_attention线性注意力携带conv1d、A_log、dt_bias等参数从 model.safetensors.index.json 的linear_attn权重命名可印证其包含 in_proj_a/b/qkv/z、out_proj、SSM 式状态参数。这种稀疏全注意力 线性注意力的组合显著降低长上下文下的 KV 开销。共享专家每层除 256 路 switch MLP 外还有shared_expert与shared_expert_gate路由门保证每个 token 都有稳定的共享计算底座。关于 K 值的口径说明README 声称每 token 激活 4 个专家K4而config.json的text_config.num_experts_per_tok记录为 8。两者差异可能与 edge0 框架与 transformers 配置字段的口径不同有关例如是否计入共享专家或是否由 Prerouter 缩减实际激活数。此处以 README 官方口径K4、256/4为准配置字段值如实引用供读者交叉核对。量化实现仓库权重为仿射affine4-bit 量化group_size 64且所有路由门mlp.gate与mlp.shared_expert_gate单独提升到8-bit精度——路由头对数值精度更敏感这是合理的工程取舍。仓库文件清单与权重组织仓库根目录直接是一个完整可运行的 edge0 模型目录依据 README.md 与文件列表文件作用model-00001-of-00004.safetensors~model-00004-of-00004.safetensors4 个基础 checkpoint 分片含biases/scales量化参数model.safetensors.index.json权重分片索引total_size约 20.4 GB含视觉编码器与语言模型全部权重lora_edge0_35b.safetensorsRecover-LoRA 适配器蒸馏恢复量化损失prerouter_edge0_35b.safetensorsPrerouter 前置路由预测头config.json模型结构 量化配置generation_config.json生成采样参数tokenizer.json/vocab.json/tokenizer_config.json分词器chat_template.jinja对话模板含 thinking 模式、工具调用、多模态占位preprocessor_config.json/processor_config.json图像/视频预处理配置值得留意的是config.json中还包含vision_config27 层视觉编码器、hidden_size 1152、patch_size 16、temporal_patch_size 2与image_token_id/video_token_id说明该模型基于 Qwen3 的多模态底座但本次 preview 发布的核心焦点是语言侧推理。processor_config.json与preprocessor_config.json配置了Qwen3VLProcessor的图像/视频处理管线tokenizer_config.json中model_max_length为 262144与max_position_embeddings一致。生成参数依据 generation_config.json仓库内置的默认生成配置为do_sample: true、temperature: 1.0、top_k: 20、top_p: 0.95eos_token_id为[248046, 248044]含思考结束标记pad_token_id为 248044。这意味着不额外传参时模型即按采样方式输出。对话模板与 thinking 模式依据 chat_template.jinja仓库自带的 jinja 对话模板支持thinking 模式生成时默认以think开头支持enable_thinkingfalse关闭思考、preserve_thinking保留历史思考内容工具调用function calling以tool_call/function/parameterXML 格式输出支持多步工具链multi-step tool与tool_response回传多模态占位支持|vision_start||image_pad||vision_end|与视频占位符。该模板是 edge0 推理时自动应用的无需手动拼 prompt。质量评估量化 适配器后的精度损失README 声明所有基准由作者使用 OpenCompass 在相同设置与参数下对两个模型edge0 int4 管线 vs Qwen3.6-35B-A3B fp16 基座进行评测结果如下基准edge0-35bint4Qwen3.6-35B-A3Bfp16AIME 202686.692.7HumanEval90.995.1GPQA-Diamond79.881.8MMLU-Pro81.084.6IFBench57.961.7平均79.283.2即 edge0 管线相对 fp16 基座平均损失3.9 分。这是Recover-LoRA 把 4-bit 量化损失压到很小的直接证据——尤其在数学推理AIME 2026 仅差 6.1、代码HumanEval 差 4.2与知识类任务上表现接近基座。性能实测数据README 给出的官方性能数据由examples/bench.py在Mac mini M4 Pro24 GB上测得解码速度Prefill 吞吐冷 / 热峰值活跃内存*14.9–17.7 tok/s113 / 140 tok/s2.9 GiB注*短上下文下的测量值长上下文会增加 KV cache 占用。专家权重从 SSD 按需流式加载、不常驻内存。需要强调的是以上数据仅为该项目自测结果适用前提是 Apple Silicon MLX 后端 快速存储NVMe/内置闪存不同硬件与上下文长度下会有明显差异。快速开始安装、下载与运行以下命令来自 README.md 的 Quick start 部分为完整可复现流程# 1. 安装 edge0 框架含 fetch 下载依赖 pip install -e githttps://github.com/Edge0-AI/edge0.git#eggedge0[fetch] # 2. 将本模型仓库下载到本地目录 huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview # 3. 指定模型目录并启动命令行聊天 export EDGE0_35B_MODEL$PWD/Edge0-35b-a3b-preview edge0 chat --name edge0-35b --prompt Introduce yourself # 4. 或启动 OpenAI 兼容的 HTTP API 服务 edge0 serve --name edge0-35b --port 8085关键点解读--name edge0-35b是 edge0 侧注册的模型名EDGE0_35B_MODEL环境变量用于指向本地模型目录由于本仓库本身就是一个完整的模型目录基础权重 LoRA Prerouter 同仓发布下载完成后无需任何额外拼接即可直接运行——这正是 README 强调的开箱即用edge0 serve --port 8085提供 OpenAI 兼容接口方便接入既有应用环境前提edge0 的 MLX 后端目前面向Apple Silicon见下文局限且建议使用快速存储以获得 Prerouter 的理想收益。更完整的用法Python API、流式选项、Prerouter 细节请参考 edge0 框架文档README 中已给出指引。使用场景依据 README 的 Use cases 部分该模型面向三类典型场景边缘 / 端侧推理GPU VRAM 稀缺但存储很快NVMe、内置闪存的设备上运行 35B 级模型单机批量服务一个只读基础模型同时服务多套 LoRA 适配器无需重新量化即可切换不同适配多语言聊天与推理通过内置 chat template 启用 thinking 模式获得推理增强。局限性说明README 明确列出的限制使用时需注意预览版本覆盖度与质量仍在扩展中主要针对基础模型的语言进行调优Agent 能力未优化工具使用、多步规划、长周期自主性目前较弱完整版将显著强化后端平台限制MLX 后端当前仅面向 Apple Silicon其他后端在 edge0 路线图中长上下文代价长上下文会显著增长 KV cache想保持 3 GiB 峰值内存请使用较短的上下文。相关文件索引以下仓库文件可作为进一步深入研究的入口README.md官方文档包含全部机制说明、基准与命令config.json模型结构、混合注意力层序、4-bit/8-bit 混合量化配置generation_config.json默认采样参数chat_template.jinjathinking 与工具调用模板model.safetensors.index.json权重分片与总量索引lora_edge0_35b.safetensorsRecover-LoRA 适配器prerouter_edge0_35b.safetensorsPrerouter 路由预测头tokenizer_config.json 与 processor_config.json分词与多模态预处理配置。如果需要在研究中引用该工作README 提供如下 BibTeX 条目论文主题为从 SSD 服务 35B MoE 的受训路由预测misc{lin2026halfmemorywallserving, title{The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction}, author{Yu Lin and Yiming Wang and Runyuan Cai and Hanze Liu and Xiaodong Zeng}, year{2026}, eprint{2609.18063}, archivePrefix{arXiv}, primaryClass{cs.AI}, }许可证为 Apache 2.0。总体而言Edge0-35B Preview 以SSD 卸载换内存、Prerouter 换吞吐、LoRA 蒸馏换精度的组合为内存受限的端侧与单机推理提供了一条可复现的工程路径本仓库即是这套管线完整、可直接运行的模型载体。赞分享人工智能大模型模型量化LoRA本地部署【免费下载链接】Edge0-35B-A3B-preview项目地址https://ai.gitcode.com/hf_mirrors/Edge0/Edge0-35B-A3B-preview点击查看免费下载相关推荐Recover-LoRA原理揭秘Edge0-35B-A3B如何用蒸馏找回4-bit量化损失Recover LoRA原理揭秘Edge0 35B A3B如何用蒸馏找回4 bit量化损失 Edge0 35B A3B 是一个能在 3 GiB 内存里跑起来的人工智能大模型模型量化LoRA本地部署如何读懂量化配置Edge0-35B-A3B 4-bit加8-bit混合精度的质量与速度秘诀如何读懂量化配置Edge0 35B A3B 4 bit加8 bit混合精度的质量与速度秘诀 想在 3 GiB 内存里跑一个 35B 的 MoE 大模型本文带人工智能大模型模型量化LoRA本地部署Edge0-35B-A3B是什么35B MoE大模型跑进3GB手机内存边缘推理完整指南Edge0 35B A3B是什么35B MoE大模型跑进3GB手机内存边缘推理完整指南 Edge0 35B A3B 是一款 35B 级稀疏 MoE混合专家人工智能大模型模型量化LoRA本地部署创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表