
一、模型速览腾讯混元Tencent Hy在 2026 年 8 月 28 日正式发布并开源Hy4 preview这是从 Hy3295B 总参 / 21B 激活 / 256K 上下文迭代而来的新一代 MoE 旗舰模型预览版。发布方腾讯混元团队Tencent Hy Team参数量770B 主干总参数每 Token 激活 49B256 路由专家 1 共享专家每 Token 激活 Top-8 路由专家 共享专家另有独立 MTP 层 10B 总参 / 0.7B 激活用于推测解码上下文长度原生 1M tokens1,048,576最大生成 64K许可证Apache License 2.0无字段限制、无地域排除可商用一句话定位面向代码、办公分析、游戏原型、科研等真实生产力工作流的「数据中心级」开源 Agent 基座模型一句话总结它不是来陪你聊天的是来钻进代码仓库、Office 文档、游戏引擎和科研流程里干活的。二、核心亮点亮点 1Gated DSA 稀疏注意力 IndexCache让 1M 上下文「喂得起」Hy4 的注意力模块采用门控版 DeepSeek 稀疏注意力Gated DeepSeek Sparse Attention, DSA并引入IndexCache——跨层复用稀疏选择索引而非每层重复计算。这是 1M 上下文在推理成本上「真正可用」的关键。# 官方 vLLM 部署时直接指定稀疏注意力后端--attention-backend FLASHMLA_SPARSE数据来源模型卡 / aicybr.com 部署解析官方架构说明亮点 2原生 MTP 推测解码层提速写进权重里与很多模型事后在推理框架里「外挂」投机解码不同Hy4 在权重侧内置了一个MTPMulti-Token Prediction层10B 总参 / 0.7B 激活用于原生 next-token 预测加速。vLLM / SGLang 双双在官方预构建镜像里默认开启。# 开启原生 MTP 推测解码每步预测 3 个 token--speculative-config {method: mtp,num_speculative_tokens: 3}数据来源Hugging Face 模型卡 deployment 章节亮点 349B 激活的「大库小用」MoE兼顾能力与成本770B 的「专家库」每道题只叫最相关的一批专家Top-8 路由 1 共享上场计算量按 49B 走。相比同等能力的稠密模型推理算力大幅下降这也是它能把 API 价格压到输入 6 元 / 百万 tokens、输出 18 元 / 百万 tokens、缓存命中 0.3 元的底气。数据来源腾讯混元官方公告2026-08-28亮点 4Agentic 基准全面领先同级开源官方在 agentic 维度的公开分数相当能打数据来源模型卡 / explainx.ai 整理基准Hy4 preview说明Terminal-Bench 2.185.4终端自动化Agent 核心能力MCP-Atlas (public)83.7工具调用编排SWE-Bench Pro65.7真实软件工程CyberGym78.4网络安全任务OfficeQA Pro66.2跨文件办公分析GPQA Diamond92.3研究生级科学推理亮点 5no_think直答开关关掉过度自我验证官方承认 preview 版在复杂任务上「思考偏长、过度自我验证」。为此提供reasoning_effort: no_think参数一键切回快速直答模式# 关闭深度思考适合简单问答 / 低延迟场景extra_body{chat_template_kwargs: {reasoning_effort: no_think}}数据来源Hugging Face 模型卡亮点 6iHC 残差超连接 相比 Hy3 的代际跃迁Hy4 用identity Hyper-ConnectionsiHC跨 4 条残差流拓宽层间信息流缓解超深 MoE78 层的训练/推理梯度问题。相比 Hy3295B 总参 / 21B 激活 / 256K官方附录 46 项成绩全部高于 Hy3几个提升夸张的DeepSWE28.0 → 64.336.3SWE Atlas Codebase QA30.8 → 64.0MathArena Apex 202538.7 → 74.2Toolathlon-Verified56.2 → 74.1数据来源腾讯混元官方对比附录2026-08-28从 Hy3 到 Hy4 preview 仅 53 天规模 2.6×、上下文 4×——国产开源的迭代节奏还在加速。三、部署实战⚠️ 重要前提Hy4 preview 是数据中心级模型。BF16 权重约 1.54TBFP8 权重约 770GB单机消费级显卡无法本地部署。官方 recipe 默认8 卡张量并行。以下给出生产可用的完整命令复制即可跑需 8×80GB 显存如 8×A100/H100/H800 或昇腾 Atlas 800I A3。3.1 环境准备官方提供预构建 Docker 镜像无需手动编译 vLLM# 拉取官方预构建镜像多架构 x86 / Arm docker pull vllm/vllm-openai:hy4-preview # 或通过 SGLang 部署 docker pull lmsysorg/sglang:hy4-preview如需从源码构建指定 Python 3.12uv venv --python 3.12 --seed --managed-python source .venv/bin/activate git clone https://github.com/vllm-project/vllm.git cd vllm uv pip install --editable . --torch-backendauto3.2 模型下载通过 huggingface-cli 或 modelscope 拉取权重FP8 变体体积更小推荐生产用# BF16 原版约 1.54TB谨慎 huggingface-cli download tencent/Hy4-preview --local-dir /data/hy4 # FP8 量化版约 770GB推荐生产部署 huggingface-cli download tencent/Hy4-preview-FP8 --local-dir /data/hy4-fp8权重地址https://huggingface.co/tencent/Hy4-preview 同步上线 ModelScope / GitCode / CNB3.3 启动推理服务vLLM8 卡 TPdocker run --gpus all -p 8000:8000 --ipchost \ -v ~/.cache/huggingface:/root/.cache/huggingface \ vllm/vllm-openai:hy4-preview \ tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config {num_speculative_tokens:3,method:mtp} \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 \ --reasoning-parser hy_v4 \ --enable-auto-tool-choice \ --port 8000 \ --served-model-name hy4-preview或用裸命令本地已装 vLLMvllm serve tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 \ --speculative-config.method mtp \ --speculative-config.num_speculative_tokens 3 \ --attention-backend FLASHMLA_SPARSE \ --tool-call-parser hy_v4 \ --reasoning-parser hy_v4 \ --enable-auto-tool-choice \ --port 8000 \ --served-model-name hy4-previewSGLang 等价命令docker run --gpus all --ipchost -p 8000:8000 \ lmsysorg/sglang:hy4-preview \ python3 -m sglang.launch_server \ --model tencent/Hy4-preview-FP8 \ --tp-size 8 \ --reasoning-parser auto \ --tool-call-parser auto \ --speculative-algorithm NEXTN \ --speculative-num-steps 3 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 4 \ --port 8000 \ --served-model-name hy4-preview数据来源Hugging Face 模型卡 deployment 章节 / bittide.aicompass.dev 整理3.4 完整可运行推理代码OpenAI 兼容服务起来后直接用openaiSDK 调用无需 extra 依赖# pip install openai from openai import OpenAI client OpenAI( base_urlhttp://localhost:8000/v1, api_keyEMPTY, # 本地部署无需真实 key ) # 1) 默认 high 推理模式深度思考适合编程/数学/科研 resp client.chat.completions.create( modelhy4-preview, messages[{role: user, content: 用 Python 写一个快速排序并分析时间复杂度。}], temperature0.9, top_p1.0, ) print(【深度思考】\n, resp.choices[0].message.content) # 2) no_think 直答模式关闭 CoT低延迟 resp2 client.chat.completions.create( modelhy4-preview, messages[{role: user, content: 今天北京天气怎么样用一句话回答。}], temperature0.9, top_p1.0, extra_body{chat_template_kwargs: {reasoning_effort: no_think}}, ) print(【直答】\n, resp2.choices[0].message.content) # 3) 工具调用Agent 场景需服务端已开 --enable-auto-tool-choice tools [{ type: function, function: { name: get_weather, description: 查询指定城市天气, parameters: { type: object, properties: {city: {type: string}}, required: [city], }, }, }] resp3 client.chat.completions.create( modelhy4-preview, messages[{role: user, content: 帮我查下上海今天天气。}], toolstools, tool_choiceauto, ) print(【工具调用】\n, resp3.choices[0].message.tool_calls)3.5 效果验证服务就绪后健康检查 冒烟测试# 检查模型已加载 curl -sf http://127.0.0.1:8000/v1/models # 发送一条推理请求 curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:hy4-preview,messages:[{role:user,content:Who are you?}],max_tokens:256,temperature:0}验证命令参考Hugging Face 模型卡 / 昇腾适配文档昇腾 0day 适配国产算力可行发布当天昇腾即实现 0day 支持基于vLLM-Ascend在 Atlas 800I A316 卡上用 W8A8 量化权重约 762G完成部署预构建镜像quay.io/ascend/vllm-ascend:hy4。数据来源昇腾官方适配公告2026-08-28四、性能测评说明本机无多卡 GPU以下速度/显存数据来自官方 recipe 与社区实测逐项标注来源未做任何虚构。4.1 显存占用量化视角权重格式估算存储部署前提BF16 / FP16~1.54 TB8×H100 仍吃紧需专家并行 高利用率FP8 / INT8~770 GB官方推荐8 卡 TP 可行W8A8昇腾~762 GBAtlas 800I A3 16 卡 TP数据来源aicybr.com 权重估算 / 昇腾适配文档均为一阶权重存储估算未含 KV cache、运行时开销4.2 推理速度官方 recipe 在 8 卡张量并行 MTP 推测解码下社区实测观察到约36 tok/sexplainx.ai 报道单请求 decode。端到端吞吐相对基线提升31.8%腾讯官方公告指算子融合 通信优化后的训练/推理栈整体收益。速度数据来源explainx.ai 博客2026-08-28、腾讯混元官方公告。未实测标注为「官方/社区观测」。4.3 与同级开源模型横向对比维度Hy4 previewGLM-5.3 (MIT)Kimi K3DeepSeek-V4-Pro总参数770B7430B(稠密)2.8T MoE1.6T–1.7T MoE激活参数49B全量~?~?上下文1M256K–1M1M1M协议Apache 2.0MIT开源MITTerminal-Bench 2.185.487.9*86.6*88.2*SWE-Bench Pro65.767.7*64.6*79.2*输入价格(¥/M)6.01.40(国际$1.40)—~0.44($)自托管门槛极高(8卡)高极高高带*为腾讯官方对比表中的「最高可用结果」口径其余来自模型卡与 explainx.ai 整理。价格来源腾讯官方 / explainx.ai。结论Hy4 preview 在 Apache 2.0 同级里 agentic 能力稳居第一梯队与 GLM-5.3 / Kimi K3 互有胜负官方内部盲测 203 工程任务均分 2.99 vs GLM 2.92 / Kimi 2.94差距在噪声范围内。相比 DeepSeek-V4-Pro 价格略高、绝对跑分略低但协议更宽松、无字段限制。五、使用建议适用场景长程软件工程跨文件重构、SWE-bench 级任务SWE-Bench Pro 65.7。配合 CodeBuddy / WorkBuddy 已内嵌可直接接管代码仓库做多文件修改。跨文件办公分析OfficeQA Pro 66.2适合企业知识库 / 文档智能体1M 上下文能一次塞进整本手册或数月邮件。工具调用编排 AgentMCP-Atlas 83.7原生支持 function calling适合把数据库、内部 API、运维脚本编排成自主工作流。数据中心私有化部署Apache 2.0 可商用无地域/领域限制金融、政企等对协议合规敏感的行业友好。不适用场景❌ 个人开发者单机部署FP8 仍需 ~770GB 显存消费级显卡无缘别浪费时间折腾 llama.cpp。❌ 追求最低 API 成本输入 6 元/百万 tokens高于 DeepSeek-V4-Pro~$0.44/M约 3 元预算敏感选后者。❌ 要求稳定生产模型官方明确为 preview存在过度自我验证、思考偏长问题上线前务必做一轮业务侧回归。调优提示简单任务务必加reasoning_effort: no_think否则延迟翻倍且容易「想太多」给出冗长答案。必开 MTP 推测解码num_speculative_tokens3官方 recipe 下实测提速明显是性价比最高的开关。长上下文配合--attention-backend FLASHMLA_SPARSE否则 KV cache 随序列长度线性膨胀直接 OOM。用官方预构建镜像vllm/vllm-openai:hy4-preview别自己从源码编 vLLM版本对齐坑多、启动慢。昇腾用户直接拉quay.io/ascend/vllm-ascend:hy40day 适配最省心多机部署记得先起 DP Coordinator 再拉 worker。固定模型 revision 与镜像 tag这是 preview 版本权重和 serving 栈会快速迭代生产环境务必 pin 版本保证可复现。5.1 硬件选型的「两个档位」很多读者关心的核心问题是「我到底要几张卡」。根据官方 recipe 与权重体积给出两个典型档位数据来源aicybr.com 权重估算 官方 8 卡 TP recipe部署形态推荐硬件权重格式说明单机验证8×H100/H800 80GBFP8 (~770GB)官方默认档支持短序列功能验证长序列生产2×8 节点 (16 卡) DP2FP8 / W8A8上下文可扩至 32K–1M并发 256国产算力昇腾 Atlas 800I A3 16 卡W8A8 (~762GB)0day 适配vLLM-Ascend 直接跑注意BF16 全精度约 1.54TB即便 8 张 80GB 卡640GB 总显存也装不下必须走专家并行expert-parallel或降精度。普通团队直接选 FP8 变体最现实。5.2 流式调用示例生产常用上面的推理代码是一次性返回生产环境通常用流式输出避免前端「转圈」# pip install openai from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) stream client.chat.completions.create( modelhy4-preview, messages[{role: user, content: 写一段用于解析 CSV 并统计各列缺失率的 Python 函数带类型注解。}], temperature0.9, top_p1.0, streamTrue, # 开启流式 ) for chunk in stream: delta chunk.choices[0].delta.content if delta: print(delta, end, flushTrue) print(\n--- 生成结束 ---)5.3 常见部署坑与排查现象可能原因处理启动报OOM/ 显存不足用了 BF16 或 KV cache 过大切 FP8降低--gpu-memory-utilization或缩--max-model-len推理极慢且无加速MTP 未生效确认--speculative-config与镜像版本匹配工具调用不触发未开--enable-auto-tool-choice补该参数并确认--tool-call-parser hy_v4长上下文直接崩未用稀疏注意力后端加--attention-backend FLASHMLA_SPARSE多机 worker 起不来DP Coordinator 未先就绪先起节点 1 看到Started DP Coordinator再拉节点 2