腾讯混元Hy3深度解析:295B参数只激活21B,推理效率怎么做到提升40%的
📅 2026/7/26 0:40:19
👁️ 次浏览
7月6日腾讯混元Hy3正式发布7月20日宣布限时免费延长到8月5日。说实话295B参数、Apache 2.0开源、API定价输入1元/输出4元/百万token——这些数字单独拿出来都不算特别惊人但放在一起看你会发现腾讯这次打了一套组合拳。我最感兴趣的不是参数规模而是它那个快慢思考融合的架构设计。295B的总参数一次推理只激活21B——这个7%的激活率在MoE模型里算是相当激进的。更关键的是它把快思考和慢思考两个模式融合在同一个模型里而不是像GPT-5那样需要显式地切换推理模式。快慢思考融合Hy3最被低估的设计快慢思考这个概念来自丹尼尔·卡尼曼的《思考快与慢》。简单说人脑有两种思考模式系统1快思考是直觉的、自动的、不费力的系统2慢思考是分析的、刻意的、费力的。在AI领域这个概念的落地方式是对于简单问题比如今天天气怎么样用快模式快速回答对于复杂问题比如帮我分析这个代码库的性能瓶颈用慢模式深度思考。GPT-5的做法是用户自己选择用哪个模式。Hy3的做法不一样——它把两个模式融合在同一个模型里模型自己判断该用哪个模式。简单问题复杂问题用户输入Hy3 路由判断快思考路径激活 21B 参数慢思考路径激活更多专家单次推理延迟 500ms成本低0.56元/百万token多步推理Chain-of-Thought激活额外专家如代码/数学专家成本高输出 4元/百万token输出结果这个设计的巧妙之处在于用户不需要显式选择模式模型自己判断任务的复杂度。你问11等于几它自动走快路径你问帮我分析这个SQL查询的性能瓶颈并给出优化建议它自动走慢路径。实现这个的关键是Hy3的动态门控机制——一个轻量级的分类器在推理前先判断token的复杂度然后决定激活哪些专家。# Hy3 快慢思考融合的简化实现importtorchimporttorch.nn.functionalasFclassFastSlowRouter(torch.nn.Module):Hy3 风格的快慢思考路由器def__init__(self,d_model:int,n_fast_experts:int,n_slow_experts:int):super().__init__()self.d_modeld_model self.n_fastn_fast_experts self.n_slown_slow_experts# 复杂度判断器预测 token 是否需要慢思考self.complexity_gatetorch.nn.Sequential(torch.nn.Linear(d_model,d_model//4),torch.nn.GELU(),torch.nn.Linear(d_model//4,1),torch.nn.Sigmoid())# 专家路由门self.fast_gatetorch.nn.Linear(d_model,n_fast_experts,biasFalse)self.slow_gatetorch.nn.Linear(d_model,n_slow_experts,biasFalse)defforward(self,x:torch.Tensor,fast_experts:list,slow_experts:list): x: [batch, seq, d_model] # 步骤1: 判断复杂度complexityself.complexity_gate(x)# [batch, seq, 1]# 步骤2: 根据复杂度分配专家fast_logitsself.fast_gate(x)# [batch, seq, n_fast]slow_logitsself.slow_gate(x)# [batch, seq, n_slow]# 复杂度低 → 多用快专家复杂度高 → 多用慢专家fast_weightsF.softmax(fast_logits,dim-1)*(1-complexity)slow_weightsF.softmax(slow_logits,dim-1)*complexity# 步骤3: 加权融合快慢专家输出outputtorch.zeros_like(x)fore,expertinenumerate(fast_experts):outputfast_weights[:,:,e:e1]*expert(x)fore,expertinenumerate(slow_experts):outputslow_weights[:,:,e:e1]*expert(x)returnoutput为什么只激活21B是个巧妙的设计Hy3的295B参数中一次推理只激活21B——也就是7%的激活率。这个数字看起来很小但背后有个很精妙的计算参数多 知识容量大。295B参数意味着模型可以记住更多的知识、更多的模式、更多的语言习惯。在需要广博知识的任务上比如开放域问答、多语言翻译大参数量的优势很明显。激活少 推理快、成本低。每次推理只激活21B意味着计算量和显存占用都只有21B量级。这比全量推理295B少了93%的计算量。换句话说Hy3的策略是用295B的参数来存储知识用21B的激活来执行推理。存储和计算分离这在MoE架构里是一个经典的优化思路但Hy3把它做到了一个比较极致的程度。Hy3 MoE 模型93% 参数不参与计算295B 参数知识存储21B 激活推理执行推理节省显存和算力传统 Dense 模型70B 参数70B 激活推理限时免费背后的商业逻辑腾讯把Hy3的限时免费延长到8月5日这个操作值得玩味。从表面上看这是让更多用户体验产品。但往深了想腾讯在下一盘更大的棋Hy3不只是一个大模型它是腾讯整个AI生态的入口。Hy3背后连着腾讯的多个产品线微信的AI助手、腾讯云的AI服务、腾讯文档的智能写作、企业微信的智能客服。用户通过Hy3的API进来了后面自然会被引导到腾讯的整个生态里。# 腾讯 AI 生态的模型路由概念性代码classTencentAIRouter:腾讯内部 AI 模型路由MODELS{hunyuan_hy3:{api:https://api.hunyuan.cloud.tencent.com/v1,use_case:通用对话、代码生成、文档写作,pricing:输入1元/输出4元/百万token,},hunyuan_hy3_free:{api:https://api.hunyuan.cloud.tencent.com/v1/free,use_case:免费试用限时到8月5日,pricing:免费,},}defroute(self,user_tier:str)-str:ifuser_tierfree_trial:returnhunyuan_hy3_freereturnhunyuan_hy3这和OpenAI的策略完全不同。OpenAI的全系产品都是闭源的你只能通过API用——用多少付多少。腾讯走的是开源免费试用生态绑定的路线——开源吸引开发者免费试用降低门槛生态绑定实现商业变现。写在最后腾讯混元Hy3的发布让我看到了国产大模型在技术架构创新上的一个有意思的尝试。快慢思考融合不是一个新的概念但Hy3把它做到了模型内自动判断的程度这在工程上确实需要不小的勇气。295B参数只激活21B推理效率提升40%Apache 2.0开源限时免费——这些数字和策略放在一起腾讯的意图很明确在AI大模型的牌桌上既要占技术位又要占生态位。对开发者来说Hy3的免费期到8月5日现在是体验的最佳时机。用过的都懂等收费了再想白嫖就来不及了。标签腾讯混元Hy3、MoE架构、快慢思考、开源大模型、AI推理优化
博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…
📅 2026/7/26 0:39:19
很多开发者在使用AI编程工具时,会把“重试”当成最直接的恢复方式。命令执行失败,重新运行一次。
测试没有通过,让Codex继续修复。
结果偏离需求,再补充一段提示。
任务中断以后,让ChatGPT接着往下做。在简单任务中&am…
📅 2026/7/26 0:39:19
本文列举了AI在制造业、农业、零售业等10个行业的实际应用案例,展示AI如何通过自动化、预测和优化提升效率、降低成本。从制造业的智能质检到农业的精准种植,从零售业的智能库存管理到金融业的快速信贷审批,AI正以具体、务实的方式重塑各行各…
📅 2026/7/26 0:39:19
很多站长还在死磕外链数量,却忽略了链接来源的地理权重,这篇内容直接拆解如何通过 geo 相关性分析提升本地排名,解决流量精准度低和转化差的痛点。最近跟几个做本地生活服务的老板聊天,发现一个挺扎心的现象:同样的预算,别人家门店天天排队,自家店却连个响儿都没有。不是…
📅 2026/7/26 2:06:42
1. 大模型工程化现状全景扫描2026年的大模型工程化领域已经完成了从技术探索期到产业落地期的关键跨越。根据全球AI工程院最新发布的产业白皮书显示,企业级大模型部署量在过去18个月实现了400%的爆发式增长,但与此同时,有78%的CIO在技术调研报…
📅 2026/7/26 2:06:50
1. 项目背景与核心价值在数据分类预测领域,传统径向基神经网络(RBFNN)存在参数选择依赖经验、收敛速度不稳定等问题。这个项目通过引入冠豪猪优化算法(CPO)来自动化RBFNN的参数优化过程,实现了分类精度和模型效率的双重提升。我在金融风控领域实际应用中…
📅 2026/7/26 2:06:50
League Akari:基于LCU API的智能游戏辅助工具解决方案 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit
在英雄联盟游戏生态中&#…
📅 2026/7/26 2:06:50
1. 项目背景与核心价值在火力发电厂的日常运营中,锅炉效率、汽轮机热耗、厂用电率等关键参数的精准预测直接关系到机组经济运行。传统BP神经网络(BPNN)在电厂数据预测领域已有广泛应用,但存在收敛速度慢、易陷入局部最优、超参数敏感等问题。我们团队将水…
📅 2026/7/26 2:06:50
RPG Maker MV/MZ插件库:300专业插件构建你的终极游戏开发工具箱 【免费下载链接】RPGMakerMV RPGツクールMV、MZで動作するプラグインです。 项目地址: https://gitcode.com/gh_mirrors/rp/RPGMakerMV
你是否在为RPG Maker的功能限制而烦恼?想要实…
📅 2026/7/26 2:06:50
更多请点击:
https://codechina.net
第一章:AI帮助理解数学概念 人工智能正以前所未有的方式重塑数学学习的路径。通过自然语言处理与符号计算的深度融合,AI不仅能解析抽象定义,还能将定理、证明和几何直觉转化为可交互、可验证的…
📅 2026/7/26 0:00:06
1. 项目背景与核心价值去年参与的一个短剧项目让我深刻体会到传统创作流程的痛点:编剧团队花了三周打磨剧本,角色设计反复修改了七版,最后成片时又因为演员档期问题不得不临时调整分镜。这种低效的创作模式在快节奏的内容行业越来越难以为继。…
📅 2026/7/26 0:00:06
remix-i18next TypeScript类型安全实践:确保翻译键与类型定义同步 【免费下载链接】remix-i18next The easiest way to translate your React Router framework mode apps 项目地址: https://gitcode.com/gh_mirrors/re/remix-i18next
在开发多语言应用时&am…
📅 2026/7/26 0:00:06
更多请点击:
https://codechina.net
第一章:AI帮助理解数学概念 人工智能正以前所未有的方式重塑数学学习的路径。通过自然语言处理与符号计算的深度融合,AI不仅能解析抽象定义,还能将定理、证明和几何直觉转化为可交互、可验证的…
📅 2026/7/26 0:00:06
1. 项目背景与核心价值去年参与的一个短剧项目让我深刻体会到传统创作流程的痛点:编剧团队花了三周打磨剧本,角色设计反复修改了七版,最后成片时又因为演员档期问题不得不临时调整分镜。这种低效的创作模式在快节奏的内容行业越来越难以为继。…
📅 2026/7/26 0:00:06
remix-i18next TypeScript类型安全实践:确保翻译键与类型定义同步 【免费下载链接】remix-i18next The easiest way to translate your React Router framework mode apps 项目地址: https://gitcode.com/gh_mirrors/re/remix-i18next
在开发多语言应用时&am…
📅 2026/7/26 0:00:06
目录
第一步:选对模板,省心一半
第二步:打开扫码点餐功能
开启功能按钮
桌台管理与桌码生成
第三步:个性化设计,打造品牌感
调整点餐页面
设置点餐规则 你还在让顾客站着排队点餐吗?2025年ÿ…
📅 2026/7/25 7:09:18
在业务中快速构建一个能理解私有文档、准确回答专业问题的智能助手,是很多开发团队面临的共同挑战。传统方案往往需要从零开始搭建复杂的 RAG(检索增强生成)系统,涉及文档解析、向量化、检索、大模型调用等多个环节,整…
📅 2026/7/25 17:09:47
FAE放射组学分析工具:医学影像特征探索的完整解决方案 【免费下载链接】FAE FeAture Explorer 项目地址: https://gitcode.com/gh_mirrors/fae/FAE
你是否曾经面对海量医学影像数据感到无从下手?想要从CT、MRI等影像中提取有价值的定量特征&#…
📅 2026/7/25 5:09:14