WAIC 2026|无问芯穹夏立雪:AGI时代,基础设施的决胜点是「AI原生的Agentic Infra」

WAIC 2026|无问芯穹夏立雪:AGI时代,基础设施的决胜点是「AI原生的Agentic Infra」
7 月 20 日2026 年世界人工智能大会上无问芯穹联合创始人兼 CEO 夏立雪提出从 Pre-training预训练 到 Post-training后训练、从Test-time推理时扩展 到 Agentic scaling智能体扩展在四条 Scaling Law 的作用下模型训练和推理的超级市场正在互相孕育。当下的人工智能基础设施AI Infra“必须以极致的效率服务更大规模。”基于规模与效率两大锚点夏立雪从无问芯穹的 AI 生产力公式AI生产力 智能资源规模 × Token 转化效率 × AI生产力转化效率出发首次公布无问芯穹 Agentic Infra 的“前店后厂一中心”战略布局涵盖三大核心技术能力与产品服务体系“算力集散中心”Agentic Infra 自主式基础设施平台“Token工厂”Agentic MaaS 大模型服务平台“AI生产力商店” Agentic Infra 行业解决方案这套 Agentic Infra 产品与服务体系立足基础设施向下汇聚能源和芯片向上支撑模型和应用不仅极致提升底层资源向AI生产力转化的规模和效率更有着 Agentic AI 时代最显著的 AI 原生能力——用基础设施智能体蜂群赋能资源规模扩展、提效 Token 生产并支持 Agentic AI 的持续进化。Agentic Infra自主式基础设施平台服务下一代Agentic AI在线进化无问芯穹 Agentic Infra 自主式基础设施平台的核心目标是实现智能资源规模最大化。它就像一座“算力集散中心”把散落的、异构的算力资源统一汇聚、弹性调度、按需分发为模型与应用层筑牢充足、稳定、可扩展的算力底座。夏立雪认为“算力的异质化、碎片化问题是全球性的如何把不同的、跨区域的算力资源高效聚合协同起来是扩大智能资源规模的关键。”无问芯穹自成立以来一直致力于通过“多元异构、软硬协同”技术破解异质算力聚合的难题打造了面向异构集群的大模型跨域训练系统并集成于 Agentic Infra 自主式基础设施平台软件中通过计算通信重叠的流水编排、自适应的通信流调度和异构算力调度机制三位一体全栈协同优化能够系统性地破解算力聚合的行业难题。该系统已经受过三大类跨域算力聚合训练实践的生产级考验第一是超远距离聚合。无问芯穹已联合中国电信完成了国内首例超 4000 公里距离的大模型跨域混训在新疆哈密与广东深圳两地集群间实现联合训练性能提升 165%验证了超远距离跨域集群协同训练的可行性。第二是多数据中心聚合。打通 4 个不同代际、不同型号的 GPU 集群联合训练近百亿参数大模型四集群协同性能提升 41%有效盘活了不同批次的存量异构算力。第三是混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训整体性能提升 68%帮助众多企业客户解决本地算力不足、云上资源却闲置的错配痛点。目前这套跨域训练系统已在全国部署触达超 37,000P 算力、覆盖 16 种主流芯片盘活了广域分散的异质算力使之成为 Agentic AI 时代的最坚实底座。当下强化学习成为下一代 AI 进步的重要手段。但相较传统预训练强化学习“多角色协同”的特性使其对硬件的种类需求更加复杂规模量级也更加庞大基于异构和超大算力规模的双重刚需跨集群强化学习因此成为智能规模化及持续进化的新锚点这也是无问芯穹Agentic Infra自主式基础设施平台重点布局与攻克的核心场景。该场景存在两大重要问题一是跨集群之后不同角色之间的等待时间将被拉长二是当规模扩大到万卡级后从显卡到服务器、网络、存储故障将以小时级的频率存在而重新拉起任务耗时长达数十分钟任务难以持续稳定运行。因此针对跨域强化学习场景无问芯穹把全栈协同的技术思路贯穿到底——从网络、平台到框架做一体式深度优化打通分散的异构集群实现全局资源一盘棋调度。在此之上无问芯穹进一步将优化渗透进全链路的每一个环节尤其是在跨域通信和容错这两个层面通过优化计算通信重叠技术让跨域通信效率直接提升 3-4 倍实现通信开销 100% 全掩盖训练不再因跨域通信产生额外耗时损耗同时搭建了故障无感的训练机制成功实现了跨域强化学习训练连续一周0中断稳定运行。让大规模跨域强化学习不仅可以“跑得通”还能“跑得快、跑得稳”。“这只是一个起点。”夏立雪表示伴随着大规模跨集群强化学习训练技术的持续成熟突破无问芯穹还将持续深耕并行策略、通信融合、智能算子、极致容错等核心技术“未来我们能够将跨域计算资源的支撑规模持续拓展至十万卡级以上支撑下一代Agentic AI的在线进化。”Agentic MaaS大模型服务平台无问芯穹Token工厂以“效”搏大Token 经济时代无问芯穹早在 2023 年初就提前布局的 Agentic MaaS 大模型服务平台目前正在迎来高速且持续的增长曲线。该平台就像一座“Token 工厂”核心目标是用极致效率服务Token的规模化、高质量生产。发布会现场夏立雪用千卡至万卡规模下完整推理服务技术栈揭示了一座 Token 工厂内部的可优化空间“从网关、路由到底层推理实例Token工厂层层可优化、处处有增量。”随后夏立雪披露了无问芯穹首创的新一代推理系统优化成果——跨集群异构PD分离架构Prefill-RelayDecode-MainDecode, PDD。智能体推理需求的特征有“三极”上下文极长、交互轮次极多、缓存命中率极高对吞吐、时延、缓存复用的要求远高于传统对话场景。同时从实测数据中能直观看到不同芯片在Prefill、Decode阶段的性能差异极大。而眼下这些散落在不同地区的存量集群几乎都是同构的且几乎每个集群都“偏科”。因此该架构首先用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来让算力强的集群做 Prefill 任务让显存带宽高的集群做 Decode 任务。这一架构设计相当于让“偏科”的硬件只刷自己最擅长的题可以极大提升大模型推理系统效率是每座Token工厂都必备的“超级管线”。然而基于以太网的 KV Cache 跨集群传输存在带宽和延迟瓶颈这根“超级管线”既要能扛住智能体业务的巨大“流量”也要能跟得上用户对“流速”的极致要求。基于 Agentic MaaS 线上业务长期的大规模实践积淀无问芯穹推理团队首先把为了 Decode 实例重复前缀存储去重而设计的 Decode Radix Cache 技术创新性地迁移至跨集群异构 PD 分离架构之中实现跨集群 KV Cache 传输数据量降低一个数量级 让“流量过载”的难题迎刃而解。其次更大的挑战在于“流速”——智能体的响应速度是最直观的产品体验底线。PDD将传统的PD分离链路“P-D”创新解构为“P-RLD-MD”的三级分离式推理架构就像是为这条“超级管线”加装了一个“精密增压阀”。对于高传输延迟的请求RelayDecode 先行输出 Token 给用户从而让用户侧完全感受不到这一实际上长达数十秒的传输延迟当传输完成后输 Token 给用户的任务被无缝切换给 MainDecode 来处理避免了 RelayDecode 被长期占用。通过这一设计仅需极少量机器承担 RelayDecode 就能掩盖以太网 KV Cache 传输延迟。实测显示该架构在实现了首 Token 延迟TTFT降低 51.5% 的同时单 Token 成本可降低 37.5%。这不仅意味着用户端速度体验的显著提升更意味着每一个集群都能被充分利用起来最大化释放全域异构算力的产业应用价值。过去一年里无问芯穹的 Token 工厂已通过一系列原始技术创新推动了推理成本的 10 倍下降。夏立雪判断随着跨集群异构PD分离架构的规模化落地推理成本依然有10倍的下降空间。“目前无问芯穹的 Agentic MaaS 大模型服务平台的增长飞轮已经全面转起来了”夏立雪表示。技术迭代驱动成本下降业务规模加速技术创新。通过与 Kimi、智谱、Minimax、阶跃星辰等头部大模型企业的密切合作无问芯穹在真实业务场景中持续打磨、积累了大量优化经验。截至 7 月平台单日 Token 调用量较去年 12 月已实现了 40 倍 的爆发增长而海量业务经验又能反哺技术快速迭代催动平台性能与可靠性的同步跃升形成“业务带技术技术提效率效率促增长”的正向循环。夏立雪总结“6 月的 GTC 上黄仁勋展示了英伟达的 ‘算力即收入’曲线。无问芯穹的 Token 工厂则希望用这个‘优化即利润’的增长飞轮向推理时代交出 Token 效率的答卷。”无问芯穹已携手上海移动联合打造了 “沪芯沪产服务沪客”的“天问”模型服务门户也与 AI 原生新世代社区“观猹”联合打造了“中国版 OpenRouter” TokenDance词元跳动 平台。未来无问芯穹将持续携手优秀的行业伙伴以这套高效的“Token 工厂”赋能更多产业领域、服务更广泛客用户。Agentic Infra行业解决方案以AI原生赋能百业提效依托“算力集散中心”与“Token 工厂”无问芯穹可以将计算资源高效转换成高质量 Token。然而相同的业务效果基于不同的推理路径、模型规模和芯片Token的成本天差地别深度影响其在真实生产环境中的商业化潜力。为此无问芯穹正通过 Agentic Infra 行业解决方案携手多行业伙伴把 Token 高效转化为产业真正认可的高质量 AI 生产力它就像一个“AI 生产力商店”持续赋能千行百业降本提效。现场夏立雪带来了覆盖文娱游戏、医疗健康、法律终端、能源电力等多个垂直行业的 Agentic Infra 行业解决方案。在文娱游戏场景无问芯穹携手 VAST 的Tripo 3D 大模型联合打造了 AGENTIC 3D GAME GEN 解决方案把分散的创意输入转化为可执行、可比较、可细化的 3D 模型输出高效释放游戏内容生产力。在医疗健康场景无问芯穹服务上海瑞金医院算力及模型管理助力医疗大模型及智能应用在运营管理、临床诊疗辅助、医学教育培训等场景的探索落地在法律终端场景无问芯穹打造律师事务所专属 AI 合伙人——”律盾芯人“与“段和段律师事务所、君合律师事务所、竞天公诚律师事务所、通商律师事务所”等行业私有化 AI 终端合作伙伴以及“法义经纬、图灵法思”等生态合作伙伴一起共同推动法律行业的智能化安全升级在能源电力场景无问芯穹也正与南网能源一起深度探索基于智能体技术的智算中心能耗智能预测与协同调度解决方案。基础设施自己本身也是个行业无问芯穹已经在这个行业深耕多年既积累了丰富的实践经验与技术也拥有足够多的应用场景与需求。因此在支撑千行百业智能升级的另一面无问芯穹也持续将智能体的能力应用到 AI Infra 本身打造了一套基础设施智能体蜂群。遵循“用智能体赋能基础设施提升计算规模和智能效率”的核心目标无问芯穹基础设施智能体蜂群目前已包含三个子集对应在 AI 生产力转化、智能资源规模、Token 生产效率的三方面面向用户的平台管家智能体系统、面向集群的运维智能体系统、以及面向芯片的算子生成智能体系统。夏立雪提到“我们不仅用 Agent 赋能资源规模扩展、提效 Token 生产更致力于以 Agent 能力驱动整套 AI Infra 形成自主迭代、自我优化的闭环让基础设施越用越强。”平台管家智能体系统是整个基础设施智能体蜂群协同场景下的全局统筹者与用户入口它有效降低了用户驾驭复杂系统的学习成本通过自然语言交互就能让智能体主动帮助用户操作平台、统筹 AI 基座轻松高效完成复杂的资源运营、管理和答疑排障等工作能够独立解决 80% 日常问题剩下 20% 深度问题再转交对应垂类 Agent。智算集群运维智能体系统是一个能够端到端地解决实际生产场景中的运维难题的7×24小时全天候值守的“运维专家团”系统以运维主智能体为核心大脑与故障排查智能体、环境部署智能体、故障处理智能体等协作运行不仅可以完整执行一个集群的告警自动闭环处置任务还能够“防患于未然”地规划周期性巡检任务提前识别潜在隐患。让智算集群的运维从“人找问题”转变为“问题找人”和“问题自己解决”。经过大规模生产环境验证这套系统的价值正在逐渐凸显可实现运维人效提升5倍以上关键故障处理效率提升6倍不仅为大规模 GPU 训练与推理业务提供了更加稳定、高效的基础设施保障也让运维人力能够被真正解放出来聚焦更有价值的技术创新。算子是释放AI硬件性能的最后一公里同时也是拉开基础设施效率差距的关键变量。目前大模型已经能够快速产出算子但“能跑通”不等于“能用好” —— 要在生产环境中实现性能超越成熟推理引擎、达到工业级落地标准难度依然极大。无问芯穹高性能算子生成智能体系统 KernelMind以算子生成主控智能体为调度中枢联动多类专用智能体通过 “需求分析 — 智能调度 — 内核生成 — 沙箱验证 — 评审沉淀”五步闭环工作流可在真实编译试错与知识沉淀中持续自迭代稳定交付可直接落地的高质量工业级算子。在 GLM5.2 模型的实测中对比行业基线该系统在NVIDIA旗舰卡中实现了端到端7.3%的性能提升在AMD旗舰卡中更是带来了39%的整体性能跃升GEMM、Attention、Router 等各类核心算子性能均实现全面超越。早在 2025 年无问芯穹就已经在业内率先提出了 Agentic Infra 的范式变革。如今Agentic Infra 支撑智能体规模化运行与持续进化的产业价值正在被不断验证。从概念到落地无问芯穹始终坚持以硬核技术推动 Agentic Infra 走向真实业务场景。夏立雪提到“我们的愿景始终清晰而坚定通过Agentic Infra实现用智能进化智能用生产力加速生产力。”One More Thing迈向物理世界演讲最后夏立雪将视野从云端的数字世界延伸至真实的物理世界。他提出“在物理世界中具身智能的Scaling Law同样需要高效率、大规模的基础设施支持。”现场无问芯穹公布了在具身智能领域的全新探索 ——首个面向大规模具身任务的云边端一体化管理与调度平台。该平台首次把云端 GPU 集群、边缘算力节点和机器人真机设备统一接入到一个平台中支持训练、数据采集、评测和真机执行等多种具身任务统一编排运行有效解决了具身训练中资源分散、跨集群协同困难、任务角色复杂、真机状态不可见、启动链路长的问题。同时针对具身智能的训练与推理部署两大核心环节夏立雪宣布了无问芯穹两项重磅技术升级面向具身智能的大规模真机强化学习训练框架RLinf V0.3以及面向机器人与端侧 AI 场景的全栈的推理优化体系Mizar-Robo。RLinf 在 V0.1 版本中实现了在仿真环境下渲训推一体化的强化学习在 V0.2 版本中实现了像管理 GPU 一样管理真机设备而V0.3 版本的升级则新增支撑具身智能大规模真机、跨域端云协同的强化学习训练支持具身智能的持续进化。从实验室到产业无问芯穹也与智元、清华大学携手深度探索了真机强化学习训练的技术与实践攻克阻碍真机强化学习训练大规模落地的核心痛点与难点。通过首创的 HotSwarm 与端云协同训练模式RLinf V0.3 可以支持真机设备1000次在线上下线训练0中断并成功实现近百台真机规模专线需求降至2Gbps以下大幅拉低具身智能规模化训练的成本门槛。Mizar-Robo 则依托流水线调度、算子内核、量化压缩、计算图四层协同优化全方位释放端侧硬件潜力大幅提升具身模型的部署效率让具身智能即便在低功耗硬件上也能实现连贯流畅、低延迟、长续航的高精动作交互。在无问芯穹与自变量机器人 WALL-OSS 系列模型的联合优化部署中在保持 WALL-OSS 原有任务成功率的前提下实现了7.14倍的推理性能提升经 Thor 平台实测端侧推理时延从 500ms 压缩至 70ms降幅达 86%。不仅保障了实时交互的流畅度与稳定性也有效延长作业续航为机器人产品从实验室走向规模化商用落地提供了有力的基础设施支撑。“让智能无所不能是AGI而让智能无处不在是AGI Infra。”夏立雪在发布会的尾声中说道。“AI 无疑是目前世界上发展变化最快的行业但我们的初心从未改变就是做 AGI 时代最需要的 AI Infra。”从“算力集散中心”做大资源总盘到“ Token 工厂”深挖效率红利再到 “AI 生产力商店”循环造血向产业输出价值乃至向物理世界AI的探索与实践无问芯穹始终锚定“规模与效率”两大支点稳步向前。“前店后厂一中心” 的 Agentic Infra 体系 既是无问芯穹积淀多年的战略蓝图系统性落地也代表着无问芯穹锚定 AGI 时代的长期方向为未来数字与物理世界的所有AI生产力的运行构筑基础设施。