ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

边缘AI-6:最讲效率的计算芯片NPU

边缘AI-6:最讲效率的计算芯片NPU 写作原则尽量不废话直奔主题。为了极致效率砍掉所有退路这就是NPU1.NPU十年2016年中星微星光智能一号把NPU塞进安防监控SoC系统级芯片这也是国内第一颗嵌入式NPU让摄像头可以在本地识别人脸不再需要回传服务器。一年后华为Mate 10搭载寒武纪NPU苹果A11加入神经网络引擎NPU进入手机。到2024年微软将NPU算力门槛设在40 TOPSAMD、英特尔、高通纷纷入场NPU也从手机扩展到了笔记本任务从人脸识别升级为大模型生成。随着2025年大模型涌入边缘为卷积神经网络CNN设计的旧架构在Transformer面前力不从心——CNN的固定数据流与Transformer的动态注意力权重天然不匹配不规则层结构和注意力机制让实际利用率大幅下降于是新一代NPU迅速转向支持Transformer、稀疏计算、片上解压。NPU这十年轨迹很清楚从安防到手机从手机到PC从CNN到Transformer每跨一步旧架构就被甩开一截。这期间各家NPU没有挤在同一条赛道上而是在不同的场景里寻找各自的答案。2.七家NPU厂商七条路按路径类型划分七家厂商各自代表了不同的突围哲学开创者之路中星微。2016年的星光智能一号最早为安防监控定义嵌入式NPU的形态让本地人脸识别成为可能。十年后的今天它依然代表着一个起点。场景定制之路国创中心。2025年推出的端侧AI系列场景芯片采用RISC-VNPU架构运算效率比传统控制芯片高出30到40倍综合节能率达25%目前已在家电领域实现超过20万片规模应用。它不是通用NPU而是专门为空调、冰箱、洗衣机的感知与控制量身定制场景绑定最深。功耗极致之路Ambiq。2026年发布的Atomiq SoC在SPOT平台上首次集成NPU采用12nm FinFET工艺工作电压低至300mV——需说明的是这是该SoC集成NPU后的系统最低工作电压相较Ambiq此前MCU产品的230mV核心电压虽有所提升但首次在NPU加持下维持了超低功耗水平。电池供电的微型设备上跑AI不需要大力出奇迹够用且省电就是商业价值本身。算力堆叠之路AMD。2026年发布的Ryzen AI Embedded P100系列集成8-12核Zen 5 CPU、RDNA 3.5 GPU和XDNA 2 NPU系统AI算力最高达80 TOPS相比上一代提升2.1倍面向工业自动化、机器人、医疗设备等工控场景。在边缘单芯片上这是目前算力数字的天花板。算法协同之路国科微。GKNPU 4.0聚焦FlashAttention 4.0优化提出增强型脉动阵列架构。其核心改进在于通过细粒度数据流调度将权重矩阵分块驻留于片上SRAM配合计算流水线重叠访存与运算从而压缩数据搬运路径与流水线开销增强片上闭环计算能力。配套的GKToolchain 3.0工具链强调硬件感知编译、自动分块、自动向量化这不是在堆算力而是在具体算子层面抠效率。架构转型之路安谋科技。2025年发布的周易X3采用DSPDSADomain-Specific Architecture领域专用架构全新架构从定点转向浮点计算专为大模型重做。单Cluster算力8-80 FP8 TFLOPS可配置单Core带宽256GB/s实测Llama 2 7B模型Prefill阶段算力利用率达72%——这一数字的新架构意义在于CNN时代的老NPU跑Transformer时利用率常跌破30%72%意味着架构转型取得了实质性突破。Decode阶段得益于自研WDC解压硬件可额外提升15%-20%的等效带宽处理能力。新架构对Transformer适配最彻底同时CNN性能也提升了30%-50%——这种兼容不是保留通用性而是架构底层的矩阵/向量计算能力提升后对旧任务的顺手优化核心设计仍是为Transformer重做。规模普及之路高通和三星。继续在移动端旗舰SoC中推高NPU算力覆盖AI手机和端侧生成式AI。它们的优势不在单项数字而在规模——移动端NPU的出货量最大、普及面最广端侧AI能力的下沉速度最快。横向对比表七家厂商各走各路说明NPU没有标准答案只有场景适配。每一条路都是用放弃通用性换来的——选择功耗极致就放弃了通用算力选择算法协同就放弃了架构弹性。这就是砍掉退路的本义。不过另一方面看尽管NPU算力数字年年涨但用户端的AI体验却没跟上问题出在哪3.行业NPU三个突出问题所谓“用户端AI体验”落地为三个具体层面端侧大模型首字响应延迟影响可用性、可运行的模型规模上限影响功能丰富度、多任务并发时的卡顿频率影响日常流畅度。这三者的瓶颈指向同一个根源第一老NPU的架构为CNN设计现在却要跑Transformer的随机内存访问。CNN时代NPU依赖固定数据流权重读取模式规则可预测而Transformer的注意力机制每次计算涉及不同token之间的动态关联内存访问模式高度随机。就像流水线工人硬干策略分析师的活——CNN的固定流水线遇上Transformer的动态权重结构天生不匹配。安谋科技周易X3在大模型Prefill阶段能做到72%利用率已是新架构的大进步——作为参照更早的CNN专用NPU在此类任务中实际利用率常跌破30%。第二真正的瓶颈不在算力在内存。几十亿参数的大模型带宽和内存容量才是限制因素。参数反复在DRAM和NPU之间搬运功耗和延迟同步上升。边缘设备功耗预算固定1个TOPS如果配不上对应的带宽就是芯片上的无效面积。云端可以堆HBM和散热但手机和笔记本没有这个空间。第三工具链太碎。CUDA生态用了十几年变成今天的样子NPU这边还是各家自建一套。用一位算法工程师话说将Llama 3.2从GPU移植到部分国产NPU平台时算子适配和性能调优周期较长性能折损也相当明显——工具链的成熟度直接影响开发效率和最终产品体验。上面三个问题是全行业共有的到了中国NPU圈还得额外扛三层。4.中国NPU三层困境需要提前说明的是这三层困境并非对所有玩家同等致命——它们的杀伤力集中在手机AP、AI PC等通用市场竞争中而在家电、工控、安防等垂直定制场景通过架构创新可以在相当程度上抵消其影响。这正是前文七条路中差异化选择的深层原因。第一层先进制程受限。手机AP、AI PC这类市场制程落后意味着同算力下功耗和面积高出30%-50%。边缘端功耗是硬约束制程落后一寸产品就失去上桌资格。工控、安防稍微好一些但成熟制程意味着必须用更大的片上SRAM和更聪明的数据流策略来补偿这对架构团队是额外考验。第二层EDA工具受限。芯片设计依赖Synopsys、Cadence的工具先进节点上国产EDA工具的覆盖率和成熟度仍有明显代差仿真验证周期更长设计迭代成本更高流片失败风险更大。先进节点一次MPW流片成本数百万到上千万对创业公司压力巨大。第三层生态标准不在手里。全球开发者已经习惯PyTorch/TensorFlow加CUDA/ROCm的组合中国NPU软件栈要兼容主流框架先天慢半拍。英伟达和微软掌握着“模型-芯片”联合优化的话语权他们定义什么结构好部署、什么算子效率高中国NPU只能被动适配每出一个新模型就补课一次。压力不小但有人换了打法。有团队在28nm、22nm上死磕架构用更大的片上SRAM和更聪明的数据复用策略来抵消制程劣势或者绕过通用NPU专攻家电、工业、安防这些垂直场景做定制化方案又或者押注RISC-V开源架构从指令集层面重建生态。这不是弯道超车是换道竞争。胜负不取决于发布会上的TOPS数字取决于谁先在某一个细分场景让客户为够用付费而不是为参数买单。那下一代NPU会是长什么样行业正在形成几个判断。5.下一代NPU的四个判断第一个判断战场从堆算力转向搬数据。传统NPU的困境本质上是为CNN设计的流水线硬跑Transformer的随机访问。头部厂商2026年的NPU设计里近存计算和片上SRAM池化的优先级已经超过堆砌MAC阵列。原因很简单边缘端算力相对便宜数据搬运的成本才是大头——功耗就那么多花在搬运上的电多了花在计算上的就少了。谁能把数据搬运距离从去DRAM取数缩短到在SRAM里流转谁就赢。这一趋势已在2026年量产芯片中落地如AMD Ryzen AI系列的片上内存层次优化预计2027-2028年将成为主流NPU设计的标配。第二个判断NPU的协同方式在变。NPU不是独立工作的它旁边有CPU、DSP、GPU。下一代NPU的设计重点之一是它怎么跟低功耗CPU和DSP分工——谁负责调度、谁负责预处理、谁负责推理怎么共享内存、怎么最小化搬运开销。堆算力是粗放式打法精细化的协同调度才是下一代NPU要解决的工程难题。这一演进已在高通Hexagon NPU与Kryo CPU的异构调度方案中初现端倪预计2027年后会有更标准化的片上协同架构出现。第三个判断工具链决定谁能活下来。谁能让开发者从模型到NPU“开箱即用”谁就建立了生态护城河。国科微已经把工具链和硬件架构并列为核心战略。边缘场景下开发者没有云端那种专职优化团队“开箱即用”就是生产力本身。CUDA用十几年构筑的壁垒NPU工具链没有那么多时间——胜负将在未来三到五年内见分晓。第四个判断低功耗设计路径被验证了。Ambiq的SPOT技术证明在电池供电的微型设备上跑AINPU不必走大力出奇迹的路。IoT端“够用且省电”比“强大且费电”更有商业价值这个市场的规模可能超过旗舰手机芯片。这一路径的商业验证周期较长预计2028年前后才能看到大规模放量但其技术方向已获行业共识。这四个判断指向同一个方向下一代NPU依然在为了极致效率而选择——选择近存计算而非堆MAC选择协同调度而非单兵突进选择工具链投入而非硬件炫技选择低功耗而非高算力。但最后还有一个问题超出边缘AI范畴拷问每个做NPU的人。6.谁来回答最后一个问题如果大模型的下一个形态不是Transformer如果注意力机制只是通往AGI的中间站下一站是状态空间模型、Mamba或者某个今天还不存在的东西——那么为Transformer量身定制的NPU三年后会不会变成另一批“专为CNN而生”的芯片正如有些人所说NPU是专拧特定螺丝的电动扳手拧起来又快又省力但如果明天螺丝型号变了呢定制扳手怎么办说明1.本文参考公开报道并借助AI工具进行整理和分析如有不妥之处欢迎指正。2.部分市场数据基于行业估算、发布以及官方报道具体精确数据请以权威机构为准。3.欢迎长期追踪边缘AI的朋友一起探讨。
返回列表