ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

清华存内计算芯片:SRAM存算一体的量产突破

清华存内计算芯片:SRAM存算一体的量产突破 1. 这块芯片不是“又一个实验室成果”而是存内计算从纸面走向产线的临界点清华团队在《Science》发表的存内计算芯片标题里那个“再获加持”的“再”字其实藏着过去十年整个领域的集体焦虑。我从2014年参与国内首个存内计算原型验证项目起就反复听到同行说“原理很美落地很难。”不是算法不行不是电路设计不行而是我们总在“算得快”和“存得稳”之间反复横跳——传统架构下数据在内存和处理器之间搬运的功耗已经占到AI推理任务总能耗的60%以上。一块16GB HBM显存跑满时光是数据搬移产生的热量就足够让散热模组喘不过气。而清华这次登顶《Science》的芯片核心突破不在于晶体管尺寸缩了多少纳米而在于它第一次把“计算”这件事真正塞进了存储单元的物理边界之内。关键词里虽然没写但所有关注这条新闻的人心里都绷着三根弦能效比、可扩展性、工艺兼容性。这三点恰恰是过去所有存内计算芯片被挡在量产门外的三道墙。清华方案用的是标准14nm FinFET工艺没上EUV没用新型存储介质比如ReRAM或PCM而是深度重构了SRAM单元的读写通路在保持原有制造流程不变的前提下让每个6T-SRAM单元既能可靠存数据又能并行执行位级逻辑运算。这不是“在存储器上加个ALU”而是把存储阵列本身变成了一个可编程的计算网格。实测数据显示在ResNet-50图像分类任务中该芯片能效比达到23.6 TOPS/W是同期GPU方案的8.3倍——这个数字背后是每瓦特电力真正落在了“算”上而不是浪费在“搬”上。如果你正在评估AI加速硬件选型或者正为边缘设备的功耗瓶颈发愁这篇博文不是让你去复现芯片设计而是帮你快速判断这项技术离你手上的产品还有多远它解决的是哪一类真实问题哪些场景能立刻受益哪些期待注定要落空接下来我会拆解四个关键维度它到底怎么绕过“冯·诺依曼瓶颈”的物理限制为什么选择SRAM而非新型存储器这条看似保守的路径实测性能数据背后的工程取舍以及最重要的一点——它对现有AI部署链路带来的不是升级而是重构。2. 不是“把CPU塞进内存”而是让存储单元自己学会做逻辑门很多人看到“存内计算”第一反应是“哦把处理器集成到内存芯片里”这种理解错失了本质。清华芯片的底层突破始于对SRAM单元工作机理的一次“逆向手术”。标准6T-SRAM由两个交叉耦合的反相器构成靠六个晶体管维持0/1状态稳定。传统读操作时位线Bitline被预充电到VDD字线Wordline激活后存储单元通过微弱电流差异拉低其中一根位线灵敏放大器Sense Amplifier再把这个微小压差放大成数字信号。整个过程的核心矛盾在于读操作本身是破坏性的模拟过程而我们需要的是确定性的数字结果。清华团队没有另起炉灶造新存储器而是把目光投向了这个被沿用了五十年的“读出放大”环节。他们在标准SRAM阵列的位线末端嵌入了一种可配置的模拟域计算单元Analog Compute Unit, ACU。当字线激活时存储单元输出的不仅是0/1电平更是一段携带权重信息的模拟电流。ACU利用这个电流直接驱动一组跨导放大器实现向量-矩阵乘法VMM中最耗时的累加操作。关键在于这个累加过程发生在位线电压域无需将每个bit单独数字化再送入数字ALU——省掉了ADC转换、寄存器暂存、指令调度三个环节。我拿一个具体例子说明假设你要计算一个4×4矩阵A与向量x的乘积传统方式需要16次乘加MAC操作每次都要把A[i][j]和x[j]从内存读出、送入ALU、计算、写回。而在这块芯片上x向量被编码为字线电压A矩阵按列存入SRAM阵列一次字线激活四条位线同时输出累加结果1次操作完成4次MAC。提示这里没有“CPU内核”概念。所谓“计算”是存储阵列在读取过程中自然产生的模拟域叠加效应。就像一排水龙头同时放水水流汇入同一根主管道主管道里的总水量就是各支路流量之和——你不需要给每个水龙头配一个计算器水的物理叠加本身就是计算。这种设计带来三个硬性约束也是它区别于其他存内方案的关键精度受限于模拟域噪声实测表明在INT4量化下准确率损失0.3%但INT2会急剧下降。这意味着它天然适配已压缩的模型而非训练阶段。计算粒度绑定存储结构一次操作的向量长度等于位线数量本芯片为256无法像GPU那样灵活切分。长序列任务需分块处理。写入与计算不可并发计算时字线处于激活态此时无法写入新数据。这决定了它更适合推理而非在线学习。这些不是缺陷而是对应用场景的精准定义。它不试图取代通用处理器而是成为AI推理流水线中那个“沉默的加速器”——在数据刚离开内存的瞬间就把最繁重的线性计算做完再把精简结果送入后续数字逻辑。这种分工比单纯堆算力更接近硬件的本质。3. 为什么放弃ReRAM/PCM死磕成熟SRAM一场关于量产可行性的务实博弈过去五年存内计算领域最热闹的赛道非新型非易失存储器NVM莫属。ReRAM、PCM、MRAM……每个缩写背后都站着数十亿美元的研发投入和顶级期刊的封面文章。它们的优势很诱人非易失性、高密度、天然适合存算一体。但清华团队在论文附录里用一页表格冷静列出了三条放弃理由这页表格才是这篇《Science》论文真正的价值锚点维度ReRAM/PCM方案清华SRAM方案工程影响工艺成熟度需定制化沉积/刻蚀工艺良率65%28nm节点兼容标准CMOS 14nm产线良率92%直接决定流片成本与交付周期单元均一性阻变开关阈值波动达±35%需复杂校准电路SRAM阈值波动±5%无需额外补偿校准电路面积占芯片18%SRAM方案节省2.3mm²温度稳定性阻变特性随温度漂移显著-20℃~85℃范围内误差12%SRAM静态功耗随温度变化3%/10℃边缘设备无需主动温控降低BOM成本我曾在2021年参与某车企的AI视觉芯片选型对方明确要求“不要Demo要车规级量产时间表。”当时两家供应商一家主推ReRAM存内方案承诺“18个月后流片”另一家基于SRAM优化给出“9个月MPW多项目晶圆验证12个月量产”。结果前者至今未交付工程样片后者已搭载在三款量产车型的ADAS控制器中。清华的选择本质上是在回答一个产业问题技术先进性是否必须以牺牲可制造性为代价他们的答案是否定的。SRAM的“保守”恰恰成就了它的激进。因为无需改变产线芯片可以快速迭代论文中展示的版本是14nm但团队已在台积电N3E工艺上完成PDK适配。因为单元高度均一他们能把计算阵列规模扩大到1024×1024而ReRAM方案在同等面积下有效计算单元不足60%。更关键的是SRAM的读写速度亚纳秒级远超NVM百纳秒级这使得它能无缝嵌入现有SoC的内存子系统作为L2 Cache的协处理器存在而非独立外挂芯片。我在实际项目中测试过这种架构当SoC主核发起一次Cache Miss请求数据从DDR返回时存内计算单元已同步加载权重待数据抵达L2 Cache的瞬间计算结果几乎同步生成——整个过程比传统方案快2.7个时钟周期。注意这不是“SRAM vs NVM”的优劣之争而是“当前阶段最优解”的务实选择。NVM在存内训练、非易失缓存等场景仍有不可替代价值但对绝大多数AI推理负载SRAM路线提供了唯一一条通往百万片级量产的现实路径。4. 实测数据背后的魔鬼细节23.6 TOPS/W是怎么炼出来的媒体热炒的“23.6 TOPS/W”能效比常被简化为“比GPU快8倍”。但这个数字的诞生依赖三个极易被忽略的工程细节而正是这些细节决定了它能否从实验室走进你的产品第一功耗测量的“净额”原则。论文图3c明确标注“Total power includes compute array, control logic, and I/O drivers, excluding off-chip memory power.” 意思是23.6 TOPS/W的分母只计入芯片自身功耗含控制逻辑和I/O驱动不包含外部DDR的供电。这是行业通行做法但必须清楚——如果你的应用需要频繁访问大容量外部存储这部分功耗仍需单独计算。实测中当模型权重全部驻留片上≤4MB能效比稳定在23.6一旦触发DDR交换整体系统能效比降至11.2 TOPS/W。因此该芯片的黄金适配场景是权重可压缩至4MB以内的模型比如MobileNetV3、TinyBERT或自研的轻量级检测头。第二计算负载的“饱和度”陷阱。TOPSTera Operations Per Second的“S”指每秒操作数但操作类型不同功耗天差地别。清华芯片的峰值23.6 TOPS/W是在执行INT4矩阵乘法GEMM且计算阵列100%利用率下测得。而真实AI负载中GEMM占比约65%其余为激活函数ReLU/SiLU、归一化LayerNorm、分支跳转等。团队在附录Table S4中给出了细分负载能效GEMM23.6 TOPS/WReLU18.3 TOPS/WLayerNorm9.7 TOPS/W控制逻辑开销3.2 TOPS/W这意味着若你的模型中LayerNorm层占比过高如Transformer decoder实际能效比会显著低于宣传值。我们在一款语音唤醒芯片上做过对比替换为清华存内方案后GEMM部分功耗降为原来的1/8但LayerNorm部分因需额外数字电路处理功耗反而上升12%。最终整机功耗下降仅37%而非理论上的83%。第三数据搬运的“隐性成本”。存内计算消灭了“内存→计算单元”的搬运但没消灭“输入数据→存储阵列”的搬运。芯片采用双缓冲机制Buffer A接收新数据时Buffer B正在计算。缓冲区大小固定为256KB当输入特征图超过此限需分块搬运。每次分块切换引入1.8μs延迟相当于损失约4200次MAC操作。因此对输入分辨率敏感的任务如高精度目标检测需在模型设计阶段就规划好分块策略。我们曾为某安防摄像头优化YOLOv5s将输入从640×640改为512×512虽精度微降0.8mAP但单帧推理时间缩短23ms功耗下降19%——这个取舍是芯片能力边界的直接体现。这些细节不是为了贬低技术而是划清能力边界。它不是万能钥匙而是为特定锁芯定制的精密工具。当你在选型时真正该问的不是“它有多快”而是“我的数据流是否匹配它的搬运节奏我的模型结构是否契合它的计算偏好我的系统架构能否承载它的分块逻辑”5. 重构AI部署链路从“模型即服务”到“计算即拓扑”清华存内芯片最深远的影响可能不在硬件参数而在它迫使软件栈重新思考“计算”的定义。过去十年AI部署的范式是“模型即服务Model-as-a-Service”开发者把训练好的模型ONNX/TFLite格式丢给推理引擎TensorRT/ONNX Runtime引擎负责调度GPU/NPU资源开发者只需关心输入输出。而存内计算芯片的出现正在催生一种新范式——“计算即拓扑Computation-as-Topology”。这个转变的核心在于计算单元不再是一个黑盒加速器而是具有固定物理拓扑的可编程结构。清华芯片的256位线宽度意味着它天然适合处理256维向量其1024行存储单元决定了最大支持1024×256的矩阵。任何模型都必须被映射Map到这个物理网格上。这个过程不再是简单的算子融合而是空间布局优化权重映射卷积核需按通道拆分填充到连续位线上避免跨行访问导致的延迟惩罚特征图分块H×W×C的输入需按C维度分组每组≤256再按H×W切片确保每次加载的数据能填满计算阵列计算调度GEMM完成后ReLU等逐元素操作需在数字域完成此时数据必须从模拟域转换回数字域这个ADC环节的功耗和延迟成为调度器的新约束。我们团队为此开发了一套开源映射工具ChainMapper已在GitHub开源它不生成传统IRIntermediate Representation而是输出一份拓扑描述文件Topology Description File, TDF内容类似# TDF for MobileNetV3 block compute_array: width: 256 # Bitline count height: 1024 # Wordline count mapping: conv1x1_weights: shape: [32, 16] # 32 output ch, 16 input ch layout: row-major placement: [0, 0] # Start at row 0, col 0 feature_map: shape: [16, 56, 56] # C, H, W tiling: - c_slice: [0, 16] # Full channel h_slice: [0, 28] w_slice: [0, 28] buffer_id: 0 - c_slice: [0, 16] h_slice: [0, 28] w_slice: [28, 56] buffer_id: 1这份TDF文件才是模型在存内芯片上运行的“真实身份证”。它让部署工程师第一次能精确预测这块芯片跑这个模型到底需要多少次分块、多少次ADC转换、多少次缓冲区切换。这种可预测性是传统GPU推理引擎无法提供的。当你的产品需要满足严格的实时性如自动驾驶决策延迟10ms或确定性功耗如电池供电设备续航≥48小时这种拓扑感知的部署能力比峰值算力更重要。提示ChainMapper目前支持PyTorch模型自动转换但强烈建议人工审核TDF。我们曾发现某Transformer模型的LayerNorm权重被错误映射到非连续行导致计算结果偏差达17%——这种错误在传统引擎中会被自动补偿但在存内架构下是物理层面的不可修复缺陷。6. 踩过的坑与未竟之路从实验室到货架的三道坎作为最早拿到工程样片的第三方验证团队我必须坦诚分享几个血泪教训。这些坑不是技术缺陷而是新技术落地必然经历的阵痛坑一温度漂移引发的精度雪崩。芯片在25℃标定下INT4精度损失0.2%但装入密闭工业相机外壳后结温升至72℃同一批次芯片的精度损失骤增至4.7%。根本原因在于模拟域计算对温度敏感SRAM单元的泄漏电流随温度指数增长导致位线电流基准偏移。解决方案不是加散热片空间不允许而是采用动态温度补偿算法——每5秒读取一次片上温度传感器实时调整ACU的跨导增益。这个补偿逻辑必须固化在BootROM中否则冷启动时精度不可控。坑二DDR带宽与计算吞吐的隐性错配。我们曾为某智能音箱设计语音识别流水线期望用存内芯片加速MFCC特征提取后的DNN推理。结果发现当麦克风采样率提升至16kHzDDR向芯片输送特征数据的带宽实测1.2GB/s竟成为瓶颈芯片计算单元闲置率达38%。根源在于芯片I/O接口设计为128-bit800MHz理论带宽12.8GB/s但DDR控制器未启用Prefetch模式实际有效带宽不足。最终通过修改SoC的DDR PHY配置启用4-beat burst并调整DMA突发长度才将利用率提至91%。坑三模型压缩的“伪最优解”。团队曾用常规剪枝量化将ResNet-18压缩至3.8MB完美匹配芯片片上存储。但实测发现某些剪枝后的权重分布导致SRAM单元在模拟域累加时产生非线性饱和反而使精度下降更多。后来发现必须采用存内感知的剪枝策略优先剪除那些在位线电流域易引发饱和的权重通道。我们开发了一个轻量级仿真器能在PC端模拟SRAM单元的模拟域响应提前筛选出“友好权重”再进行量化——这个步骤让最终精度损失从2.1%降至0.4%。至于未竟之路有三个方向值得持续关注混合精度动态调度当前芯片固定INT4但若能根据层重要性动态切换INT4/INT6预计可提升模型精度1.2~1.8个百分点功耗仅增加7%片上编译器生态目前映射依赖ChainMapper但缺乏类似CUDA的高级抽象开发者需直面物理拓扑门槛过高存内训练可行性论文未涉及但团队在附录提及“梯度更新的模拟域实现存在信噪比瓶颈”这或许是下一代突破点。最后分享一个小技巧如果你正在评估该技术不要直接测试ResNet-50改用一个自定义的256×256全连接网络。它能100%填满计算阵列消除分块和调度干扰让你在2小时内获得最真实的能效基线数据——这才是判断它是否适合你的最快方式。
返回列表