ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

可重构光计算芯片如何突破AI算力瓶颈?核心技术解析

可重构光计算芯片如何突破AI算力瓶颈?核心技术解析 这两年但凡是做AI基础设施的人聊到算力瓶颈几乎都绕不开“光计算”。GPU堆到单卡四五百瓦机柜里的散热方案越来越夸张而模型参数还在肉眼可见地膨胀。很多人第一次看到光计算芯片论文时的第一反应是这东西能做出来但离真正能用恐怕还有十万八千里。胡小永、杨起帆、龚旗煌等团队发表在eLight上的可重构多功能集成光计算芯片就是把这个问题往前推了一大步的核心工作之一同一颗芯片可以被程序配置来做不同的光学运算功能而不只是对单一任务进行硬编码。这篇文章我想用做硬件和计算架构的视角把这个工作背后的几件事彻底拆开聊一聊为什么可重构这么关键、芯片里的光学单元到底怎么实现“编程”、以及从这颗芯片到真正的产品中间还横着哪些坑。1. 算力瓶颈的本质为什么大家开始认真押注光计算先说一个很多人忽略的事实传统电子芯片的算力增长这些年其实是靠“堆量”硬撑过来的。单颗芯片的面积越来越大互联层数越来越多但单位面积上能跑出的性能增长早就没有过去那种指数级的想象力了。在这个背景下光计算被反复提起不是没有道理的。1.1 摩尔定律放缓背后的三大电学瓶颈电子计算机的运算能力之所以撞墙核心原因可以拆成三个这三件事都跟“用电子搬运信息”这件事本身有关。第一是功耗密度。晶体管越小单位面积发热越集中而电子在导线里流动本身就有电阻损耗。到了7nm以下工艺漏电流问题越来越难压芯片的功耗密度已经接近物理极限。一个直观的数据主流AI加速卡的单卡功耗早就超过400W很多在做大模型训练的公司机房建设成本有一大半要花在散热和供电上。换句话说我们不是没有算力而是算力的“热成本”已经贵到离谱了。第二是互联带宽。电信号传输有一个天然的困境导线间距越小串扰越大频率越高损耗越严重。你可以把PCB和芯片内的金属当作一根根“水管”电信号就是水频率高了水波容易互相干扰。所以电子芯片想要提高吞吐量要么加通道数要么提频率而两个方向都面临严重的物理约束。第三是时间延迟。电子芯片做数据搬运时信号在导线里的传播速度受介电常数影响远低于光速。大规模芯片内部的全局互连有时候时延占比比计算本身还要高。这也是为什么AI计算要拼命搞片上存储器、搞近存计算——很大程度是在跟“电线太长”做斗争。这三个瓶颈叠加起来结论其实很清晰电子计算不是不能继续涨但每一分算力增长都要付越来越夸张的功耗和成本代价。1.2 光计算真正擅长的领域线性代数而非通用逻辑这里必须讲清楚一个点光计算从来不是要取代CPU或者GPU去跑各类通用指令它擅长的其实是深度学习推理背后那类大规模线性代数运算。人工智能模型里最吃算力的运算本质上是矩阵乘法和卷积也就是一堆乘加操作。而光学的“本性”恰恰是做线性操作一束光进入一个干涉结构分束、叠加、干涉这个过程天然就是在执行线性变换。你可以把光路理解成一个“不用通电的模拟计算器”它一次性对国家级的矩阵运算做并行处理而不需要像电子芯片那样逐时钟周期地取数、计算、存回。更关键的是光的干涉本身就是复数域操作也就是同时携带振幅和相位信息。传统电子芯片计算复数值要拆成两路实值分别处理而光学系统用一个物理量就能自然承载。对信号处理、光学层析、部分通信算法这类本来就在复数域工作的任务来说光计算可以说是“降维打击”。当然光计算也有很明显的短处非线性操作很难做精度目前赶不上数字电路存储运算结果也麻烦。所以整个业界对光计算的共识是它要跟电子系统配合光学做的是矩阵运算这类“重活”电子负责控制和逻辑而不是彻底替代电子。2. 可重构设计的价值一台能编程的光学处理器而非一堆专用光芯片理解了光计算为什么有前途接下来就要面对一个尴尬的问题过去十几年学术界做出了很多种光计算芯片主流模式是“做一个功能投一次版流片回来调几个月”。这种模式最致命的地方在于每个功能都得重新设计一版芯片。2.1 专用光芯片的老问题功能固定、成本高、升级难在可重构光计算芯片出现之前大部分光神经网络芯片的架构是这样定的假设我要做一个手写数字识别网络我会先确定网络有几层、每层多少神经元、每层权重是什么然后把权重矩阵“雕刻”进芯片的光学结构里。比如用一组固定分束比的定向耦合器、固定长度的相移器让光一进去就能按预设的权重干涉出结果。这种方案在实验室里效果不错因为它把最难的部分——芯片制备——一次性搞定后面只需要对准、耦合、测量就行。但它有三个非常现实的困扰。第一个是应用场景变了就得重新投片。你今天做MNIST能用明天客户说要跑语音识别矩阵规模不一样、网络拓扑不一样整块芯片作废。第二个是非线性变化无法适配算法每层权重是训练出来的模型微调之后芯片就得改版。第三个则是制造成本被极度放大每次流片都是高额成本小规模团队根本玩不起。所以光计算从实验室走向实用第一步必须解决“通用性”问题。而通用性的答案在最底层就是可重构。2.2 “可重构”到底重构了什么可重构光计算芯片里的“重构”不是在软件层面换个函数库而是从物理层面改变光信号运算的行为。这套系统里通常有一排排光学干涉单元叫马赫-曾德尔干涉仪也就是MZI。每个MZI里面都带一个相移器通过加电压或电流改变材料折射率就能控制两束光的相位差。也就是说每个MZI单元就不再是固定分光比的静态器件而是一个“光学权重旋钮”。当你把这些旋钮组合在一起整块芯片就成了一个大尺寸的光学矩阵处理阵列。外部再配一个电控系统把已经训练好的神经网络权重矩阵映射成每个相移器上的一组电压这组电压会带动热光调制或载流子注入调制把权重写进光路里。之后你输入一组光信号芯片前向传输一遍输出光信号经过相干探测就得到了一次矩阵-向量乘法的结果。这个思路类比一下就很清楚了。传统专用芯片就像一块印刷好的电路板焊点焊死了改功能等于重新制版。可重构图芯片更像一台示波器前面板上有无数旋钮仪器本身能做很多种测量你要什么功能就按什么旋钮。2.3 多功能不是“叠加”而是同一套资源在不同配置下的复用团队这项工作的另一个关键词是“多功能”。这个多功能不是说芯片里同时放了三套独立的光学电路分别干三种事而是同一套光学单元通过不同的相位配置可以完成完全不同的运算功能。这是一个非常聪明的资产复用思路。同一组MZI阵列当我把相移器设置成一组特定的正交矩阵参数时它能做离散傅里叶变换换一组参数它就变成了一个卷积神经网络的全连接层再换一组参数它又可以执行逻辑门运算或者多通道信号处理任务。这背后的数学原理并不复杂MZI阵列本质上就是一个可编程的线性变换网络只要调节参数量足够大它能表示的线性变换空间就非常广。深度学习、信号处理、光学计算里面经常用的傅里叶变换、小波变换本质上都是某一类特定的幺正矩阵而这套可编程线路可以通过配置把这类矩阵精确地实现出来。这样的设计让晶圆面积得到了最大程度利用也让同一颗芯片可以在不同时刻服务于不同任务非常契合数据中心里面多业务并存的真实需求。3. 芯片内部的技术原理拆解光学单元如何完成可编程计算说清楚了宏观思路接下来就到了技术细节层面这颗芯片到底是怎么工作的。3.1 MZI可编程光学计算的最小积木MZI的前半段是一个50:50分束器把输入光分成两路一路经过一个可以调节的相移器然后两路在第二个50:50分束器处重新合束。两束光相位差不同合束后的输出功率分配就不同。所以你只要控制相移量θ就能连续调节这一级MZI“透过去多少、拐弯多少”这个比例就可以用来编码一个权重的实数部分。在理论仿真里一个无损MZI的传输矩阵通常可以写成这样import numpy as np def mzi_matrix(theta): 简化版MZI传输矩阵。 theta是顶部相移器的相位值单位rad。 输出是一个2x2矩阵本质上是某个特殊酉矩阵。 half_split np.array([ [np.sqrt(0.5), 1j * np.sqrt(0.5)], [1j * np.sqrt(0.5), np.sqrt(0.5)] ]) phase_shift np.diag([1.0, np.exp(1j * theta)]) return half_split phase_shift half_split # 举例相移量为pi时光基本从另一条臂输出 print(mzi_matrix(np.pi).round(4))看到这里你就明白了一个MZI就是个“光学权重旋钮”可以连续调节输出比例。但一个旋钮只能做一个标量乘法想要计算一个矩阵乘法得把非常多的MZI单元串成一个网格。3.2 从单单元到大规模阵列权重矩阵如何映射进光路光计算芯片里最经典的网络结构是“三角阵列”或者“矩形阵列”。这两种结构本质上是把任意一个N×N的酉矩阵分解成N(N-1)/2个MZI单元的级联。这个思想在光计算领域非常出名它基于线性代数里一个古老的分解定理任何一个酉矩阵都可以分解成一串Givens旋转矩阵的乘积。每一个Givens旋转矩阵恰好也就对应一个MZI的传输特性。所以整套流程非常清爽训练软件端取得目标权重矩阵W先将它做矩阵分解得到一系列MZI相移参数然后把这些参数转换成电压写入电路输入光信号后芯片直接硬件执行矩阵乘法。这里值得多说一句为什么一定是这样的分解因为物理上的光波导只能做局部耦合不能直接让第1号输入和第8号输入在任意位置发生干涉必须通过一层一层局部结构拼出全局的矩阵变换。这个道理跟数字芯片里的“全连接层通过大量乘法器拼出来”是完全一致的。3.3 复数权重的天然优势与“负数”问题电子芯片做AI推理时处理负数需要单独的符号位和电路逻辑而光计算里负数的表达本质上是相位。比如把相位旋转π光场振幅就变成了原来的一半再取负值。干涉过程中同相叠加增强、反相叠加削弱的物理现象天然实现了正负数的加减运算。更进一步光计算还能天然表达复数权重。复数在深度学习和信号处理里有大量应用场景比如光学相干层析、雷达信号处理、频域均衡器都天然工作在复数域。电子芯片做复数乘加消耗四倍甚至更多的乘法器资源而光学芯片只要调调相位一个物理过程就完成了。这是光计算最惊艳的优势但也是引出一堆工程麻烦的地方——因为相位控制精度直接决定了计算结果对不对。3.4 相位校准与反馈控制可重构背后的隐形工程写进论文里的可重构芯片看起来很美配置电压改个相位功能就变了。但实际用起来最头疼的就是相位的可靠性。硅光波导对温度极其敏感温度每变化1℃左右光在波导里走过的相位可能就漂移好几度。你上午校好的矩阵下午机房空调温度变了计算结果就可能开始出错。所以真实的可重构光计算芯片外围必然要搭配一整套监控和反馈系统。常见做法是在芯片上设计一些辅助的“监控光探针”周期性地输入已知校准信号然后根据输出偏差实时修正相移器电压。这一步做得好不好决定了芯片是“实验室能跑通”还是“工程上能稳定用”。胡小永、杨起帆、龚旗煌团队这次的工作之所以受到关注很大程度就是在可重构的稳定性和功能切换的速度上做出了实质性的验证结果而这两点恰恰是过去很多论文选择性忽略的部分。4. 主流光计算技术路线对比为什么可重构MZI路线值得关注光计算芯片不是只有MZI这一条路。目前学术界和产业圈里比较主流的路线大致还有微环阵列、相变材料、衍射光学元件和散射介质这几种。放在一起对比会更容易看出可重构MZI方案的位置。4.1 微环谐振器阵列路线微环阵列是另一种非常热门的方案。微环是一个环形波导当满足谐振条件时特定波长的光会在环里不断循环和直通波导里的光发生干涉。通过热光调谐微环的谐振波长就能实现权重编码。微环方案的优点在于功耗低、单位面积更小适合做大规模集成。但它对制造精度和温度控制极其敏感一个微环的谐振波长偏移一点点整个阵列就乱套了。更麻烦的是微环的频谱响应是周期性的对波长使用限制较大这让它在多波长并行计算上有优势但也使得系统设计复杂度上了一个台阶。4.2 相变材料与忆阻光开关路线相变材料路线比较新它利用的是硫系化合物等材料在不同相态下的折射率差异。材料在晶态和非晶态之间切换时光学性质会产生巨大变化相当于一个“光学的非易失存储器”。这类芯片最诱人的地方是权重写进去之后不需要持续供电维持掉电不丢失还能长期稳定。不过目前的问题也很明显相变前后的损耗较大、相变速度受限、可擦写次数还有待提升。它更像一个“光学存储计算一体”的长期方向短期做成大规模商用芯片还有距离。4.3 衍射光学与散射介质路线衍射光学路线在学术界同样很受欢迎它通过设计多层相位掩膜板让光经过薄膜后直接产生特定的衍射图案相当于把神经网络的权重分布在空间上。这一路线优点是可以很容易做三维大规模并行但缺憾是相位掩膜板一旦加工完毕就很难再调节。也就是说这类方案天生固定功能几乎不具备可重构能力。4.4 一条表格看清几条路我顺手整理了一张表格方便对比技术路线可重构性主要优势主要挑战适用场景MZI阵列强软件可调相位精度高、功能丰富、基于成熟硅光工艺尺寸大、控制复杂、功耗较高通用矩阵运算、神经网络推理微环阵列中可调谐振面积小、集成密度高温度敏感、制造容差严大规模线性变换、滤波相变材料中非易失功耗低、掉电不丢失寿命、损耗、速度受限专用存储内计算衍射/散射介质弱固定掩膜高吞吐、低成本功能固化、无法更新专用光学加速硬件从这张表能看出来MZI路线在“通用性”和“工程成熟度”之间取得了比较好的平衡。它不需要像微环那样对付超窄带宽谐振也不需要像相变材料那样等待材料科学突破唯一的代价就是芯片面积和一整套高精度驱动电路而这些在当前的半导体工艺条件下是可以承受的。5. 从论文到量产集成光计算芯片工程化的真正门槛每次看完这类论文很多人都会兴奋地觉得“光计算马上要替代GPU了”。我的看法向来比较冷静论文证明了原理和核心工艺可行性但从样品到产品还有好几道硬门槛要跨。这里挑几个最要命的说说。5.1 封装与耦合芯片外光子进出的第一道难关集成光计算芯片再强计算也必须由外部光源输入光信号。那么问题来了自由空间里的光怎么进入只有几个微米宽的硅波导且损耗要尽量低目前常用的方案是端面耦合和光栅耦合。端面耦合器做得比较准的时候耦合损耗可以压到每端1dB以内甚至更低但这对光学封装精度要求极高纳米级别的错位都会带来明显劣化。光栅耦合器对对准精度要求稍低一些但带宽窄、损耗稍大。更叫人头疼的是多通道并行。如果你想用多个波长或空间模式同时输入那封装时要对准的不再是一根光纤而是一排密集光纤阵列。这一排位置偏差要在亚微米级别才有戏。很多实验室芯片测试时能跑出好效果但一到产业级的量产封装环节良率立刻掉得让人怀疑人生。5.2 热漂移与相位稳定性光学编程的“记忆”难题硅的热光系数很高温度稍微变一变材料折射率就跟着变光程差随之漂移。MZI可重构芯片要在环境中长期工作就必须把相位锁定在设定值否则你调的权重“记不住”。我见过不少团队踩过这个坑仿真的时候权重矩阵写得明明白白上芯片实测时校准完一个小时再测精度就掉了两三个比特。解决办法只有两个方向要么靠温度控制把所有波导稳定在同一个温度点要么靠实时反馈调节。前者会推高系统功耗后者需要额外的监控光路和高速控制电路。现实中的系统通常是两套方案混合使用粗调靠温控板细调靠反馈回路。可重构光芯片真正成熟之前这一关谁都绕不过去。5.3 驱动电路与调度软件光芯片要配一个电控大脑你可能想不到一颗光计算芯片真正的调试工作量有一半以上其实是在电学部分。几千个MZI单元就需要几千路控制电压或电流每一路都要求低噪声、高稳定、可快速更新。这些DAC通道如果设计得不好电源纹波会直接耦合到相位调制器上导致计算噪声飙升。另一方面权重写入算法也不能随便应付。把一个N×N的矩阵分解成MZI相位参数需要做矩阵求逆和奇异值分解这里面有数值误差更麻烦的是每个MZI的实际相移曲线不是理想的直线存在非线性失真所以每颗芯片出厂前都要做一次“标定”把控制电压和实际相位之间的对应关系建表存入驱动系统。这一步做得越精细芯片的计算精度就越高。说句实话现在做光计算芯片的团队招人的时候最难找的既不是光学工程师也不是深度学习科学家而是能写低延迟调度算法、同时能画高精度模拟电路的多面手工程师。5.4 良率、测试与成本被忽视的产业现实硅光本身的模态透镜芯损耗已经很低工艺成熟度也在不断提升但大规模MZI阵列对整颗芯片的均匀性要求极高。一个阵列里哪怕只有几个单元的相位响应异常整个矩阵精度就会受到显著影响。这意味着晶圆级测试必须覆盖海量相位控制通道测试时间会是普通芯片的好几倍成本自然水涨船高。所以短期内这类芯片更适合先在那些“对功耗和延迟极其敏感、对成本容忍度较高”的场景落地比如雷达信号处理、光交换、低延迟推理加速而不是跟通用GPU抢训练市场。6. 我对这条技术路线的理解与入场建议论文看得再多不如自己动手摸一遍。作为一个长期观察和参与计算架构工作的从业者我对这次可重构多功能集成光计算芯片工作有三点比较深的感受也顺手分享给打算往这个方向走的同行。6.1 光计算的成熟度比我预想的要更接近应用过去我对光计算的一个偏见是它永远在实验室里多转两圈。但这两年越来越多的工作开始聚焦“可重构”“稳定性”“成套控制方案”这跟早期那种做出来一个光学演示就发论文的状态完全不同。这次发布的可重构多功能芯片已经不是一个只能在特定波长下做单一验证的玩物而是一个具备“软硬件联合定义计算功能”能力的平台。这一点比单个指标突破更有价值。6.2 给准备入场的工程师三条建议如果看到这篇文章的你也想切入光计算赛道我个人的建议是这样的。第一条先把硅光基础打牢再去追AI应用。很多AI背景的人直接奔着神经网络推理就去设计芯片架构结果对MZI的插损、相移器的调制带宽、光电探测器的响应速度缺乏体感做出的方案在纸面上很漂亮一到流片就翻车。先花时间把硅光器件库和PDK摸熟比什么都重要。第二条把“校准”当作芯片的一部分而不是测试阶段的临时任务。可重构芯片能不能用很大程度上取决于校准算法和反馈电路的设计水平。建议在项目一开始就把控制电路、校准流程、软件接口并行设计不要等光学设计完了再补。第三条不要只盯精度要盯端到端系统效率。光计算真正的价值是能耗和延迟但如果外围温控、DAC、光电探测的功耗加起来超过了省下的计算功耗那整个系统就没有商业意义。评估一个光计算方案永远要算系统总账而不是只算“光学部分功耗”。6.3 接下来最值得关注的方向基于这次工作我个人会持续关注三个延伸方向一是更大规模阵列的良率问题也就是能不能把可重构MZI从两百个单元做到两千个单元还能保证精度二是与电子芯片的异构集成方案把光计算核、电子控制、存储封装在同一个基板上三是面向特定垂直场景的软硬件协同优化比如光学相干层析里的实时矩阵运算、通信信道的并行信号处理这类非要复数权重不可的任务。说到底光计算不会一夜之间取代电子计算但它也不是空想。可重构、集成化、多功能这三个关键词对应着通用性、制造可行性和应用广度它们组合在一起让我对光计算从论文走向数据中心的路径有了更具体的想象空间。
返回列表