作者:Zaijun Chen 来源:《光:科学与应用》 发布时间:2026/8/5 9:43:26
选择字号:
高时钟频率自由空间存内计算

 

导读

近日,加州大学伯克利分校、南加州大学与德国柏林工业大学联合团队提出了一种高时钟速率自由空间光存内计算架构——FAST-ONN(Fanout Spatial Time-of-flight Optical Neural Network)。该系统结合高速VCSEL(垂直腔面发射激光器)阵列与高像素数空间光调制器(SLM),实现了每秒数十亿次卷积运算,并在实验中完成1亿帧/秒(100 MFPS)的卷积处理演示,为构建超高速、低延迟、可扩展的光神经网络系统开辟了新路径。该成果以“High-clockrate free-space optical in-memory computing”为题发表在国际顶尖光学期刊《Light: Science & Applications》。Yuanhao Liang为第一作者,Zaijun Chen为通讯作者。

研究背景

人工智能模型的快速演进正在重塑信息处理方式,使机器在感知、决策与控制方面达到前所未有的精度。当这些模型从云端走向自动驾驶、无人机与机器人等边缘场景时,算力与能效之间的矛盾日益突出。深度神经网络的核心在于大规模矩阵运算,这类计算对带宽与并行度提出极高要求。传统电子处理器依赖电荷存储与搬移,受限于冯·诺依曼瓶颈和电容损耗,在功耗、散热与时钟频率方面逐渐逼近极限。在严格的尺寸、重量与功耗约束下,实现高速、低延迟的智能推理仍是边缘人工智能面临的关键挑战。

光计算因其以光速传播、低损耗传输和天然并行特性,被视为突破电子瓶颈的重要方向。集成光子芯片已在干涉网络与片上矩阵运算方面取得进展,但器件尺寸与控制复杂度限制了进一步扩展。自由空间光计算则利用三维传播实现大规模并行权重调制,具备更高的系统扩展潜力。然而,长期以来,其整体性能受限于输入调制器件的低时钟速率,系统吞吐率难以提升,成为释放光计算潜能的核心障碍。

创新研究

本研究提出高速自由空间光存内计算架构FAST-ONN(图1d),通过高密度 VCSEL阵列实现百兆样本每秒级输入调制,结合空间扇出复制与可编程光权重调制,实现并行矩阵与卷积运算。系统在光域中完成乘加与累加过程,并通过差分读出机制支持带符号权重计算,在保持结构紧凑与可扩展性的同时显著提升了系统时钟速率与整体吞吐能力。FAST为突破自由空间光计算长期受限于低输入速率的瓶颈提供了系统级解决方案,展现出面向实时边缘智能与大规模模型计算的广阔应用前景。

图1:FAST-ONN 架构概念示意图。a. 边缘计算应用示例,包括自动驾驶、无人机、卫星系统、高频交易、机器人以及加密货币等场景。这些应用通常处于移动端、嵌入式或高频决策环境,对低延迟、低能耗的人工智能推理能力具有迫切需求。b. 应用场景示意图。画面左前方的一辆汽车被检测并以边界框标出,作为感兴趣区域(ROI),随后该区域被送入光计算数据流进行推理处理。c. 边缘摄像头采集图像后,通过并行卷积生成多个特征图,形成多通道光学读出信号并传输至下游模块。系统同时支持前向推理与反向优化,实现系统训练能力。d. 输入子图像被编码至包含 N 个单元的 VCSEL 阵列,并通过空间扇出复制为 M 路并行信号,在 FAST-ONN 中执行卷积运算。预训练模型可加载用于推理,读出信号亦可反馈用于在线权重更新。最终检测结果被渲染回原始场景,其中车辆以绿色标注,其余目标以红色标注。

FAST-ONN实验系统由高速 VCSEL 阵列、空间扇出模块(DOE)、可编程光权重调制单元(SLM)以及差分光电读出模块构成。VCSEL 阵列负责将输入数据编码为光信号,经DOE实现空间复制后,在空间光调制器上并行加载卷积权重,实现光域乘加运算。加权后的光信号通过二维光纤阵列进行收集,并由平衡光电探测器完成差分检测与读出。

图2:FAST-ONN 的实验系统与器件实现。a. 用于 FAST-ONN 系统的 VCSEL 阵列实物图,共包含 8 个子阵列,每个子阵列由 5 × 5 个 VCSEL 单元组成。b. 实验中使用的 5 × 5 VCSEL 阵列放大图。c. FAST-ONN 实验系统示意图。系统由 VCSEL 阵列构成输入编码层,发射经输入信号调制后的光信号;光束通过衍射光学元件(DOE)被复制为多个空间扇出副本;各副本在空间光调制器(SLM)上并行调制,以加载卷积核权重;加权后的光信号通过芯径为 300 μm 的多模光纤进行汇聚,并由平衡光电探测器(BPD)阵列进行检测。d. 用于实现 3 × 3 空间扇出的 DOE 相位图案显微图。e. SLM 器件及其局部放大图,展示可独立寻址的液晶像素结构。f. VCSEL 阵列编码字母“C”时形成的 3 × 3 实验扇出光斑图样。g. 系统中使用的二维光纤阵列,其中一组用于加权光路,另一组用于参考光路。

为验证 FAST-ONN 在矩阵运算中的计算精度与多通道并行能力,研究团队开展了随机矩阵–向量乘法实验。系统采用调制光路与参考光路的双路径结构:输入信号首先编码至 VCSEL 阵列,经空间扇出后,一路进入空间光调制器进行权重加载作为调制光路,另一路作为参考光路直接送入探测端。两路信号在平衡光电探测器中进行差分读出,从而实现带符号权重计算。实验在 100 MS s?¹ 工作速率下完成随机输入向量与随机权重的乘加计算,9 个并行输出通道与理论真值高度相关,对应有效计算精度超过 6 bit,表明系统能够稳定完成高精度矩阵运算。

在此基础上,团队进一步验证了 FAST-ONN 在图像处理任务中的应用能力。系统分别对南加州大学与加州大学伯克利分校校徽图像以及 MNIST 手写数字图像进行了边缘检测实验。结果显示,FAST-ONN 输出的边缘特征与数字计算真值高度一致,证明该系统不仅能够完成随机数乘法等基础矩阵运算,还具备执行实际视觉处理任务的能力,为后续复杂光学神经网络应用奠定了实验基础。

图3:FAST-ONN 实现随机矩阵-向量乘法(MVM)的同步获取实验。a. FAST-ONN 实验系统光路示意图。b. 随机分布输入向量与带符号权重相乘的实验结果与数字计算真值对比。输入信号编码至一个9单元VCSEL阵列,工作速率为100 MS s?¹,权重加载于 SLM 上。c. 9 个光学输出通道的实验结果与理论真值之间的相关性分析。d. 所有光学通道乘法误差的统计直方图,平均计算误差为3.27%。e. 实验结果与理论真值对比的局部放大图。f. 南加州大学校徽的边缘检测结果。g. 加州大学伯克利分校校徽的边缘检测结果。h. MNIST手写数字数据集的边缘检测结果。上、中、下三行分别为原始输入图像、数字计算真值结果以及FAST-ONN输出的检测结果。

为验证FAST-ONN在真实复杂场景中的应用能力,研究团队基于COCO数据集构建了目标级车辆与背景二分类任务,并采用光电混合计算流程进行推理。系统首先对检测到的目标区域进行边界框裁剪,将感兴趣区域送入网络完成特征提取与分类判别,其中光学计算模块与电子处理模块协同工作。实验结果表明,实验输出与纯电子计算结果高度一致,第二卷积层的时间波形误差仅为 0.037,分类概率分布与最终判决结果均保持良好匹配。

此外,团队通过在卷积层中引入不同强度的高斯噪声,对硬件扰动对系统性能的影响进行了系统评估。结果显示,即使在噪声标准差 σ 提升至 0.5 的情况下,系统仍保持较高的AUC值,体现出良好的抗噪声能力与鲁棒性。这不仅验证了FAST-ONN在实际边缘部署环境中的稳定推理能力,也为未来向更深层次、多层级光学神经网络架构的拓展提供了有力支撑。

图4:基于 FAST-ONN 的目标级车辆分类与卷积噪声分析。系统采用光电混合计算流程,对检测到的目标区域进行车辆与背景二分类判别。a. 应用于边界框裁剪图像的目标级分类算法流程示意。b. 推理结果示意图,绿色边界框表示识别为车辆的目标,红色边界框表示背景类别。c. FAST-ONN 第二卷积层输出的时间波形与纯电子计算结果对比,二者误差为 0.037。d. 结果对比局部时间段放大图,显示实验结果与理论真值具有良好一致性。e. 集成与未集成 FAST-ONN 条件下的最终分类概率对比,训练得到的判决阈值为 0.4042。f. 在理想条件下完整分类流程的混淆矩阵。g. 在所有卷积层中引入实验噪声(包括 ResNet-18 第 1–2 层与任务相关卷积层第 1–2 层)后的混淆矩阵。h. AUC 随注入噪声强度变化曲线,噪声标准差 σ 从 0 增加至 0.5。

在实验中,团队基于 FAST-ONN 完成了光学推理任务。在不同类型的任务中,如手写数字识别和服饰识别,系统均实现了接近纯电子模型的分类准确率。同时,研究团队还结合光学前向计算与电子反向传播,对层内参数进行损失计算与梯度更新,实现了系统内的在线参数优化与训练。在20个训练轮次内,模型在训练集与测试集上实现稳定收敛,进一步证明了FAST在保持高速推理能力的同时,具备原位学习与自适应优化的潜力。

图5:基于FAST-ONN的机器学习推理与系统内训练性能评估。a. 用于MNIST与 Fashion-MNIST分类任务的神经网络模型结构示意。模型包含一个卷积层(9 个 3 × 3 卷积核)以及一个全连接输出层。前向传播结果与理论真值进行比较以计算损失函数,并更新卷积核权重与输出层权重。b. MNIST 数据集的输出层读出结果。c、d. 从测试集中随机选取 800 张样本,对 MNIST 分类任务的电子计算结果。(c)与光学计算结果(d)混淆矩阵进行对比(电子准确率 95.75%,光学准确率 93.75%)。e. Fashion-MNIST 数据集的输出层读出结果。最终分类结果由输出层中最大概率对应的类别确定。f、g. 从测试集中随机选取 800 张样本,对 Fashion-MNIST 分类任务的电子计算结果(f)与光学计算结果(g)混淆矩阵进行对比(电子准确率84.88%,光学准确率80.75%)。光学结果与电子结果高度一致,验证了FAST-ONN 的推理能力。h. 系统内在线训练准确率随训练轮数变化曲线(20 轮训练后,训练子集准确率 93.5%,测试子集准确率 92.8%)。i. 完成 20 轮系统内训练后的混淆矩阵。

总结与展望

本研究提出的 FAST-ONN 架构,将高速、紧凑且可规模制造的 VCSEL 发射阵列与大规模可编程空间权重调制相结合,为自由空间光计算提供了一种兼具高时钟速率与强并行能力的新路径。该平台不仅突破了传统自由空间系统受限于低输入调制速率的瓶颈,还实现了可重构矩阵计算与带符号精确运算,在混合光电架构中成功验证了车辆识别等实时任务。依托VCSEL阵列的高密度可扩展特性与SLM百万级权重调制能力,系统在通道数与带宽提升后具备向更高吞吐率和更优能效跃迁的潜力。未来,FAST-ONN 有望从边缘智能设备拓展至更大规模模型计算,在自动驾驶、智能感知、机器人控制及高性能人工智能加速等领域展现重要应用价值,为构建高效、可扩展的新一代计算体系奠定基础。(来源:LightScienceApplications微信公众号)

相关论文信息:https://doi.org/10.1038/s41377-026-02206-8

 
 
 
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。
 
 打印  发E-mail给: 
    
 
相关新闻 相关论文

图片新闻
青藏高原地球系统模型1.0版在京发布 新研究破解致命出血热病毒复制之谜
青藏高原首个综合性汞数据集发布 科学家首次观测到“系外月球”
>>更多
 
一周新闻排行
 
编辑部推荐博文