AI消息速览

MDTransformer——模式分集光子Transformer加速器的软硬件协同设计

事件日期 2026-07-28 · 学术前沿 · 已接受

事件日期2026-07-28
信息日期2026-07-28
入库日期2026-07-29
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MDTransformer——模式分集光子Transformer加速器的软硬件协同设计

一句话结论

MDTransformer 首次利用模式分集光学数据流与逆设计的多模耦合器件,在单激光连续波 1550 nm 光源下实现四路并行光子张量核,相比现有光子 Transformer 加速器(PTA)在面积、功耗和能耗上分别降低约 40.4%、63.6% 和 40.6%,且延迟相当,为高性能 Transformer 推理提供了一种更实用的光子计算方案。

事件概述 / 研究问题

现有光子 Transformer 加速器依赖昂贵的多波长光源和基于有源移相器的大尺寸点积单元,导致效率低、成本高、可扩展性差。为克服这一困境,作者提出 MDTransformer——一种基于模式分集光数据流与运算的软硬件协同设计,核心思想是利用空间模式干涉(而非波长分集)来完成矩阵运算,通过逆设计的多模耦合器、交叉波导和马赫-曾德尔 IQ 调制器,在单一波导中实现四个独立计算通道(TE0–TE3),从而避免光谱滤波和自由频谱范围限制。

方法 / 产品要点

  • 硬件架构:逆设计的模式分集光子张量核(MPTC),每个引导模式作为独立计算通道,在单根波导内实现四倍并行性,无需多波长光源。
  • 计算原理:相干检测与 IQ 调制联合编码振幅和相位,支持复数值算术,满足 Transformer 中全范围运算需求。
  • 关键参数:模拟乘法有效精度 < 4 bit,模式间串扰 < –30 dB;采用单激光连续波 1550 nm 光源,与现有 CMOS 兼容。
  • 软硬件协同:适配 Transformer 的矩阵运算数据流(具体调度策略原文未提供,待核实)。
  • 评估负载:DeiT-Tiny/Small/Base 和 BERT-Base/Large。

主要结果或产业意义

  • 与已有最先进 PTA 相比:面积减少 40.4%,功耗节省 63.6%,能量节省 40.6%,延迟相当。
  • 意义:证明了模式分集光子计算可以替代多波长方案,大幅降低系统复杂度和成本,同时保持高性能和能效,为光子 AI 加速器的实用化迈出重要一步。

为什么重要

  • 突破多波长瓶颈:传统光子加速器需要多个激光器和波长管理,MDTransformer 通过空间模式复用简化光源需求,提升可扩展性。
  • 逆设计集成:利用逆设计方法(而非手工布局)自动优化耦合器/交叉波导,实现紧凑、低串扰的光子张量核。
  • 填补空白:现有光计算加速器多基于电子-光学混合或波长分集,本文首次系统展示模式分集在 Transformer 推理中的完整端到端设计。

局限与不确定性

  • 有效精度仅 < 4 bit,可能限制需要高精度计算的应用(如大规模语言模型训练或某些推理场景)。
  • 模式间串扰 –30 dB 是否在更大规模集成(如几十个模式)下仍可维持,待核实
  • 文中未提供与纯电子加速器(如 GPU)的对比,待核实
  • 逆设计方法的可制造性、工艺容差及温度敏感性未详细讨论,待核实

可用于图书 / PPT / 简报的角度

  • 从光计算到模式分集:用“光可以像路一样分车道”比喻空间模式复用,说明如何用一束激光实现四倍并行计算。
  • 逆设计:展示“计算机自动优化光子器件”的概念,类比 AI 辅助芯片设计。
  • Transformer 硬件加速器的异构进化:从电子 → 多波长光子 → 模式分集光子,突出每一代解决的痛点。

原始材料

  • 标题(英文):MDTransformer: A Hardware-Software Co-Design of Mode-Division Photonic Transformer Accelerator with Inverse-Designed Coherent Crossbar
  • 关键词(英文):foundation-model
  • 来源:arXiv: 2607.26016v1, URL: https://arxiv.org/abs/2607.26016v1
  • 备注:由于未能抓取论文正文,本卡片仅基于摘要元数据生成,所有未明确提及的细节(如具体调度算法、实验条件、与其他方法的消融对比等)均已标注“待核实”。