AI消息速览

组共享低秩近似:让大核CNN的点卷积在移动端更高效

事件日期 2026-08-26 · 学术前沿 · 已接受

事件日期2026-08-26
信息日期2026-08-26
入库日期2026-08-27
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:组共享低秩近似:让大核CNN的点卷积在移动端更高效

一句话结论:大核CNN中占参数主导的pointwise卷积可通过“通道组共享低秩近似(CGS)”大幅压缩,在保持竞争力的同时显著降低存储与加载开销,使预训练模型更易部署到手机等边缘设备。

英文关键词:low-rank approximation; pointwise convolution; large-kernel CNN; edge deployment; model compression

事件概述或研究问题:大核CNN通过扩大感受野获得优秀视觉性能,但参数随核大小二次增长,边缘部署受限。现有高效架构常用depthwise separable卷积,并优先压缩depthwise部分,却忽视了pointwise卷积的参数占比(如RepLKNet-31B中>87%)和部署瓶颈。本文针对这一缺口提出CGS方法。

方法/产品要点:CGS是一种基于SVD的低秩近似与参数共享策略。它在层内跨通道组共享高参数成本的降维/升维投影矩阵(down/up-projection),同时为每个通道组保留低参数成本的可扩展对角矩阵,形成与SVD分解同构的结构化低秩范式。这样既压缩pointwise卷积,又保留通道组特异性。

主要结果或产业意义:在RepLKNet、ConvNeXt、SLaK上应用CGS后,实验显示能够在保持有竞争力性能的同时,显著降低模型存储成本。通过缓解存储限制、降低模型加载时的内存带宽压力并减少加载延迟,CGS使预训练的大核CNN模型在边缘设备(如4-12GB RAM的智能手机)上的部署变得可行。具体压缩率和精度变化待核实。

为什么重要:已有高效架构多聚焦depthwise卷积压缩,本文指出pointwise卷积才是大核CNN参数与部署的主要瓶颈,并给出一种组共享低秩近似方案。这一增量视角有助于连接高性能视觉模型与资源受限设备的实际落地,也与已有相关卡片中聚焦生成模型或LLM压缩的主题形成区分。

局限与不确定性:摘要未提供具体的数据集、压缩倍率、推理耗时或精度损失数值;CGS在不同硬件平台上的实际加速效果、与量化/蒸馏等其他压缩方法的兼容性等,均待核实。

可用于图书/PPT/简报的角度:可举例说明“大核CNN很强大但很胖,点卷积才是真正的‘内存大户’”;用CGS的思路解释如何通过跨通道组共享投影矩阵、只保留少量组内对角矩阵来为模型“减肥”,从而把大模型塞进手机。

原始材料

  • 英文标题:Group-Shared Low-Rank Approximation for Mobile-Efficient Pointwise Convolutions in Large-Kernel CNNs
  • arXiv ID:2608.26069v1
  • URL:https://arxiv.org/abs/2608.26069v1
  • Authors:Hao Luo, Yiting Yang, Wenyi Zhao, Man Jiang, Zhijun Lin, Ghulam Mohiuddin, Ting Jiang, Kunming Luo, Zihao Zhang, Qingsen Yan, Guoqing Wang, Wei Dong, Peng Wang
  • Published:2026-08-26T17:36:35Z
  • Updated:2026-08-26T17:36:35Z
  • Primary category:cs.LG / Categories:cs.LG