AI消息速览

MixFrag:脆弱性引导的视觉Transformer混合精度训练后量化

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-07-31
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:MixFrag:脆弱性引导的视觉Transformer混合精度训练后量化

英文标题:MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

英文关键词:Post-training Quantization; Vision Transformers; Mixed-Precision; Fragility-Guided; KL Divergence; Multiple-Choice Knapsack Problem

一句话结论

MixFrag 提出一种基于“量化脆弱性”引导的混合精度训练后量化(PTQ)框架,通过KL散度评估ViT各组件对量化的敏感度,并将比特分配建模为多选择背包问题(MCKP),在目标比特预算下自适应分配层间精度,从而在目标检测等任务上取得超越现有混合精度PTQ方法的效果。

事件概述或研究问题

现有ViT的PTQ方法通常对各组件采用统一比特宽度,忽略了不同层/模块对量化误差的异构敏感性,导致精度分配低效。MixFrag 旨在解决该问题:如何为Vision Transformer的不同组件自动分配不同比特宽度,在满足总比特预算的同时最小化量化性能损失。

方法/产品要点

  • 组件级脆弱性估计:使用小型校准集,计算全精度输出分布与“独立量化”后输出分布之间的KL散度,以衡量每个组件对量化的敏感程度。
  • 比特分配建模:将每个组件的可选位宽视为一个选项,把总比特数作为约束,将位分配形式化为多选择背包问题(MCKP),从而在给定预算下选择最优混合精度配置。
  • 训练后量化(PTQ):无需完整重训练,适合资源受限设备上的ViT部署。

主要结果或产业意义

  • 在ImageNet-1K上,多个ViT架构下,MixFrag 在实用混合精度设置下取得有竞争力的分类性能(论文未给出具体数字,待核实)。
  • 在COCO目标检测与实例分割任务上,MixFrag 在现有混合精度PTQ方法中达到最佳性能;在具有挑战性的MP3/MP3设置下,比此前最佳方法最高提升9.6 AP。
  • 额外分析验证了脆弱性指标的有效性,并显示其与学到的比特分配有强相关性。

为什么重要

  • 打破了ViT量化中“均匀比特宽度”的常见假设,强调组件级异构敏感性的重要性。
  • 将比特分配形式化为MCKP,提供了清晰的优化框架,可适配不同比特预算。
  • 在检测/分割等下游任务上的大幅提升(最高+9.6 AP)表明混合精度PTQ在ViT上仍有显著改进空间。
  • 与既有脉络的关系:属于模型压缩与高效推理方向,增量在于用脆弱性指标指导非均匀精度分配,而非对所有层一视同仁。

局限与不确定性

  • 摘要未给出ImageNet-1K上的具体分类精度数值,需要阅读全文核实。
  • “MP3/MP3”设置的具体含义、评估协议和对比基线细节待核实。
  • 脆弱性估计的计算开销、所需校准集大小、对校准集分布的依赖程度待核实。
  • 是否适用于更广泛的Transformer结构(如多模态、大语言模型)待核实。

可用于图书/PPT/简报的角度

  • 示例标题:“别让所有层都‘一刀切’:混合精度量化让ViT更轻更快”
  • 可以用“每个Transformer组件的脆弱性不同”作为切入点,解释为什么统一位宽会浪费资源。
  • 用“背包问题”的类比说明如何在预算下选择最优比特组合。
  • 展示COCO任务上的AP提升(最高+9.6 AP)作为量化方法有效性的强证据。

原始材料

  • 论文标题:MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers
  • arXiv ID:2607.28589v1
  • 作者:Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk
  • 提交/更新:2026-07-30
  • 分类:cs.CV, cs.LG
  • URL:https://arxiv.org/abs/2607.28589v1