AI消息速览

看得少,想得快:多模态大语言模型的联合Token与计算自适应

事件日期 2026-07-22 · 学术前沿 · 已接受

事件日期2026-07-22
信息日期2026-07-22
入库日期2026-07-23
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:看得少,想得快:多模态大语言模型的联合Token与计算自适应

一句话结论:SmartVL 通过联合控制视觉 token 数量与大语言模型(LLM)的计算深度,实现了在多种计算预算下比单维度自适应方法更优的精度-效率平衡。

事件概述或研究问题

多模态大语言模型(MLLM)在视觉-语言任务中表现优异,但高推理成本(源于大量视觉输入 token 和 LLM 的繁重计算)阻碍了实际部署。现有方法通常独立优化单个维度(如裁剪冗余视觉 token、跳过 LLM 层或注意力头),忽略了计算资源必须在各维度间根据输入内容动态分配的根本耦合问题。

方法/产品要点

SmartVL 是一种统一的自适应推理框架,包含两个协调的控制器:

  • 视觉侧 token 控制器:动态选择信息量高的视觉 token。
  • LLM 侧计算控制器:自适应调整 LLM 的计算深度。
  • 联合调度机制:通过共享预算编码连接两个控制器,并利用可微延迟估计器进行端到端训练,使整体推理成本满足目标预算。这使得跨阶段分配策略能同时适应输入复杂度和运行时计算约束。

主要结果或产业意义

在多个 MLLM 基准上的实验表明,SmartVL 的联合调度一致优于先前的自适应方法,实现了更优的精度-效率帕累托前沿。具体数值待核实材料原文(摘要未给出量化结果)。产业上,该工作有望降低 MLLM 在边缘设备或实时场景中的部署成本。

为什么重要

它首次将视觉 token 压缩与 LLM 计算裁剪作为耦合问题统一建模,而不是独立优化。这与已有相关卡片(如独立优化 token 或层的方法)形成增量:本文指出独立优化的根本缺陷,并提出联合调度方案,在概念和方法上均有推进。

局限与不确定性

  • 实验细节(如具体模型、预算设置、对比基线)需阅读全文确认。
  • 可微延迟估计器的实际部署开销与泛化性待进一步验证。
  • 是否适用于更广泛的 MLLM 架构(如不同视觉编码器或 LLM 家族)未在摘要中明确。

可用于图书/PPT/简报的角度

  • 标题举例:“多模态大模型推理加速新范式:从独立裁剪到联合调度”
  • 核心比喻:就像同时调整“看什么(token)”和“怎么想(计算深度)”,而非只做其一。
  • 对比演示:可以用一张图展示独立优化 vs 联合优化的精度-效率曲线。

原始材料

  • 英文标题: Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
  • 英文关键词: multimodal large language models, inference efficiency, adaptive inference, token pruning, compute skipping
  • 来源: arXiv:2607.20357v1, https://arxiv.org/abs/2607.20357v1
  • 项目页面: https://www.schaterji.io/publications/2026/jointtokencompute