AI消息速览

ParVL:多模态大模型的并行缩放与可扩展计算分配

事件日期 2026-08-04 · 学术前沿 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-05
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:ParVL:多模态大模型的并行缩放与可扩展计算分配

一句话结论

ParVL 提出一种不直接扩大模型参数、也不增加顺序推理计算的多模态大模型缩放框架:通过复用现有 ViT 和 LLM 骨干参数、在多个视觉/语言分支上分配共享骨干的计算,从而在固定骨干参数预算下实现并行缩放,并系统研究视觉与语言模态之间的计算分配权衡。

事件概述或研究问题

现有 MLLM 缩放策略通常要么扩展模型参数,要么扩展顺序推理计算,会带来较大的内存或延迟开销;更重要的是,大多数方法无法改变 ViT 与 LLM 之间刚性固定的计算分配,难以针对具体任务进行优化。ParVL 提出的核心问题是:在固定骨干参数预算下,额外的共享骨干计算应如何在视觉模态和语言模态之间分配?

方法/产品要点

  • 提出并行视觉-语言(ParVL)缩放框架,通过复用既有 ViT 和 LLM 骨干参数,跨多个视觉和语言分支扩展并行计算。
  • 每个并行计算流在共享骨干上使用“分支特定的前缀参数”(branch-specific prefix parameters)进行实例化。
  • 使用约 13B token 进行全参数监督微调,端到端训练整个模型。
  • 系统研究 ViT 编码器与 LLM 解码器之间的计算分配权衡。

主要结果或产业意义

  • 在相同训练方案下,ParVL 的整体多模态性能优于单分支基线。
  • 最优的视觉—语言计算分配会因任务不同而变化。
  • 代码已公开:https://github.com/YangYangGirl/ParVL

为什么重要

ParVL 将缩放视角从“增加参数”或“加深顺序计算”转向“固定骨干、并行分支、可分配计算”,为多模态大模型提供了一种更低内存/延迟开销的扩展路径,也为任务自适应的视觉/语言计算分配提供了新思路。

局限与不确定性

  • 摘要未提及具体模型规模、参数量、训练算力开销等细节,待核实。
  • 摘要未给出具体评测基准名称、任务清单及与最强方法的数值对比,待核实。
  • “全参数监督微调”的具体数据来源、数据配比和训练细节待核实。
  • 代码仓库是否可用、是否包含完整训练流程,待核实。

可用于图书/PPT/简报的角度

  • 从“加参数”到“分计算”:MLLM 缩放的新思路。
  • 视觉和语言谁该获得更多共享计算?答案可能因任务而异。
  • 固定骨干 + 多分支前缀:用较低额外成本实现并行扩展。
  • 计算分配权衡:一个值得进一步探索的设计维度。

与既有脉络的关系

本卡片与已有卡片“看得少,想得快:多模态大语言模型的联合Token与计算自适应”同属多模态大模型计算效率与分配主题;本条增量在于提出并验证了一种“固定骨干、多视觉/语言分支并行、可分配共享计算”的缩放框架,并强调视觉—语言计算分配随任务变化。

原始材料

  • 英文标题:ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs
  • 英文关键词:Multimodal LLM; Parallel Scaling; Compute Allocation; Vision Transformer; Shared Backbone
  • 来源:arXiv:2608.04010v1
  • URL: https://arxiv.org/abs/2608.04010v1
  • PDF URL: https://arxiv.org/pdf/2608.04010v1