知识卡片:ParVL:多模态大模型的并行缩放与可扩展计算分配
一句话结论
ParVL 提出一种不直接扩大模型参数、也不增加顺序推理计算的多模态大模型缩放框架:通过复用现有 ViT 和 LLM 骨干参数、在多个视觉/语言分支上分配共享骨干的计算,从而在固定骨干参数预算下实现并行缩放,并系统研究视觉与语言模态之间的计算分配权衡。
事件概述或研究问题
现有 MLLM 缩放策略通常要么扩展模型参数,要么扩展顺序推理计算,会带来较大的内存或延迟开销;更重要的是,大多数方法无法改变 ViT 与 LLM 之间刚性固定的计算分配,难以针对具体任务进行优化。ParVL 提出的核心问题是:在固定骨干参数预算下,额外的共享骨干计算应如何在视觉模态和语言模态之间分配?
方法/产品要点
- 提出并行视觉-语言(ParVL)缩放框架,通过复用既有 ViT 和 LLM 骨干参数,跨多个视觉和语言分支扩展并行计算。
- 每个并行计算流在共享骨干上使用“分支特定的前缀参数”(branch-specific prefix parameters)进行实例化。
- 使用约 13B token 进行全参数监督微调,端到端训练整个模型。
- 系统研究 ViT 编码器与 LLM 解码器之间的计算分配权衡。
主要结果或产业意义
- 在相同训练方案下,ParVL 的整体多模态性能优于单分支基线。
- 最优的视觉—语言计算分配会因任务不同而变化。
- 代码已公开:https://github.com/YangYangGirl/ParVL
为什么重要
ParVL 将缩放视角从“增加参数”或“加深顺序计算”转向“固定骨干、并行分支、可分配计算”,为多模态大模型提供了一种更低内存/延迟开销的扩展路径,也为任务自适应的视觉/语言计算分配提供了新思路。
局限与不确定性
- 摘要未提及具体模型规模、参数量、训练算力开销等细节,待核实。
- 摘要未给出具体评测基准名称、任务清单及与最强方法的数值对比,待核实。
- “全参数监督微调”的具体数据来源、数据配比和训练细节待核实。
- 代码仓库是否可用、是否包含完整训练流程,待核实。
可用于图书/PPT/简报的角度
- 从“加参数”到“分计算”:MLLM 缩放的新思路。
- 视觉和语言谁该获得更多共享计算?答案可能因任务而异。
- 固定骨干 + 多分支前缀:用较低额外成本实现并行扩展。
- 计算分配权衡:一个值得进一步探索的设计维度。
与既有脉络的关系
本卡片与已有卡片“看得少,想得快:多模态大语言模型的联合Token与计算自适应”同属多模态大模型计算效率与分配主题;本条增量在于提出并验证了一种“固定骨干、多视觉/语言分支并行、可分配共享计算”的缩放框架,并强调视觉—语言计算分配随任务变化。
原始材料
- 英文标题:ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs
- 英文关键词:Multimodal LLM; Parallel Scaling; Compute Allocation; Vision Transformer; Shared Backbone
- 来源:arXiv:2608.04010v1
- URL: https://arxiv.org/abs/2608.04010v1
- PDF URL: https://arxiv.org/pdf/2608.04010v1