AI消息速览

跨域整合RLVR能力:融合范式的深入比较

事件日期 2026-08-27 · 学术前沿 · 已接受

事件日期2026-08-27
信息日期2026-08-27
入库日期2026-08-28
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:跨域整合RLVR能力:融合范式的深入比较

English Title: Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms

English Keywords: RLVR; Merge; Mix RL; MOPD; multi-domain; task vectors

一句话结论

用“可验证奖励的强化学习”(RLVR)训练出多个领域专家模型后,合并任务向量(Merge)、混合数据训练(Mix RL)、多教师同策略蒸馏(MOPD)三种整合范式的平均表现差距很小(≤1.4个百分点),但在单一基准上最大差距可达8.6个百分点。选型时应考虑:是否已有专家模型、端到端成本是否重要、以及是否需要尽可能保留领域特异增益。

事件概述/研究问题

RLVR能显著提升大语言模型的特定能力,但要覆盖多个能力,常见做法是先训练多个领域专家模型,再把它们整合起来。此前 Merge、Mix RL、MOPD 三种范式基本是被分开研究的,缺乏系统比较,导致“该选哪种融合方式”并不清楚。本文在共享专家和数据、多个模型规模、多领域基准套件的条件下,对三种范式进行了统一比较。

方法/产品要点

  • Merge:复用专家模型的任务向量,将多个专家更新压缩到一个模型中。
  • Mix RL:复用专家数据,将多领域数据混合后进行统一的 RLVR 训练。
  • MOPD:多教师同策略蒸馏(multi-teacher on-policy distillation),同时复用专家任务向量和数据集。
  • 比较设置:使用共享的专家模型与训练数据,跨模型规模和多个领域基准进行评估。

主要结果或产业意义

  • 三种范式的平均性能差异不大,最多只差 1.4 个百分点;但单一基准上最大差距达到 8.6 个百分点。
  • 领域层面的表现差异与任务向量几何中可见的跨领域关系相关。
  • 训练动态暴露出各自约束:
    • Mix RL 对领域混合比例敏感;
    • MOPD 的效果受限于教师模型;
    • Merge 把所有专家更新压缩进单一模型。
  • 三者都能提升单样本准确率(single-sample accuracy),但没有显著提升方案覆盖(solution coverage),也没有造成留出能力(held-out capabilities)的明显损失。

产业意义上的选型指南:

  • 已有专家模型、且低成本融合最重要 → 用 Merge
  • 没有现成专家模型、想训练统一模型 → 用 Mix RL,并针对跨域迁移调整领域混合比例。
  • 更看重保留领域特异增益,而非超越教师模型或最小化端到端成本 → 用 MOPD

为什么重要

这项工作把三种原本分散研究的 RLVR 融合范式放到同一套实验条件下比较,给出了可操作的选型依据。它提醒我们:只看平均分可能掩盖单领域风险,需要结合任务向量几何、训练约束、端到端成本和保留能力来综合判断。

与既有脉络的关系

已有相关卡片分别涉及 RAG 领域适配、医学图像分割、可穿戴传感器融合等具体应用。本条卡片不是某个垂直领域的单一模型方案,而是面向基础模型层的“多领域 RLVR 能力整合”方法论比较,提供了跨领域的增量视角:如何把多个领域专家整合为统一模型,以及不同融合范式的取舍。

局限与不确定性

本卡片仅基于 arXiv 摘要与抓取文本生成,全文实验细节尚未核实。以下内容待核实:

  • 具体评测基准名称与任务集;
  • 模型规模的具体列表;
  • MOPD 中“同时使用任务向量和数据集”的详细实现方式;
  • 任务向量几何的度量方法;
  • 方案覆盖(solution coverage)的测量方式;
  • 除摘要提到的 1.4/8.6 个百分点之外的具体数字。

可用于图书/PPT/简报的角度

  • “模型融合不只是平均成绩:1.4 个百分点的平均差背后,是单一基准上 8.6 个百分点的分野。”
  • “三种 RLVR 融合范式怎么选:Merge、Mix RL、MOPD。”
  • “从任务向量几何看跨领域迁移,可能是理解多能力整合差异的一个切入点。”
  • “选型三问:有没有专家模型?端到端成本是否重要?要不要优先保留领域增益?”

原始材料

  • 原文标题:Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
  • arXiv ID:2608.27409v1
  • 作者:Siye Wu, Kai Yang, Yuchen Cai, Xin Xu, Peng-Yuan Wang, Jiaxuan Wang, Jiashun Liu, Jiafei Lyu, Yangkun Chen, Saiyong Yang, Yanghua Xiao
  • 发布/更新:2026-08-27T17:38:04Z
  • 分类:cs.CL
  • 摘要页:https://arxiv.org/abs/2608.27409v1
  • PDF:https://arxiv.org/pdf/2608.27409v1