知识卡片:你真的需要为在线RL微调预训练Q函数吗?
一句话结论
在基于价值函数的强化学习(RL)微调中,对Q函数进行预训练(与预训练策略配合)并不能稳定带来性能提升,随机初始化Q函数在多数情况下效果相当甚至更好;作者提出了一种简单的集成策略初始化方法(IPE)可将微调性能提升平均1.26倍。
事件概述/研究问题
预训练+微调已成为学习高性能策略的主流范式。对于基于价值函数的RL,一个自然的问题是:给定一个预训练的策略,Q函数是否也应该在离线数据上预训练?传统观点认为应该,但近期结果表明,使用随机初始化的Q函数进行在线RL也能产生高性能且可靠的策略。本文系统研究了在预训练基础策略上进行微调时,预训练Q函数是否真正有帮助。
方法/产品要点
- 问题识别:作者发现,朴素Q函数预训练往往带来有限收益,根源在于一个根本性不匹配——预训练期间学习的Q函数是针对预训练策略的Q函数,而不是在线微调将要收敛到的Q函数;即使经过离线价值最大化,这种差距依然存在。
- 提出方法:集成策略初始化(Initialization via Policy Ensemble, IPE),一种简单方法:训练多个多样化的策略,利用它们的汇总轨迹来引导在线RL中的Q函数学习。
主要结果或产业意义
- 在一系列具有挑战性的连续控制基准测试中,IPE相比朴素Q函数预训练,平均微调性能提升了1.26倍。
- 结果挑战了“预训练Q函数总是有益”的常规认知,为在线RL微调提供了更高效的初始化策略。
为什么重要
- 揭示了价值函数预训练与策略预训练之间的关键不匹配现象,为设计更高效的微调算法提供了理论洞见。
- IPE方法简单易行且效果显著,可直接用于现有RL微调管线,节省离线预训练的计算开销。
局限与不确定性
- 待核实:实验仅在连续控制基准上验证,对离散动作或视觉输入场景的效果未知。
- 待核实:IPE中多样策略的生成策略与数量对性能的影响尚未系统讨论。
- 待核实:论文未分析预训练数据质量与规模对结论的影响。
可用于图书/PPT/简报的角度
- 机器学习实验设计:质疑“默认应该预训练所有组件”的思维惯性,展示分模块验证的重要性。
- 迁移学习与微调:在RL中区分“策略迁移”与“价值函数迁移”的不同行为,提供实操建议。
- 集成学习应用:IPE作为利用策略多样性提升Q函数初始化的范例,可用于课程设计。
原始材料
- URL:https://arxiv.org/abs/2607.27203v1
- 英文标题:Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
- 英文关键词(待核实):foundation-model, reinforcement learning, offline pretraining, Q-function, fine-tuning
- 来源:arXiv preprint, 2026