论文提出用“近最优区域”而非单个最优比例来刻画 LLM 后期训练中 SFT(监督微调)与 RL(强化学习)之间的标注预算分配问题;研究发现该区域即使在 2%–10% 的较小性能容差下也相当宽,会随模型规模增大而变宽,并且可以从较小的代理模型可靠迁移到较大的目标模型。因此,用小模型做预算分配扫描,可能就不再需要对大模型进行穷举式搜索。
大型语言模型的后期训练通常同时使用 SFT 和 RL,但固定的标注预算如何在两者之间分配仍是一个开放问题。已有研究只给出了粗略趋势,例如低数据区域中 SFT 占主导,缺少原则性的分配框架,也没有验证最优比例是否能跨模型规模迁移。