在不更新弱模型参数的前提下,更强的 builder 模型可以在测试时为其构建推理 harness,从而显著提升任务表现;摘要报告在四个 Theory-of-Mind 基准上,弱模型平均性能从 0.49 提升到 0.91(待核实)。
传统蒸馏通常发生在训练时:通过 teacher forcing、on-policy distillation 等方法,把大模型能力迁移到小/弱模型,往往需要更新后者的参数。 本文研究的问题是:这种能力迁移是否也能发生在测试时? 具体研究“强到弱脚手架”(strong-to-weak scaffolding):强 builder 模型能否构建 inferen…