AI消息速览

PyroDash:成本高效的令牌级小-大语言模型协同推理

事件日期 2026-07-22 · 学术前沿 · 已接受

事件日期2026-07-22
信息日期2026-07-22
入库日期2026-07-24
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:PyroDash:成本高效的令牌级小-大语言模型协同推理

  • 英文标题:PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
  • 英文关键词:SLM-LLM collaboration; token-level handoff; cost-aware inference; control token; GRPO

一句话结论

PyroDash 通过让小语言模型(SLM)在生成过程中按 token 发出控制令牌,自主决定是否向大语言模型(LLM)卸载部分推理,可在数学推理基准上以更低总成本实现接近甚至超过纯 LLM 推理的准确率。

研究问题

大语言模型(LLM)推理成本高昂,难以大规模服务;小语言模型(SLM)成本低廉但处理复杂问题时可靠性不足。如何在保证推理质量的前提下,通过 SLM 与 LLM 的协同来降低总成本?

方法/产品要点

  • 框架架构:SLM 在生成过程中输出控制令牌(control token),指示是否需要帮助;Collaborate Engine 将当前查询及部分推理轨迹通过一次交接发送给冻结的 LLM 进行补全。
  • 策略内化:控制策略完全内置于 SLM 中,无需独立路由器、LLM 微调或访问 LLM logits。
  • 三阶段训练
    1. 控制令牌嵌入学习(control-token embedding learning)
    2. 卸载导向的监督微调(offloading-oriented supervised fine-tuning)
    3. 基于 Group Relative Policy Optimization(GRPO)的成本感知对齐
  • 奖励函数:平衡答案准确率与推理成本(成本以 LLM 单独推理成本归一化)。
  • 无需额外组件:仅需 SLM 的训练和部署,LLM 保持冻结。

主要结果

在五个数学推理基准(如 GSM8K、MATH 等)上,PyroDash 支持通过超参数 λ 调节准确率-成本权衡:

  • λ = 0.05:平均准确率 64.04%,比仅使用 LLM 的基线高 6.36 个百分点,同时成本降低 20.4%。
  • λ = 0.6:平均准确率 54.55%,LLM 令牌占比仅 1.90%,每样本平均仅调用 LLM 0.012 次,总成本从 49.36 美元降至 1.78 美元(节省约 96.4%)。

为什么重要

  • 提供了 token 级 的精细卸载粒度,与已有查询级模型选择方法(如预算感知重采样/重路由)不同,能在更细粒度上优化成本与质量。
  • 无需修改 LLM 或依赖外部路由器,部署简单,易于与现有 SLM 模型结合。
  • 通过控制 λ 可灵活适配不同成本预算和准确性要求的场景。

局限与不确定性

  • 实验仅针对数学推理任务,在常识推理、对话等其他任务上的有效性待核实。
  • 训练需要 GRPO 对齐阶段,对 SLM 的初始能力有要求(待核实具体 SLM 和 LLM 的型号与规模)。
  • 单次交接(single handoff)可能无法处理需要多次协作的复杂推理链,该限制在论文中未明确讨论(待核实)。
  • 奖励函数中的成本归一化依赖于 LLM 单独推理的成本估计,实际部署中成本模型可能变化(待核实)。

可用于图书/PPT/简报的角度

  • 成本-质量帕累托前沿:展示如何通过智能卸载实现工程上的成本与性能平衡。
  • 小模型+大模型协作范式:与模型蒸馏、级联推理等方法对比,突出 token 级动态决策的优势。
  • 实际部署案例:以数学辅导或客服场景为例,说明如何用低成本 SLM 处理大部分简单问题,仅将复杂问题交给 LLM。

与既有脉络的关系

  • 本条卡片是对已有卡片“重采样还是重路由?大语言模型的预算感知测试时模型选择”的补充与区别:该卡片关注查询级预算分配,而 PyroDash 在 token 级别决定是否求助,粒度更细且无需额外路由器。
  • 与“BiSCo-LLM”和“弹性组”无直接功能重叠,三者分别涉及模型压缩、推理调度和协作文本生成。

原始材料

  • 论文标题:PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
  • 作者:Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding
  • 发布/更新:2026-07-22
  • arXiv ID:2607.20327v1
  • URL:https://arxiv.org/abs/2607.20327v1