AI消息速览

DARTree:利用自回归草稿树进行推测式扩散解码

事件日期 2026-08-13 · 学术前沿 · 已接受

事件日期2026-08-13
信息日期2026-08-13
入库日期2026-08-15
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:DARTree:利用自回归草稿树进行推测式扩散解码

一句话结论

DARTree 是一种无需训练的推测解码方法,将预训练的自回归修正头(AR correction head)从单条链扩展到树结构,在数学、代码和对话等七个基准上实现了更高的平均接受长度和推理加速。

事件概述或研究问题

推测解码通过并行验证多个草稿 token 来无损加速自回归语言模型。扩散式草稿模型能并行预测整个 token 块,但其逐位置分布是边缘分布,并未按每个草稿路径实际选中的 token 进行条件化;现有循环修正方法仅沿单条草稿链引入因果信息,而扩散式树构建扩大了候选覆盖范围,但没有在单个分支内携带这种修正。DARTree 研究的问题是:如何将预训练的自回归修正头从链式结构扩展到树结构,从而同时获得扩散式草稿树的覆盖率和沿分支的因果修正。

方法/产品要点

  • DARTree 是一种无需训练(training-free)的推测解码方法。
  • 核心思路:将预训练的自回归修正头从“链”扩展到“树”。
  • 首先构建一个固定宽度的候选树:在每个深度以单个批次扩展并评分所有节点。
  • 然后仅使用最佳优先剪枝(best-first pruning)来选择用于验证的树,从而将自回归修正头的推理与顺序堆操作解耦。
  • 摘要未给出更多实现细节,具体算法流程待核实。

主要结果或产业意义

  • 在七个数学、代码、对话基准上,DARTree 在所有四种“模型—温度”配置中均取得最高的平均接受长度和加速比。
  • 每轮验证最多接受 12.97 个 token,在同一设置下比 DFlash 多 98.6%,比 Domino 多 27.9%。
  • 相对本地测量的自回归解码,最高达到 9.73 倍无损加速
  • 基准具体名称、模型规模、温度取值等细节在摘要中未列出,待核实。

为什么重要

DARTree 将扩散式草稿树的候选覆盖与自回归修正头的因果信息结合,且不需要额外训练。相比依赖高质量语言模型作为草稿模型的推测解码方案,它提供了一条更轻量的路径,并在多类任务和不同温度配置下显示出一致的加速优势。

局限与不确定性

  • 摘要未报告模型参数量、具体基准列表、硬件环境及与全部基线方法的详细对比。
  • 未说明每轮验证接受 12.97 token 时的具体任务和配置条件。
  • 未讨论计算开销、内存占用和实际部署成本。
  • DARTree 的算法实现细节和实验复现信息需要阅读全文确认。

与既有脉络的关系

已有相关卡片“训练无关松弛推测解码的实用研究”指出,许多推测解码方法依赖高质量语言模型作为草稿模型,不适合轻量专用多令牌预测器。DARTree 是这一脉络的延续和更新:它同样属于训练无关方法,但将预训练自回归修正头从链扩展到树,在不依赖额外训练的情况下改善了扩散式草稿树缺少分支内因果修正的问题。

可用于图书/PPT/简报的角度

  • 用“草稿链 vs 草稿树”的示意图说明并行覆盖率差异。
  • 用 DARTree 的 12.97 tokens/轮和 9.73× 加速比作为推测解码效果的量化案例。
  • 解释“扩散草稿模型 + 自回归修正头”的分工:扩散负责并行生成整个块,AR 修正头负责按分支修正因果依赖。
  • 强调“无需训练”这一特性,适合讨论轻量化推理优化。

原始材料

  • 英文标题:DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees
  • 英文关键词:Speculative Decoding; Diffusion Models; Autoregressive Draft Trees; Lossless Acceleration
  • 原始来源:https://arxiv.org/abs/2608.13524v1
  • 作者:Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen
  • arXiv ID:2608.13524v1(cs.LG)
  • 发布时间:2026-08-13