摘要本文解读 ICML 2023Oral论文《Fast Inference from Transformers via Speculative Decoding》。该论文提出投机解码Speculative Decoding通过融合小模型草稿采样、大模型并行验收与投机采样修正实现无需重训练、无需架构改动的大模型推理加速其特别之处在于输出分布与目标模型单独解码逐 token 完全一致。实验表明T5-XXL11B推理提速 2X–3X英德翻译最高 3.4X并给出接受率 $\alpha$ 的精确理论刻画为 LLM 推理加速领域提供了奠基性的重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息为什么自回归解码这么慢投机解码要解决什么问题研究主线从问题到结论基准设计草稿-验收-修正三步循环分类全景推理加速方法谱系方法细节投机采样与四项理论保证实验设计与结果T5-XXL 实测 2X-3X结果对比总结关键发现局限性常见问题FAQ投机解码会改变模型的输出吗投机解码需要重新训练模型吗怎么选择草稿模型和 γ 参数投机解码适合什么硬件场景投机解码和拒绝采样有什么区别现在的 LLM 推理框架还用投机解码吗参考链接论文基本信息项目内容标题英文Fast Inference from Transformers via Speculative Decoding标题中文投机解码草稿模型并行采样 大模型无损验收作者Yaniv Leviathan, Matan Kalman, Yossi Matias机构Google Research, Mountain View, CA, USA会议ICML 2023OralarXivhttps://arxiv.org/abs/2211.17192项目网站无官方项目页作者为 Google Research参见 Google Research 博客为什么自回归解码这么慢投机解码要解决什么问题自回归模型如 GPT、T5、LaMDA的每一次解码都必须串行进行生成第 $K$ 个 token 需要先完成前 $K-1$ 个因此解码 $K$ 个 token 需要 $K$ 次串行的模型前向延迟随生成长度线性增长。现有的加速路线大致分两类各有短板对所有输入一视同仁的优化知识蒸馏、稀疏化、量化、架构改进如 Primer、Multi-Query Attention——优化的是平均推理成本且往往需要改架构或重训练。自适应计算adaptive computationearly exit、自适应注意力范围、深度自适应 Transformer——按难度动态减少计算量但通常需要训练辅助模块且会改变模型输出。与投机解码最接近的并行解码先驱也有明显局限Blockwise Parallel Decoding只支持贪心解码temperature0需要额外训练自定义模型Shallow Aggressive DecodingSAD只能把输入复制到输出仅适用于语法纠错这类输入输出高度相似的场景。投机解码的出发点有两个关键观察第一很多困难的语言任务内部包含大量容易被小模型近似好的更简单子步骤第二大模型推理的瓶颈往往是内存带宽与通信而非算力——也就是说芯片上有闲置的并发算力。把处理器设计中的投机执行分支预测思想推广到随机采样场景就得到了投机解码。值得对比的是附录 B 证明如果只做单次非迭代的经典拒绝采样期望接受率至多为 $\alpha$远低于投机采样的接受率——拒绝后的修正采样同样产出有效 token是投机采样信息零浪费的关键。研究主线从问题到结论图 6研究主线流程图Mermaid——从串行解码瓶颈到无损加速范式基准设计草稿-验收-修正三步循环投机解码算法 1SpeculativeDecodingStep每一轮迭代只做三件事草稿Draft用小模型 $M_q$ 自回归采样 $\gamma$ 个猜测 token $x_1, \dots, x_\gamma$并行验收Verify大模型 $M_p$ 对这 $\gamma1$ 个前缀一次性并行前向得到全部位置的分布 $p_1, \dots, p_{\gamma1}$投机采样修正Sample逐个检查猜测遇到第一个被拒绝的 token就用修正分布$p(x) norm(\max(0, p(x) - q(x)))$ 重新采样。每轮大模型前向至少产出 1 个、至多 $\gamma1$ 个 token被拒绝的猜测只是浪费了并行算力但分布严格不变。下图展示了完整 encoder-decoder 栈的调度$\gamma7$ 时每段紫色$M_p$调用前都排着 7 个蓝色$M_q$调用串行的大模型调用被大幅压缩。图 1投机解码示意38 个 token 仅 9 次串行大模型运行输出分布不变分类全景推理加速方法谱系图 7推理加速方法分类全景Mermaid——投机解码在加速谱系中的位置方法细节投机采样与四项理论保证标准化采样框架argmax、top-k、nucleus、temperature 等采样方式都可以统一为从调整后的概率分布做标准采样——论文只需处理一种情形。接受-拒绝规则采样 $x \sim q(x)$ 后若 $q(x) \le p(x)$ 则接受若 $q(x) p(x)$以 $1 - \frac{p(x)}{q(x)}$ 的概率拒绝并从 $p(x) norm(\max(0, p(x) - q(x)))$ 重新采样。附录 A 用接受 拒绝两路分解给出精确证明接受路径贡献 $\min(q(x), p(x))$拒绝路径贡献 $(1-\beta)p(x)$两路相加 $P(xx) \min(q(x), p(x)) (1-\beta)p(x) p(x)$——即输出分布与目标模型单独解码严格相同对任意 $p, q$ 成立、零近似。论文还给出四项可部署的理论结果期望生成 token 数$E[#\text{tokens}] \frac{1 - \alpha^{\gamma1}}{1 - \alpha}$其中接受率 $\alpha E(\beta)$接受率精确刻画$\beta 1 - D_{LK}(p,q)$$\alpha 1 - E(D_{LK}(p,q))$$D_{LK}$ 是对称散度$\alpha 0 \iff p q$墙钟加速因子$\frac{1 - \alpha^{\gamma1}}{(1-\alpha)(\gamma c 1)}$其中 $c$ 是草稿模型相对成本只要 $\alpha c$ 就有收益且因子至少 $\frac{1\alpha}{1c}$运算量分析总运算量因子 $\frac{(1-\alpha)(\gamma\hat{c}\gamma1)}{1-\alpha^{\gamma1}}$但目标模型权重与 KV cache 的内存访问次数反而下降 $\frac{1-\alpha^{\gamma1}}{1-\alpha}$ 倍——这正是带宽瓶颈下算力换延迟的理论依据。草稿模型的选择实验证明现成的 off-the-shelf 小模型比目标小约两个数量级通常最优更有趣的是零成本模型——例如 n-gram 查表英德翻译任务中 bigram 草稿 $\alpha \approx 0.2$仍带来 1.25X 加速。此外还支持非自回归草稿模型甚至随机采样草稿保证对任意 $M_p$ 都有微弱收益。扩展方向附录附录 F 的 lenience 宽松采样把 $q(x)$ 乘以 $l$ 后再比较保证任何 token 的采样概率不超过 $\frac{p(x)}{l}$T5-small EnDe 下 $l0.1$ 时加速从 2.5X 提升到 5X附录 G 讨论 beam search 扩展——草稿模型以更宽束宽 $u \ge w$ 运行 $\gamma$ 步只要 $top_w(M_p) \subseteq top_u(M_q)$ 即接受结果与单独 beam search 一致。图 2trace 图——投机解码把串行的大模型调用压缩为1 次并行验收 γ 次草稿实验设计与结果T5-XXL 实测 2X-3X实验设置目标模型 $M_p$ T5-XXL11B任务为英德翻译WMT EnDe与新闻摘要CNN/DailyMail草稿模型使用现成 T5-large800M、T5-base250M、T5-small77Mcheckpoint零训练与 T5X 官方实现对比墙钟时间batch size 1单块 TPU-v4同时覆盖 argmaxtemp0与标准采样temp1两种模式接受率 $\alpha$ 在 10K tokens 上估计。任务草稿 $M_q$Temp$\gamma$$\alpha$加速EnDe 翻译T5-small (77M)070.753.4XEnDe 翻译T5-small (77M)170.622.6XEnDe 翻译T5-base (250M)070.802.8XCNNDM 摘要T5-small (77M)050.653.1XCNNDM 摘要T5-small (77M)150.532.3XCNNDM 摘要T5-base (250M)050.733.0X核心结论T5-small 以最优的 $c$–$\alpha$ 平衡夺冠——翻译任务 argmax 下 3.4X、标准采样下 2.6X摘要任务 3.1X / 2.3X且输出与基线逐 token 一致。$\alpha$ 随草稿规模上升T5-large 达 0.82但 $c$ 同步变大综合反而不如小草稿argmax 分布更尖接受率与加速全面高于标准采样。跨规模结论一致GPT-like 97M 配 6M 草稿 $\alpha \approx 0.88$LaMDA 137B 配 8B 草稿 $\alpha \approx 0.75$。图 3期望 token 数与 $\alpha$ 的关系选择 $\gamma$ 的理论依据图 4算力-延迟权衡——$\alpha$ 低时以算力换延迟代价高$\alpha$ 高时并发几乎免费理论 vs 实测附录 D论文用 profiler 估计 $c$ 后对比预测与实测——EnDe/T5-small/t0 预测 3.2X vs 实测 3.4XCNNDM/T5-small/t0 预测 2.4X vs 实测 3.1X整体吻合良好偏差源于实现优化差异与 $\beta$ 独立同分布的简化假设。$\gamma$ 选择权衡附录 E假设草稿零成本时$\alpha0.9$ 且 $\gamma10$ 加速可达 6.86X运算量仅 1.6X$\alpha0.6$ 时 $\gamma2$ 即最优——高接受率下大 $\gamma$ 近乎免费。图 5最优 $\gamma$ 查图选参——$c$ 越大最优 $\gamma$ 越小结果对比总结图 8结果对比总结Mermaid——3.4X 加速与逐 token 输出一致性关键发现无损加速T5-XXL 在翻译任务实测 3.4Xargmax、2.6X标准采样加速摘要任务 3.1X / 2.3X输出与基线逐 token 一致。理论可部署接受率 $\alpha 1 - E(D_{LK})$ 可直接度量只要 $\alpha c$ 即有收益加速至少 $\frac{1\alpha}{1c}$。草稿可以非常小bigram 查表模型 $\alpha \approx 0.2$ 仍带来 1.25X6M 草稿配 97M 目标 $\alpha \approx 0.88$。并发近乎免费$\alpha0.9$、$\gamma10$ 时加速 6.86X运算量仅增加 1.6X$c0$ 假设下。零成本接入无需重训练、无需架构改动与量化、蒸馏等静态优化正交可叠加。独立复现验证Chen et al. 2023 独立实现Chinchilla 70B得到 2X–2.5X 类似加速。局限性以运算换延迟总运算量因子 $\frac{(1-\alpha)(\gamma\hat{c}\gamma1)}{1-\alpha^{\gamma1}}$没有空闲并发算力时方法不适用。依赖带宽瓶颈前提收益来自内存带宽受限、算力富余的部署条件。静态配置$\gamma$ 与草稿模型全程固定oracle 动态 $\gamma$ 理论可再提升约 60%上界 $\frac{1}{1-\alpha}$。范围受限仅在文本模态验证与 beam search 的完整兼容分析留待未来工作。常见问题FAQ投机解码会改变模型的输出吗不会。论文附录 A 给出严格证明接受路径贡献 $\min(q,p)$拒绝路径贡献 $(1-\beta)p(x)$两路相加精确等于 $p(x)$——输出分布与目标模型单独解码逐 token 相同这是数学保证而非实验观察。投机解码需要重新训练模型吗不需要。草稿模型直接用现成的 off-the-shelf 小模型如 T5-small、LaMDA 8B甚至 n-gram 查表这类零成本模型目标模型完全不动这是它与 Blockwise Parallel Decoding 等方法的本质区别。怎么选择草稿模型和 γ 参数接受率 $\alpha$ 在 1 万 token 上实测即可获得然后按墙钟加速公式 $\frac{1-\alpha^{\gamma1}}{(1-\alpha)(\gamma c 1)}$ 数值最大化选择 $\gamma$。经验法则草稿比目标小约两个数量级、$\alpha$ 落在 0.5–0.9 区间时效果最好最优 $\gamma$ 可查图 5。投机解码适合什么硬件场景适合内存带宽受限、算力有富余的推理场景——此时并行的 $\gamma1$ 次前向几乎免费。如果算力已满载如极低 batch 的 CPU 推理投机解码的运算量增幅可能超过收益。投机解码和拒绝采样有什么区别经典拒绝采样需要已知最大值 $M$ 且可能多次迭代投机采样的修正分布 $p(x)$ 让拒绝也产出有效 token期望接受率严格更高非迭代拒绝采样至多 $\alpha$。更关键的是投机采样把 $\gamma$ 个猜测一次并行验收直接压缩串行步数。现在的 LLM 推理框架还用投机解码吗是。投机解码已成为事实标准vLLM、NVIDIA TensorRT-LLM、HuggingFace TGI 等主流推理栈均内置该技术后续 Medusa、EAGLE 等多头草稿方法进一步摆脱了单独草稿模型的依赖。参考链接论文 arXivhttps://arxiv.org/abs/2211.17192 Fast Inference from Transformers via Speculative Decoding独立同时发现https://arxiv.org/abs/2302.01318 Accelerating Large Language Model Decoding with Speculative Sampling草稿模型演化 Medusahttps://arxiv.org/abs/2401.10774草稿模型演化 EAGLEhttps://arxiv.org/abs/2401.15077Google Researchhttps://research.google/blog/给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件