Speculative Decoding

  • 生成式模型由于其 “推理, 思考” 的潜在能力, 逐步成为各个领域的标准答案. 然而, 生成式模型往往依赖较大的模型参数, 推理的复杂度水涨船高. 投机/推测解码 (Speculative Decoding) 通过小模型推理, 大模型验证的思路能够很大程度上降低推理成本, 在技术上和应用上都颇为有趣.

2026

根据置信度在固定节点预算下自适应分配草稿树的宽度与深度

2024

路径累计置信度动态扩展和重排 draft tree & target LM Head
用动态规划优化 token tree, 以无放回采样提高验证鲁棒性
特征空间自回归
用多个轻量预测头并行提出未来 token, 通过树状验证减少解码轮数

2023

从最优传输理解投机解码及其多候选扩展
将单序列投机解码推广到 tree-based 场景, 提高接受率且能同时利用多个小模型

2022

开山之作: Speculative Sampling 理论和分析