Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads

研究背景

核心思想

20260911104750

Medusa 的关键不是让多个头直接替代自回归生成, 而是将它们作为低成本的并行候选生成器. 整体仍遵循生成候选、验证候选、接受前缀的流程.

1. 多个预测头: 从同一个状态预测不同未来位置

2. 候选树: 将多头预测组合后一次验证

20260911104842

3. 接受候选: 严格验证与 typical acceptance

4. Medusa-1/2: 如何训练预测头

关键洞察

模型 Medusa-1 加速 Medusa-2 加速 Medusa-2 MT-Bench 得分及相对原模型变化
Vicuna-7B $2.18\times$ $2.83\times$ $6.18\ (+0.01)$
Vicuna-13B $2.33\times$ $2.83\times$ $6.43\ (-0.14)$
Vicuna-33B 未列出 $2.35\times$ $7.18\ (+0.05)$
Zephyr-7B 未列出 $2.66\times$ $7.25\ (-0.07)$

质量由 GPT-4 评分. 这些结果支持测试任务上质量大致保持, 不意味着每种任务均无损, 更不意味着 typical acceptance 保持精确采样分布.

继往开来

参考文献

  1. Cai T., Li Y., Geng Z., Peng H., Lee J. D., Chen D. and Dao T. Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads. ICML, 2024. [PDF]