SpecInfer: Accelerating Large Language Model Serving with Tree-based Speculative Inference and Verification

研究背景

核心思想

20260904110026

20260904111335

20260904112822

注: 这里应该有一个 trade-off, 本质上 SpecInfer 的做法是把整棵树拉平为序列, 好处是能够避免一些重复的计算, 但坏处是序列变长后会导致 attention 的计算成本上升, 因此反而可能造成总体的成本增加.

20260904113412

20260904113522

继往开来

参考文献

  1. Miao X., Oliaro G., Zhang Z., Cheng X., Wang Z., Zhang Z., Wong R. Y. Y., Zhu A., Yang L., Shi X., Shi C., Chen Z., Arfeen D., Abhyankar R. and Jia Z. SpecInfer: Accelerating Large Language Model Serving with Tree-based Speculative Inference and Verification. ASPLOS, 2024. [PDF] [Code]