投机采样(Speculative Decoding):草案模型、并行验证与加速原理
投机采样(Speculative Decoding)是当前 LLM 推理延迟优化的核心技术——用一个小草案模型快速生成候选 token,再用大模型一次并行验证多个候选,单步接受多个 token,显著降低自回归解码的串行延迟。
tag
投机采样(Speculative Decoding)是当前 LLM 推理延迟优化的核心技术——用一个小草案模型快速生成候选 token,再用大模型一次并行验证多个候选,单步接受多个 token,显著降低自回归解码的串行延迟。