新智元报道 大语言模型「逐字蹦」式的自回归生成,是推理慢、成本高的核心瓶颈。投机解码(Speculative Decoding)让一个轻量「草稿模型」先猜好一整块字、再由大模型一次并行「批改」,是近年最主流的免费提速思路之一,已被 vLLM 等主流框架广泛采用。 但它有一条「严格」的批改规则:草稿只 本文链接