论文《Confidence-Modulated Speculative Decoding for Large Language Models》总结与翻译
一、文章主要内容
本文聚焦大型语言模型(LLMs)自回归推理效率低下的问题,提出了一种基于置信度调制的自适应推测解码框架(CM-ASD),旨在通过动态调整推测生成的token数量和验证阈值,在保证生成质量的同时提升推理速度。
1. 研究背景
自回归解码(AR)是自然语言处理中序列生成(如机器翻译、文本摘要)的主流范式,但因其生成过程的顺序性,无法有效利用GPU等并行硬件,导致推理吞吐量低、延迟高。推测解码(Speculative Decoding)通过“先推测再验证”的范式并行生成token,缓解了这一问题,但现有方法存在局限性:采用固定推测窗口大小(k)和刚性验证标准,无法适应模型不确定性变化和输入复杂度差异,可能导致推测过度(频繁回滚)或推测保守(速度提升有限)。
2. 核心框架:CM-ASD
CM-ASD以信息论为基础,通过编码器输出分布的熵和边际不确定性度量,实现推测过程的动态调整,核心包含三部分:
- 置信度估计:从token层面计算模型对预测的置信度,提供三种计算方式:
- 熵基置信度:通过预测分布的熵量化不确定性,熵值越低置信度越高,经归一化后
订阅专栏 解锁全文

381

被折叠的 条评论
为什么被折叠?



