Confidence-Modulated Speculative Decoding for Large Language Models

论文《Confidence-Modulated Speculative Decoding for Large Language Models》总结与翻译

一、文章主要内容

本文聚焦大型语言模型(LLMs)自回归推理效率低下的问题,提出了一种基于置信度调制的自适应推测解码框架(CM-ASD),旨在通过动态调整推测生成的token数量和验证阈值,在保证生成质量的同时提升推理速度。

1. 研究背景

自回归解码(AR)是自然语言处理中序列生成(如机器翻译、文本摘要)的主流范式,但因其生成过程的顺序性,无法有效利用GPU等并行硬件,导致推理吞吐量低、延迟高。推测解码(Speculative Decoding)通过“先推测再验证”的范式并行生成token,缓解了这一问题,但现有方法存在局限性:采用固定推测窗口大小(k)和刚性验证标准,无法适应模型不确定性变化和输入复杂度差异,可能导致推测过度(频繁回滚)或推测保守(速度提升有限)。

2. 核心框架:CM-ASD

CM-ASD以信息论为基础,通过编码器输出分布的熵和边际不确定性度量,实现推测过程的动态调整,核心包含三部分:

  • 置信度估计:从token层面计算模型对预测的置信度,提供三种计算方式:
    • 熵基置信度:通过预测分布的熵量化不确定性,熵值越低置信度越高,经归一化后
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值