- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月21日 18:49
- 状态
- 单一信源
01
发生了什么
研究者提出在三种访问模式下估计自回归模型间总变差距离的算法:样本访问需Õ(n²K/ε²)查询,优于此前Õ(n³m/ε⁵);logit访问达到最优O(n/ε²);噪声logit访问可插值。实证测量了SGLang与vLLM在相同权重下的距离,并开源代码。
02
为什么重要
此前估计自回归模型分布差异的查询复杂度较高或条件严格;本文不仅大幅降低了样本访问下的查询量,还首次在logit访问下达到理论最优,且能处理KL散度无穷的情况,为LLM推理引擎的一致性提供了可实用化的量化方法。
03
底层逻辑
总变差距离衡量两个概率分布的全局差异;本文针对自回归模型逐token的next-token分布,基于采样或logit值构造估计器,并利用分布稀疏性及噪声模型优化查询复杂度,实现了对不同推理引擎输出差异的低成本检测。
04
产品与商业机会
为LLM推理引擎(如SGLang、vLLM)输出一致性的量化提供了高效方法,可用于质量监控、回归测试及部署前差异验证;同时便于开发者评估各种推理优化(如量化、自定义内核)对分布的实际影响。
- 开发LLM推理引擎一致性测试工具,集成TV距离计算到CI/CD流程中
- 在模型服务框架中加入输出分布差异告警,辅助监控生产环境稳定性
- 利用TV距离指标优化推理引擎的量化或内核参数,减少与参考实现的偏差
05
仍待确认
- 该算法在大规模长序列(n>10k)下的实际计算时间和内存消耗如何?
- 是否适用于非自回归模型或带有特殊token(如工具调用)的生成流水线?
- 不同硬件后端(GPU/CPU)下估计值的稳定性是否一致?