- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月22日 13:34
- 状态
- 单一信源
01
发生了什么
量化小语言模型在推理中可能出现长序列、重复或低效轨迹。MGT-B是一种外部监控引导回溯控制器,通过CUSUM形状的警报机制检测退化,并在触发后回滚至早期状态并重新解码。在240对审计集上准确率从82/240提升至88/240(+2.5百分点,p=0.2632),在467对历史集上从146/467升至167/467(+4.5百分点,p=0.000753)。
02
为什么重要
此前推理时间计算通常不关注轨迹发展,导致无效益的计算浪费。该方法首次将统计过程控制中的CUSUM框架引入语言模型推理,通过实时监控不确定性特征并回溯纠正,在保持无报警输出不变的同时提升了准确率。
03
底层逻辑
MGT-B基于token级e-CUSUM控制器,将重叠窗口的不确定性和退化特征映射为位置条件尾部概率,累积混合赌注因子。当警报触发时,估计回滚点并恢复token和KV缓存状态,然后进行约束重新解码,从而打断低效推理路径。
04
产品与商业机会
机会分析尚未生成当前仅展示原文证据与规则信号,不用规则补写影响结论。
05
仍待确认
- 阈值h=10如何确定?其对不同模型或任务是否通用?
- 该方法在更大规模模型(非量化)上的效果如何?
- 实时监控和回溯带来的额外推理延迟是否可接受?