- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月23日 15:37
- 状态
- 单一信源
发生了什么
研究发现DeepSeek-R1-Distill-Qwen-7B等链式思维模型的生成呈现双峰收敛模式:在Token预算内完成推理(收敛)或耗尽预算未得出结论(非收敛)。收敛样本在AIME 1983-2024上准确率90.3%,非收敛仅6.6%,总体收敛率62.0%。通过隐藏状态线性探针可在Token位置50-300早期检测收敛结果,第20层第150步的AUC为0.608,但统计显著性较低(p=0.063,未达到常规阈值)。
为什么重要
此前CoT模型无法在推理过程中判断是否将收敛,只能等输出结束。该研究显示模型内部表示在早期就已部分编码收敛命运,为动态节省计算资源提供了可能性,但统计证据尚不充分。
底层逻辑
模型在不同隐藏层激活中隐式编码了推理路径是否趋向收敛,线性探针可从中间表示中提取该信号;非收敛的推理通常会导致Token预算耗尽,且与准确率极低相关。
产品与商业机会
若方法被验证可靠,可在推理早期识别非收敛分支并提前终止,减少Token消耗和计算成本,提升响应速度和资源利用效率;但当前统计显著性不足,尚无法直接工程化。
- 在CoT推理引擎中集成隐蔽状态探针,对非收敛推理实施早期退出以节约Token预算。
- 基于探针置信度动态调整推理上限Token数,优先为高收敛概率推理分配更多计算资源。
仍待确认
- 该方法在更大参数规模模型(如DeepSeek-R1-67B)上是否仍有效?
- 能否找到更具统计显著性的检测信号(如更优层数、位置或探针设计)?
- 检测阈值如何设定才能同时避免误停收敛推理与漏停非收敛推理?