- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月1日 04:18
- 状态
- 单一信源
发生了什么
arXiv 论文提出 AdaMTP,一种自适应训练范式,用于多 Token 预测。现有方法采用固定预测长度,忽略信息密度不均,强制跨高熵语义边界预测会引入噪声梯度。AdaMTP 用基于熵的算法动态调整预测深度,并通过掩码目标抑制跨边界损失,在 Llama-3.1-8B、Qwen-2.5-7B 和 Gemma-3-12B 上,数学推理、代码生成和通用任务中均优于标准 MTP,还加快推理。
为什么重要
此前多 Token 预测采用固定长度预测,未考虑文本信息密度不均,跨语义边界预测会产生噪声信号,损害模型能力。AdaMTP 首次将预测长度与序列内在可预测性动态对齐,在多个模型和基准上同时提升任务表现与推理加速,为高效训练提供了新方向。
底层逻辑
AdaMTP 利用基础模型检测熵的突变点作为语义边界,将序列分割为变长分组,为每个 Token 分配自适应预测深度,并采用动态掩码的 MTP 目标,抑制跨越边界的预测损失,从而减弱噪声梯度对共享主干网络的影响。
产品与商业机会
该范式可在不改变模型架构的前提下,通过调整训练策略提升多 Token 预测的效果与速度,可能降低训练成本或加速推理,对采用 MTP 的大语言模型产品有直接优化价值。
- 在现有 MTP 训练框架中集成 AdaMTP 的熵分割与动态掩码模块,评估其在内部模型上的收益。
- 针对代码生成或数学推理场景,用 AdaMTP 预训练或微调专用模型,验证推理延迟和准确率提升。
- 将 AdaMTP 与推理加速缓存结合,在 API 服务中测试减少的端到端延迟,用于优化用户体验。
仍待确认
- AdaMTP 是否已开源或提供代码实现,具体超参数如何设置?
- 在更大规模模型(如 70B)上的效果是否依然显著?
- 动态掩码策略是否增加训练开销,实际训练时间对比标准 MTP 如何?