- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 16:33
- 状态
- 单一信源
发生了什么
T^2MLR是一种基于Transformer的潜在推理架构,它通过缓存前一个token的中间层表示并直接注入当前token的早期层,使中间计算在解码步骤间持久化。在自然语言预训练和多跳推理微调中,T^2MLR始终优于数据量和参数匹配的Transformer基线。仅对网络20%的中间层应用循环即可超越全层循环。该架构无需从头预训练,在现有1.7B预训练模型上通过短时微调即可显著提升数学推理能力。
为什么重要
此前Transformer因自回归解码被迫不断将丰富中间计算压缩到token空间,导致推理状态难以跨时间步保留。T^2MLR通过局部中间层循环实现了高效的潜在推理,且无需全层循环和从头训练,大幅降低了实际应用门槛。
底层逻辑
该架构在每个解码步骤缓存前一个token选定的中间层表示,并在当前token的对应早期层注入该缓存,使抽象中间计算(如推理步骤)可在时间步之间延续。仅对局部中间层(约20%网络)进行循环即可捕获关键信息,引入极小推理开销。
产品与商业机会
产品可直接利用现有预训练模型(如1.7B)通过短时微调获得更好推理能力,无需重新训练完整模型,降低计算成本和部署周期。适用于需要多跳推理的NLP产品(如数学解题、问答系统),可提升准确率且保持实时性。
- 对现有1.7B规模预训练模型进行T^2MLR微调,快速提升数学推理任务性能
- 在对话机器人中集成T^2MLR,增强长上下文推理和逻辑一致性
- 针对问答产品(如智能客服)利用T^2MLR优化多跳问题回答准确率
- 探索将T^2MLR用于代码生成场景,提升跨token的中间状态保持
仍待确认
- T^2MLR在更大规模模型(如10B+)上的效果和开销如何?
- 循环的最佳中间层位置是否因任务(如数学 vs. 常识推理)而异?
- 该架构是否可迁移到视觉Transformer或跨模态场景?
- 微调所需数据量和训练步数对实际部署敏感度如何?