arXiv AI1
arXiv 论文报告前沿大语言模型在嵌套条件规则评估中存在“异常链崩溃”故障,且模型准确性会无通知地漂移(如 GPT-5.4 从 96.6% 升至 100%)。作者提出 Aethis Eligibility Module,一种神经符号架构,让 LLM 从权威源编写规则,再由 SMT 层确定性执行。在 225 个场景基准、20 个对抗用例和 9 个 LegalBench 任务(949 例)中,该引擎准确率显著优于三个前沿模型(McNemar p≤0.003)。
为什么值得看此前认为前沿 LLM 在规则理解上足够可靠,该发现表明模型在复杂嵌套规则下存在系统性失败,且准确性会无版本变更地自行变化,这对监管合规领域(如保险、法律)构成不可预见的合规边界漂移风险,质疑了直接使用 LLM 进行关键规则判断的可靠性。
arXiv AI1
研究者针对多模态自动化事实核查(MAFC)的评估污染问题,构建了动态基准ClaimReview2025Q4并进行实验。发现动态评估虽减少污染但未完全消除,17.09%–29.30%的截止日期后声明仍可被LLM内部知识验证;污染可导致Macro-F1虚高11.34分并扭曲系统排名。研究提供了可信评估的实践指南。
为什么值得看此前认为收集LLM知识截止日期后的声明即可实现无污染评估,但研究表明即使声明发布时间晚于截止日期,仍有两到三成可通过公开知识直接或综合验证,这意味着动态评估的“无污染”假设不成立,行业对事实核查模型真实能力的判断可能被高估。
arXiv AI1
一项针对代码代理工作流的实证研究发现,第三方API路由器位于代理与LLM提供商之间,虽作为统一访问层,却因缺乏输出与实际执行动作的一致性验证,使客户端权限机制形同虚设。论文设计了四种注入级别(L1-L4)并开发了SIDEL框架评估,结果显示在未额外防御时所有测试代理的防御成功率为0%。
为什么值得看此前普遍认为第三方API路由器仅简化接口调用,但该研究证实其作为可信中间层可任意修改请求/响应,且现有客户端防护(白名单、LLM审查)完全无法检测此类注入,意味着依赖第三方路由器的代码代理面临严重安全漏洞。
Hugging Face Daily Papers1
研究提出Multi-Head Latent Control,一种轻量层,通过读取冻结LLM或VLM的隐状态轨迹,生成部署时的控制信号。它包括Capability Head(预测模型能力)和Resolution Head(决定澄清、工具调用、拒绝或直接回答),仅在冻结模型隐轨迹上训练,无需修改模型。在语言和视觉语言任务中,多模型系统质量-成本权衡改善,路由执行中大模型使用减少最高90.7%。
为什么值得看此前基于提示路由、外部编排或任务微调的方式依赖输入侧信号,成本高且难以维护。本方法直接从模型隐生成过程推断控制决策,实现后验适配,无需改动骨干模型,大幅降低大模型调用成本。
arXiv AI1
O^2-CritiCuRL提出离线-在线课程强化学习框架,解决多模态大模型推理中依赖虚假捷径、中间步骤不可靠的问题。离线阶段通过多rollout分析估计步骤重要性,蒸馏关键推理步骤;在线阶段采用渐进式步骤级强化学习,用截断链引导模型补全缺失步骤。在多模态推理基准上取得最优性能,同时训练和推理效率更高。
为什么值得看此前多模态大模型在推理中常产生有缺陷的中间步骤却得到正确最终答案,说明依赖捷径而非忠实推理。O^2-CritiCuRL首次通过离线-在线范式引入步骤级关键意识,克服静态监督局限,使模型聚焦于关键推理步骤,显著提升可解释性和可靠性,并实现更好的训练与推理效率。