arXiv AI1
LEDGERMIND是一个多模态智能体推理系统,将代理轨迹建模为受来源约束的状态机,通过结构化证据账本来约束推理和决策。它引入三层接地协议、自适应双路径调度器和事件触发验证修复引擎,针对无支撑推理、实体幻觉、过度推理和修复放大等问题。实验表明,该方法在多个基准上提升了答案准确性和轨迹级忠实度。
为什么值得看此前多模态智能体评估仅关注最终答案准确性,无法区分正确回答是源于证据、语言先验还是错误抵消。LEDGERMIND首次将来源约束引入智能体轨迹状态,确保推理过程可追溯,能识别并修复无支撑推理和实体幻觉,从而提升模型可信度与可靠性。
arXiv AI1
arXiv AI 发布论文,提出 Aging-Aware Autonomous Intelligence (AAAI) 框架,将硬件健康状态直接纳入推理、规划与任务执行。框架包含硬件自感知、自适应推理和生存中心智能三大支柱,通过闭路认知架构整合预测、生命周期管理和硬件感知计算,旨在缓解自主系统因老化导致的性能下降与任务失败,适用于太空、海洋及植入医疗设备等场景。
为什么值得看已有自主系统假定硬件恒定,老化的硬件与软件预期不匹配可能导致整机故障。AAAI 首次将硬件健康统一纳入自主决策闭环,应用预测模型主动适应能力衰减,为长期或安全关键任务中的系统韧性提供新路径。
arXiv AI1
FrontisAI 发布论文,介绍 AI4AI 模型 Frontis-MA1(35B),在开放的 OpenMLE 全栈系统上,通过执行反馈的 SFT 和 RL 训练,结合进化搜索,使 MLE-Bench Lite 的 Medal Average 从 39.39% 提升至 60.61%,在 OpenMLE-Evo-Max 下达到 71.21%,超过 GPT-5.5+Codex,接近 GPT-5.6 Sol 和 Kimi K3。模型和代码已开源。
为什么值得看该工作将递归自我改进从概念推进到可执行系统:开放全栈 OpenMLE 支持训练、验证和进化,且模型性能在标准基准上显著提升,并超越 GPT-5.5+Codex,接近更大规模模型。这为 AI 自我改进提供了可复现的工程路径,可能加速 AI 研发效率。
arXiv AI1
WIDE是一种端到端可微分的token级动态宽度剪枝框架,针对LLM推理的prefill和decode场景设计。它允许每个token动态选择注意力头组和FFN通道组,实现细粒度计算分配。在50%稀疏度下,相比最先进的动态深度剪枝方法,WIDE实现了55.1%的性能提升。
为什么值得看现有静态结构化剪枝硬件友好但精度损失大,动态剪枝又局限于粗粒度结构。WIDE首次将动态剪枝扩展到神经元块级别,并通过剪枝-内核协同设计实现实际加速,为高效LLM推理提供了新路径。
arXiv AI1
ORCA-bench 是一个新基准,将通用编程 agent 置于生产级 oncall 环境,使用 OpenTelemetry 微服务系统,提供六天指标、日志和追踪数据,并包含 1,079 个 RCA 任务。五个前沿 agent 在中等难度任务上最佳 RCA 准确率为 25.3%,在困难任务上为 10.0%,最弱模型在 40% 报告中幻觉出不合理解释。
为什么值得看此前基准多聚焦代码生成或漏洞修复,而 ORCA-bench 首次将 agent 置于真实 oncall 环境,暴露了前沿编码 agent 在根因分析上的显著差距(25.3%/10.0%),表明 AI 在运维场景中的实际可用性远低于预期,为评估和投资提供了新标尺。