886
论文SecRespond:评估AI智能体在真实入侵后事件响应中的表现
筛选线索Agent 智能体大模型与推理AI 主题大语言模型1 个独立信源
此前网络安全基准侧重于入侵前场景,智能体在干净理想环境下测试。SecRespond首次聚焦入侵后场景,提供真实云主机取证快照和警报,要求智能体产出取证报告和修复计划,更贴近实际安全运维,为提升智能体安全能力提供了重要测试平台。
Hugging Face Daily Papers/
64887
现有验证方法(如答案匹配、LLM 评判、标量奖励)主要关注最终结果或主观评判,无法定位推理链条中的具体失败步骤。SymDiag 将验证重构为结构化的失败诊断,提供可验证的证据(反例、不一致、缺失前提),并解决了符号翻译噪声与真实推理缺陷的区分问题,从而显著提升了对不忠实推理的检测能力和多轮修复的反馈质量。
Hugging Face Daily Papers/
64888
论文基于变分学习的参数探索用于RLVR
筛选线索大模型与推理AI 编码大语言模型推理能力1 个独立信源
现有LLM强化学习探索多基于动作空间(如温度缩放),无法重排token,仅影响分布方差,限制探索并可能导致训练发散。论文提出参数空间探索,通过从后验采样不同策略生成rollout,为探索提供新的控制维度,并在多个任务上验证有效性,为LLM强化学习提供新思路。
Hugging Face Daily Papers/
64889
该研究提出注意力机制的一种新泛化形式,并给出推理时输入不变性的崩溃定理,可能对模型可解释性和推理可控性产生影响。
Hugging Face Daily Papers/
64890
此前LLM智能体控制路径中,工具调用间的确定性小转换通常由主机处理。该研究证明了将路由决策保留在GPU上可显著减少往返延迟(最高快2.39倍),并提供了量化GPU机会的边界框架,为优化智能体服务架构提供了可验证的参考。
Hugging Face Daily Papers/
63891
此前参数化工具检索(如ToolSense)破坏工具知识且解码慢,TRACE通过思考痕迹和业务规则推理保留知识并实现单束贪婪解码,首次达到生产延迟下的高效检索,使企业LLM能实时调用大规模工具集。
Hugging Face Daily Papers/
63892
此前教育大模型评测主要关注考试问答,缺少对课程知识结构和视觉呈现的理解。该研究首次提出课程认知概念,并构建了结构化基准,揭示现有模型在前提关系、概念邻近性等核心认知任务上表现差,为开发真正理解学科知识结构的专用教育模型提供了新方向和数据基础。
Hugging Face Daily Papers/
63893
此前针对PPO-Clip探索崩溃的改进多为启发式方法,未触及根本原因。RIPO从几何原理出发,首次纠正度量不一致,实现更有效的探索与利用平衡,性能提升幅度大。
Hugging Face Daily Papers/
63894
此前任务合成受限于固定工具或技能图,扩展需要人工工程和定制基础设施,且分布存在偏差。NexForge通过需求描述直接合成任务,无需手动构建底层资源,大幅降低了扩展agent训练数据的门槛和成本。
Hugging Face Daily Papers/
62895
该竞赛和基准数据集针对科学图表理解这一多模态 AI 的难点,公开了前沿模型的性能局限,尤其是视觉问答和数据提取任务,为多模态 AI 在科研领域的应用提供了可量化的评估平台,推动了领域发展。
Hugging Face Daily Papers/
62896
论文掩码扩散语言模型作为强且可控的文本世界模型用于代理强化学习
筛选线索Agent 智能体开源模型与生态智能体模型推理1 个独立信源
自回归世界模型因从左到右的偏差无法对全局状态锚点(如工具模式、先前回合)进行条件控制。MDLM通过双向去噪克服这一限制,以更小的参数量实现更强的可控性和多样性,可动态生成训练场景,而不依赖固定手工环境。
Hugging Face Daily Papers/
62897
论文多轮在线策略蒸馏:基于前缀重放的离环境学习方法
筛选线索Agent 智能体大模型与推理大语言模型推理能力1 个独立信源
此前多轮在线策略蒸馏需要每次更新都进行学生与环境交互和教师查询,成本极高。ReOPD将昂贵的在线交互转化为离线可重用资源,在相同或更高准确率下将训练速度提升4倍以上,显著降低了智能体训练的成本和门槛。
Hugging Face Daily Papers/
62898
论文从零开始扩展原生多模态预训练的缩放规律研究
筛选线索多模态大模型与推理推理能力多模态1 个独立信源
此前原生多模态预训练的缩放属性未被系统表征,该研究首次揭示了语言与多模态目标的不同缩放行为,并量化了数据组成对计算效率的影响,为多模态模型训练的资源分配提供了可预测的指导。
Hugging Face Daily Papers/
62899
论文Zero-Mem:面向LLM代理的零token记忆操作
筛选线索大模型与推理Agent 智能体大语言模型发布动态1 个独立信源
现有LLM代理的记忆系统普遍依赖额外LLM调用来处理和检索记忆,产生重复的token与时间成本,且可能丢失原始细节。Zero-Mem首次提出无需生成即可实现结构化记忆访问,显著降低延迟与成本,可能影响代理系统的架构设计。
Hugging Face Daily Papers/
62900
论文DocOps:面向复杂文档操作的自主智能体可验证基准
筛选线索Agent 智能体开源模型与生态AI 主题智能体1 个独立信源
此前缺乏对智能体在复杂文档操作中的系统评估。DocOps首次提供可重复验证的基准,暴露出现有模型在长程一致性维护上的深层缺陷,将推动非破坏性智能体设计方向。
Hugging Face Daily Papers/
61