871
论文使用大语言模型学习化学反应机理推理
筛选线索大模型与推理推理能力模型推理1 个独立信源
此前化学大语言模型主要依赖粗粒度的命名反应进行产物预测,常出现物理不一致和幻觉。该研究通过构建推理数据集和基准,证明机理感知训练能显著增强LLM的化学推理能力,超越了专用小模型。
arXiv AI/
65872
该研究首次系统量化了LLM在深层因果推理上的检测-归因分离,揭示模型可能仅停留在表面模式识别,无法真正理解变化根源。这挑战了将LLM直接用于根因分析等复杂推理任务的可靠性预期。
arXiv AI/
65873
论文多语言提示下的大语言模型代码生成:精选基准与代码质量研究
筛选线索大模型与推理AI 编码模型家族大语言模型1 个独立信源
此前业界普遍假设英语提示能获得最佳代码质量,本研究通过系统实验证实该假设不成立,非英语提示可能输出更优结果,且不同模型对语言偏好的响应差异显著,挑战了当前多语言代码生成产品的默认策略。
arXiv AI/
65874
此前普遍认为对监督检查点运行GRPO可增强智能体能力,但本研究通过严格对照实验表明,在小规模模型上GRPO不能提升已掌握任务的成功率,反而可能造成伤害,挑战了默认使用强化学习的做法。
arXiv AI/
65875
商业 AI 产品的系统提示通常不公开,导致信任和问责缺口。AISPA 提供了首个用户中心的审计框架,对 88 个产品的系统提示进行系统化审查,揭示了设计差异和问题指令的普遍性,为行业监管和产品改进提供了实证基础。
Hugging Face Daily Papers/
65876
此前对模型规划能力的获取机制不清晰,依赖不可控的互联网数据。该研究通过可控实验揭示了预训练数据格式、质量和后期训练方法对长程规划的具体影响,为训练更可靠的多轮agent提供了可解释的指导。
Hugging Face Daily Papers/
65877
论文RecGPT-V3技术报告
筛选线索Agent 智能体大模型与推理大语言模型基础模型1 个独立信源
从基于历史行为匹配的推荐转向基于意图推理,并通过状态化记忆和混合模态(文本+语义ID)克服了LLM推荐系统中的无状态计算、标签-物品信息瓶颈及延迟过高等关键问题,是推荐系统架构的重要演进。
Hugging Face Daily Papers/
65878
论文AVA-Encoder:面向智能体的视频表示学习框架
筛选线索Agent 智能体AI 视频推理能力智能体1 个独立信源
此前创意智能体缺乏有效的视频学习方式,难以生成电影级视频。AVA-Encoder通过知识图谱和文本梯度优化,提供了一种结构化且可直接用于智能体推理和编辑的视频表示方法,显著提升了编码性能,并减少了系统提示词使用量,有利于开发更高效的视频生成智能体。
Hugging Face Daily Papers/
65879
论文展示而非叙述:在生成像素中评估空间认知
筛选线索大模型与推理Agent 智能体大语言模型推理能力1 个独立信源
此前评估空间认知的基准均以文本或坐标作为答案接口,导致图像生成模型无法在相同语义下被评估。ProVisE让模型直接在像素空间表达空间判断,更贴近真实物理世界交互,且实验揭示了两种模型的能力差异,为后续评估和模型改进提供了新方向。
Hugging Face Daily Papers/
65880
论文从预训练到后训练:推理能力的理解研究
筛选线索大模型与推理大语言模型推理能力1 个独立信源
此前RL后训练与预训练被孤立研究,无法明确二者关系。本工作首次揭示预训练损失可预测后RL性能、预训练数据量线性提升RL效率,并阐明了RL在难题上探索新正确动作而非仅强化已有偏好的机制。
Hugging Face Daily Papers/
64881
论文代理对抗代理:自动化提示注入红队测试的代理系统
筛选线索Agent 智能体安全与对齐模型家族大语言模型1 个独立信源
现有提示注入红队方法多依赖强化学习,攻击模型对新目标泛化差。PIMiner首次展示策略库可直接迁移至未见模型,无需再训练,且查询效率高,显著提升红队测试的效率和可扩展性,为评估和防御数据收集提供新路径。
Hugging Face Daily Papers/
64882
论文解码层禁忌:针对大语言模型鲁棒性的诊断压力测试
筛选线索大模型与推理安全与对齐大语言模型评测基准1 个独立信源
传统评估只关注模型在最优条件下的表现,忽略了真实部署中复杂提示和约束导致的能力下降。Taboo 提供了一种在运行时直接干预模型生成的方法,能更真实地暴露模型在非理想路径下的弱点,推动评估方法和性能优化思路的变革。
Hugging Face Daily Papers/
64883
论文SkillRise:用于跨任务技能演化的智能体强化学习
筛选线索Agent 智能体大模型与推理大语言模型智能体1 个独立信源
此前技能学习要么重复单一任务,要么使用多阶段管线,将提取、检索和执行纠缠在一起。SkillRise 提出统一框架,能在相关但不同的任务间学习并复用技能,显著提升性能,同时降低运行时开销,这改变了技能学习的范式。
Hugging Face Daily Papers/
64884
论文多模态大语言模型能理解OCT图像吗?
筛选线索多模态大模型与推理推理能力多模态1 个独立信源
现有基准将OCT理解简化为粗粒度疾病分类或孤立问答,而OCT-Bench首次模拟临床解读全流程,从视觉感知到临床推理进行分层评估,揭示了当前模型在复杂医学影像任务中的系统性不足。
Hugging Face Daily Papers/
64885
此前研究多关注MLLMs的感知能力,本文揭示失败可能源于感知后利用环节而非视觉编码,并证明通过微调和激活干预可控制视觉与先验的权衡,为提升视觉任务可靠性提供新方向。
Hugging Face Daily Papers/
64