Hugging Face Daily Papers1
论文提出“Combodied Agents”这一以人为中心的智能体范式,将数字智能体与具身智能体结合,把感知、建模、预测和辅助个人状态轨迹作为核心,整合多种能力形成闭环,并使用有界且可纠正的表示而非完整数字孪生。
为什么值得看现有智能体要么只改变软件状态,要么只改变物理状态,均未将个人状态与主体性作为核心。Combodied Agents首次提出统一框架,将个人状态作为建模、干预和评估对象,可能推动AI从任务执行向人本辅助转变。
Hugging Face Daily Papers1
InSight-doc 是一个面向长文档理解的智能体视觉感知框架,将视觉分辨率视为自适应推理资源,从低分辨率开始选择性放大到高分辨率区域,无需外部检索器。研究构建了含 17.9K SFT 示例和 19.2K 强化学习示例的语料,通过 SFT+RL 训练后,InSight-doc-8B 在文档 VQA 基准上提升 4.3-16.4 个准确率点,长文档幻觉减少超 40%,推理延迟降低 41%-68%,同时保持准确率优势。代码、数据集和模型已开源。
为什么值得看此前长文档视觉理解通常固定使用高分辨率,推理成本高且易受上下文损坏影响。InSight-doc 将分辨率作为动态推理资源,按需放大,无需外部检索器,既提升准确率又显著降低延迟和幻觉,为长文档多页推理提出了一种更高效、可靠的新范式。
Hugging Face Daily Papers1
Hugging Face 每日论文发布 JigShape 基准,用拼图游戏的插片互锁设计评估视觉语言模型的视觉-几何推理能力。基准包含 95K 实例,覆盖 4x4 到 16x16 四种网格密度。研究发现,零样本模型大多缺乏几何推理能力,仅 GPT-5.5 在 4x4 上超过随机基线。微调模型在小网格上表现良好,但网格增大时性能急剧下降,出现“缩放悬崖”现象。
为什么值得看现有基准多使用矩形切割,在纹理重复区域存在歧义,而 JigShape 通过插片设计提供强几何约束,使得评估更准确。研究发现主流模型在几何推理上普遍薄弱,且规模增大时性能崩溃,这一发现挑战了当前 VLM 的能力边界,为未来模型设计指明改进方向。
Hugging Face Daily Papers0
Hugging Face Daily Papers 发布论文《Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness》,提出一种名为 Taboo 的零提示诊断压力测试,在运行时的 logit 空间动态屏蔽候选词,迫使模型偏离常规生成路径。评估多个开源模型系列后发现,模型规模和训练后指令对齐程度与离路径鲁棒性正相关。该测试可用于生成合成数据、测试安全护栏和部署前可靠性审计。
为什么值得看传统评估只关注模型在最优条件下的表现,忽略了真实部署中复杂提示和约束导致的能力下降。Taboo 提供了一种在运行时直接干预模型生成的方法,能更真实地暴露模型在非理想路径下的弱点,推动评估方法和性能优化思路的变革。