- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月1日 15:19
- 状态
- 单一信源
01
发生了什么
arXiv AI 发布论文,提出 SCHEMA,一个基于证据、拓扑感知的科学 Agent 幻觉评估框架。它自动构建科学概念图谱,生成多种任务,通过轨迹幻觉管线和反事实归因模块进行诊断。研究发现幻觉集中在高连接度知识枢纽,且最终答案准确性与轨迹诚实性脱钩。
02
为什么重要
现有幻觉基准多孤立处理事实,忽略知识间的拓扑结构。SCHEMA 首次将拓扑感知引入评估,揭示幻觉集中在关键知识枢纽,证明终端准确性不足以衡量 Agent 可靠性,为高可靠性科学应用提供了新的评估维度。
03
底层逻辑
SCHEMA 自动构建科学概念图,基于图谱生成任务,并通过拓扑加权严重度评分审计中间推理轨迹,利用多智能体反事实归因定位失败机制。该机制能识别因关键概念错误导致的级联传播,从而区分最终答案正确但推理路径有缺陷的情况。
04
产品与商业机会
对依赖 LLM Agent 的科学产品,SCHEMA 可提供更可靠的评估信号,帮助研发团队定位推理链中的关键错误节点,改进模型训练或推理逻辑。但当前证据未提供其成本或具体工程实现细节,实际集成影响需进一步验证。
- 开发基于 SCHEMA 的评估工具,帮助科学 Agent 研发团队在发布前检测推理链中的级联幻觉。
- 利用 SCHEMA 的归因模块,识别模型训练数据中缺失或错误的关键概念,针对性补充。
- 将 SCHEMA 的拓扑加权评分融入现有评估流程,作为终端准确率的补充指标。
05
仍待确认
- SCHEMA 在不同科学领域的泛化能力如何?
- SCHEMA 的评估开销和计算成本是多少?
- SCHEMA 是否提供开源代码或 API 便于集成?
- SCHEMA 是否能与现有 LLM 训练流程结合,用于减少幻觉?