- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月5日 19:23
- 状态
- 单一信源
01
发生了什么
一项研究测试了在LLM评判中是否应先将证据锁定再作决定。在24,000次评判中,相比结构化单次调用,证据锁定将人类偏好一致性降低4至6个百分点,答案顺序不一致性增加8至10点,对Claude Sonnet 4.5和GPT-5均成立。
02
为什么重要
此前LLM评判常假定先提取标准与证据有助于后续裁决,但本研究证明,将证据持久化并作为后续判定唯一输入会损害与人类偏好的一致性。这提示依赖中间证据的评判流程可能需重新设计。
03
底层逻辑
LLM在推理时,可见字段顺序并不反映内部决策顺序。当强制将证据固定并隔离,模型失去了在最终决策时重新参考原始答案的机会,可能导致信息失真或上下文缺失,从而降低评判准确性和一致性。
04
产品与商业机会
对依赖LLM评判的产品(如自动评估、内容审核),若采用证据锁定流程,可能降低评判质量。但持久化证据仍可用于审计,需在决策阶段平衡证据使用与原始信息访问。
- 在评判流程中,避免将中间证据作为唯一输入,保留原始答案供模型最终参考。
- 开发混合流程:先结构化提取证据,但在决策时同时提供原始答案与证据。
- 利用证据锁定用于审计追踪,但调整决策阶段输入,以兼顾可审计性和准确性。
05
仍待确认
- 证据锁定在非推理型模型中是否同样有害?
- 若在决策时同时提供证据与原始答案,效果是否会优于仅提供原始答案?
- 证据锁定对长文本评判的影响是否更大?