- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月15日 17:21
- 状态
- 单一信源
01
发生了什么
Hindcast是一种评估LLM预测能力的新方法。传统回测存在信息泄露:模型可检索事件发生后发布的报告,且新模型训练数据包含结果公布后的内容。Hindcast通过冻结特定历史日期前的Reddit数据,只允许模型读取该日期之前的帖子,从而封闭泄露。评估发现,封闭泄露后检索仅在Reddit事先讨论了事件时改善预测,否则反而有害。
02
为什么重要
此前评估LLM预测能力的方法可能因信息泄露高估其性能。Hindcast能够更真实地衡量模型基于历史信息(而非事后信息)的预测水平,为评测LLM在时间敏感任务中的表现提供了更可靠的工具。
03
底层逻辑
传统回测允许模型检索事件发生后的文档,且新模型训练数据包含未来事件,使预测退化为查找或记忆。Hindcast设定固定时间戳,仅使用该时间点之前的Reddit帖子作为知识源,再利用已结算的Polymarket市场对比模型概率与人类实时价格,从而隔离所有事后信息。
04
产品与商业机会
机会分析尚未生成当前仅展示原文证据与规则信号,不用规则补写影响结论。
05
仍待确认
- Hindcast的评估框架是否能推广到除Reddit外的其他信息源(如新闻、维基百科)?
- 不同LLM(如闭源与开源)在Hindcast下的表现差异有多大?
- 基于Reddit的事前讨论是否足够代表真实世界的信息环境?