- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月15日 00:14
- 状态
- 单一信源
发生了什么
一篇关于表格识别的研究论文利用FinTabNet和OmniDocBench数据集,系统验证了LLM作为评判员在闭环再生中的效用。结果发现评判信号弱:分数经常平局、排名不可重现,唯一优于随机的选择策略依赖最早迭代平局规则,其优势不能归因于评判分数本身。迭代虽能生成更好候选,但评判员无法将其选出。未加入特定评判反馈时出现严重损失;加入结构保留指令可降低严重损失率,但并未提升最终性能。这表明评估能力不等同于优化效用,闭环改进至少需要能确定性检测结构变化的验证信号。
为什么重要
此前业界广泛使用LLM作为评判员提供反馈与选择信号,但此研究首次在受控实验(表格识别)中证明,即使LLM评估能力强,在闭环迭代中也可能无法有效选择更优结果,甚至引发严重损失,挑战了“评估即优化”的隐性假设。
底层逻辑
闭环再生依赖评判分数作为选择信号的机制存在缺陷:分数频繁平局且排名不可复现,导致评判员无法可靠区分好坏候选;严重损失源于目标保持失败,结构变化的检测缺失,仅靠评判分数无法制止错误迭代。结构保留指令能减少严重损失的发生,但不能提升整体输出质量。
产品与商业机会
对于使用LLM作为自动评判的文档解析、表格识别等产品,此研究表明依赖单一评判分数做迭代选代可能引入不可预测的严重错误,且难以恢复。产品需增加确定性验证信号(如结构完整性检测)或改变迭代策略(如结合最早迭代平局规则)以降低风险。
- 在表格识别闭环中采用最早迭代平局优先策略替代纯LLM评分选择,可提升随机基线之上的效果
- 开发混合验证系统:结合确定性结构指标(如TEDS)与LLM评判,避免结构保持失败导致的严重损失
仍待确认
- 结构保留约束在降低严重损失的同时,是否会在其他任务中引入新的偏差?
- LLM评判在何种特定任务(如非结构化文本生成)中能真正体现优化效用?
- 除最早迭代平局规则外,是否有更通用的选择策略能稳定优于随机?