- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月28日 11:30
- 状态
- 单一信源
发生了什么
这项研究提出BeyondUncertainty方法,利用黑盒LLM口头表达的置信度作为检索路由信号。系统先让LLM生成临时答案和置信度,置信度低于阈值则触发TF-IDF检索并重新生成答案,否则直接输出。在六个QA基准、三个模型家族共27000个实例上测试,平均token级F1为0.483,高于始终检索(0.467)和不检索(0.401),同时减少20.4%检索段落,但总token使用量增加28.2%。
为什么重要
此前黑盒LLM的置信度多用于自我评估或简单过滤,本文首次将其作为动态检索路由的实用信号,实证表明可以在保证或提升回答质量的同时减少无效检索,但代价是额外的推理消耗,揭示了质量、效率与成本之间的新权衡。
底层逻辑
该方法分为两步:先让LLM输出临时答案和置信度(verbalized confidence),然后根据预选阈值决策—低置信度问题触发检索(top-5 TF-IDF)并重答,高置信度直接返回。阈值在验证集上选定后固定。这种机制利用了模型自身的不确定性估计来避免不必要的证据获取,但额外的一次生成增加了token开销。
产品与商业机会
产品中集成此类动态路由可降低检索系统调用次数(减少约20%),适合API成本敏感场景;但需额外一次推理(token增加28%),对延迟敏感的产品需要权衡。该方法依赖模型置信度的可迁移性,不同模型需单独标定阈值。
- 在知识问答产品中集成置信度判断,为低置信问题触发检索,减少不必要的外部调用成本
- 结合混合检索策略(如BM25+向量),进一步优化检索质量与计算开销的平衡
- 针对高频高置信问题缓存答案,避免重复推理,降低总体token消耗
仍待确认
- 该方法在非QA任务(如对话、摘要)中的泛化效果如何?
- 置信度阈值如何自动适应不同领域或用户分布,避免手动调优?
- AUROC仅0.628,是否可以通过多轮置信度或联合预测提升信号可靠性?
- 增加的28.2% token使用在实际系统中是否能被批处理或量化推理抵消?