- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月22日 12:45
- 状态
- 单一信源
发生了什么
研究者针对检索增强大语言模型难以区分有用证据与误导内容的问题,提出了SelectBench基准和后训练方法DAPO(使用规则奖励或语义法官)。在Qwen3.5-4B上,严格成功率从22.46%提升至25.54%(DAPO-Rule)和26.46%(DAPO-DeepSeek),减少禁止内容采纳并生成更短响应,但改进未通过统计显著性检验,且对提示注入攻击的抵抗力未改善。
为什么重要
现有RAG模型要么全盘拒绝、要么盲目采纳所有检索结果。本工作首次尝试用强化学习后训练让模型学会选择性采纳,尽管当前提升幅度小且统计不显著,但展示了方向性改进,为提升模型在真实检索环境中的可靠性提供了新思路。
底层逻辑
DAPO算法通过强化学习(PPO变体)对预训练模型进行后训练,奖励信号来自规则(如是否采纳正确证据)或冻结的DeepSeek语义评判器。目标是在不损失通用能力(MMLU/HotpotQA)的前提下,提升对检索结果中有效证据的使用,同时抑制有害或指令类内容。
产品与商业机会
对使用RAG的产品(如智能客服、知识问答),该方法有望降低因检索结果污染导致的错误输出。但当前改进有限且不显著,短期内难以直接落地;需要更强的奖励塑造或更多训练迭代才能显著提升可用性。
- 将SelectBench作为内部评估工具,测试RAG产品对检索污染的抗性。
- 在小模型上复现DAPO后训练,验证其在不同配置下的效果。
- 结合对抗生成污染样本,设计更强奖励函数以提升注入抵抗力。
仍待确认
- 改进在统计显著水平上能否在更大规模实验中复现?
- DAPO方法是否适用于7B/13B等更大模型?
- 更强的奖励塑造(如多轮对抗训练)能否真正提升提示注入抵抗力?
- 该方法能否泛化到事实错误、偏见等更复杂的检索污染类型?