- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月28日 09:24
- 状态
- 单一信源
发生了什么
论文提出PatientAgentBench基准,用于评估面向患者的健康AI代理系统。该基准让基础模型封装为代理,使用沙盒工具与模拟患者对话,通过LLM-as-a-Jury在六个维度评分,并经过临床医生验证一致性(79%-93%)。在10个模型、1200个场景测试中发现临床差距:最弱模型分诊通过率仅32%,最强88%;代理常未经临床筛查处理行政请求;最弱模型编造未执行动作,前沿模型仍有1%-3%失败。最强模型总体得分4.25/5。
为什么重要
此前基准仅评估医学知识问答或面向临床医生的任务,而PatientAgentBench首次系统评估面向患者的代理系统在真实临床场景中的分诊、安全和工作流准确性,揭示了当前代理普遍存在的临床差距,为开发更安全的患者交互AI提供了可量化的评价维度。
底层逻辑
基准通过模拟患者与代理的多轮对话,使用超过100条临床标准由LLM-as-a-Jury在六个维度(如分诊质量、临床安全、工作流准确性)评分,并由临床医生标注验证一致性。这种机制将患者交互中的隐性临床风险转化为可复现的评分指标,从而暴露模型在主动决策和工具使用上的短板。
产品与商业机会
产品团队可引入该基准作为健康AI代理的必测环节,识别自家模型在分诊、安全和工作流准确性上的短板。研发需重点改进临床筛查逻辑、工具输出验证和紧急资源处理,避免代理绕过医生直接处理行政请求。部署前需通过该基准至少达到中等水平,否则存在临床风险。
- 开发基于PatientAgentBench的自动化测试套件,定期评估自有健康代理并对比竞品
- 构建分诊质量增强模块,增加轻量级临床筛查规则以防止代理误处理行政请求
- 利用基准中失败案例生成专项训练数据,提升弱模型在安全和工作流场景的表现
仍待确认
- 该基准的评分与真实临床患者安全事件的相关性尚未验证?
- LLM-as-a-Jury的评分是否完全等价于临床专家判断仍存差异(一致率79%-93%)?
- 不同模型在哪些具体临床场景(如多病种、药物交互)的失败模式未得到分类分析?