- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月5日 06:49
- 状态
- 单一信源
发生了什么
RESPClinBench是一个面向呼吸专科临床决策的多模态基准,包含427例AECOPD病例和196例肺结节病例,共623例。研究评估了7个大语言模型,生成4361个响应。模型平均得分68.58,Qwen3.6-27B总分第一(71.22),Qwen3.5-397B-A17B在PNBIM上领先(72.48)。PNBIM中31.85%的响应存在影像幻觉,8.16%存在严重医疗风险;AECOPD-PIM中26.93%存在药物安全风险,1.44%存在严重医疗风险。
为什么重要
此前医疗基准多以考试为导向,未能充分反映呼吸专科对多模态解读、纵向风险评估及全程管理的要求。RESPClinBench基于真实临床数据构建,聚焦临床决策任务,并系统评估了模型在影像、药物安全等方面的风险,为医疗AI在专科场景的可靠性提供新标尺。
底层逻辑
基准由呼吸专科医生修订病例、参考答案和原子临床动作点,并通过自动化框架计算原子动作召回率与LLM裁判评分的算术平均。任务设计结合了胸部CT与结构化信息,模拟真实诊疗流程,从而暴露模型在特定任务上的能力短板和安全隐患。
产品与商业机会
医疗AI产品(如临床辅助决策系统)在呼吸专科落地时,需重点优化影像解读的准确性和药物安全审查能力,避免幻觉和严重风险。评估流程可作为研发测试的参考,但基准本身仅用于衡量现有模型能力,不直接改变产品功能。
- 开发针对影像幻觉的检测防护机制,在肺结节辅助诊断产品中降低31.85%的幻觉率。
- 在药物管理模块中集成安全审查规则,针对AECOPD案例减少药物安全风险。
- 基于RESPClinBench构建内部测试套件,持续对比模型版本在呼吸专科的表现。
仍待确认
- RESPClinBench是否公开提供数据集和评估脚本?
- 七款模型的具体名称和版本是否完整披露?
- LLM-as-a-Judge评估的可靠性与人类专家的一致性如何?
- 基准是否有其他外部团队复现验证?