- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月28日 11:19
- 状态
- 单一信源
01
发生了什么
一项法医可重复性审计对保存的放射学视觉语言模型基准进行了回溯检查,发现严重不一致:提示绑定错误、DICOM渲染未按要求极性反转、报告截断、数据集分割丢失等。重新构建队列后Cochran's Q从154.73变为182.29,45个McNemar比较中27个p<0.05。作者撤回了原始性能、排名和临床主张。
02
为什么重要
该审计表明,即使经过发布的基准也可能存在系统性、未检测到的错误,导致模型排名和临床性能声明不可靠。这警示其他依赖类似基准评估模型的产品团队需要警惕结果的可重复性。
03
底层逻辑
医学影像AI基准涉及多个环节(数据集、DICOM渲染、提示、API调用、自动化标签、统计代码等),各工件间的协议一致性通常未经测试。提示绑定错误、渲染参数缺失、输出截断等硬件问题改变了输入和标注,进而改变了统计检验结果,使得原始比较无意义。
04
产品与商业机会
依赖该基准评估视觉语言模型的产品团队可能基于错误数据做出技术选型或临床部署决策,需重新审视模型实际性能,并建立内部可重复性验证流程以避免类似风险。
- 提供医学影像AI基准的独立可重复性审计服务,帮助团队检测提示绑定、DICOM渲染、标注提取等环节的一致性
- 开发自动化验证工具,在基准发布前自动检查提示、DICOM参数、数据集分割等关键工件的可重复性
05
仍待确认
- 其他未审计的放射学视觉语言模型基准是否存在类似问题?
- 该审计中发现的错误是否也存在于其他医学影像领域(如病理、CT)的基准中?
- 原始模型在修正这些错误后的真实性能如何?