EarlyDx:以入院时刻为锚点、面向开放式证据支持急诊诊断生成的基准
原标题:EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses
AI 导读
EarlyDx基于MIMIC-IV的154,834次急诊就诊,仅使用入院时刻可获得的记录,并以急诊阶段诊断而非出院诊断作为监督。LLM审计标签支持度后发现,现有通用、医疗专用及领域后训练系统都难以稳定整合证据;后训练虽将需推断诊断的召回率提高至56%,但时间关键疾病仍未达到临床敏感性与精确性的平衡。
为什么值得读
该基准把急诊早期诊断从代码匹配改成受时间约束的开放式推理,直接暴露模型在证据整合与高风险疾病判断上的缺口。
深度解读
1. 发生了什么
原始事实: 论文提出EarlyDx,这是一个面向开放式急诊就诊诊断生成的基准,数据来自MIMIC-IV的154,834次急诊就诊。每次就诊只允许使用入院时刻t0可获得的记录,监督信号来自急诊阶段记录的诊断,而不是包含完整住院过程信息的出院诊断。
分析: 这使任务更接近临床首次评估,而非利用事后信息进行诊断回溯。
2. 核心技术
原始事实: 系统需要生成自由文本诊断,并由LLM审计器判断每个标签相对于入院证据是“支持”“部分支持”还是“不支持”。主要评价只计入完全获得支持的标签。
分析: 该设计同时测量诊断内容、证据可追溯性和时间截断下的推断能力,而不是单纯匹配封闭代码集。
3. 关键证据与数字
原始事实: 数据规模为154,834次急诊就诊。零样本系统对必须从记录中推断、而非直接读取的诊断,仅召回约3%至31%;后训练将这类推断依赖诊断的召回率提升至56%。论文摘要称,前沿通用模型、医疗专用模型和领域后训练模型均未能可靠综合入院时证据;对时间关键疾病,没有系统达到临床医生的敏感性与精确性平衡。
未验证推断: 摘要未给出各模型名称、置信区间、审计器与专家的一致性、数据划分细节及不同疾病类别的完整结果,因此不能仅据摘要比较具体模型优劣。
4. 为什么重要
分析: 许多医学诊断基准使用出院诊断,容易把整个住院过程中的检查、治疗反应和专家判断泄漏到监督目标中。EarlyDx将输入和目标都锚定在急诊阶段,更明确地测试模型能否在证据不完整时形成可支持的早期判断。
5. 实际影响
分析: 对医疗AI开发者,该基准可用于评估自由文本诊断、证据引用和早期风险识别,而不只是代码分类准确率。对部署方,结果提示后训练能够改善推断型诊断召回,但不能据此认为系统已经适合独立承担急诊分诊或诊断责任。
6. 局限与不确定性
原始事实: 研究使用MIMIC-IV,并依赖语义LLM-as-a-judge协议;摘要未说明其是否经过广泛临床专家复核。MIMIC-IV是特定机构和数据生成流程下的回顾性数据,不能自动代表其他医院、地区或实时工作流。
分析: “完全支持”这一严格标准有助于控制幻觉,但也可能低估临床中合理但记录不完整的判断。反之,LLM审计器的语义判断也可能带来评估偏差。时间关键疾病结果的具体分组和错误类型,需查看全文与发布的构建、评测代码。
7. 原始来源
- arXiv:2607.28788
- 数据集:MIMIC-IV,论文摘要所述来源
- 论文发布信息:2026-07-30
来源边界: 本条内容依据用户提供的arXiv标题、摘要和链接整理;未对论文全文、代码仓库或补充材料进行独立核验。