阅读原文
arxivpapers88

EarlyDx:以入院时刻为锚点、面向开放式证据支持急诊诊断生成的基准

原标题:EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

AI 导读

EarlyDx基于MIMIC-IV的154,834次急诊就诊,仅使用入院时刻可获得的记录,并以急诊阶段诊断而非出院诊断作为监督。LLM审计标签支持度后发现,现有通用、医疗专用及领域后训练系统都难以稳定整合证据;后训练虽将需推断诊断的召回率提高至56%,但时间关键疾病仍未达到临床敏感性与精确性的平衡。

为什么值得读

该基准把急诊早期诊断从代码匹配改成受时间约束的开放式推理,直接暴露模型在证据整合与高风险疾病判断上的缺口。

深度解读

1. 发生了什么

原始事实: 论文提出EarlyDx,这是一个面向开放式急诊就诊诊断生成的基准,数据来自MIMIC-IV的154,834次急诊就诊。每次就诊只允许使用入院时刻t0可获得的记录,监督信号来自急诊阶段记录的诊断,而不是包含完整住院过程信息的出院诊断。

分析: 这使任务更接近临床首次评估,而非利用事后信息进行诊断回溯。

2. 核心技术

原始事实: 系统需要生成自由文本诊断,并由LLM审计器判断每个标签相对于入院证据是“支持”“部分支持”还是“不支持”。主要评价只计入完全获得支持的标签。

分析: 该设计同时测量诊断内容、证据可追溯性和时间截断下的推断能力,而不是单纯匹配封闭代码集。

3. 关键证据与数字

原始事实: 数据规模为154,834次急诊就诊。零样本系统对必须从记录中推断、而非直接读取的诊断,仅召回约3%至31%;后训练将这类推断依赖诊断的召回率提升至56%。论文摘要称,前沿通用模型、医疗专用模型和领域后训练模型均未能可靠综合入院时证据;对时间关键疾病,没有系统达到临床医生的敏感性与精确性平衡。

未验证推断: 摘要未给出各模型名称、置信区间、审计器与专家的一致性、数据划分细节及不同疾病类别的完整结果,因此不能仅据摘要比较具体模型优劣。

4. 为什么重要

分析: 许多医学诊断基准使用出院诊断,容易把整个住院过程中的检查、治疗反应和专家判断泄漏到监督目标中。EarlyDx将输入和目标都锚定在急诊阶段,更明确地测试模型能否在证据不完整时形成可支持的早期判断。

5. 实际影响

分析: 对医疗AI开发者,该基准可用于评估自由文本诊断、证据引用和早期风险识别,而不只是代码分类准确率。对部署方,结果提示后训练能够改善推断型诊断召回,但不能据此认为系统已经适合独立承担急诊分诊或诊断责任。

6. 局限与不确定性

原始事实: 研究使用MIMIC-IV,并依赖语义LLM-as-a-judge协议;摘要未说明其是否经过广泛临床专家复核。MIMIC-IV是特定机构和数据生成流程下的回顾性数据,不能自动代表其他医院、地区或实时工作流。

分析: “完全支持”这一严格标准有助于控制幻觉,但也可能低估临床中合理但记录不完整的判断。反之,LLM审计器的语义判断也可能带来评估偏差。时间关键疾病结果的具体分组和错误类型,需查看全文与发布的构建、评测代码。

7. 原始来源

  • arXiv:2607.28788
  • 数据集:MIMIC-IV,论文摘要所述来源
  • 论文发布信息:2026-07-30

来源边界: 本条内容依据用户提供的arXiv标题、摘要和链接整理;未对论文全文、代码仓库或补充材料进行独立核验。

标签

EarlyDx临床AI急诊诊断MIMIC-IV医学基准LLM评测证据支持