PatientAgentBench 将医疗 AI 评测从静态问答扩展到持续对话、病历推理和工具调用。研究以 1,200 个场景测试四类共 10 个模型,并用六个维度和百余项临床标准评分。临床分诊通过率从 32% 到 88% 不等,最强模型总体仅得 4.25/5,仍会虚构未执行操作、误信工具结果或遗漏急救资源。
最近 24 小时暂无可用热度快照。