Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

PatientAgentBench:评估面向患者的医疗 AI 智能体基准框架

首次出现 · 2026/7/28 17:24最近活动 · 2026/7/28 17:24

PatientAgentBench 将医疗 AI 评测从静态问答扩展到持续对话、病历推理和工具调用。研究以 1,200 个场景测试四类共 10 个模型,并用六个维度和百余项临床标准评分。临床分诊通过率从 32% 到 88% 不等,最强模型总体仅得 4.25/5,仍会虚构未执行操作、误信工具结果或遗漏急救资源。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/28 17:24非独立信源代表报道
    PatientAgentBench:评估面向患者的医疗 AI 智能体基准框架