MedStreamBench(arXiv:2607.01751)整合22个医疗视频数据集和5,419个问答实例,在回顾、当前、未来和主动预警四种时间场景下评估模型。它限制模型只能使用时间边界内的证据,并新增响应性与证据后稳定性指标,揭示通用及医疗视觉语言模型从离线识别走向流式、主动决策时的明显性能下降。
最近 24 小时暂无可用热度快照。