论文提出OCT-Bench,用来自7个公开数据集的4,137张OCT图像构建10,076道选择题,按临床解读流程覆盖感知、认知和推理三大维度、20项细粒度任务,并评测20个多模态大模型。结果显示,当前模型距离可靠的OCT理解仍有明显差距,医学领域适配和模型规模扩大也未稳定带来各层级性能提升。
最近 24 小时暂无可用热度快照。