arXiv 预印本Ji Soo Lee
WearableQA:面向真实长周期可穿戴健康数据的推理基准
原标题:WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
论文78
可穿戴传感技术的最新进展使得对生理和行为信号的持续监测成为可能,然而现有的基准极少评估人工智能系统是否能够对真实用户的长期纵向可穿戴记录进行推理。我们推出了 WearableQA,这是一个包含 4,084 道十选一选择题的基准测试,这些题目基于 200 名真实用户的可穿戴时间序列、血液生物标志物和人口统计学数据构建而成,每位用户拥有长达 500 天的日常监测数据。WearableQA 保留了包含设备噪声和个体间差异的真实可穿戴数据分布。为了评估不同的推理能力,我们引入了沿着两个互补维度组织的 16 种问题类型:数据推理与健康推理(将基于纵向测量的数据计算与生理学解释区分开来);以及单信号推理与跨信号推理(将对单一信号的推理与对多种信号的整合区分开来)。为了大规模构建可靠的问题,我们采用了一种双重锚定框架,将基于文献的生理学发现与经统计验证的基于人群的生理模式相结合。这使得基准能够捕捉在真实世界可穿戴数据中观察到的有意义的关系。对 14 种专有和开源大语言模型的评估表明,WearableQA 能够有效区分模型能力,在 10% 的随机概率基线对照下,模型表现介于 19.6% 至 72.9% 之间。此外,WearableQA 远未被解决:大多数模型的准确率都在 60% 以下。总体而言,WearableQA 为评估大语言模型在真实世界可穿戴数据上的推理能力提供了一个切合实际且具有诊断价值的基准。
为什么值得读
不同于常规的文本医学问答,该基准将长程多模态传感器噪声与临床生理指标结合,真实揭示了当前大模型在个人连续健康推理上的短板。
标签
WearableQALLM BenchmarkDigital HealthTime SeriesHealthcarePhysiological ReasoningWearables