可穿戴设备记录下的持续生理体征,开始被置于大模型的推理解析视线中。新提出的 WearableQA 汇集了 200 名用户最长达 500 天的设备数据与血液指标,构建出包含噪声与个体差异的 4,084 道多选题。在对 14 款主流模型的评测中,多数模型准确率未及六成,日常体征与病理推断之间仍隔着明显的缝隙。
最近 24 小时暂无可用热度快照。