WearableQA:一个面向真实世界可穿戴数据的健康推理基准
近年来,可穿戴传感技术的进步实现了对生理与行为信号的连续监测,然而现有基准很少评估 AI 系统能否对真实用户的纵向可穿戴记录 进行推理。为此,我们提出 WearableQA,一个包含 4,084 道 10 选项多选题的基准,题目构建自 200 位真实用户的可穿戴时间序列、血液生物标志物与人口统计学信息,每位用户拥有长达 500 天 的每日测量数据。该基准保留了包含设备噪声与个体间差异的真实可穿戴数据分布。 为评估不同的推理能力,我们引入 16 种题型,沿两条互补的轴组织: - 数据推理 vs 健康推理:区分对纵向测量值的计算与生理学解释; - 单信号推理 vs 跨信号推理:区分对单一信号的推理与多信号整合。 为大规模构建可靠题目,我们采用双重锚定 框架,将文献支撑的生理学发现与经统计验证的人群级生理模式相结合,从而捕捉真实可穿戴数据中有意义的关联。 对 14 个闭源与开源 LLM 的评估表明,WearableQA 能有效区分模型能力,性能区间为 19.6%–72.9%(随机基线为 10%)。此外,该基准远未被解决:多数模型准确率低于 60%。总体而言,WearableQA 为评估 LLM 在真实世界可穿戴数据上的推理能力提供了一个真实且具诊断性的基准。
论文精读
TL;DR WearableQA 基于 200 名真实用户长达 500 天的可穿戴数据,构建 4084 道 10 选 1 健康推理题,评估 LLM 在单/跨信号与数据/健康维度的能力,目前最优仅 72.9%,远未解决。
问题
问题背景
可穿戴设备已能连续采集心率、睡眠、活动量等多模态生理与行为信号,业界开始探索用 LLM 对个人长期健康记录进行推理,但缺乏针对真实用户数据的严格评估基准。
现有方法局限
- 现有健康问答基准多依赖合成病例或静态医学知识,未引入真实设备噪声、采样缺失和个体差异,模型可凭表面文本线索而非时序推理得分。
- 时间序列推理基准通常使用理想化信号或短序列,无法检验模型处理长达 500 天、多信号共变的能力。
- 问题生成往往仅靠文献证据,缺少统计验证,难以保证问答的可靠性与区分度;同时没有分层评测数据计算 vs 健康解释、单信号 vs 跨信号等不同推理维度。
为什么这个问题难/重要
真实可穿戴数据存在采样不规则、传感器漂移和用户基线差异,模型必须同时理解时序模式与生理意义。区分“从原始数据计算统计量”与“基于生理知识做推断”对于评估 LLM 是否具备可信的医疗辅助能力至关重要。业界对 LLM 落地健康监测兴趣浓厚,但若基准失真,模型可能通过记忆或文本捷径获得虚假高分。WearableQA 采用 dual-grounding framework,将文献生理发现与统计验证的人群模式结合,构建 16 类问题,有效暴露模型在跨信号整合和长期依赖上的短板。
行业类比
正如自动驾驶需要真实道路里程而非模拟器来检验端到端决策,健康 LLM 也需要真实可穿戴记录作为推理测试场,否则难以判断其是否真正理解个体健康动态。
核心洞察
- WearableQA 首次将真实用户长期穿戴数据(含设备噪声与个体差异)纳入 LLM 推理 benchmark,评估模型对生理时间序列的理解能力。与现有 health QA 基准(如 MedQA)或时间序列推理基准(如 TimeQA)不同,它保留了实际穿戴设备产生的缺失、噪声和分布漂移,因此能检验 LLM 在现实健康监测场景下的鲁棒性,而非仅考察医学知识记忆或模式匹配。
- WearableQA 采用双基础框架(文献基础 + 人群统计验证)构建问题,确保问题既符合生理学原理又在真实数据中具有统计显著性。该框架解决了大规模生成高质量健康推理问题的难题,纯人工标注成本过高,纯统计关联可能产生虚假相关;双基础结合了领域知识与数据驱动,为医疗 AI 基准构建提供了可复用的方法论,并可推广至其他需要可靠标注的时序智能任务。
方法
输入:真实纵向多模态健康数据
WearableQA 以 200 名真实用户 的 最长 500 天 日常测量数据为基础,涵盖:
- 可穿戴时间序列:心率、睡眠、身体活动等信号,保留设备噪声与个体间变异性。
- 血液生物标志物:如血糖、血脂等临床检测指标。
- 人口统计学信息:年龄、性别等基础属性。
关键模块一:双轴问题分类体系
为系统评估推理能力,WearableQA 设计了 16 种问题类型,沿两个正交轴划分:
- 数据推理 vs 健康推理:前者要求对纵向测量做计算或统计(如趋势识别、极值查询),后者要求生理学解释(如某指标异常意味着什么健康风险)。
- 单信号 vs 跨信号推理:单信号只涉及一种测量序列;跨信号需整合多个信号(如心率与睡眠的关联)。
关键模块二:双 grounding 问题生成
为保证题目在规模上的可靠性,采用 双 grounding 框架:
- 文献 grounding:从已发表的生理学研究中提取因果关系或相关性结论,作为问题设计的依据。
- 人群 grounding:对数据集中用户进行统计验证,确保标注的“正确选项”在真实人群中确实成立。
具体生成采用 discover-then-labeling 流程:先从数据中发现具有统计显著性的模式,再将该模式转化为多选题,并构造 9 个干扰项。最终生成 4,084 个 10 选项多选题。
输出:LLM 推理能力诊断基准
WearableQA 对 14 个闭源与开源 LLM 进行评测,准确率从 19.6% 到 72.9%,随机基线为 10%。大多数模型低于 60%,表明任务远未解决。
与同类方法差异
相比现有健康问答或时间序列推理基准,WearableQA 首次基于真实用户长期纵向数据,保留原始分布与噪声,同时显式区分数据与健康两个推理维度,并通过双 grounding 保证问题可验证性。
实验
实验设计
- 数据集:
WearableQA包含 4,084 道 10 选 1 多选题,基于 200 名真实用户长达 500 天的日常可穿戴数据(时序、血液生物标志物、人口统计)。 - 任务类型: 16 种问题类型,沿两个正交维度划分:数据推理 vs 健康推理、单信号 vs 跨信号推理。
- 构建方法: 采用 dual-grounding 框架,结合文献生理发现与统计验证的群体模式,确保问题可靠。
关键发现
- 评估 14 个专有与开源 LLM,准确率范围 19.6% – 72.9%,随机基线为 10%。
- 大多数模型准确率低于 60%,说明
WearableQA远未被解决。 - 该 benchmark 能有效区分不同模型的推理能力。
与基线对比解读
- 所有模型均显著超过随机基线(10%),证明 LLM 具备对真实可穿戴数据的初步推理能力。
- 但最高准确率仅 72.9%,仍有较大提升空间;跨信号推理与健康解释可能是主要瓶颈。
- 真实数据中的噪声与个体差异进一步提高了任务难度,这为后续模型优化提供了明确方向。
行业影响
落地场景
WearableQA 直接支撑可穿戴健康监测产品的 AI 推理能力评测与选型。例如:
- 消费级设备:智能手表 / 手环厂商在开发健康摘要、异常提醒、个性化建议等功能时,可用该 benchmark 评估不同 LLM 对长期生理时序数据的理解和推理表现,避免上线后出现错误健康解读。
- 远程医疗与企业健康管理:面向企业员工健康平台或远程患者监测服务,可集成 WearableQA 作为验收指标,筛选出能安全处理跨信号(如心率 + 睡眠 + 活动)推理的模型,用于生成周期性健康报告或风险预警。
商业价值
- 降低人工审核成本:在健康数据解读场景中,先由 LLM 生成草稿,通过 WearableQA 达标(如 >60% 准确率)的模型可减少临床人员复核量。
- 提升用户体验与黏性:准确、个性化的健康洞察(例如识别活动不足与睡眠质量下降的关联)能增强用户对设备的信任,提升订阅或硬件复购。
- 规避合规风险:健康建议涉及安全,WearableQA 可作为模型上线前的安全基准,筛选出在数据推理和生理推断上均表现稳健的模型,避免误导用户导致法律纠纷。
与现有产品 / 工作流的接口
WearableQA 以多选题形式提供标准化评测集,可直接接入现有 LLM 评估 pipeline:
- 通过
Hugging Face Datasets或 github.com/facebookresearch/WearableQA 引入,与lm-evaluation-harness等框架配合,实现自动打分。 - 作为持续回归测试:在模型迭代(微调、RAG、prompt 优化)过程中,定期运行 WearableQA 的 16 种题型,监控数据 vs 健康推理和单信号 vs 跨信号推理的细分能力变化,避免“整体准确率提升但跨信号推理退化”的隐性回归。
- 对于需要处理可穿戴数据的 MLOps 平台,可直接将 WearableQA 作为健康推理能力的质量门禁,与数据漂移检测、模型监控工具联动。
局限
- **双接地框架的可靠性局限**:WearableQA 采用文献接地与统计接地相结合的方式生成问题,但统计关联并非因果关系,文献中的生理发现也可能存在人群异质性。因此,某些问题可能捕捉到虚假关联或简化了真实病理生理机制,导致模型即使答对也未必具备临床意义的推理能力。此外,统计接地依赖于现有数据的分布,如果数据中存在未观测的混杂因素,生成的问题可能带有偏差。
- **数据规模与模态覆盖不足**:基准仅包含 200 名用户、最多 500 天的数据,且血液生物标志物种类有限,未纳入基因、环境、用药等潜在重要信息。样本量偏小可能限制问题多样性和罕见健康事件的覆盖,影响对模型泛化能力的稳健评估。同时,10 选项 MCQ 格式允许通过排除法得分,不能完全反映开放域临床推理的复杂性。
- **评估协议与实际应用存在差距**:目前仅评测了通用 LLM 在文本化输入上的表现,未涉及专门针对医疗健康领域的模型,也未与人类专家基准对比。输入形式可能将原始时间序列转化为聚合统计或文本描述,丢失了端到端处理原始信号的能力评估。因此,基准的难度和区分度虽然有效,但与真实可穿戴健康助手的部署场景仍有距离。