面向可穿戴健康數據的通用智能基礎模型與個人健康代理

Published 2026-05-21 · AI Daily — AI-assisted deep research, methodology & disclosure

本文針對可穿戴設備數據轉化難、高質量標註稀缺及個體差異大等痛點,提出了一種基於萬億分鐘無標籤傳感器數據預訓練的可穿戴健康基礎模型。該模型在500萬參與者的大規模隊列上訓練,通過聯合擴展模型容量與數據量,在35項涵蓋心血管、代謝、睡眠及心理健康等任務中實現了系統性性能提升。研究進一步發現,該大規模表征支持標籤高效的小樣本學習與生成式指標估算,並部署LLM智能體自動搜索下游預測頭結構,顯著增強預測能力。最終構建的個人健康代理經1860名臨床醫生評估,展現出更高的相關性、上下文感知力與安全性,為可穿戴健康數據的深度挖掘與個性化應用提供了全新範式。

可穿戴设备虽已能捕捉海量的行为与生理信号,但将这些低层数据转化为具有临床或个人价值的健康洞察仍面临巨大挑战。核心难点在于个体间极高的表型多样性、基线健康状态的差异以及生活方式的复杂影响,使得从原始信号中提取能够表征高层健康状态的特征变得异常困难。此外,获取带有高质量健康结果标注的数据集成本高昂且耗时,回溯性标注在现实中几乎不可行,导致高质量标注数据的严重匮乏。针对这一领域长期存在的瓶颈,本研究提出了一种面向可穿戴健康数据的通用基础模型。该模型的核心贡献在于突破了传统方法对标注数据的依赖,通过利用大规模无标签数据进行预训练,构建了一个能够理解复杂生理信号变化的通用表征空间,从而为解决个性化健康监测中的泛化性与数据稀缺问题提供了全新的技术路径。在技术方法上,该研究构建了一个规模庞大的预训练框架,其训练数据来源于500万参与者队列中超过一万亿分钟的无标签传感器信号。这种极大规模的数据输入旨在让模型自主学习人类生理与行为模式的底层规律,而非仅仅拟合特定的标签。

研究重点探讨了模型容量与预训练数据量联合扩展对性能的影响,证实了这种缩放策略能带来系统性的性能提升。为了进一步挖掘预训练表征的潜力,团队并未止步于传统的监督微调,而是引入了一种创新的自动化搜索机制。他们部署了一个由大型语言模型(LLM)智能体组成的"教室",让这些智能体在预训练模型生成的嵌入空间上,自主搜索和构建最优的下游预测头结构。这种将LLM的推理能力与基础模型的表征能力相结合的策略,不仅提高了预测头的构建效率,还通过LLM容量的增加带来了持续的性能增益,展现了智能体在模型架构搜索中的巨大潜力。实验评估覆盖了35项多样化的健康预测任务,范围广泛涵盖心血管健康、代谢指标、睡眠质量、心理健康状态,甚至包括生活方式选择与人口统计学因素。关键结果显示,随着模型和数据规模的扩大,各项任务的预测精度均呈现出稳步提升的趋势,验证了基础模型在跨领域健康指标预测上的通用性。消融实验与深入分析发现,该大规模预训练表征解锁了标签高效的小样本学习能力,意味着在仅有少量标注数据的情况下,模型仍能保持较高的预测性能,这对于解决标注数据稀缺问题至关重要。

此外,模型还展现出强大的生成式能力,能够用于稳健的日常健康指标估算。在下游预测头的自动搜索实验中,LLM智能体构建的预测结构在多项任务上均优于人工设计的基线,且随着LLM自身容量的增加,这种性能提升更加显著,证明了智能体在优化下游任务中的有效性。该研究的行业意义在于它不仅提供了一个强大的基础模型,更通过构建"个人健康代理"展示了落地的可能性。通过将上述下游预测器整合到代理系统中,系统能够生成更具相关性、上下文感知力且更安全的治疗或健康建议。为了验证这一代理的实际效用,研究团队收集了1860名临床医生的评分数据。评估结果表明,基于该基础模型构建的代理在临床相关性、上下文理解及安全性方面均获得了高度评价。这一成果对开源社区、工业落地及后续研究具有深远影响,它证明了利用超大规模无标签数据预训练结合LLM智能体自动化优化,是解决个性化健康数据价值挖掘的有效途径,为未来可穿戴设备从单纯的数据记录者向智能健康顾问转型奠定了坚实的技术基础。

Sources

FAQ

这个可穿戴健康数据基础模型是什么?

它是专为可穿戴健康数据设计的通用AI模型,基于超万亿分钟无标签传感器数据预训练,无需昂贵标注即可自主学习复杂的生理与行为模式。

这项研究对个性化健康监测有何重要意义?

这项突破性研究在35项健康任务中系统提升性能,并实现标签高效的小样本学习,成功打破了长期制约数字健康发展的优质标注数据稀缺瓶颈。

未来应用发展中值得关注什么?

该模型已转化为经1860名临床医生严格评估的“个人健康代理”,展现出高安全性,正推动可穿戴设备从被动记录数据转向主动健康顾问。