Nimblemind多智能体系统:构建可审计的心力衰竭电子健康记录特征工程新范式

针对电子健康记录(EHR)特征工程效率低且缺乏临床可解释性的痛点,研究提出Nimblemind多智能体系统(nMAS)。该基于证据链的自动化管线在500份模拟记录中生成132个结构化及70个聚合特征,经受限大模型审计后,使HFrEF与HFpEF表型预测AUROC分别提升至0.963和0.910。独立评估显示其证据支持度达满分81.5%,证明了复杂心血管数据自动化特征工程的可行性,为临床AI落地提供了可追溯的方法论基础。

在临床研究与人工智能的交叉领域,电子健康记录(EHR)的特征工程往往被视为一道难以逾越的鸿沟。据统计,这一环节占据了数据科学家39%至45%的工作量,而在心力衰竭这一影响美国约670万成年人的复杂疾病研究中,这一问题尤为突出。心力衰竭的诊断与分型需要整合碎片化的EHR数据,并严格遵循基于指南的临床推理逻辑。现有的基于规则的方法或大语言模型(LLM)方法虽然提供了一定程度的自动化,但往往缺乏可维护性,且难以实现证据的可追溯性,导致模型在临床应用中面临"黑盒"信任危机。针对这一痛点,本研究提出了Nimblemind多智能体系统(nMAS),这是一种证据链接、评分标准锚定的自动化管线,旨在解决心力衰竭特征工程中的自动化与可解释性双重挑战。其核心贡献在于构建了一个能够自动生成、验证并审计结构化特征的系统框架,确保每一步特征提取都有据可查,从而在提升效率的同时保障临床数据的严谨性。nMAS的技术架构核心在于其多智能体协作机制与证据链接策略。系统并非简单地调用LLM进行文本生成,而是设计了一套严密的流水线,将EHR数据从原始表格转化为具有临床意义的聚合特征。

首先,系统从九个EHR源表中提取数据,通过多智能体协同工作,依据特定的临床评分标准(rubric)对数据进行解析和重组。这一过程不仅生成了132个基础的结构化特征,还进一步聚合出70个高阶特征。关键在于,nMAS引入了证据链接机制,确保每个生成的特征都能追溯到原始数据点,并通过受限的LLM进行审计。这种审计不仅检查数据的结构完整性,还验证特征是否符合预设的临床评分标准。通过这种"生成-验证-审计"的闭环策略,系统有效避免了传统LLM应用中常见的幻觉问题,确保了特征生成的逻辑严密性和临床合规性,为后续机器学习模型提供了高质量、可解释的输入数据。在实验评估阶段,研究团队使用了来自单一机构的500份模拟患者记录,涵盖了九个EHR源表,以验证nMAS的有效性与鲁棒性。实验结果显示,nMAS成功生成了符合结构完整性、评分标准合规性及溯源要求的特征集。为了量化这些特征对下游任务的价值,研究团队将其应用于心力衰竭表型预测任务,具体包括射血分数降低的心力衰竭(HFrEF)和射血分数保留的心力衰竭(HFpEF)。

结果表明,在引入nMAS生成的聚合特征后,HFrEF表型预测的AUROC从基线的0.895显著提升至0.963,HFpEF表型预测的AUROC也从0.870提升至0.910。这一提升不仅证明了特征工程的有效性,也反映了nMAS在捕捉复杂心血管数据模式方面的优势。此外,通过独立的LLM基于评分标准的评估,生成的特征在证据支持度与方法学严谨性上获得了相当于满分81.5%的评分,进一步佐证了该方法在生成高质量临床特征方面的可靠性。尽管实验局限于单机构队列且需要外部验证,但这些结果已充分展示了自动化特征工程在提升模型性能方面的巨大潜力。从行业意义来看,nMAS的提出为临床AI领域提供了一种可审计、可维护的特征工程新范式。在开源社区,该系统为处理复杂EHR数据提供了新的思路,即通过多智能体协作和证据链接来平衡自动化效率与临床严谨性。对于工业落地而言,这种能够自动生成可解释特征的方法有助于降低临床AI模型的开发门槛,加速从数据到决策的转化过程,特别是在心力衰竭等需要高度专业知识的领域。此外,该研究强调了证据溯源的重要性,为未来监管审批和临床信任建立奠定了基础。尽管目前评估仍受限于单一机构数据,需要进一步的外部验证,但nMAS证明了自动化、可审计的特征工程在复杂心血管数据中的可行性。这不仅为后续研究提供了新的技术路径,也为推动临床AI从实验走向实际应用提供了重要的方法论支持,有望在未来改变数据科学家在临床研究中的工作模式。

Sources