当AI开始“倾听”病历中的低语:MGB发布全自动认知障碍筛查系统-肽度TIMEDOO

近日,来自美国麻省总医院查尔斯顿分院(Mass General Brigham, MGB)的研究团队在《npj Digital Medicine》上发表了一项突破性研究。该团队开发出一种全自动人工智能(AI)系统,能够通过分析日常临床文档(Clinical documentation)自动筛查认知障碍(Cognitive impairment)。

该系统的显著特征在于其完全自主性:部署后无需人工干预或提示词引导(No human intervention or prompting)。在真实世界的验证测试中,该系统表现出了极高的特异性(Specificity),达到 98%。

构建“数字临床团队”:五大智能体协同辩论

与传统的单一 AI 模型不同,该系统采用了多智能体协作架构。研究通讯作者、麻省总医院临床增强智能(CLAI)研究小组主任 Hossein Estiri 博士表示:“我们建立的不是一个单一模型,而是一个‘数字临床团队’。该系统包含五个专门的智能体(Five specialized agents),它们模拟临床病例讨论会的模式,通过相互质疑和精炼推理(Refine their reasoning)来做出临床判定。”

为了确保数据隐私,该系统运行在开放权重(Open-weight)的大语言模型上,可以完全部署在医院内部的 IT 基础设施中,无需将任何患者数据传输到外部服务器或云端。

早期检测:倾听病历中的“低语”

随着阿尔茨海默病新疗法的获批,早期检测变得至关重要,因为这些药物在疾病早期阶段最为有效。然而,传统的认知测试由于资源密集且可及性低,导致大量患者错过了最佳治疗窗口。

研究共同第一作者 Lidia Moura 博士指出:“临床病历中隐藏着认知能力下降的‘低语’(Whispers of cognitive decline),而忙碌的临床医生往往无法系统性地将其表面化。该系统实现了大规模的‘倾听’,能将日常医疗记录转化为识别潜在认知障碍的机会。”

性能验证:AI 在分歧中展现“临床合理性”

研究分析了 200 名患者的 3,300 多份临床记录。一个引人注目的发现是:当 AI 与人类复核员意见不一致时,独立专家的复审结果显示,58% 的情况下 AI 的判断是正确的。Estiri 博士指出,AI 并非在乱猜,而是在根据病历中的证据做出“具有辩护性(Defensible)”的临床判断。

研究也诚实地披露了系统的局限性(Calibration challenges):

  • 环境影响: 在真实世界环境下(患病率 33%),系统灵敏度(Sensitivity)为 62%,虽然低于平衡测试时的 91%,但特异性依然稳定在 98%。

  • 数据依赖: 系统在处理长篇叙述性病历时表现优异,但在仅有简单“问题列表(Problem lists)”而缺乏上下文描述时容易出错。

开源贡献:发布 Pythia 工具

为了促进行业共同进步,研究团队同步发布了名为 Pythia 的开源工具。该工具能够实现自主提示词优化(Autonomous prompt optimization),帮助其他医疗机构在自己的 AI 筛查应用中部署类似的自动化流程,而无需手动调整复杂的指令。

参考文献:

Jiazi Tian et al, An autonomous agentic workflow for clinical detection of cognitive concerns using large language models, npj Digital Medicine (2026). DOI: 10.1038/s41746-025-02324-4

Access the Pythia tool

编辑:王洪

排版:李丽