开放源代码AI迎头赶上?哈佛研究:诊断复杂病例表现可媲美GPT-4-肽度TIMEDOO

人工智能(AI)正在以多种方式变革医学领域,其中最具潜力的应用之一便是充当医生的“诊断助手”。过去两年,专有AI模型(即封闭源代码模型)在需要复杂临床推理的疑难病例中表现出色,甚至优于开源模型。

但开源AI是否已经迎头赶上?

答案似乎是肯定的。根据哈佛医学院(Harvard Medical School, HMS)研究人员领衔的一项由美国国立卫生研究院(NIH)资助的新研究,最新的开源AI工具Llama 3.1 405B在诊断疑难病例方面的表现已可媲美知名封闭源代码模型GPT-4。该研究与哈佛附属贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)和布列根妇女医院(Brigham and Women’s Hospital)的临床医生合作完成,研究结果于3月14日发表在**《JAMA Health Forum》**期刊上。

研究团队将Llama 3.1 405B与GPT-4进行了对比测试,选用了**《新英格兰医学杂志》(NEJM)**“每周疑难病例”栏目中发布的92个临床挑战案例。结果表明,这款开源AI在诊断准确率方面达到了与GPT-4相当的水平。

开源AI的突破:挑战封闭源代码模型

“据我们所知,这是首次有开源AI在如此具有挑战性的临床病例中达到与GPT-4相当的表现,并获得医生的认可,”该研究的资深作者、哈佛医学院Blavatnik研究所生物医学信息学助理教授Arjun Manrai表示。“Llama模型进步如此之快,确实令人惊叹。患者、医疗提供者以及医院都将从这场竞争中受益。”

开源AI与封闭源代码AI的优劣势对比

开源AI和封闭源代码AI在多个方面存在关键差异。

  1. 数据安全性:开源模型可以在医院的本地计算机上运行,从而确保患者数据不离开院内。而封闭源代码模型通常依赖外部服务器,用户需要将敏感数据传输至第三方平台。

    “对于许多首席信息官(CIO)、医院管理者和医生而言,数据离开医院交由其他机构(即使是值得信赖的机构)处理,这一事实可能是不可接受的。”研究第一作者、哈佛医学院生物医学信息学系AI医学方向博士生Thomas Buckley表示。

  2. 可定制性:开源AI允许医疗和IT专业人员根据具体的临床和研究需求进行调整,而封闭源代码AI的定制难度较大。

    “这点至关重要,”Buckley补充道,“医院可以利用本地数据对开源模型进行微调,无论是基本优化还是深度调整,使其更符合本院医生、研究人员和患者的需求。”

  3. 系统集成:封闭源代码AI由OpenAI、Google等科技公司提供完整的托管服务和技术支持,而开源模型的部署和维护责任则由用户自行承担。此外,目前封闭源代码模型在与电子病历系统(EHR)及医院IT基础设施的兼容性方面仍具有一定优势。

临床测试:Llama 3.1 405B VS GPT-4

AI模型的训练基于海量医学数据,包括医学教科书、同行评审研究、临床决策支持工具以及匿名患者病例(如检查结果、影像学数据和确诊信息)。这些算法通过超高速分析学习医学模式,例如:

  • 识别病理切片上的癌变和良性肿瘤特征;
  • 判断心力衰竭的早期迹象;
  • 区分正常和炎症性结肠的CT影像特征。

研究人员在本次研究中,让Llama 3.1 405B测试了70个先前用于评估GPT-4的NEJM疑难病例,并额外增加了22个Llama训练后才发表的新病例,以防止AI在训练过程中“见过”原有案例。

结果显示:

  • 在全部92个病例中,Llama 3.1 405B的正确诊断率为70%,GPT-4则为64%;
  • Llama 3.1 405B的首选诊断正确率为41%,GPT-4为37%;
  • 在新增的22个病例中,Llama 3.1 405B的正确诊断率达到73%,首选诊断正确率为45%。

“作为一名医生,我过去看到的先进大型语言模型(LLM)几乎都是封闭源代码的,我们无法在本地运行,”研究合著者、贝斯以色列女执事医疗中心医学助理教授Adam Rodman表示。“我们的研究表明,开源模型同样强大,这将赋予医生和医疗系统更多对AI技术的控制权。”

AI能否减少诊断错误?

据2023年一份报告,美国每年约有79.5万名患者因诊断错误而死亡或永久性残疾。

除了对患者造成直接伤害,误诊或延迟诊断还可能增加医疗系统的经济负担。错误的诊断可能导致不必要的检查、不合适的治疗,甚至使病情恶化,导致更复杂、更昂贵的医疗处理。

“如果能合理使用并妥善融入现有医疗体系,AI工具将成为医生的可靠副驾驶(copilot),帮助提升诊断的准确性和效率。”Manrai总结道,“但最关键的是,医生必须主导这项技术的应用,以确保AI真正为他们所用。”

参考文献:Thomas A. Buckley et al, Comparison of Frontier Open-Source and Proprietary Large Language Models for Complex Diagnoses, JAMA Health Forum (2025). DOI: 10.1001/jamahealthforum.2025.0040

编辑:王洪

排版:李丽