
在人工智能(AI)生成内容席卷全球的背景下,医学影像的真实性正面临前所未有的挑战。近日,发表在《放射学》(Radiology)杂志上的一项研究显示,无论是资深的放射科医生还是最先进的多模态大语言模型(LLMs),都难以稳定识别由 AI 生成的“深伪(Deepfake)”X 射线图像。这一发现引发了对医疗数据完整性、虚假诉讼及网络安全风险的广泛担忧。
该研究由纽约西奈山伊坎医学院(Icahn School of Medicine at Mount Sinai)的 Mickael Tordjman 医学博士领衔,揭示了医疗AI发展过程中隐藏的“双刃剑”效应。
研究设计:横跨六国的“人机识别大战”
为了评估人类专家与 AI 在识别合成影像方面的能力,研究团队组织了一项回顾性研究,邀请了来自美国、法国、德国、土耳其、英国和阿联酋 6 个国家的 12 个中心的 17 名放射科医生参与,其从业经验涵盖 0 到 40 年。
研究共采用了 264 幅 X 射线图像,其中一半为真实影像,另一半由 AI 生成:
-
数据集一: 包含多个解剖部位,由 ChatGPT 生成。
-
数据集二: 专门针对胸部 X 射线,由斯坦福大学研究人员开发的开源生成式 AI 扩散模型 RoentGen 生成。
核心发现:AI 影像已达“乱真”程度
研究结果显示,深伪 X 射线图像的逼真程度足以欺骗受过严格训练的医学影像专家。
-
人类专家表现: 在放射科医生不知道实验真实目的的情况下,仅有 41% 的人能自发识别出图像异常。在告知存在合成图像后,医生的平均识别准确率仅为 75%。值得注意的是,从业年限与识别准确率之间不存在相关性,但骨科放射科医生(Musculoskeletal radiologists)表现出更高的敏感度。
-
大模型表现: 多模态大模型如 GPT-4o、GPT-5、Gemini 2.5 Pro 和 Llama 4 Maverick 的表现同样参差不齐,准确率在 52% 至 89% 之间波动。甚至连用于生成这些图像的 GPT-4o 模型,也无法百分之百识别出自己的“作品”。
专家警示:“太完美”或是最大漏洞
虽然 AI 生成的图像极具欺骗性,但 Tordjman 博士指出了一些微小的“合成特征”:
-
过度完美: 骨骼边缘过于平滑,脊柱异常笔直,肺部纹理过度对称。
-
特征异常: 血管模式极其统一;骨折线呈现出一种不自然的流畅与一致感,且往往仅限于骨骼的一侧(Unicortical)。
Tordjman 博士警告说:“这为欺诈性诉讼制造了巨大的风险,例如伪造一个肉眼无法分辨的骨折。此外,如果黑客入侵医院网络注入合成图像,可能会操纵诊断结果,造成临床混乱并破坏电子病历系统的根本可靠性。”
解决方案:构建数字“防火墙”
面对潜在的威胁,研究建议采取多重防范措施:
-
数字水印(Invisible watermarks): 在影像中嵌入所有权或身份数据的隐形信息。
-
加密签名: 在拍摄影像的同时,自动附加与技师身份绑定的加密签名。
-
教育与工具: 建立专门的教育数据集,训练医生识别 AI 生成的痕迹。
总结与展望
“我们现在看到的可能只是冰山一角,”Tordjman 博士表示,“进化的下一步将是 3D 合成影像,如 CT 和 MRI。”这项研究不仅敲响了警钟,更强调了在享受 AI 带来的效率提升时,必须同步构建保护医疗影像真实性的技术壁垒。
参考文献:
The Rise of Deepfake Medical Imaging: Radiologists' Diagnostic Accuracy in Detecting ChatGPT-generated Radiographs, Radiology (2026).
The study's authors have published a curated deepfake dataset with interactive quizzes for educational purposes.
编辑:王洪
排版:李丽





评论 (0)