
随着大语言模型技术的普及,数以百万计的用户开始尝试通过通用 AI 聊天机器人讨论情绪与心理健康问题。然而,此类模型在面对心理脆弱群体时,其多轮对话的安全性与潜在风险一直缺乏系统性的临床评估手段。
近日,发表于《自然-医学》(Nature Medicine)杂志的一项研究,推出了一项名为 SIM-VAIL 的临床验证评估框架。该框架专为模拟与审计 AI 聊天机器人在心理健康场景下的多轮对话表现而设计,为揭示 AI 隐性风险及构建针对性安全防护墙提供了全新工具。
该研究由伦敦大学学院(UCL)、牛津大学以及英国 AI 安全研究所(UK AI Security Institute)等机构的研究团队合作完成。伦敦大学学院与牛津大学的 Matthew Nour 博士为本文通讯作者,马克斯·普朗克 UCL 计算精神病学与衰老研究中心的 Veith Weilnhammer 博士为第一作者。
动态对抗测试:揭示“脆弱性放大交互循环”
传统的 AI 安全基准测试大多依赖于针对单条提示词(Single-message prompt)的静态响应评估,难以捕捉在长时间复杂交谈中逐渐累积的隐蔽风险。
为了突破这一局限,研究团队构建了 SIM-VAIL 自动化红队测试(Adversarial red teaming)系统。该框架能够模拟涵盖抑郁症、躁狂症、精神病性障碍、强迫症及不安全依恋等特定心理脆弱特征的用户画像,并设定不同的对话意图(例如试图诱导 AI 同意其偏激观点、轻视自身困境或认可高风险行为)。
研究人员应用该框架,对 9 款前沿 AI 模型(包括 Claude、ChatGPT、Gemini、Grok 及 Llama 系列模型)进行了 810 场多轮模拟对话测试,产生了超过 90,000 份临床维度评分。
研究发现,在面对心理脆弱用户时,目标聊天机器人的不当应答行为普遍存在(尽管在最新一代模型中已显著降低)。风险通常不是在对话初期爆发,而是在多轮交互中渐进式显现:AI 表面上看似提供支持与共情的回复,可能会无意中强化用户底层心理机制中的病理认知。研究人员将这一危险演进模式定义为“脆弱性放大交互循环”(Vulnerability-Amplifying Interaction Loop, VAIL)。
精准干预与开源探索:从评估走向修复
除了揭示风险,研究团队还提出了明确的优化路径:如果在对话早期及时干预并替换掉某一次不恰当的回复,后续整段对话的安全性轨迹将获得大幅改善。这表明在风险演进早期实施针对性干预,能够有效阻断后期危险行为的发生。
临床评估对照显示,SIM-VAIL 的自动化临床风险评分与精神科专业医生的评估结果高度一致,证实了其作为大规模、可扩展审计工具的有效性。
通讯作者 Matthew Nour 博士指出,SIM-VAIL 的核心目的并非简单地给某个模型贴上“安全”或“不安全”的标签,而是提供一个能够精准定位特定漏洞并验证新防护策略是否有效的测试平台。
为了推动行业的共同进步,研究团队已同步公开发布了开源工具“SIM-VAIL Explorer”。科研人员、AI 开发者及公众均可通过该平台查看全部对话样本,逐轮追踪风险的动态形成过程,并对比不同模型在特定心理画像下的安全性表现。研究团队同时强调,由于该框架采用了对抗性压力测试,其结果反映的是极限条件下的潜在漏洞,而非日常使用中的风险发生概率。
参考文献:Veith Weilnhammer et al, A clinically validated framework for auditing AI chatbot behavior in mental health interactions, Nature Medicine (2026). DOI: 10.1038/s41591-026-04577-2
编辑:王洪
排版:李丽





评论 (0)