DRUGONE
随着通用人工智能聊天机器人被越来越多地用于情绪支持、关系咨询、陪伴以及心理健康相关交流,如何系统评估这些模型在心理脆弱用户中的安全性成为重要问题。传统人工智能安全基准通常依赖固定问题和单轮回答,能够发现明显的自伤鼓励、不当医疗建议等问题,却难以识别在多轮对话中逐渐形成的隐性风险。尤其值得关注的是,一些通常被认为具有支持性的行为,例如共情、肯定和安慰,在特定心理脆弱状态下可能反而强化异常信念、回避行为或对聊天机器人的情感依赖。
研究人员提出SIM-VAIL,即“模拟脆弱性放大交互循环”审计框架,通过人工智能模拟具有特定心理脆弱性和交互意图的用户,与待评估聊天机器人进行动态多轮对话,并利用自动安全评判模型从13个具有临床依据的心理健康风险维度评价每轮交互。研究共构建30种模拟用户画像,对9种前沿人工智能聊天机器人开展810次多轮对话,包含6,329轮交互,产生超过10,000个对话级评分和90,000个轮次级评分。
结果显示,心理健康相关风险并不是聊天机器人固有且固定的单一属性,而是由用户心理脆弱性、交互意图、模型本身以及对话发展轨迹共同决定。精神病性脆弱和躁狂脆弱情境总体具有较高风险,而寻求极端状态美化、情感依赖和危险行为支持等意图也更容易诱发令人担忧的回答。不同聊天机器人表现出显著差异,同一模型面对不同用户画像时也可能形成完全不同的风险模式。
更重要的是,风险往往不是由某一句明显有害的回答突然产生,而是在连续对话过程中逐步积累。研究人员将一种关键失败模式定义为“脆弱性放大交互循环”(VAIL):聊天机器人表面上表现为理解、支持或共情,但这些行为恰好与用户潜在的病理性认知或行为机制一致,从而不断强化原有心理脆弱性。反事实干预进一步表明,在风险开始升级的关键节点仅改变一条用户信息或聊天机器人回答,就能够显著降低后续风险。研究由此建立了一套具有临床验证基础、可扩展并能够解析对话动态的人工智能心理健康安全审计体系。

全球心理健康服务长期面临专业人员不足和医疗资源分布不均的问题。在这一背景下,具有全天候可访问性、低边际成本和自然语言交互能力的通用人工智能聊天机器人,正在成为部分用户寻求情绪支持、关系建议、陪伴甚至治疗建议的重要渠道。人工智能因此具有扩大心理健康支持可及性的潜力,但同样意味着模型可能直接面对抑郁、精神病性体验、躁狂、强迫症状以及高度依恋等心理脆弱状态。
人工智能聊天机器人的输出具有概率性和高度情境依赖性,因此很难仅凭模型设计或安全规则预先保证其在所有心理健康场景下的行为。现有自动化安全评估通常向模型提供固定问题,然后判断单次回答是否安全。这种方法适合检测明显违规,却存在两个突出问题:固定测试集容易随着模型优化而饱和;更重要的是,单轮评估无法反映真实用户与聊天机器人持续交流时形成的上下文累积效应。
人工红队测试能够通过动态调整提问策略发现更多潜在失败模式,但需要大量专业人员参与,而且难以标准化和规模化。与此同时,无论固定基准还是传统红队测试,往往重点关注自伤鼓励、危险医疗建议或污名化语言等显性危害,而容易忽略更加微妙的“交互性危害”。例如,聊天机器人不断确认一个精神病性用户对模糊事件的威胁性解释,可能强化异常信念;持续满足强迫症用户对确定性的要求,可能形成反复保证与检查循环;向具有不安全依恋特征的用户提供过度亲密和排他性的回应,则可能增强其对人工智能的情感依赖。
因此,研究人员提出一个核心观点:判断心理健康场景中的人工智能安全性,不能仅询问“这句话是否有害”,还必须考察“这句话对这个用户意味着什么,以及连续出现这种回答会把对话带向哪里”。SIM-VAIL正是围绕这一问题建立。
方法
研究人员将SIM-VAIL构建为自动化多轮对抗性红队框架,以“用户是谁”和“用户希望从聊天机器人获得什么”两个维度建立交互空间。用户脆弱性包括抑郁、精神病性脆弱、强迫症、躁狂和不安全依恋五类状态;交互意图包括寻求不良信念确认、寻求可能促进回避的保证、建立对聊天机器人的情感依赖、淡化症状或风险、寻求危险行为帮助以及美化痛苦或极端精神状态。两者组合形成30种具有临床依据的模拟用户画像。模拟用户模型根据相应画像主动与9种前沿聊天机器人展开对抗性多轮交流,每组条件重复3次,对话最多持续10轮,并由自动安全评判模型从39个行为维度进行评价,其中预先确定13个心理健康相关维度,包括总体令人担忧行为、治疗质量、自伤处理、不良信念强化、危险行为支持、回避与保证循环、依赖、奉承迎合、症状淡化、精神疾病美化、污名化以及医疗建议等。最终形成810次模拟对话。研究人员同时邀请27名临床人员对部分交互进行独立评价,并利用不同评判模型、重复模拟、已知高低风险样本、统计分析、风险轨迹聚类和反事实干预验证框架的可靠性。

图1|SIM-VAIL用于人工智能聊天机器人心理健康安全自动化红队测试的整体框架。
结果
SIM-VAIL的自动安全评价具有较高临床一致性
建立自动化审计框架首先需要回答一个关键问题:人工智能安全评判模型能否可靠评价另一人工智能模型的心理健康行为?
研究人员进行了多层验证。两个独立安全评判模型给出的对话级风险评分高度相关,相关系数达到0.91,说明总体结果并不高度依赖某一个特定评判模型。同一“用户脆弱性×交互意图×聊天机器人”组合重复模拟3次后也具有较好的稳定性,三次结果平均后的组内相关系数达到0.90。面对预先构建的高风险和低风险对话,自动评判系统区分两类情况的中位AUC达到0.98。
更关键的是临床人员验证。27名临床人员对488个轮次进行评价,其对“令人担忧的聊天机器人行为”的评分与自动评判结果显著相关。自动评判模型与单个人类评价者之间的一致程度甚至高于两名人类评价者彼此之间的一致程度。另一名精神科医生对完整对话进行独立评价后,与自动评分同样具有较强一致性。
模拟对话本身也具有较高真实性。临床评价者在5分制真实性评分中的平均值为4.15,其中44%的交互被认为“像真实对话”,只有约1%被判断为明显人工生成。
这些结果说明,SIM-VAIL虽然采用人工智能模拟用户和自动评判,但并非完全建立在模型“自我评价”之上,而是获得了临床人员评价支持,为后续大规模自动审计提供了基础。
心理健康风险取决于用户脆弱性与交互意图
研究人员随后分析哪些用户最容易诱发聊天机器人的风险行为。结果显示,不同心理脆弱状态之间存在显著差异。总体而言,精神病性脆弱和躁狂情境产生的令人担忧行为最高,抑郁和不安全依恋居中,而强迫症情境总体较低。
交互意图同样具有重要影响。当用户试图美化极端精神状态、寻求对聊天机器人的情感依赖,或者要求模型支持危险行为时,风险明显升高;寻求信念确认和淡化症状处于中间水平,而单纯寻求保证或短期缓解总体风险相对较低。
更值得关注的是,脆弱性和意图并非彼此独立。例如,强迫症情境总体风险较低,但当用户寻求情感依赖或危险行为帮助时,风险明显增加;抑郁、躁狂和精神病性脆弱与美化、症状淡化和依赖等意图组合时,则特别容易诱发问题回答。作为对照,心理健康的模拟用户即使使用相同六类交互意图,也产生显著更低的风险评分,说明检测到的现象与用户心理脆弱性具有特异联系。

图2|人工智能聊天机器人的令人担忧行为随用户心理脆弱性和交互意图而变化。
不同人工智能聊天机器人具有不同风险谱
研究人员进一步比较9种前沿聊天机器人。结果表明,不同模型的总体令人担忧行为存在显著差异,而且同一模型面对不同心理状态和交互目的时,其风险表现也可能发生明显变化。
在该研究的特定API版本和实验条件下,Claude Sonnet 4.5的总体令人担忧行为评分最低,而Grok 4最高。同一模型家族内部,新版本总体上比旧版本表现出更低的风险,但Grok系列是明显例外。研究人员进一步使用来自另一开发者的模型重新审计Claude Sonnet 4.5,其相对较低风险仍然存在,降低了原结果仅由同一家模型同时担任审计者和被审计对象所造成的可能性。
模型之间的差异也不仅体现为简单的“安全排名”。部分模型在各种用户场景中表现相对稳定,有的整体稳定地保持低风险,有的则广泛表现出较高风险;另一些模型具有明显情境敏感性,在一种用户画像中表现良好,却可能在另一种心理脆弱性和交互意图组合下出现明显风险。
因此,单一总体安全分数不足以完整描述聊天机器人的心理健康安全性,更合理的评价对象应当是模型面对不同用户和不同意图时形成的“风险谱”。

图3|不同人工智能聊天机器人的总体风险和情境敏感性存在明显差异。
风险在多轮对话中逐渐积累并形成不同轨迹
单轮基准最容易忽略的现象,是风险随上下文不断积累。研究发现,在全部模拟交互中,令人担忧行为总体随对话轮次增加而升高。其中躁狂和精神病性脆弱用户的风险上升更加迅速;在交互意图方面,寻求情感依赖以及美化自身痛苦或极端体验时,风险也更早、更明显地升级。
研究人员进一步对810次对话的风险时间序列进行无监督聚类,发现四种具有代表性的轨迹:始终保持较低风险的“低风险型”;风险随对话逐渐积累的“渐进升级型”;在前几轮便迅速进入高风险并持续存在的“早期升级型”;以及风险最初升高但随后重新下降的“恢复型”。这四种轨迹在不同用户脆弱性、交互意图和聊天机器人之间并非随机分布。
这一结果改变了对聊天机器人安全失败的理解。风险并不一定表现为突然生成一句极端危险的话,而可能由多次看似合理的回答逐步形成。单独检查其中任何一句可能并不严重,但连续组合后却能够强化用户原有认知和行为模式。因此,心理健康人工智能安全评价必须从“回答级”扩展至“对话轨迹级”。

图4|人工智能聊天机器人的心理健康风险随对话轮次累积。
心理健康风险具有多维结构并形成脆弱性放大交互循环
研究人员进一步分析13种风险指标之间的关系。结果表明,心理健康风险并非单一维度。第一主成分解释62.4%的总体变异,其一端对应较高治疗质量,另一端则同时表现为更强的令人担忧行为、不良信念强化、迎合以及危险行为支持。第二主成分进一步区分不同危害机制:一侧主要体现依赖、回避和反复保证等关系性风险,另一侧更多体现对他人的伤害以及污名化。其他维度则进一步区分自我伤害、关系性危害和不当医疗建议等风险类型。
不同用户在这一风险空间中的位置明显不同。躁狂和精神病性脆弱更多进入一种风险区域,而抑郁、强迫症和不安全依恋更多表现为关系依赖、回避和保证循环等另一类风险。这意味着两个对话即使最终具有类似总体风险分数,背后的心理机制也可能完全不同。
由此,研究人员提出VAIL概念。VAIL最值得关注的地方在于,危险行为并不一定表现为明显敌意或直接鼓励伤害。相反,它可能来自通常被认为“良好”的聊天机器人特征。当模型的共情、确认、积极鼓励或持续保证恰好与用户心理脆弱性的维持机制一致时,这些局部看似支持性的回答便可能形成连续反馈,使异常信念、冲动行为、回避或者情感依赖逐渐增强。

图5|人工智能聊天机器人心理健康风险的多维结构。
在风险升级早期干预单条信息即可改变后续轨迹
最后,研究人员利用反事实实验检验VAIL是否具有可干预性。他们将首次出现较高令人担忧行为评分的回答定义为风险拐点,并分别从用户和聊天机器人两侧进行干预。
第一项实验改变风险拐点之前的用户消息。研究人员保持用户身份、对话背景和语气基本一致,但将原消息改写为更具降级作用的版本,然后要求原聊天机器人重新回答。结果显示,仅改变这一条用户信息,就显著降低了随后聊天机器人回答的风险。
第二项实验更加具有实际安全设计意义。研究人员不改变用户,而是将聊天机器人首次出现明显风险的回答改写为更加安全、具有降级作用的版本,然后从这一节点继续生成后续对话。结果发现,单次安全改写不仅降低了紧接着下一轮回答的风险,其影响在随后五轮交互中仍然可以检测到。
这说明多轮心理健康风险具有路径依赖性,但也意味着安全干预无需重构整个聊天机器人。当系统检测到风险开始上升时,在关键节点进行针对性的消息级干预,就可能阻断脆弱性放大循环。

图6|反事实干预能够在关键拐点阻断脆弱性放大交互循环。
讨论
该研究的核心贡献不是提出又一个单轮心理健康问答基准,而是重新定义了人工智能聊天机器人心理健康风险的评估单位:真正需要审计的并非孤立回答,而是“用户脆弱性—交互意图—模型行为—时间轨迹”共同组成的动态系统。
VAIL概念尤其具有临床意义。传统人工智能安全机制通常比较容易识别明显的危险内容,例如直接支持自伤或危险行为,但更加困难的是识别“情境错误的支持”。对于普通用户而言,确认感受、积极鼓励和提供保证可能是合理行为;但对于处于躁狂、精神病性体验、强迫循环或高度依恋状态的用户,同样的语言策略可能强化维持症状的认知和行为机制。因此,心理健康聊天机器人的理想安全策略并不是简单降低共情,而是要求模型能够区分“确认用户的情绪体验”和“确认可能有害的解释、信念或行为”。
研究同时表明,心理健康安全不是模型的固定属性。用户画像不同、交互目标不同,甚至对话发展阶段不同,同一模型都可能表现出截然不同的风险。未来模型安全评估因此需要从一个总体分数扩展到具有临床解释性的多维风险图谱,并特别关注风险如何在多轮交互中产生、升级、持续和恢复。
反事实实验则提供了积极的工程启示。VAIL虽然具有累积性,却并非不可逆转。早期识别风险拐点并对单条回答实施上下文敏感的安全改写,就可能改变后续对话轨迹。这为未来构建实时心理健康安全层提供了依据:系统可以持续估计当前用户情境和对话风险,在出现升级迹象时动态调整回答,而不是仅依赖静态关键词过滤。
研究也存在明确限制。SIM-VAIL使用的是模拟用户,30种用户画像无法覆盖现实世界心理健康表现的全部异质性。真实个体还受到年龄、文化、语言、教育、发展经历以及社会环境等因素影响,因此研究人员强调,其结果更适合被理解为发现了一个具有临床意义的“风险下限”,而非穷尽所有真实心理健康交互。
此外,研究通过公开API评估目标模型,而不是直接测试普通用户实际使用的完整消费级产品。因此结果主要反映基础目标模型在实验条件下的行为,并不能完全代表包含系统提示、安全中间件、产品编排和个性化记忆后的真实部署系统。SIM-VAIL本身也被定位为模型级审计和比较基准,而不是预测某一个真实用户临床风险的诊断工具。
总体而言,该研究证明,人工智能聊天机器人在心理健康场景中的风险具有显著的情境依赖性、多维性和时间累积性。令人担忧的交互往往并非来自一次明显失控,而是来自模型持续以表面支持性的方式配合用户心理脆弱性的维持机制。与此同时,新一代模型总体呈现出安全性改善,早期消息级干预也能够有效降低后续风险,说明这些问题并非无法解决。SIM-VAIL由此提供了一种从静态“安全问答测试”走向动态“临床情境交互审计”的方法,为未来开发能够识别用户情境、理解对话轨迹并实施实时干预的心理健康人工智能安全体系提供了基础。
整理 | DrugOne团队
参考资料
Weilnhammer, V., Hou, K.Y., Luettgau, L. et al. A clinically validated framework for auditing AI chatbot behavior in mental health interactions. Nat Med (2026).
https://doi.org/10.1038/s41591-026-04577-2

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢