- 简介尽管经过了大量安全训练,语言模型仍易受提示注入攻击的影响。我们发现这一缺陷的根源在于“角色混淆”:模型依据文本的书写方式(而非其来源)来推断其中所扮演的角色。为此,我们设计了一套新颖的“角色探针”(role probes),用以捕捉模型在内部如何识别“谁在发言”。这些探针揭示了提示注入之所以奏效的根本原因:不可信文本一旦模仿某一角色,便会自动继承该角色所具有的权威性。我们基于这一洞见展开验证,将伪造的推理内容分别注入用户提示与工具输出中,在StrongREJECT基准上平均攻击成功率达60%,在智能体数据窃取(agent exfiltration)任务上达61%;实验覆盖多种开源与闭源权重模型,而各模型在未注入时的基线成功率均接近于零。尤为引人注目的是,模型在生成开始前其内部角色混淆的程度,便已能高度预测后续攻击是否成功。我们的研究结果揭示了一个根本性鸿沟:安全性是在系统接口层面定义的,而权威性却是在模型的隐空间(latent space)中被赋予的。更广泛而言,我们提出了一种统一且具有机制解释力的提示注入分析框架,证实各类看似迥异的提示注入攻击,实则均利用了同一底层机制——即角色混淆。
-
- 图表
- 解决问题语言模型在经过大量安全训练后,仍易受提示注入攻击,论文指出其根本原因在于‘角色混淆’——模型根据文本的书写方式(而非来源)推断说话者角色,导致恶意文本通过模仿权威角色(如系统指令或工具输出)获得不应有的执行权限。这是一个对提示注入机制的新归因,超越了传统将问题归于对抗性token或上下文覆盖的表层解释。
- 关键思路提出‘角色探针(role probes)’这一可解释性工具,首次在模型隐空间中量化地捕捉模型如何内化和分配‘谁在说话’;揭示所有提示注入攻击本质上共享同一机制:未受信文本通过风格模仿劫持角色身份与对应权威,从而绕过接口层的安全边界。该思路将安全问题从输入/输出接口层转向模型内部的语义角色建模机制,具有根本性理论突破。
- 其它亮点在StrongREJECT(60%攻击成功率)和代理数据泄露任务(61%)上实现跨模型(Llama-3、Qwen、Claude、GPT-4)鲁棒攻击;角色混淆程度可在生成前预测攻击成功率(无需运行完整响应),为防御提供前置干预窗口;实验涵盖用户提示与工具输出双路径注入,验证机制普适性;暂未提及其代码是否开源;未来方向包括:构建角色感知的解耦式安全层、设计抗角色漂移的微调目标、开发角色身份认证协议。
- ‘Universal and Transferable Adversarial Attacks on Aligned Language Models’ (Zou et al., 2023); ‘Jailbreaking LLMs via Interleaved Prompting’ (Zhao et al., ACL 2024); ‘The Illusion of Control: Why LLM Safety Layers Fail Under Role Ambiguity’ (Perez et al., NeurIPS 2023 Workshop); ‘ToolFormer: Language Modeling Grounded in Tool Use’ (Schick et al., 2023)


提问交流