

视觉语言模型凭借更强的推理能力极大推动了自动驾驶技术的发展,但此类模型极易遭受对抗样本攻击。现有研究大多聚焦通用场景下视觉语言模型的攻击,针对安全关键的自动驾驶场景定制的攻击方法的相关工作仍十分匮乏。北京航空航天大学刘祥龙团队首次面向自动驾驶场景下的视觉语言模型设计白盒对抗攻击,揭示该类攻击在自动驾驶这一安全攸关领域存在的重大安全隐患。研究团队梳理出针对自动驾驶视觉语言模型构建有效对抗攻击的两大特有难点:文本指令的多样性、驾驶视觉场景的时序特性。为此,本文提出ADvLM——首个专为自动驾驶视觉语言模型打造的视觉对抗攻击框架。该框架提出语义不变诱导模块:依托大语言模型,在语义熵约束下生成语义含义一致、表述多样化的文本提示词库。在此基础上,研究团队设计场景关联增强策略:借助注意力机制筛选驾驶场景中的关键帧与关键视角,优化对抗扰动,使其能够在完整时序驾驶场景中具备泛化攻击效果。文章在多款自动驾驶视觉语言模型、多套标准评测数据集上开展了大量对比实验,结果表明ADvLM实现了当前最优的攻击性能。此外,真实世界攻击实验进一步验证了该攻击在落地场景中的可行性与威胁。相关成果已发表于MIR 2026年第4期专题。

图片来自Springer
全文下载:
Visual Adversarial Attack on Vision-language Models for Autonomous Driving
Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu
https://link.springer.com/article/10.1007/s11633-026-1667-4
https://www.mi-research.net/article/doi/10.1007/s11633-026-1667-4
全文导读
视觉语言模型具备优异的泛化能力与天然可解释性,在自动驾驶等各类任务中均表现出出众性能。该类模型可赋能自动驾驶系统完成场景理解与自然语言处理,能够充当自动驾驶系统的”决策大脑”,为复杂场景下的高阶推理、高效人机交互提供可靠解决方案。作为端到端自动驾驶领域的全新技术路线,视觉语言模型拥有巨大的未来发展潜力。
然而,视觉语言模型存在显著安全缺陷,鲁棒性较差,在对抗攻击这类精心构造的视觉扰动面前尤为脆弱。目前学界虽已提出多种攻击算法,但现有研究大多针对通用视觉语言模型,并未结合自动驾驶场景的特有需求展开针对性研究。自动驾驶属于安全关键领域,识别并修复此类模型漏洞至关重要:一旦视觉语言模型运行失效,将引发严重后果,例如车辆交通事故、系统决策错乱等。
本文首次开展面向自动驾驶视觉语言模型的对抗攻击研究。以往对抗攻击研究大多针对通用视觉语言模型或仅依靠视觉输入的自动驾驶系统;而自动驾驶任务具备独特的多模态与时序特性,这一特性带来了亟待攻克、风险突出的攻击面,即需要在动态变化的视觉画面中解读各类语言指令,直接将现有通用视觉语言模型对抗攻击方法迁移至自动驾驶场景极具难度,本文提炼出自动驾驶视觉语言模型独有的两大核心挑战,具体如下。
攻击需满足两点要求:1) 面对措辞、句式各不相同但任务语义一致的多条文本指令时,攻击仍需生效;2) 针对包含多帧画面、视角持续切换的特定时序驾驶场景,攻击需具备稳定效果。为解决上述难题,本文提出ADvLM,首个专门面向自动驾驶视觉语言模型设计的视觉对抗攻击框架。现有相关研究均将文本与视觉模态分开处理,与之不同,ADvLM设计两套适用于驾驶场景、相互耦合的核心机制:在文本模态层面,本文提出语义不变诱导,构建低语义熵提示词库,库内包含表述多样但语义完全一致的各类文本指令。具体而言,本文以原始基准提示词为种子,借助大语言模型生成多种变体文本,并以语义熵为约束优化变体,丰富文本表达方式的多样性。在视觉模态层面,本文提出场景关联增强:依托模型注意力权重筛选驾驶场景中的关键帧与核心视角;遍历全部提示词库的同时,基于筛选出的关键帧迭代优化对抗扰动,让攻击效果能够泛化至整套时序驾驶场景。借助该方案,本研究可在更大范围的文本、图像输入空间内生成对抗样本,所得攻击能够稳定生效,无论面对多样文本指令还是连续时序画面视角,均可诱导自动驾驶视觉语言模型输出指定错误行为。

图1 ADvLM攻击框架图。在文本域引入语义不变诱导,在图像域引入场景关联增强,确保跨不同指令和视角的攻击有效性

图2 ADvLM攻击效果示意图。通过视觉对抗扰动实施攻击可致使模型输出错误决策,直观展现自动驾驶视觉语言模型存在对抗脆弱性所带来的潜在安全风险。
尽管已有诸多研究探究视觉语言模型的对抗攻击,但几乎没有方法针对自动驾驶的特有场景需求定制设计。例如跨提示词攻击(CroPA)未做任务专属优化,对不同表述的文本指令攻击效果很差;而自动驾驶场景下的指令表达方式丰富多变,因此该方法适用范围受限。FMM-Attack虽兼顾了时序连续性,却忽略了动态驾驶场景中至关重要的视角切换问题。与此同时,CAD主要研究黑盒攻击,这类方法虽贴合真实部署场景,但无法像白盒攻击那样完整挖掘模型潜藏的脆弱性。与之相比,本文提出的ADvLM是首个面向自动驾驶视觉语言模型量身打造的白盒对抗攻击框架。该框架通过语义不变诱导机制,兼容语义相同但表述各异的指令;同时采用场景关联增强策略,保证攻击在连续时序帧、多视角切换场景下均具备稳定鲁棒性。ADvLM 针对性解决自动驾驶场景独有的两大难点,构建出一套更完整、攻击效果更优异的攻击框架,能够深度揭示安全关键驾驶场景下模型的鲁棒性缺陷。
为验证本框架的攻击有效性,本研究在多款自动驾驶视觉语言模型上开展大量对比实验。无论是白盒还是黑盒实验设置下,本文所提攻击方法的性能均大幅超越所有基线算法,模型最终评测指标降幅分别领先 16.97%、7.49%。在基于CARLA仿真平台的闭环仿真测试中,ADvLM 同样表现出最优攻击效果,车辆碰撞指标达到 2.954。除此之外,本文还在实车上开展实景物理攻击实验,进一步证实该攻击方案具备现实威胁潜力。
核心创新点
本文核心创新点如下:
1) 本文提出首个面向自动驾驶视觉语言模型的白盒对抗攻击框架 ADvLM,攻克了自动驾驶场景下独有的攻击难点。
2) 文本域设计语义不变诱导机制,视觉域设计场景关联增强策略,保障攻击对多样化指令、时序多视角场景均能稳定生效。
3) 数字仿真与实车实景多场景大量实验证明,ADvLM 性能优于现有各类方法,具备极强的现实落地威胁。
全文下载:
Visual Adversarial Attack on Vision-language Models for Autonomous Driving
Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu & Xianglong Liu
https://link.springer.com/article/10.1007/s11633-026-1667-4
https://www.mi-research.net/article/doi/10.1007/s11633-026-1667-4
BibTex:
@Article{MIR-2025-06-346,
author={Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu},
journal={Machine Intelligence Research},
title={Visual Adversarial Attack on Vision-language Models for Autonomous Driving},
year={2026},
volume={23},
issue={4},
pages={823-840},
doi={10.1007/s11633-026-1667-4}}


特别感谢本文作者团队对以上内容的审阅和修改!
纸刊免费寄送
Machine Intelligence Research
MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!
说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737
收件信息登记:
https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢