Machine Intelligence Research
随着生成式人工智能快速发展,多模态感知在构建高鲁棒性智能系统中承担愈发关键的作用。多模态图像融合技术在抵御对抗扰动方面具备巨大潜力,但现有方案存在两大核心缺陷,导致防御效果薄弱:一是融合过程缺少攻击感知机制;二是整套融合流程未搭建一体化多阶段防御体系。针对上述问题,北京交通大学张淳杰教授团队提出一种具备攻击感知能力的多模态融合模型,通过嵌入分层防御策略提升模型对抗鲁棒性。具体而言,在特征提取阶段引入预训练去噪自编码器,抑制输入图像噪声,输出清晰度更高、鲁棒性更强的特征表征;融合阶段设计攻击感知融合模块,动态估算各模态所含扰动强度,并自适应调整融合权重,降低不可靠模态输入的权重占比;模型训练阶段搭配对抗训练,进一步增强模型对各类攻击的抵御能力。各模块协同构成分层防御体系,提升模型整体稳定性。实验结果表明,在图像描述、语义分割、目标检测等主流视觉任务中,即便处于对抗攻击环境下,本文所提方法的鲁棒性表现显著优于现有基线方法。相关成果已发表于MIR 2026年第4期专题。

图片来自Springer
全文下载:
Countering Adversarial Attacks with Multimodal Image Fusion
Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang & Yao Zhao
https://link.springer.com/article/10.1007/s11633-025-1613-x
https://www.mi-research.net/article/doi/10.1007/s11633-025-1613-x

过去数年,人工智能系统在图像理解、内容生成、语义分割等任务上取得了显著进展。随着此类系统落地各类实际场景,对抗攻击已然成为威胁模型稳定性与安全性的主要风险来源。在单模态视觉任务中,即便向图像施加极其微小的扰动,也会大幅偏移模型的分类决策边界,造成精度与鲁棒性大幅衰减。学界虽已提出对抗训练、数据增广等方案用于提升模型抗攻击能力,但面对复杂多变的新型攻击时依旧防御失效。该现象的核心根源在于单模态输入信息本身存在固有信息缺失问题。
为克服单模态方案的上述缺陷,多模态信息融合成为近年来的研究热点。多模态融合系统整合多类传感器采集的数据(可见光相机、红外相机、深度相机等),或是语音、文本等不同模态信息,构建信息更完整、具备互补性的特征表征,以此提升模型在复杂环境下的鲁棒性与稳定性。例如自动驾驶领域,深度融合图像与激光雷达特征能够提升系统在恶劣工况及对抗攻击下的稳定运行能力;音视频相关任务中,融合音频与图像模态可提升感知精度,尤其在嘈杂环境下鲁棒性提升显著。现有研究证实,多模态融合能够充分利用各模态信息互补的特性,在提升感知精度的同时增强系统抵御对抗攻击的能力 (见图 1)。尽管如此,现有的多模态图像融合算法在对抗攻击防御层面仍存在诸多难题。如何有效融合异构模态数据、提升模型对抗鲁棒性,是当前亟待解决的研究难题。
图 1 多模态融合可提升模型抵御对抗扰动的鲁棒性。(a)(b) 两组子图表明,可见光、红外单模态图像在施加对抗扰动后,模型识别结果出现错误。与之对比,图 (c) 多模态融合输出结果可正确识别全部三个人,表明多模态信息融合能够增强模型的抗攻击能力。
现有多模态图像融合方法在抵御对抗攻击方面存在两大核心短板。第一,模型缺少攻击感知机制,无法精准识别并量化各模态遭受的扰动程度。这就导致融合阶段模型难以区分受扰动与未受扰动的数据源,只能对所有模态特征无差别融合。该方式会混入受损模态带来的误导性特征,同时掩盖干净模态中可靠的语义信息,最终造成模型整体鲁棒性下降。以 PAIF为例,该算法虽引入下游语义反馈以优化融合效果,但融合流程不具备攻击感知能力,极易被异常模态的错误信息干扰,进而损害系统整体性能。第二,现有方法大多仅采用单阶段防御机制,缺少覆盖完整融合流程的系统化鲁棒性框架。这类算法的防御设计多集中于模型训练或特征提取环节,很少考量融合阶段存在的模态差异与扰动传递问题,各阶段防御策略无法协同配合。例如 A2RNet通过引入对抗样本提升模型鲁棒性,但其防御机制仅适配特定类型扰动,不具备扰动感知与自适应调整能力,面对复杂攻击模式时防御效果十分有限。
为解决上述难题,本文提出一种融合攻击感知机制与分层防御策略的多模态融合模型。该模型在融合流程的特征提取、特征融合、模型训练三大关键阶段均嵌入针对性鲁棒性模块,构建端到端协同防御体系。各模块分别针对不同薄弱点设计,彼此互补协同,全方位提升模型整体对抗鲁棒性。具体实现方案如下:在特征提取阶段接入预训练去噪自编码器,抑制输入噪声,提升特征质量与固有鲁棒性;特征融合阶段设计攻击感知融合模块,动态评估各模态的扰动强度,并依据评估结果自适应调节融合权重,放大可靠模态的贡献、削弱易受攻击模态的影响;训练阶段采用对抗训练方案,引导模型学习抗干扰能力更强的特征表征。本文在图像描述、语义分割、目标检测等任务上开展大量对比实验,验证了所提方法具备更优越的综合性能。

本文的核心创新点总结如下:
1) 本文提出一种搭载分层防御策略、具备攻击感知能力的多模态融合模型。该模型在完整融合流程中集成三大组件:用于噪声抑制的去噪自编码器、实现权重自适应调节的攻击感知融合模块,以及用于提升整体鲁棒性的对抗训练策略。
2) 本文在图像描述、语义分割、目标检测等多项视觉任务上完成实验验证,证明该方法能够有效提升模型的对抗鲁棒性与泛化能力。
全文下载:
Countering Adversarial Attacks with Multimodal Image Fusion
Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang & Yao Zhao
https://link.springer.com/article/10.1007/s11633-025-1613-x
https://www.mi-research.net/article/doi/10.1007/s11633-025-1613-x
BibTex:
@Article {MIR-2025-06-276,
author={Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang, Yao Zhao},
journal={Machine Intelligence Research},
title={Countering Adversarial Attacks with Multimodal Image Fusion},
year={2026},
volume={23},
issue={4},
pages={916-930},
doi={10.1007/s11633-025-1613-x}}
北京交通大学
博士研究生
北京交通大学
教授
中国科学院信息工程研究所
研究员
中国科学院西安光学精密机械研究所
副研究员
北京交通大学
教授
特别感谢本文作者团队对以上内容的审阅和修改!
MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!
说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737
收件信息登记:
https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr
关于Machine Intelligence Research
Machine Intelligence Research(简称MIR)由中国科学院自动化研究所主办,于2022年正式出版。MIR立足国内、面向全球,着眼于服务国家战略需求,刊发机器智能领域最新原创研究性论文、综述、评论等,全面报道国际机器智能领域的基础理论和前沿创新研究成果,促进国际学术交流与学科发展,服务国家人工智能科技进步。期刊入选"中国科技期刊卓越行动计划",已被ESCI、EI、Scopus、中国科技核心期刊、CSCD等20余家国际数据库收录,入选图像图形领域期刊分级目录-T2级知名期刊。2022年首个CiteScore分值在计算机科学、工程、数学三大领域的八个子方向排名均跻身Q1区,最佳排名挺进Top 4%,2023年CiteScore分值继续跻身Q1区。2024年获得首个影响因子(IF) 6.4,位列人工智能及自动化&控制系统两个领域JCR Q1区;2026年发布的最新影响因子达10.0,继续跻身JCR Q1区,最佳排名进入全球第5名;2026年进入期刊分区表1区,最新CiteScore分值达17.8。
点击"阅读原文"下载全文
内容中包含的图片若涉及版权问题,请及时与我们联系删除










评论
沙发等你来抢