蓝底 2026最新版.jpg


Machine Intelligence Research

随着生成式人工智能快速发展,多模态感知在构建高鲁棒性智能系统中承担愈发关键的作用。多模态图像融合技术在抵御对抗扰动方面具备巨大潜力,但现有方案存在两大核心缺陷,导致防御效果薄弱:一是融合过程缺少攻击感知机制;二是整套融合流程未搭建一体化多阶段防御体系。针对上述问题,北京交通大学张淳杰教授团队提出一种具备攻击感知能力的多模态融合模型,通过嵌入分层防御策略提升模型对抗鲁棒性。具体而言,在特征提取阶段引入预训练去噪自编码器,抑制输入图像噪声,输出清晰度更高、鲁棒性更强的特征表征;融合阶段设计攻击感知融合模块,动态估算各模态所含扰动强度,并自适应调整融合权重,降低不可靠模态输入的权重占比;模型训练阶段搭配对抗训练,进一步增强模型对各类攻击的抵御能力。各模块协同构成分层防御体系,提升模型整体稳定性。实验结果表明,在图像描述、语义分割、目标检测等主流视觉任务中,即便处于对抗攻击环境下,本文所提方法的鲁棒性表现显著优于现有基线方法。相关成果已发表于MIR 2026年第4期专题。



360截图20260813135354366.jpg

图片来自Springer



全文下载:

Countering Adversarial Attacks with Multimodal Image Fusion

Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang & Yao Zhao

https://link.springer.com/article/10.1007/s11633-025-1613-x

https://www.mi-research.net/article/doi/10.1007/s11633-025-1613-x


全文导读



过去数年,人工智能系统在图像理解、内容生成、语义分割等任务上取得了显著进展。随着此类系统落地各类实际场景,对抗攻击已然成为威胁模型稳定性与安全性的主要风险来源。在单模态视觉任务中,即便向图像施加极其微小的扰动,也会大幅偏移模型的分类决策边界,造成精度与鲁棒性大幅衰减。学界虽已提出对抗训练、数据增广等方案用于提升模型抗攻击能力,但面对复杂多变的新型攻击时依旧防御失效。该现象的核心根源在于单模态输入信息本身存在固有信息缺失问题。


为克服单模态方案的上述缺陷,多模态信息融合成为近年来的研究热点。多模态融合系统整合多类传感器采集的数据(可见光相机、红外相机、深度相机等),或是语音、文本等不同模态信息,构建信息更完整、具备互补性的特征表征,以此提升模型在复杂环境下的鲁棒性与稳定性。例如自动驾驶领域,深度融合图像与激光雷达特征能够提升系统在恶劣工况及对抗攻击下的稳定运行能力;音视频相关任务中,融合音频与图像模态可提升感知精度,尤其在嘈杂环境下鲁棒性提升显著。现有研究证实,多模态融合能够充分利用各模态信息互补的特性,在提升感知精度的同时增强系统抵御对抗攻击的能力 (见图 1)。尽管如此,现有的多模态图像融合算法在对抗攻击防御层面仍存在诸多难题。如何有效融合异构模态数据、提升模型对抗鲁棒性,是当前亟待解决的研究难题。


360截图20260813142323847.jpg 图 1 多模态融合可提升模型抵御对抗扰动的鲁棒性。(a)(b) 两组子图表明,可见光、红外单模态图像在施加对抗扰动后,模型识别结果出现错误。与之对比,图 (c) 多模态融合输出结果可正确识别全部三个人,表明多模态信息融合能够增强模型的抗攻击能力。


现有多模态图像融合方法在抵御对抗攻击方面存在两大核心短板。第一,模型缺少攻击感知机制,无法精准识别并量化各模态遭受的扰动程度。这就导致融合阶段模型难以区分受扰动与未受扰动的数据源,只能对所有模态特征无差别融合。该方式会混入受损模态带来的误导性特征,同时掩盖干净模态中可靠的语义信息,最终造成模型整体鲁棒性下降。以 PAIF为例,该算法虽引入下游语义反馈以优化融合效果,但融合流程不具备攻击感知能力,极易被异常模态的错误信息干扰,进而损害系统整体性能。第二,现有方法大多仅采用单阶段防御机制,缺少覆盖完整融合流程的系统化鲁棒性框架。这类算法的防御设计多集中于模型训练或特征提取环节,很少考量融合阶段存在的模态差异与扰动传递问题,各阶段防御策略无法协同配合。例如 A2RNet通过引入对抗样本提升模型鲁棒性,但其防御机制仅适配特定类型扰动,不具备扰动感知与自适应调整能力,面对复杂攻击模式时防御效果十分有限。


为解决上述难题,本文提出一种融合攻击感知机制与分层防御策略的多模态融合模型。该模型在融合流程的特征提取、特征融合、模型训练三大关键阶段均嵌入针对性鲁棒性模块,构建端到端协同防御体系。各模块分别针对不同薄弱点设计,彼此互补协同,全方位提升模型整体对抗鲁棒性。具体实现方案如下:在特征提取阶段接入预训练去噪自编码器,抑制输入噪声,提升特征质量与固有鲁棒性;特征融合阶段设计攻击感知融合模块,动态评估各模态的扰动强度,并依据评估结果自适应调节融合权重,放大可靠模态的贡献、削弱易受攻击模态的影响;训练阶段采用对抗训练方案,引导模型学习抗干扰能力更强的特征表征。本文在图像描述、语义分割、目标检测等任务上开展大量对比实验,验证了所提方法具备更优越的综合性能。



核心创新点



本文的核心创新点总结如下:

1) 本文提出一种搭载分层防御策略、具备攻击感知能力的多模态融合模型。该模型在完整融合流程中集成三大组件:用于噪声抑制的去噪自编码器、实现权重自适应调节的攻击感知融合模块,以及用于提升整体鲁棒性的对抗训练策略。

2) 本文在图像描述、语义分割、目标检测等多项视觉任务上完成实验验证,证明该方法能够有效提升模型的对抗鲁棒性与泛化能力。






全文下载:

Countering Adversarial Attacks with Multimodal Image Fusion

Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang & Yao Zhao

https://link.springer.com/article/10.1007/s11633-025-1613-x

https://www.mi-research.net/article/doi/10.1007/s11633-025-1613-x

BibTex:

@Article {MIR-2025-06-276,

author={Dong Yu, Chunjie Zhang, Xiaoyu Zhang, Gaopeng Zhang, Yao Zhao},

journal={Machine Intelligence Research},

title={Countering Adversarial Attacks with Multimodal Image Fusion},

year={2026},

volume={23},

issue={4},

pages={916-930},

doi={10.1007/s11633-025-1613-x}}




作者团队


余东

北京交通大学

博士研究生

张淳杰

北京交通大学

教授

张晓宇

中国科学院信息工程研究所

研究员

张高鹏

中国科学院西安光学精密机械研究所

副研究员











赵耀

北京交通大学

教授


特别感谢本文作者团队对以上内容的审阅和修改!





 END 





纸刊免费寄送
Machine Intelligence Research

MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!

说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737

收件信息登记:

https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr





关于Machine Intelligence Research

Machine Intelligence Research(简称MIR)由中国科学院自动化研究所主办,于2022年正式出版。MIR立足国内、面向全球,着眼于服务国家战略需求,刊发机器智能领域最新原创研究性论文、综述、评论等,全面报道国际机器智能领域的基础理论和前沿创新研究成果,促进国际学术交流与学科发展,服务国家人工智能科技进步。期刊入选"中国科技期刊卓越行动计划",已被ESCI、EI、Scopus、中国科技核心期刊、CSCD等20余家国际数据库收录,入选图像图形领域期刊分级目录-T2级知名期刊。2022年首个CiteScore分值在计算机科学、工程、数学三大领域的八个子方向排名均跻身Q1区,最佳排名挺进Top 4%,2023年CiteScore分值继续跻身Q1区。2024年获得首个影响因子(IF) 6.4,位列人工智能及自动化&控制系统两个领域JCR Q1区;2026年发布的最新影响因子达10.0,继续跻身JCR Q1区,最佳排名进入全球第5名;2026年进入期刊分区表1区,最新CiteScore分值达17.8。



往期目录
2026年第4期 | 特约专题: 生成式人工智能的安全与伦理
2026年第3期 | 可信 AI、SAM 视觉大模型、智能机器人等
2026年第2期 | 特约专题: 微视觉计算
2026年第1期 | 自我中心视觉、基于图的推荐系统、智能结肠镜检查、多模态大语言模型......
2025年第6期 | 大语言模型、自动驾驶、医学图像分割……
2025年第5期 | 生成式模型、疾病诊断、步态识别、行人再识别......
2025年第4期 | 特约专题: 具身智能
2025年第3期 | 大语言模型、医学图像分割、图像阴影去除、写作风格变化检测......
2025年第2期 | 常识知识获取、图因子分解机、横向联邦学习、分层强化学习...
2025年第1期 | 机器视觉、机器人、神经网络、反事实学习、小样本信息网络...
2024年第6期 | 图神经网络,卷积神经网络,生物识别技术...
2024年第5期 | 大语言模型,无人系统,统一分类与拒识...
2024年第4期 | 特约专题: 多模态表征学习
2024年第3期 | 分布式深度强化学习,知识图谱,推荐系统,3D视觉,联邦学习...
2024年第2期 | 大语言模型、零信任架构、常识知识推理、肿瘤自动检测和定位...
2024年第1期 | 特约专题: AI for Art



好文推荐
澳门理工大学袁小晨团队 | 潜域印记: 面向潜扩散模型的鲁棒模型水印方案
自动化所&UCL等合作综述 | 基于视觉语言模型的具身智能安全
西班牙格拉纳达大学 | X-SHIELD: 面向可解释人工智能的正则化方法
哈工大江俊君团队 | 综述: 基于深度学习的人脸视频修复技术
上海交通大学夏泽洋教授团队 | 基于深度学习的口腔正畸自动化治疗规划
NeurIPS'25竞赛评述 | 面向AI生成人脸检测的公平性竞赛: 方法与实验结果
专题综述: 微手势识别的数据集、方法与挑战 | 哈尔滨工业大学(深圳)徐勇团队
大湾区大学余梓彤团队 | 专题综述: 多模态欺骗检测
悉尼科技大学等团队 | 用于裂缝检测的高性能视觉特征提取自监督模型DinoV2
电子科大李宏亮团队 | 第一视角视觉:挑战与发展趋势综述
南开大学范登平团队 | 智驱结肠镜:技术变革与前沿洞察
上海交通大学夏泽洋教授团队 | 基于半监督学习的心脏磁共振影像动态特征分类
精选好文 | 基于多模态学习的非酒精性脂肪肝病预测
南京大学Kai Ming Ting团队 | 综述:基于孤立机制的异常检测研究
南洋理工大学肖佳平 等 | 基于深度强化学习的异构机器人系统目标搜索与导航
南开大学程明明团队 | MCANet:基于多尺度交叉轴注意力的医学图像分割
自动化所吴书 等 | GraphFM: 用于特征交互建模的图因子分解机
香港理工大学周立培团队等 | 综述: 面向以物体为中心的机器人操作的具身学习
清华大学朱军团队 | DPM-Solver++:用于扩散概率模型引导采样的快速求解器
南航张道强团队 | 综述:基于脑电信号与机器学习的注意力检测研究
可信图神经网络的全面综述:隐私性、鲁棒性、公平性和可解释性
哈工大江俊君团队 | SCNet:利用全1X1卷积实现轻量图像超分辨率
自动化所刘成林团队 | 统一分类与拒识: 一种一对多框架
上海交大张拳石团队 | 综述: 基于博弈交互理论的神经网络可解释性研究
专题好文 | 再思考人群计数中的全局上下文
专题好文 | Luc Van Gool团队: 基于分层注意力的视觉Transformer
浙江大学孔祥维团队 | 综述: 迈向真正以人为本的XAI
澳大利亚国立大学Nick Barnes团队 | 对息肉分割的再思考: 从分布外视角展开
前沿观点 | Segment Anything并非一直完美: SAM模型在不同真实场景中的应用调查
精选好文 | 推荐系统的波纹知识图谱卷积网络
复旦邱锡鹏团队 | MOSS: 一个开源的对话式大语言模型
自动化所黄凯奇团队 | 分布式深度强化学习:综述与多玩家多智能体学习工具箱
约翰霍普金斯大学Alan Yuille团队 | 从时序和高维数据中定位肿瘤的弱标注方法
专题综述 | 大语言模型中的知识生命周期
精选综述 | 零信任架构的自动化和编排: 潜在解决方案与挑战
欧洲科学院院士蒋田仔团队 | 脑成像数据的多模态融合: 方法与应用
金耀初团队&郑锋团队 | 综述: 深度工业图像异常检测
专题好文 | 创新视听内容的联合创作: 计算机艺术面临的新挑战



MIR资讯
IF=10, 全球第5名!MIR影响因子迈上新台阶
全球前1%, 学科第2!MIR最新CiteScore节节攀升
编委范登平 | 从论文首秀到最佳论文: 一位“野生”学者的科研进阶实录
对话优博·第3期 | 博士生如何做好系统性科研?
对话优博 · 第2期 | 读博那些事儿
对话优博·第1期 | 如何从保研小白成长为CCF优博?
MIR高下载Top文章集锦(2024-2025年)
MIR高被引Top10文章集锦 (2024-2025年)
2026年 AI 领域国际学术会议参考列表 (含8大方向,附PDF)
MIR优秀编委 & 优秀审稿人 (2025年度)
MIR致谢审稿人 (2025年度)
进阶前5%!MIR登榜”中国最具国际影响力学术期刊”
影响因子全球第6名!MIR稳步进军世界一流期刊行列
喜报 | MIR 首次入选中科院期刊分区表计算机科学类二区
喜报!MIR入选中国科技期刊卓越行动计划二期项目
特别提醒!请认准MIR官方渠道,谨防受骗
前进20名!MIR再度跻身国际影响力TOP期刊榜单
喜报 | MIR入选图像图形领域 T2级 “知名期刊”!
喜报 | MIR被 ESCI 收录!
喜报 | MIR 被 EI 与 Scopus 数据库收录

点击"阅读原文"下载全文

内容中包含的图片若涉及版权问题,请及时与我们联系删除