蓝底 2026最新版.jpg


Machine Intelligence Research

具身智能将视觉语言模型与面向动作执行的能力相结合,为自主系统带来了变革性的发展潜力。但将视觉语言模型部署至自动驾驶汽车、协作机器人等安全关键型应用场景时,会催生诸多严峻难题。其中最突出的风险为对抗攻击与内容篡改:攻击者刻意篡改图像或文本输入信息,极易造成具身智能系统产生认知偏差,进而触发危险的执行动作。除此之外,视觉语言模型嵌入智能体后会进一步放大安全隐患——实体智能体在真实物理环境中交互时会面临各类高风险复杂工况,感知、决策环节的任何失误都会立刻引发严重的现实危害。视觉语言模型虽加剧了具身智能的安全管控压力,却也为构建防护方案、提升具身智能系统可靠性提供了底层支撑。与此同时,依托视觉语言模型搭建的具身智能体系还衍生出一系列伦理难题,集中体现在责任界定、模型固有偏见、社会岗位替代等层面。自动化所及伦敦大学学院等单位合作、系统梳理了现有落地应用、各类安全风险、现有防护手段以及相关伦理影响,并据此提出可信具身智能体系的后续研究方向。相关成果已发表于MIR 2026年第4期专题



Springer截图.jpg

图片来自Springer



全文下载:

Embodied Intelligence Security with Vision-language Models: A Survey

Junxian Duan, Haisu Zhu, Canhui Liu, Shiyi Li, Xiangyun Tang & Yingxue Wang

https://link.springer.com/article/10.1007/s11633-025-1626-x


全文导读



具身智能旨在研发可与环境开展目的性物理交互的智能体。不同于纯计算式人工智能,机器人、自动驾驶车辆等各类具身智能系统,能够在复杂、动态且时常具备不确定性的物理世界中打通感知、认知与行动三者间的壁垒。这种物理执行能力与认知能力的融合,被学界普遍视作迈向通用人工智能(AGI)的关键一环。


视觉语言模型(VLMs)依托海量图文数据集完成训练,在视觉解析、自然语言理解以及多模态推理方面表现出优异性能。在此基础上,视觉-语言-动作模型(VLAs)应运而生,该类模型能够依据视觉感知信息与语言指令输出机器人动作指令。此类模型融合了感知模块(如 ViT、ResNet网络)、基于大语言模型实现的语言理解模块,以及负责底层控制信号、高层行为规划输出的动作生成模块,让机器人可在各类环境中完成多样化、具备泛化能力的作业行为。正因如此,视觉语言模型与视觉-语言-动作模型被大量集成至具身智能系统中,借助场景解析、目标导向推理、语言驱动执行以及人性化交互机制,为系统的环境感知、任务规划、指令遵从与人机交互功能提供底层支撑。


尽管视觉语言模型、视觉语言动作模型具备颠覆性的应用潜力,将二者嵌入具身智能系统会带来严峻的安全难题。运行于真实物理场景中的机器人本身就属于安全关键系统。一旦系统出现任意一类故障,例如对视觉场景、语言指令产生误判、输出危险的动作序列、推理时延过高,或是易遭受对抗操控攻击,均会引发严重后果,轻则造成财产损毁、任务失败,重则引发人身伤害。大模型本身具备概率化输出特性,且决策过程普遍存在黑箱不可解释问题,进一步加剧了各类安全隐患,难以保障系统运行的可靠性与可预测性。


本综述围绕视觉语言模型与具身智能的交叉领域,全面梳理该方向核心安全问题,重点剖析模型幻觉、数据伪造、隐私泄露、对抗攻击以及人机交互安全五大模块。文章详述了视觉语言模型现阶段的落地应用模式,系统分析了该类模型诱发的各类安全风险,同时探究其本身用于安全防护的正向价值。与此同时,本文阐释了视觉语言模型所具备的语义锚定、多模态对齐、上下文推理等能力,如何主动提升具身系统的安全性与决策可解释性。行文全程融入公平性、责任界定、人类信任度等维度的伦理问题分析。本文通过凝练出一批具备较高研究价值的前沿方向,以期构建安全、稳定、可信的视觉语言模型驱动型具身智能系统,推动具身智能领域规范化、严谨化的科研发展。


第2章首先阐述视觉语言模型在具身智能系统中的集成方式,重点介绍其在感知、规划、指令解析与人机交互环节承担的功能。第3章继而分析系统在可靠性、鲁棒性以及非预期行为方面显现的各类新兴安全风险。在此基础上,第4章依托视觉语言模型自身在上下文理解、多模态推理层面的固有优势,梳理了各类风险缓解方案。第5章进一步探讨更广范畴下的伦理问题,涵盖责任划分、决策透明性与人的监管机制。第6章提炼核心研究观点并指明未来研究方向,第7章对全文进行总结。总而言之,视觉语言模型的嵌入虽催生了全新的安全与伦理问题,也为打造更智能、行为合规可控的具身智能系统提供了广阔的发展前景。本文后续章节的整体架构如图1所示。


360截图20260731103111484.jpg

图1 具身智能中视觉语言模型集成方案与安全防护策略总览






全文下载:

Embodied Intelligence Security with Vision-language Models: A Survey

Junxian Duan, Haisu Zhu, Canhui Liu, Shiyi Li, Xiangyun Tang & Yingxue Wang

https://link.springer.com/article/10.1007/s11633-025-1626-x

BibTex:

@Article{MIR-2025-06-363,

author={Junxian Duan, Haisu Zhu, Canhui Liu, Shiyi Li, Xiangyun Tang, Yingxue Wang},

journal={Machine Intelligence Research},

title={Embodied Intelligence Security with Vision-language Models: A Survey},

year={2026},

volume={23},

issue={4},

pages={746-769},

doi={10.1007/s11633-025-1626-x}}




作者团队


段俊贤

中国科学院自动化研究所

助理研究员

朱海粟

中国科学院自动化研究所

硕士研究生

刘灿辉

伦敦大学学院

讲师(助理教授)

李施怡

中央民族大学

硕士研究生











唐湘云

中央民族大学

副教授

王迎雪

中国电子科技集团公司电子科学研究院

高级工程师


特别感谢本文作者团队对以上内容的审阅和修改!






 END 





纸刊免费寄送
Machine Intelligence Research

MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!

说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737

收件信息登记:

https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr





关于Machine Intelligence Research


Machine Intelligence Research(简称MIR)由中国科学院自动化研究所主办,于2022年正式出版。MIR立足国内、面向全球,着眼于服务国家战略需求,刊发机器智能领域最新原创研究性论文、综述、评论等,全面报道国际机器智能领域的基础理论和前沿创新研究成果,促进国际学术交流与学科发展,服务国家人工智能科技进步。期刊入选"中国科技期刊卓越行动计划",已被ESCI、EI、Scopus、中国科技核心期刊、CSCD等20余家国际数据库收录,入选图像图形领域期刊分级目录-T2级知名期刊。2022年首个CiteScore分值在计算机科学、工程、数学三大领域的八个子方向排名均跻身Q1区,最佳排名挺进Top 4%,2023年CiteScore分值继续跻身Q1区。2024年获得首个影响因子(IF) 6.4,位列人工智能及自动化&控制系统两个领域JCR Q1区;2026年发布的最新影响因子达10.0,继续跻身JCR Q1区,最佳排名进入全球第5名;2026年进入期刊分区表1区,最新CiteScore分值达17.8。



往期目录
2026年第4期 | 特约专题: 生成式人工智能的安全与伦理
2026年第3期 | 可信 AI、SAM 视觉大模型、智能机器人等
2026年第2期 | 特约专题: 微视觉计算
2026年第1期 | 自我中心视觉、基于图的推荐系统、智能结肠镜检查、多模态大语言模型......
2025年第6期 | 大语言模型、自动驾驶、医学图像分割……
2025年第5期 | 生成式模型、疾病诊断、步态识别、行人再识别......
2025年第4期 | 特约专题: 具身智能
2025年第3期 | 大语言模型、医学图像分割、图像阴影去除、写作风格变化检测......
2025年第2期 | 常识知识获取、图因子分解机、横向联邦学习、分层强化学习...
2025年第1期 | 机器视觉、机器人、神经网络、反事实学习、小样本信息网络...
2024年第6期 | 图神经网络,卷积神经网络,生物识别技术...
2024年第5期 | 大语言模型,无人系统,统一分类与拒识...
2024年第4期 | 特约专题: 多模态表征学习
2024年第3期 | 分布式深度强化学习,知识图谱,推荐系统,3D视觉,联邦学习...
2024年第2期 | 大语言模型、零信任架构、常识知识推理、肿瘤自动检测和定位...
2024年第1期 | 特约专题: AI for Art



好文推荐
西班牙格拉纳达大学 | X-SHIELD: 面向可解释人工智能的正则化方法
哈工大江俊君团队 | 综述: 基于深度学习的人脸视频修复技术
上海交通大学夏泽洋教授团队 | 基于深度学习的口腔正畸自动化治疗规划
NeurIPS'25竞赛评述 | 面向AI生成人脸检测的公平性竞赛: 方法与实验结果
专题综述: 微手势识别的数据集、方法与挑战 | 哈尔滨工业大学(深圳)徐勇团队
大湾区大学余梓彤团队 | 专题综述: 多模态欺骗检测
悉尼科技大学等团队 | 用于裂缝检测的高性能视觉特征提取自监督模型DinoV2
电子科大李宏亮团队 | 第一视角视觉:挑战与发展趋势综述
南开大学范登平团队 | 智驱结肠镜:技术变革与前沿洞察
上海交通大学夏泽洋教授团队 | 基于半监督学习的心脏磁共振影像动态特征分类
精选好文 | 基于多模态学习的非酒精性脂肪肝病预测
南京大学Kai Ming Ting团队 | 综述:基于孤立机制的异常检测研究
南洋理工大学肖佳平 等 | 基于深度强化学习的异构机器人系统目标搜索与导航
南开大学程明明团队 | MCANet:基于多尺度交叉轴注意力的医学图像分割
自动化所吴书 等 | GraphFM: 用于特征交互建模的图因子分解机
香港理工大学周立培团队等 | 综述: 面向以物体为中心的机器人操作的具身学习
清华大学朱军团队 | DPM-Solver++:用于扩散概率模型引导采样的快速求解器
南航张道强团队 | 综述:基于脑电信号与机器学习的注意力检测研究
可信图神经网络的全面综述:隐私性、鲁棒性、公平性和可解释性
哈工大江俊君团队 | SCNet:利用全1X1卷积实现轻量图像超分辨率
自动化所刘成林团队 | 统一分类与拒识: 一种一对多框架
上海交大张拳石团队 | 综述: 基于博弈交互理论的神经网络可解释性研究
专题好文 | 再思考人群计数中的全局上下文
专题好文 | Luc Van Gool团队: 基于分层注意力的视觉Transformer
浙江大学孔祥维团队 | 综述: 迈向真正以人为本的XAI
澳大利亚国立大学Nick Barnes团队 | 对息肉分割的再思考: 从分布外视角展开
前沿观点 | Segment Anything并非一直完美: SAM模型在不同真实场景中的应用调查
精选好文 | 推荐系统的波纹知识图谱卷积网络
复旦邱锡鹏团队 | MOSS: 一个开源的对话式大语言模型
自动化所黄凯奇团队 | 分布式深度强化学习:综述与多玩家多智能体学习工具箱
约翰霍普金斯大学Alan Yuille团队 | 从时序和高维数据中定位肿瘤的弱标注方法
专题综述 | 大语言模型中的知识生命周期
精选综述 | 零信任架构的自动化和编排: 潜在解决方案与挑战
欧洲科学院院士蒋田仔团队 | 脑成像数据的多模态融合: 方法与应用
金耀初团队&郑锋团队 | 综述: 深度工业图像异常检测
专题好文 | 创新视听内容的联合创作: 计算机艺术面临的新挑战



MIR资讯
IF=10, 全球第5名!MIR影响因子迈上新台阶
全球前1%, 学科第2!MIR最新CiteScore节节攀升
编委范登平 | 从论文首秀到最佳论文: 一位“野生”学者的科研进阶实录
对话优博·第3期 | 博士生如何做好系统性科研?
对话优博 · 第2期 | 读博那些事儿
对话优博·第1期 | 如何从保研小白成长为CCF优博?
MIR高下载Top文章集锦(2024-2025年)
MIR高被引Top10文章集锦 (2024-2025年)
2026年 AI 领域国际学术会议参考列表 (含8大方向,附PDF)
MIR优秀编委 & 优秀审稿人 (2025年度)
MIR致谢审稿人 (2025年度)
进阶前5%!MIR登榜”中国最具国际影响力学术期刊”
影响因子全球第6名!MIR稳步进军世界一流期刊行列
喜报 | MIR 首次入选中科院期刊分区表计算机科学类二区
喜报!MIR入选中国科技期刊卓越行动计划二期项目
特别提醒!请认准MIR官方渠道,谨防受骗
前进20名!MIR再度跻身国际影响力TOP期刊榜单
喜报 | MIR入选图像图形领域 T2级 “知名期刊”!
喜报 | MIR被 ESCI 收录!
喜报 | MIR 被 EI 与 Scopus 数据库收录

点击"阅读原文"下载全文

内容中包含的图片若涉及版权问题,请及时与我们联系删除