Machine Intelligence Research
具身智能将视觉语言模型与面向动作执行的能力相结合,为自主系统带来了变革性的发展潜力。但将视觉语言模型部署至自动驾驶汽车、协作机器人等安全关键型应用场景时,会催生诸多严峻难题。其中最突出的风险为对抗攻击与内容篡改:攻击者刻意篡改图像或文本输入信息,极易造成具身智能系统产生认知偏差,进而触发危险的执行动作。除此之外,视觉语言模型嵌入智能体后会进一步放大安全隐患——实体智能体在真实物理环境中交互时会面临各类高风险复杂工况,感知、决策环节的任何失误都会立刻引发严重的现实危害。视觉语言模型虽加剧了具身智能的安全管控压力,却也为构建防护方案、提升具身智能系统可靠性提供了底层支撑。与此同时,依托视觉语言模型搭建的具身智能体系还衍生出一系列伦理难题,集中体现在责任界定、模型固有偏见、社会岗位替代等层面。自动化所及伦敦大学学院等单位合作、系统梳理了现有落地应用、各类安全风险、现有防护手段以及相关伦理影响,并据此提出可信具身智能体系的后续研究方向。相关成果已发表于MIR 2026年第4期专题。

图片来自Springer
全文下载:
Embodied Intelligence Security with Vision-language Models: A Survey
Junxian Duan, Haisu Zhu, Canhui Liu, Shiyi Li, Xiangyun Tang & Yingxue Wang

具身智能旨在研发可与环境开展目的性物理交互的智能体。不同于纯计算式人工智能,机器人、自动驾驶车辆等各类具身智能系统,能够在复杂、动态且时常具备不确定性的物理世界中打通感知、认知与行动三者间的壁垒。这种物理执行能力与认知能力的融合,被学界普遍视作迈向通用人工智能(AGI)的关键一环。
视觉语言模型(VLMs)依托海量图文数据集完成训练,在视觉解析、自然语言理解以及多模态推理方面表现出优异性能。在此基础上,视觉-语言-动作模型(VLAs)应运而生,该类模型能够依据视觉感知信息与语言指令输出机器人动作指令。此类模型融合了感知模块(如 ViT、ResNet网络)、基于大语言模型实现的语言理解模块,以及负责底层控制信号、高层行为规划输出的动作生成模块,让机器人可在各类环境中完成多样化、具备泛化能力的作业行为。正因如此,视觉语言模型与视觉-语言-动作模型被大量集成至具身智能系统中,借助场景解析、目标导向推理、语言驱动执行以及人性化交互机制,为系统的环境感知、任务规划、指令遵从与人机交互功能提供底层支撑。
尽管视觉语言模型、视觉语言动作模型具备颠覆性的应用潜力,将二者嵌入具身智能系统会带来严峻的安全难题。运行于真实物理场景中的机器人本身就属于安全关键系统。一旦系统出现任意一类故障,例如对视觉场景、语言指令产生误判、输出危险的动作序列、推理时延过高,或是易遭受对抗操控攻击,均会引发严重后果,轻则造成财产损毁、任务失败,重则引发人身伤害。大模型本身具备概率化输出特性,且决策过程普遍存在黑箱不可解释问题,进一步加剧了各类安全隐患,难以保障系统运行的可靠性与可预测性。
本综述围绕视觉语言模型与具身智能的交叉领域,全面梳理该方向核心安全问题,重点剖析模型幻觉、数据伪造、隐私泄露、对抗攻击以及人机交互安全五大模块。文章详述了视觉语言模型现阶段的落地应用模式,系统分析了该类模型诱发的各类安全风险,同时探究其本身用于安全防护的正向价值。与此同时,本文阐释了视觉语言模型所具备的语义锚定、多模态对齐、上下文推理等能力,如何主动提升具身系统的安全性与决策可解释性。行文全程融入公平性、责任界定、人类信任度等维度的伦理问题分析。本文通过凝练出一批具备较高研究价值的前沿方向,以期构建安全、稳定、可信的视觉语言模型驱动型具身智能系统,推动具身智能领域规范化、严谨化的科研发展。
第2章首先阐述视觉语言模型在具身智能系统中的集成方式,重点介绍其在感知、规划、指令解析与人机交互环节承担的功能。第3章继而分析系统在可靠性、鲁棒性以及非预期行为方面显现的各类新兴安全风险。在此基础上,第4章依托视觉语言模型自身在上下文理解、多模态推理层面的固有优势,梳理了各类风险缓解方案。第5章进一步探讨更广范畴下的伦理问题,涵盖责任划分、决策透明性与人的监管机制。第6章提炼核心研究观点并指明未来研究方向,第7章对全文进行总结。总而言之,视觉语言模型的嵌入虽催生了全新的安全与伦理问题,也为打造更智能、行为合规可控的具身智能系统提供了广阔的发展前景。本文后续章节的整体架构如图1所示。

图1 具身智能中视觉语言模型集成方案与安全防护策略总览
全文下载:
Embodied Intelligence Security with Vision-language Models: A Survey
Junxian Duan, Haisu Zhu, Canhui Liu, Shiyi Li, Xiangyun Tang & Yingxue Wang
https://link.springer.com/article/10.1007/s11633-025-1626-x
BibTex:
@Article{MIR-2025-06-363,
author={Junxian Duan, Haisu Zhu, Canhui Liu, Shiyi Li, Xiangyun Tang, Yingxue Wang},
journal={Machine Intelligence Research},
title={Embodied Intelligence Security with Vision-language Models: A Survey},
year={2026},
volume={23},
issue={4},
pages={746-769},
doi={10.1007/s11633-025-1626-x}}
中国科学院自动化研究所
助理研究员
中国科学院自动化研究所
硕士研究生
伦敦大学学院
讲师(助理教授)
中央民族大学
硕士研究生
中央民族大学
副教授
中国电子科技集团公司电子科学研究院
高级工程师
特别感谢本文作者团队对以上内容的审阅和修改!
MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!
说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737
收件信息登记:
https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr
关于Machine Intelligence Research
Machine Intelligence Research(简称MIR)由中国科学院自动化研究所主办,于2022年正式出版。MIR立足国内、面向全球,着眼于服务国家战略需求,刊发机器智能领域最新原创研究性论文、综述、评论等,全面报道国际机器智能领域的基础理论和前沿创新研究成果,促进国际学术交流与学科发展,服务国家人工智能科技进步。期刊入选"中国科技期刊卓越行动计划",已被ESCI、EI、Scopus、中国科技核心期刊、CSCD等20余家国际数据库收录,入选图像图形领域期刊分级目录-T2级知名期刊。2022年首个CiteScore分值在计算机科学、工程、数学三大领域的八个子方向排名均跻身Q1区,最佳排名挺进Top 4%,2023年CiteScore分值继续跻身Q1区。2024年获得首个影响因子(IF) 6.4,位列人工智能及自动化&控制系统两个领域JCR Q1区;2026年发布的最新影响因子达10.0,继续跻身JCR Q1区,最佳排名进入全球第5名;2026年进入期刊分区表1区,最新CiteScore分值达17.8。
点击"阅读原文"下载全文
内容中包含的图片若涉及版权问题,请及时与我们联系删除











评论
沙发等你来抢