当前具身大模型快速涌现,Demo展示多姿多彩,各类榜单层出不穷,但模型真实能力到底如何,仿真结果能否准确映射真机性能,掌握抓取、放置等基础原子技能能否支撑复杂任务,数据规模与质量哪个更具效益,参数量越大是否意味着模型越强等问题均无定论。这背后折射出具身智能长期缺乏一座连接仿真与真机、基础能力与真实任务的统一标尺。821日,智源研究院发布FlagEval-Robo具身智能评测体系,推出FlagEval-Robo-SimFlagEval-Robo-Real两大榜单,旨在通过科学、客观、真实的评测,为具身模型从仿真能力到真实任务表现建立统一的衡量尺度。

用“仿真+真机”统一标尺,FlagEval-Robo给出12个开源模型真实能力画像

当前单独具身仿真评测和单独真机评测都存在局限性,且评测标准不统一,无法横向比较。为此智源研究院构建“仿真筛选 + 真机验证”的双轨评测体系,仿真评测(FlagEval-Robo-Sim)聚焦“效率与可复现”,真机评测(FlagEval-Robo-Real)聚焦“真实与可拆解”,两者互补,深度洞察模型真实能力。本次评测公开12个开源模型的结果,所有模型都在评测数据集上进行了平等的后训练。

(一)FlagEval-Robo-Sim榜单

针对不同Benchmark单独进行SFT,使用4个Benchmark任务成功率的算术平均进行排名。其中评测维度包括:LIBERO代表简单任务(桌面操作)、VLA-Arena代表安全、ManiSkill代表精细操作、RoboCasa代表长程任务,组成多维度评测基准体系,在高度对齐前提下进行客观公正的仿真评测。

训练时间说明:采用GPU-hours指标,即训练模型采用的显卡数量×训练时长。所有模型采用相同型号的AI加速卡。

DreamZero说明:由于只有两个Benchmark的结果,不参与排名。训练时间为2个公布的Benchmark训练耗时。

(二)FlagEval-Robo-Real榜单
针对不同真机环境的Benchmark单独进行SFT,使用模型在原子技能和组合任务上的PSR(过程成功率)指标的平均值进行排名。评测维度包括:基于ATOM-Bench ,先将复杂桌面任务拆解为两类原子技能(原子动作和原子指令),进行基础能力评测。然后再测试模型由“单一技能”到“复杂组合任务”迁移能力。

模型列表说明:考虑到真机评测的成本,真机榜单模型列表是仿真榜单的子集。

评测指标说明:SR为任务成功率;PSR为任务过程成功率,即任务完成部分的占比;CFS为组合失败占比,CFS越高代表失败越多来自「组合」环节而非原子技能本身,并非「越高越好」。

原子技能说明:原子动作如抓、放、推、倒、开合、定位等,原子指令如颜色、位置、对象、关系等。

四大核心发现:重新认识具身大模型真实能力

本次评测系统评估了12个开源具身模型,四大核心发现挑战固有认知:仿真高估明显,从仿真到真机性能最高降至七成、最低仅余13%;组合泛化困难,单一技能难以应对复杂任务,组合成功率最高仅16.7%;数据“求精”优于“堆量”,高质量真机数据才是性能提升的“黄金口粮”;结构胜于参数量,具身智能尚未迎来Scaling Law,模型架构成为决定性因素。

核心发现一:仿真到真机,性能最高“打七折”,最低仅剩13%

通过对比仿真和真机榜单可发现,模型在仿真环境中的桌面简单任务上表现良好,但到了真实环境的原子技能表现,性能大打折扣,仅达到仿真的24%~72%。如果换成双臂操作,性能还会进一步下降,约为13%~60%。

说明:LIBERO和真机的任务虽有所差异,不过整体都是桌面的简单操作任务,任务整体难度和相似性较高,因此具备一定的横向对比性。此外,上述表格中的对比数据都是后训练的数据。

从上述对比表格还可见,在仿真环境中性能差异不大的模型,在真机环境中表现差异可能会很大。比如,PI0.5、LingBot-VLA-V2、LingBot-VLA和GR00T N1.6等模型,在LIBERO上性能差异很小,但是到了真机环境,性能差异可达30%以上。这说明,相对简单的仿真评测基准已经接近饱和,已难以反映模型间的真实性能差异大小。

此外,从表格中Motus的仿真和真机表现来看,在仿真环境表现不够好的模型,在真机上表现未必不好。这也体现了目前具身模型的一个现状,仿真表现与真机表现之间不存在确定的线性关系。

综上深度洞察,仿真环境中的模型间差异趋势,整体上可以反映模型间的真实差异趋势,但无法准确反映模型间真实的水平差距大小,仿真结果会明显高估模型的能力。

核心发现二:ATOM-Bench首揭真相:原子技能学得再好,复杂任务也难“通关”

业界常好奇:具身模型一旦掌握了通用基础操作技能,是否就能自然而然地完成由这些技能组合而成的复杂任务?本次FlagEval-Robo-Real通过科学设计的ATOM-Bench评测基准,深度洞察得出了否定的答案。

说明:表中数据为在原子技能数据上训练学习后,直接用于组合任务(不在组合任务上训练)时的性能指标。SR为任务成功率;PSR为任务过程成功率,即任务完成部分的占比;CFS为组合失败占比,CFS越高代表失败越多来自「组合」环节而非原子技能本身,并非「越高越好」。

数据显示,直接组合泛化的最高成功率仅为16.7%,部分模型甚至从未成功。这明确表明,强原子技能并不能直接组合泛化到其他任务。

通过CFS指标和进一步深入分析发现,组合泛化不成功更多源于组合的衔接环节。比如抽屉任务就暴露了动作切换问题。模型单独练习时有时能拉开抽屉,但放进“打开抽屉取出物体放入篮子关闭抽屉”的完整任务后,经常在第一步就卡住;即使打开抽屉,夹爪也可能卡在把手中,无法退出并转向取物。

由此可见,将模型部署至真实场景时,必须使用真实任务数据进行训练,无法仅靠原子技能学习绕过。

核心发现三:数据既要“堆量”更要“求精”,高质量真机数据才是具身智能的黄金口粮

具身模型普遍面临数据匮乏,业界正积极利用网络视频、人类操作(ego数据)、仿真/合成等易获取数据扩充训练集。但这些数据究竟能带来多大增益,尚无权威结论。

FlagEval-Robo在榜单的基础上,进一步比较了模型训练数据的组成和规模。从数据可见,高质量的真机数据依然是提升模型性能的黄金口粮,数据质量比数据规模更加重要。比如,PI0.5仅用真机数据(质量最高的数据类型),并且数据量比部分其他模型更少,但综合表现却是最好的。

深入分析PI0.5的数据构成可见,其不仅全部采用真机数据,还在多样性上做了精细处理,进一步提升数据多样性和数据质量。因此,训练数据多样性和数据质量也是提升性能的重要法宝。

说明:△表示未披露,表中数据来源于开源论文或代码仓说明文档。

当然,除了数据质量,增加数据规模是否能带来性能增益呢?从上述表中数据可见,性能表现好的模型,通常采用了更大规模的数据集,数据规模达到1万小时以上。采用更少数据量的模型,比如MolmoAct2、OpenVLA-OFT、SmolVLA等,整体性能表现相对低一些。

核心发现四:Scaling Law在具身智能“失灵”?模型结构正成为比参数量更关键的胜负手

从榜单模型参数量来看,当前具身大模型的参数规模与性能并无直接线性关系,部分表现优异的模型参数量甚至小于表现较差的模型。这说明LLM中的Scaling Law尚未在具身大模型显现,参数量并非当前决定性能的关键变量。

此外,从模型结构层面看,大部分模型都采用“视觉语言理解主干+独立连续动作生成模块”,并普遍通过Flow Matching生成动作块。然而性能表现却有明显差异。深入分析发现,表现良好的PI0.5、LingBot-VLA-V2和ACoT-VLA分别加入了子任务、未来语义与深度、参考轨迹等中间监督,说明中间监督能够有效提升模型性能。

模型能力深度诊断

(一)动作块大小需因“任务”制宜

模型单次推理后连续执行的动作步数(action chunk size)对不同任务影响相反。短时序简单任务宜用短chunk,长时序复杂任务则长chunk效果更佳。LingBot-VLA为例,在三个短程任务中,将单次连续动作长度从8步增至50步,成功率均下降;但在厨房长程任务中,成功率反而显著提升。

(二)原子动作难度远超原子指令,精确控制仍是硬骨头

原子动作远难于原子指令,且原子动作内部难度悬殊,精确控制与物体位姿控制仍是硬骨头。数据显示,过程成功率(PSR)普遍高于任务成功率(SR),尤其在动作类任务上,说明大量失败是「部分完成」——模型能走完前几步,但无法通过最终成功判定。

(三)空间理解与连续执行能力是当前开源模型的普遍短板

当前开源模型在空间理解和连续执行能力上普遍较弱。标准桌面抓放任务中,头部模型已接近满分,真正拉开差距的是需要理解空间位置关系、并在多步操作中持续追踪目标状态的任务。例如:从抽屉最上层取出番茄放入切菜板上的瓷碗;拿起麦片旁的番茄,放入花瓶与茶壶之间的瓷碗;在水槽中用流动水冲洗生菜。

任务:把抽屉最上层那个番茄拿出来,放到切菜板上的瓷碗里

任务:把麦片旁边的番茄拿起来,放在花瓶和茶壶中间的那个瓷碗里

任务:在水槽中用流动的水冲洗生菜(考验动态环境下的实时追踪与连续调节能力)

(四)演示视频效果≠真实水平,模型选型需综合考量

尽管许多模型展示了表现优异的演示视频,但本次评测(多任务联合训练)结果显示,被测开源模型在精细操作和长程任务上仍存在显著瓶颈。例如,插销或充电头对准插入的成功率仅为1.6%–4.0%;包含移动基座的长程任务成功率普遍不足10%。这些失败更多源于机器人控制系统的问题:夹爪闭合时机、手臂微调方向、接触后的视觉纠偏、物体放置稳定性等。

换言之,当前模型已能大致判断“要做什么”,但尚不能可靠完成“手该如何精确做”。因此,模型选型时,除看综合排名外,建议还需结合桌面抓放、精细装配、语言泛化、厨房操作等实际场景及训练成本等综合考量。上述发现可为行业模型选型与落地应用提供参考。

FlagEval-Robo:以评测构建具身智能开放演进的基础设施

FlagEval-Robo致力于构建科学系统的具身智能评测体系。为保证评测结果客观、公正、可信,我们在环境搭建以及数据、训练、流程等方面做了严格对齐,确保所有模型在公平环境中进行评测。

评测设施公平性保证:对于所有模型,评测数据集完全相同、评测环境完全一致(布局/光照/物品/位置等)、采用官方开源代码和默认配置、基于官方开源模型权重进行后训练、模型训练至完全收敛。

数据污染校验:为了验证评测任务和数据是否被模型的预训练数据污染,评测团队对真机和仿真均表现较好的2款模型进行了开箱评测。结果显示,模型开箱状态下在评测数据上的成功率接近0,证明评测数据集并未被模型预训练数据污染,评测本身有效且公平。

说明:考虑到评测成本,未对剩余所有模型进行开箱评测。

具身评测不应只是一张“一劳永逸”的榜单,而应成为连接基准、环境、工具与治理的开放评测基础设施,对模型能力进行更加精细、多维的诊断,真正发现“哪里还不行”,推动能力持续进化。

面向这一目标,智源研究院将持续建设具身智能公共基础设施,与产业学术社区一起,推动具身智能能力标尺的不断完善。未来,我们还将进一步连接问题定义、开放挑战与真实场景验证——用评测看清问题,用挑战推动解题,用真实场景检验答案,推动具身智能真正解决真实世界的问题。


FlagEval-Robo官网:

https://flagevalrobo.baai.ac.cn

FlagEval官网:
https://flageval.baai.ac.cn
ATOM-Bench主页:
https://flageval-baai.github.io/AtomBenchPage/
ERQA+具身推理基准:

https://flageval-baai.github.io/ERQA-Plus-page/




内容中包含的图片若涉及版权问题,请及时与我们联系删除