
作者:田小幺
编辑:李宝珠
转载请联系本公众号获得授权,并标明来源
上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学、牛津大学的联合研究团队构建了 URBANGROUND,一个以香港真实地理数据为基础的城市级交互环境,并从局部空间理解、目标导向导航和动态环境适应三个层面,对当前 MLLM 智能体进行了系统评测。结果显示,当前模型已经具备较好的局部空间理解能力,也能够完成部分近距离导航,但这种能力并不会随着行动距离自然延伸。
城市空间的理解从来不是一次性的视觉识别。正如城市规划学者凯文·林奇在《城市意象》中所指出的,人对事物的经验总是与周围环境、此前发生的事件以及过往记忆相联系。对于试图在真实城市中行动的人工智能而言,同样如此:识别眼前的道路、建筑和地标只是第一步,更重要的是能否把连续获得的视觉信息组织成稳定的空间认知,并据此持续判断自身位置、目标方向以及下一步行动。
近年来,多模态大语言模型(MLLM)在视觉识别和空间问答等任务上取得了明显进展,已经能够从单个第一人称视角中识别城市物体、判断相对位置。但真实城市导航并不是一组彼此独立的图像理解任务。随着智能体不断移动,原本可见的地标可能消失,新的道路和建筑不断进入视野,路线还可能受到天气、障碍物或行人变化的影响。智能体需要将当前观察与此前获得的信息结合,在持续行动中保持对自身位置、目标和可行路径的判断。
这也提出了一个比「AI 能否看懂城市」更进一步的问题:当前的 MLLM 智能体,究竟能否把局部空间感知转化为真实城市尺度上的可靠行动?为回答这一问题,上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学、牛津大学的联合研究团队构建了 URBANGROUND,一个以香港真实地理数据为基础的城市级交互环境,并从局部空间理解、目标导向导航和动态环境适应三个层面,对当前 MLLM 智能体进行了系统评测。
结果显示,当前模型已经具备较好的局部空间理解能力,也能够完成部分近距离导航,但这种能力并不会随着行动距离自然延伸。当路线变长、局部几何结构更加复杂,或者原有路径在执行过程中失效时,模型的表现会明显下降。能够识别和理解局部空间信息,并不意味着模型已经能够在真实城市中持续、可靠地利用这些信息行动。
相关研究成果以「UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City」为题,已发表于预印本平台 arXiv。

查看论文:
https://hyper.ai/papers/2608.27456
数据集:把真实香港转化为可交互的城市空间
URBANGROUND 以香港特别行政区政府地政总署发布的 3D Digital Map(三维数字地图)为基础,将真实城市空间转化为可供 MLLM 智能体交互的仿真环境。其核心使用两类地理数据:3D Visualisation Map(三维可视化地图)和 3D Pedestrian Network(三维行人网络)。
3D Visualisation Map 由倾斜航空影像重建而成,以 Cesium 3D Tiles 形式提供覆盖香港全境的纹理三维网格,并采用 WGS84 地理坐标系。建筑、道路、地形及其他城市表面都包含其中。URBANGROUND 会根据智能体的位置和观察尺度,在 Unity 中动态加载相应的城市瓦片。这些几何数据既用于画面渲染,也参与物理碰撞计算,因此建筑、墙体和地形高差都会实际限制智能体移动。
3D Pedestrian Network 则描述城市中的行人空间如何连接。研究团队将其导入同一坐标系并转换为连通图,其中节点对应具体地理位置,边表示可步行路段。该网络并不会强制智能体沿规定路线移动,智能体仍可在连续空间中自由选择路径。任务结束后,研究人员可以将其实际轨迹与行人网络比较,判断是否出现横穿道路、偏离正常步行空间等行为。
在此基础上,研究团队进一步加入时间、天气、道路和行人等环境变化。系统可以模拟白天、黄昏、夜晚以及雨、雾等条件,并利用 Microsoft Rocketbox 化身库生成沿行人网络移动的虚拟行人,部分道路也可以在任务进行过程中临时关闭。由此,同一地点可以在不同环境和通行条件下重复测试。

URBANGROUND 的动态模拟组件
最终,研究团队在香港不同城区构建了 810 个经过人工验证的基础任务实例,覆盖不同街道格局、地形和垂直步行连接结构。每个任务都由人工测试者在与模型相同的 100 步限制下完成,以确认任务本身具有可行解。
与静态图片或预设路线评测相比,URBANGROUND 将城市三维结构、行人连通关系、物理约束和智能体轨迹统一到真实地理坐标中,使模型必须在同一座城市中持续移动,并根据此前行动产生的新环境继续作出判断。
建立「观察—决策—行动—再观察」的闭环智能体
URBANGROUND 并不是一个新训练的模型,而是一套用于评测现有 MLLM 空间智能体能力的交互框架。研究的重点是将不同多模态大模型接入相同的城市环境,观察它们能否将视觉理解、空间推理和连续行动结合起来。

URBANGROUND 是一个基于全区域三维地理空间数据构建的真实规模城市沙盒
整个框架由地理空间层、仿真层和智能体层组成。地理空间层统一城市三维模型、行人网络和智能体轨迹;仿真层负责连续运动、物理碰撞,以及时间、天气、道路封闭和移动行人等环境变化;智能体层负责连接外部 MLLM 与 Unity 环境。不同模型可以在保持底层城市环境不变的情况下进行替换。
每一步交互中,模型会接收当前第一人称相机生成的 RGB 图像、任务指令以及此前的文本交互历史。对于需要更大范围空间判断的任务,智能体还可以主动打开交互式地图,查看自身位置,并通过平移、缩放和旋转观察周围区域。但地图不会直接给出最短路线、剩余距离或导航 API,目标方向、可行路径和自身位置变化仍需要模型自行判断。
第一人称模式下,智能体可以移动、加速移动、调整视角、跳跃或打开地图;进入地图后,可以选择位置、平移、缩放和旋转视图。模型每轮只能选择一个动作,动作在 Unity 中执行后,系统根据新的位置和环境状态生成下一次观察,由此形成「观察—决策—行动—再观察」的闭环。
研究团队将这一过程涉及的空间能力概括为三个层面:Grounding(空间锚定)指模型能否根据当前观察建立局部空间关系;Persistence(持久性)关注地标离开视野后,此前获得的空间信息能否继续指导行动;Adaptation(适应性)则考察当道路、天气等条件变化、原有判断失效后,模型能否及时调整状态和计划。
研究评测了多个当代 MLLM,包括 GPT-5.5、GPT-5.4、GPT-5.2,Claude-Opus-5、Claude-Opus-4.6,Gemini-3.6-Flash、Gemini-3.1-Pro,以及 Doubao-Seed-2.0-Pro、GLM-5V-Turbo 和 Kimi-K3 等。所有模型使用相同的任务接口和动作空间,并未针对 URBANGROUND 进行额外训练。
局部空间能力尚难扩展为持续可靠的城市行动
研究团队围绕 Grounding、Persistence 和 Adaptation 设计了五级评测体系:第一级考察视觉识别、方向判断和主动探索;第二至第四级逐步加入短距离与长距离导航、指令式导航、目的地推断和多站点规划;第五级则进一步改变时间、天气、道路和行人状态,检验模型面对城市变化时的适应能力。

五级评测体系示意图
在局部空间任务中,当前 MLLM 已经表现出较强的视觉识别能力。当目标和视觉证据比较明确时,大多数模型能够识别附近建筑、商店和其他城市物体;即使需要通过短距离探索寻找初始视野外的信息,准确率通常也只有限下降。但涉及方向判断时,模型表现明显变差。一些模型能够正确识别地标,却无法稳定判断它相对于自身朝向的位置,部分模型在四选一方向问题上的表现甚至接近随机猜测。这说明,识别一个物体并不等于建立可靠的空间方位表征。

GPT-5.5 主动探索的示例
模型的行动轨迹还显示,答案正确也不意味着移动合理。例如在一个寻找北京同仁堂附近银行的任务中,GPT-5.5 最终正确识别出目标银行,却为了接近目标直接横穿道路,离开了登记的行人网络。模型能够找到目标,但对可通行空间和道路约束的理解仍不稳定。
当任务进一步转向持续导航时,这些问题被明显放大。部分模型能够完成一定比例的短距离导航,但路线延伸到几个城市街区之后,成功率迅速下降,长距离导航几乎在所有模型上都难以完整完成。进一步按照起点和终点距离划分后,即使仍属于短距离任务,成功率也会随着交互距离增加而持续下降。
轨迹分析显示,模型并非完全找错方向。在长距离导航中,超过一半失败轨迹的终点实际上比起点更接近目标;多站点任务中,模型平均也能够到达约 10%—20% 的指定地点。它们往往可以完成若干正确的局部行动,却难以长期维持对整体路线和任务进度的判断。

导航成功率随交互范围的变化
障碍物会进一步暴露这一问题。有些情况下,模型能够发现直接路径受阻,并找到坡道或立交桥继续前进;另一些情况下,模型却会沿着目标的大致方向反复向前,即使已经被障碍挡住,也无法及时调整路线。「朝目标靠近」和「找到真正可通行的路线」,对当前模型而言仍然存在明显差距。

GPT-5.5 使用官方人行桥穿越复杂交叉路口,并稳步朝目标方向前进的示例

GPT-5.5 在朝向目标方向穿过道路时,被中央障碍物阻挡而无法继续前行的示例
最后,研究人员改变了城市环境。在白天、黄昏、夜间以及雨雾等条件下,部分模型的局部空间问答准确率会随着能见度下降而降低,但短距离导航并未呈现完全一致的变化趋势。这说明导航失败不仅与视觉识别有关,还取决于路线状态维护和动作执行。
当原有道路在任务过程中被关闭,或路径上出现移动行人时,适应性问题更加明显。模型经常能够继续做出局部上看似合理的动作,却没有及时重建有效路线;保持在人行区域内,也不意味着能够正确处理移动障碍物。
总体来看,当前 MLLM 已经具备一定的局部空间理解和短距离行动能力,但这些能力尚难在更长的时间和空间尺度上稳定维持。当早期观察离开视野、路线不断延伸或环境发生变化后,模型此前形成的空间状态容易逐渐失效。这也是当前局部空间理解与真实城市尺度行动之间的主要差距。
写在最后
URBANGROUND 将空间智能的评测从「能不能看懂眼前的城市」推进到了「能不能在城市中持续行动」。实验显示,当前 MLLM 已经具备识别环境、理解局部关系和完成短距离探索等基础能力,但要让这些能力支撑真实尺度的导航,还需要解决长期空间状态维护、错误恢复和动态规划等问题。对空间智能而言,下一步的关键或许不只是让模型看得更准,而是让它能够在不断变化的观察中记住重要信息、修正错误,并把一次次局部判断真正组织成持续可靠的行动。

戳“阅读原文”,免费获取海量数据集资源!
内容中包含的图片若涉及版权问题,请及时与我们联系删除







评论
沙发等你来抢