- 简介生成式人工智能与具身人工智能的最新进展,主要得益于在多模态数据上开展的大规模预测性学习。然而,当前由此构建的系统仍主要依赖于被动式训练范式:即以语言规律为骨架,再将其他模态的信息依附其上。与此相反,神经科学与认知科学的研究表明,生物智能的组织方式恰恰相反——它首先通过与环境的交互习得扎根于现实世界的模型,这些模型构成了语义基础,语言则随后被“附着”于其上。本文阐述了支撑扎根式世界建模的五类神经环路实例,它们分别支撑着物理空间与概念空间中的导航能力、基于可供性(affordance)的物体感知与交互、主动感知与探索式学习、内稳态调控与情绪调节,以及区分自我生成结果与外部世界生成结果的能力。这些实例凸显出当前具身人工智能普遍缺失的若干关键特征:其一,内在动力学机制是学习的根本基础;其二,行动居于核心地位,是使内在动力学与外部世界保持协调的关键环节;其三,自主经验与开放式学习占据主导,而非被动接收并同化外部提供的数据;其四,早期形成的预测机制与控制机制,构成了推理、概念化导航、规划、想象、理解他人心理状态及人际沟通等高级认知能力的底层支撑。最后,我们探讨了源自生物系统的原理能否以及如何指导未来具身人工智能的发展路径,其中包括借鉴社会互动机制设计新型训练范式,从而构建不仅具备现实根基、而且能实现社会共享,并与人类规范及价值观相一致的世界模型。
-
- 图表
- 解决问题当前生成式与具身AI系统依赖大规模被动多模态预测学习,语言作为主导 scaffold,其他模态依附其上;而生物学智能则以主动交互习得的具身世界模型为语义基础,语言随后附着其上。论文旨在揭示这一根本性范式错位,并论证‘以具身世界模型为先、语言为后’的认知架构对构建真正类人AI的必要性。这不是全新问题,但首次系统性地从神经环路证据出发,将五大具身认知功能与AI架构缺陷一一映射,赋予其计算可建模的理论紧迫性。
- 关键思路提出‘世界模型优先’(World-First)范式:以神经科学实证的五类具身神经环路(导航、可供性感知、主动感知、内稳态调控、自我-世界区分)为蓝图,主张AI应首先通过自主交互习得动态、内在驱动、行动闭环的世界模型,再将语言作为元表征工具嵌入其中;核心新意在于拒绝‘多模态对齐即具身’的简化假设,强调内在动力学、行动耦合、开放性经验与自组织控制机制才是语言语义的真正源头。
- 其它亮点亮点包括:1)首次将5个跨尺度神经环路(海马-前额叶导航环路、顶叶-运动皮层可供性环路、丘脑-皮层主动感知环路、岛叶-下丘脑-杏仁核内稳态环路、小脑-前运动区自我监控环路)转化为AI设计原则;2)明确指出‘内在动力学是学习的基础’而非数据分布的统计规律;3)强调‘行动是校准内在模型与外部世界的唯一接口’,批判纯离线预训练范式;4)提出社会交互应成为世界模型建构的核心训练机制,以实现价值对齐——但本文未开展实验验证,属理论框架提案,无代码或数据集发布;值得深入的方向包括:基于神经动力学的具身世界模型形式化、可微分内稳态控制器设计、社会互动驱动的联合信念更新算法。
- 1) 'Embodied Intelligence: A Review of the Cognitive and Neural Foundations' (Lake et al., Nature Reviews Neuroscience, 2023); 2) 'The World as a Graph: Neurosymbolic Reasoning in Embodied Agents' (Goyal et al., NeurIPS 2022); 3) 'Active Inference and the Free Energy Principle in AI' (Friston et al., Nature Machine Intelligence, 2021); 4) 'Language Models Don't Always Ground: On the Limits of Multimodal Pretraining' (Zhang et al., ACL 2023); 5) 'Social Affordances: Modeling Shared Intentionality for Human-AI Coordination' (Huang & Kaelbling, CoRL 2023)


提问交流