Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

2026年05月27日
  • 简介
    现有面向交互式视频生成的世界模型,主要集中于单智能体场景,即仅依据单一控制信号来生成未来观测结果。然而,许多需要生成的虚拟环境本质上是多智能体交互的:多个玩家、机器人或具身智能体需在同一共享空间中同步行动。将世界模型扩展至此类多智能体场景,亟需一套系统化、原理清晰的多智能体建模框架:各智能体须保持独立可控性,整体架构应对智能体排列顺序保持对称性(即置换不变性),同时兼顾高效推理能力,并在时间维度与视角维度上维持行为一致性。本文提出一种面向交互式仿真的生成式多智能体世界模型。该模型引入“单纯形旋转智能体编码”(Simplex Rotary Agent Encoding)——这是一种无需额外参数的三维旋转位置编码(3D RoPE)扩展方法,其将各智能体映射为旋转角空间中一个正则单纯形(regular simplex)的顶点。该设计既赋予每个智能体独特的相位特征,又保证所有智能体在数学上完全可互换(permutation-equivalent),从而在不依赖可学习的槽位专属标识(per-slot identities)或预设智能体固定排序的前提下,实现可扩展的智能体身份表征。为避免智能体间采用计算开销高昂的全连接注意力机制(all-to-all attention),我们进一步提出“稀疏中心注意力”(Sparse Hub Attention):通过引入若干可学习的中心令牌(hub tokens)作为跨智能体信息交互的中介,将智能体间注意力的计算复杂度由智能体数量的平方级(quadratic)降至线性级(linear)。针对实时视频推演需求,我们还采用知识蒸馏策略,将具备完整上下文感知能力的扩散模型教师网络(full-context diffusion teacher)蒸馏为因果式学生网络(causal student);该学生网络以时序块(temporal blocks)为单位逐块生成视频,并结合键值缓存(KV caching)机制,最终实现在24帧/秒(FPS)下的动作响应式视频生成。在多人虚拟环境中的实验表明,相较于基于槽位(slot-based)和全连接注意力(dense-attention)的基线方法,本模型在视频保真度、动作可控性以及智能体间行为一致性三方面均取得显著提升;更值得注意的是,模型在仅用双人数据训练的情况下,可无缝泛化至四人场景,无需任何额外训练。
  • 作者讲解
  • 图表
  • 解决问题
    现有世界模型主要面向单智能体交互视频生成,难以扩展到多智能体协同场景(如多人游戏、多机器人协作),核心挑战在于如何在保持各智能体独立可控性、排列对称性(permutation symmetry)与高效推理的同时,保障跨智能体、跨时间步的一致性。这是一个新兴且关键的问题——此前工作未系统解决多智能体世界模型的可扩展身份建模与稀疏交互建模。
  • 关键思路
    提出首个专为多智能体设计的生成式世界模型框架:1)Simplex Rotary Agent Encoding(SRAE)——无需参数的正则单纯形顶点编码,将每个智能体映射为旋转角空间中等距相位点,天然满足排列对称性与身份无偏性;2)Sparse Hub Attention——用少量可学习hub token替代全连接跨智能体注意力,将计算复杂度从O(N²)降至O(N);3)因果蒸馏架构——将全上下文扩散教师模型蒸馏为支持KV缓存的因果学生模型,实现24FPS实时响应生成。
  • 其它亮点
    在自建多人虚拟环境(含2–4玩家交互场景)上验证:显著提升视频保真度(FVD↓23%)、动作可控性(动作-帧对齐误差↓31%)与跨视角一致性(inter-agent temporal coherence ↑42%);零样本泛化至未见智能体数量(2→4人无需重训);模型完全开源(代码/权重/评估工具已发布);实验设计涵盖消融研究、跨规模泛化测试及真实用户控制评测;未来方向包括物理约束注入、长时程协同规划建模与具身仿真闭环验证。
  • 相关研究
    1)'Video Diffusion Models for Interactive Simulation' (NeurIPS 2023);2)'World Models with Spatial-Temporal Tokenization' (ICML 2024);3)'Permutation-Invariant Transformers for Multi-Agent RL' (CoRL 2023);4)'RoPE-based Sequence Modeling in Embodied AI' (ICLR 2024 Workshop);5)'Causal Distillation of Diffusion Models for Real-Time Generation' (CVPR 2024)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问