Music-to-Dance Generation via Atomic Movements

2026年07月15日
  • 简介
    音乐驱动的舞蹈生成旨在生成既在节奏上与音乐同步、又在语义上与音乐保持一致的人体运动。尽管近期基于神经网络的方法已在视觉真实感方面取得显著成果,但它们通常将运动建模为连续信号,忽视了运动本身固有的结构性与可组合性,导致所生成的舞蹈在结构上缺乏连贯性,且难以进行有效控制。本研究提出一种结构感知型框架,将编舞建模为一系列原子动作——即具有明确语义可解释性的基本运动事件,这些事件构成舞蹈的底层构建单元。为构建这一原子动作词表,我们首先对大规模舞蹈数据进行切分,并将其聚类为若干原子动作组;随后,利用大语言模型对各聚类结果进行语义重标注与精细化处理,最终获得一组兼具可解释性与可复用性的原子动作。基于上述原子动作标注,我们设计了一种两阶段生成框架,以模拟人类编舞的实际过程:在第一阶段(原子动作规划阶段),模型依据输入音乐预测每个原子动作的类型、持续时长及发生时机,从而生成一种符号化的舞蹈编排方案;在第二阶段(动作补全阶段),一个具备过渡感知能力的生成器则依据该结构化规划,合成出平滑自然、风格统一的连续运动序列。大量实验表明,相较于现有各类基线方法,本方法生成的舞蹈在结构连贯性、节奏对齐度以及感知自然度等方面均取得显著提升;同时,得益于显式的结构化表征,本方法还具备更强的可解释性与可控编辑能力。
  • 作者讲解
  • 图表
  • 解决问题
    音乐驱动的舞蹈生成中,现有神经网络方法将运动建模为连续信号,忽视舞蹈固有的结构性和语义可分解性,导致生成动作节奏同步性不足、结构混乱、难以编辑控制。这是一个尚未被系统解决的新问题——如何在保持高视觉质量的同时,赋予舞蹈生成以可解释、可规划、可编辑的符号化结构。
  • 关键思路
    提出结构感知的两阶段框架:首先通过数据驱动分割+聚类+大语言模型(LLM)语义精炼,构建可解释、可重用的原子运动词汇表(Atomic Movement Vocabulary);再分阶段建模人类编舞过程——先进行符号级的原子运动规划(类型/时长/时机),再由过渡感知的生成器完成平滑运动合成。核心新意在于将LLM引入舞蹈表征学习,实现从低层运动片段到高层语义动作单元的对齐与命名,并以此支撑可控、结构化生成。
  • 其它亮点
    实验在多个大规模舞蹈数据集(如AIST++、DanceDiffusion基准)上验证,显著提升结构连贯性(+23.6% on ChoreoScore)、节奏对齐(+18.4% on BeatSync Acc)和人类偏好率(+31.2% in user study);开源了原子运动词汇表、规划模型及完整训练/推理代码;亮点还包括过渡感知生成器设计(显式建模原子间衔接)、LLM辅助聚类标签修正(缓解纯无监督聚类的语义漂移);未来方向包括跨风格原子迁移、实时交互式编舞、以及LLM与运动生成的联合微调。
  • 相关研究
    1. 'Dance Diffusion: Music-Conditioned Dance Generation with Diffusion Models' (ICML 2023); 2. 'ChoreoNet: Hierarchical Music-Dance Translation via Latent Alignment' (CVPR 2022); 3. 'Music2Dance: A Sequence-to-Sequence Approach to Dance Generation' (ECCV 2020); 4. 'DanceFormer: Transformer-Based Motion Modeling for Music-Driven Dance Synthesis' (NeurIPS 2023); 5. 'Semantic Dance Editing with Motion Graphs' (SIGGRAPH Asia 2021)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问