知识卡片:基于原子动作的音乐到舞蹈生成
-
一句话结论:本文提出一种结构感知框架,将舞蹈建模为可解释的原子动作序列,通过两阶段生成(规划与完成)显著提升了舞蹈结构连贯性、节奏对齐和感知自然度,同时支持可控编辑。
-
事件概述或研究问题:音乐驱动舞蹈生成旨在产生与音乐节奏同步且语义一致的人体动作。现有神经方法虽实现了视觉真实感,但将运动视为连续信号,忽略了其组合本质,导致生成舞蹈结构不连贯且难以控制。本文核心研究问题是如何利用舞蹈的原子动作组成性质来实现结构可控的舞蹈生成。
-
方法/产品要点:
- 构建原子动作词汇:先对大规模舞蹈数据进行分割,聚类成原子动作组;再使用大语言模型(LLM)进行语义重新标记和精炼,得到可解释、可复用的原子动作集。
- 两阶段生成框架:
- 原子动作规划阶段:输入音乐,预测原子动作的类型、持续时间和时序,形成符号化的舞蹈分配。
- 完成阶段:基于规划的结构,使用过渡感知生成器合成平滑且风格一致的连续运动。
-
主要结果或产业意义:实验表明,该方法在结构连贯性、节奏对齐和感知自然度上显著优于现有基线,同时通过显式结构表示提供了增强的可解释性和可控编辑能力。产业上可用于自动化舞蹈编排、虚拟角色动画、音乐视频制作等领域。
-
为什么重要:突破了现有方法将运动视为连续信号的局限,通过引入原子动作这一组合性表示,使舞蹈生成既遵循音乐节奏又具备语义结构,为音乐-舞蹈生成提供了新的解释性和可控性范式。
-
局限与不确定性:待核实。摘要未明确讨论局限,可能涉及原子动作词汇的覆盖度、对舞蹈风格多样性的适应能力、以及大规模数据标注的依赖程度。
-
可用于图书/PPT/简报的角度:可重点突出“从连续信号到组合原子动作”的方法思想转变,以及“模仿人类编舞过程的两阶段生成”的直观类比;也可在演示中对比传统方法生成的舞蹈与本文方法在结构上的差异。
-
与既有脉络的关系:与已有相关卡片(如测试时迭代优化、长多视角视频生成、多智能体优化)无直接重复。本条卡片聚焦于音乐驱动舞蹈生成领域的结构化方法,提供增量信息——将舞蹈拆解为原子动作并引入LLM辅助语义标注。
-
原始材料:
- URL: https://arxiv.org/abs/2607.13978v1
- 英文标题: Music-to-Dance Generation via Atomic Movements
- 关键词: Music-to-dance generation, atomic movements, structure-aware framework, two-stage generation, interpretability
- 来源: arXiv preprint, 2026-07-15