AI消息速览

BLARM:通过混合潜在刚体运动基元从视频驱动3D物体动画

事件日期 2026-08-31 · 学术前沿 · 已接受

事件日期2026-08-31
信息日期2026-08-31
入库日期2026-09-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:BLARM:通过混合潜在刚体运动基元从视频驱动3D物体动画

一句话结论

BLARM 是一种前馈式(feed-forward)方法,输入单目视频和一个静态物体网格,直接预测时间上连贯的动画网格,无需显式骨骼、笼子或绑定权重。

事件概述或研究问题

研究问题:如何从单目视频驱动 3D 网格动画,同时避免依赖传统绑定(rigging)或直接回归高维顶点运动。 事件概述:论文提出 BLARM,将动画表示为若干学习到的时变刚体运动分量与逐顶点蒙皮权重的混合,从而得到低维变形空间。

方法/产品要点

  • 表示:使用一组“潜在刚体运动基元”的混合来生成动画;每个基元包含时变的刚体变换和时不变的顶点到分量蒙皮权重。
  • 无需骨架、笼子、蒙皮权重或绑定标注。
  • 架构:几何派生的变形潜在变量与视频特征通过分解的时空注意力(factorized spatial-temporal attention)进行条件化,再解码出由预测蒙皮权重混合的刚体变换。
  • 训练目标:轨迹重建、熵正则化、运动感知对比学习。

主要结果或产业意义

  • 论文声称 BLARM 能生成准确且时间稳定的动画,并恢复紧凑、可解释的运动结构。
  • 具体定量指标、与基线比较等细节在摘要中未给出,需查阅全文(待核实)。
  • 产业意义:可能降低 3D 动画制作中绑定环节的成本,有助于视频驱动的角色或物体动画工作流。

为什么重要

  • 传统动画绑定依赖人工搭建骨骼或笼子,而直接回归高维顶点运动又容易不稳定;BLARM 提出一种低维、可解释的中间表示。
  • 与已有相关卡片中的 VidMap(视频运动恢复)和 LDR(视频世界模型物理外推)属于不同任务方向:BLARM 聚焦于从单目视频到 3D 网格动画的生成,而不是相机运动恢复或物理规律外推。

局限与不确定性

  • 摘要未给出数据集、评估指标、运行效率、泛化能力等信息,需待核实。
  • 是否适用于复杂拓扑、多物体交互、大幅度非刚性变形等,尚未从材料中确认。
  • 仅从摘要无法判断与现有方法相比的具体优势幅度。

可用于图书/PPT/简报的角度

  • “给静态 3D 模型注入视频动作”:用一段单目视频让 3D 模型动起来。
  • 传统绑定 vs 学习式运动分解:BLARM 把动画分解为若干刚体运动的混合。
  • 从单目视频到 3D 动画:不需要深度传感器,模型仍能学出可解释的运动结构。

原始材料

  • 英文标题:BLARM: Animating 3D Objects from Video via Blending Latent Rigid Motion Primitives
  • 英文关键词:BLARM; video-driven 3D animation; latent rigid motion primitives; skinning weights; factorized spatial-temporal attention
  • 来源:arXiv:2608.31113v1 [cs.CV]
  • URL: https://arxiv.org/abs/2608.31113v1
  • 作者:Pradyumn Goyal, Yizhak Ben-Shabat, Hsueh-Ti Derek Liu, Haomiao Jiang, Snehasish Mukherjee, Kyle Spence, Mark Stauber, Evangelos Kalogerakis, Yunze Zeng
  • 发布时间:2026-08-31