根据 arXiv 摘要,EmoWorld 在冻结的流匹配视频扩散 Transformer(Video DiT)中,将视频生成里的全局氛围、情绪语义线索和时间演化解耦,并通过 VAS/SAS/TAS 三种机制实现可控情感视频生成。在 Wan2.2 上,VAS 使目标情绪对齐提升 19%、时间波动代理指标下降 48%;SAS 使目标情绪对齐提升 37%、检测到…
摘要指出,情绪会影响观众如何理解一个场景,但现有视频生成模型往往把“全局氛围”“带情绪含义的语义线索”和“时间进展”纠缠在同一个文本条件中,难以独立控制。EmoWorld 提出在冻结的 Video DiT 内解耦这些因素:准备阶段提取层相关的情感方向和可复用线索库;推理阶段通过视觉氛围、语义情感和时间情感三条路径分别控制生成。