知识卡片:Peak-End-Net:基于峰终定律的可泛化视频美学评估框架
英文标题: Peak-End-Net: A Peak-End Rule Inspired Framework for Generalizable Video Aesthetic Assessment
英文关键词: Video Aesthetic Assessment; Peak-End Rule; Foundation Model; Image Aesthetic Assessment; Temporal Aggregation; Vision Transformer
一句话结论
Peak-End-Net 是一种受心理学“峰终定律”启发的轻量级视频美学评估框架,利用冻结的视觉 Transformer 和少量可训练参数,在域内和跨域视频美学基准上均取得当前最优性能,验证了心理学建模在视频美学评估中的价值。
事件概述或研究问题
视频美学评估(VAA)旨在预测视频的美学吸引力,但相较于图像美学评估(IAA)等其他视觉评估任务进展缓慢。主要障碍包括:大规模标注基准的缺乏,以及美学判断固有的主观性。本文从心理学角度重新审视 VAA,基于“峰终定律”(人们主要依据体验中的高峰时刻和结尾来评判整体体验)设计新框架。
方法/产品要点
- 峰终定律启发的时间聚合:利用预训练的图像美学评估头为每一帧生成美学先验分数,作为识别美学高峰时刻的替代信号,并据此指导基于峰终定律的时序聚合。
- 美学节奏编码器:额外建模视频美学随时间演进的动态模式,超越孤立帧的评估。
- 动态门控融合机制:融合峰终聚合与节奏编码的输出,增强模型在分布偏移条件下的鲁棒性。
- 参数高效:基于冻结的视觉 Transformer(ViT)骨干,仅需训练少量参数,具有可扩展性。
- 开源:代码和模型已在 GitHub 发布(https://github.com/AMAP-ML/Peak-End-Net)。
主要结果或产业意义
- 在域内评估(VADB 基准)和跨域测试(DIVIDE-3K 基准)上均达到当前最优(state-of-the-art)性能。
- 证明了从心理学定律(峰终定律)出发的建模方式可以有效提升视频美学评估的泛化能力。
- 轻量级设计使其易于部署,对媒体内容审核、视频编辑、广告推荐等产业场景具有潜在应用价值。
为什么重要
- 首次将峰终定律系统性地引入视频美学评估领域,提供了新的心理学解释路径。
- 通过知识迁移(从 IAA 到 VAA)解决了视频美学评估标注数据稀缺的问题。
- 模型在跨域测试中表现优异,表明其具有较强的泛化能力,而不仅仅是过拟合特定数据集。
局限与不确定性
- 材料未提及在不同视频内容类型(如电影、短视频、纪录片)上的细粒度性能差异。
- 对“美学先验”准确性依赖度未量化;若图像美学头在特定帧上产生噪声,对最终预测的影响程度待核实。
- 峰终定律在跨文化、跨人群中的普遍适用性尚未在本实验中验证。
可用于图书/PPT/简报的角度
- 科普:用“峰终定律”解释为什么人们记住的不是整段视频,而是最精彩的片段和结尾——将该心理学原理用于 AI 视频评分。
- 技术报告:从图像美学到视频美学的知识迁移策略(预训练 IAA 头 + 冻结 ViT + 少量微调)。
- 产品设计:短视频平台如何利用“峰值时刻+结尾”的加权方式自动推荐高质量内容。
原始材料
- arXiv ID: 2607.13941v1
- 论文标题: Peak-End-Net: A Peak-End Rule Inspired Framework for Generalizable Video Aesthetic Assessment
- PDF 链接: https://arxiv.org/pdf/2607.13941v1
- 代码仓库: https://github.com/AMAP-ML/Peak-End-Net