知识卡片:G3Ego——注视引导的图模型用于自我中心动作理解
一句话结论
G3Ego 使用佩戴者的注视作为图构建的结构性线索,从稀疏采样帧中构建动作场景图并剪枝无关实体,从而在避免大规模视频预训练的前提下,实现有竞争力的自我中心动作识别与预测,并在类不平衡评估中持续改善 Macro-F1。
事件概述/研究问题
自我中心动作理解通常依赖在大规模外部视角数据集上预训练的大视频模型。然而,许多第一人称动作只依赖于少数手-物交互,仅涉及少量相关实体。G3Ego 尝试回答的问题是:如何利用注视这一信号,把模型注意力集中在真正与动作相关的实体上,而无需昂贵的视频预训练。
方法/产品要点
- 从稀疏采样帧出发,基于视觉-语言描述、接地对象(grounded objects)和手部线索构建动作场景图。
- 利用摄像头佩戴者的注视(gaze)剪枝与当前动作无关的实体,得到聚焦于行为相关交互的图表示。
- 将图嵌入按时序聚合,用于动作识别(action recognition)和动作预测(action anticipation)。
- 与以往把注视作为辅助模态或注意力信号的做法不同,G3Ego 将注视直接纳入图的构建过程,从而得到高效且更可解释的表示。
主要结果或产业意义
- 在 EGTEA Gaze+ 和 MECCANO 两个数据集上,G3Ego 相比基于视频的方法取得了有竞争力的性能。
- 在类不平衡评估下,G3Ego 一致地提升了 Macro-F1。
- 方法避免了计算成本高昂的视频预训练,可能更适合计算资源受限或需要实时响应的自我中心视觉场景。
- 具体数值、基线对比细节和完整消融实验在材料中未给出,待核实。
为什么重要
G3Ego 提供了一个不依赖大规模视频预训练的替代路径:用稀疏帧、场景图和注视剪枝来捕捉第一人称动作的核心交互。与已有的 EgoPolice 等基准卡片不同,本条卡的增量信息在于“注视作为图结构线索”这一机制,以及“图表示 + 稀疏采样”如何替代大视频模型的方向。
局限与不确定性
- 当前内容仅来自 arXiv 摘要,缺乏完整实验设置、数据集划分、具体指标和基线细节,待核实。
- 图构建依赖视觉-语言描述和接地对象,其在不同场景下的鲁棒性、泛化性以及对手部遮挡、快速运动的适应性,材料中未说明。
- 模型是否适用于 EgoPolice 所关注的高风险、快速运动真实场景,尚不确定,待核实。
可用于图书/PPT/简报的角度
- “注视”在自我中心视觉中不只是注意力权重,而是可以作为结构化先验参与图构建。
- “稀疏采样 + 动作场景图”替代大规模视频预训练的可能性与代价。
- 图表示带来的可解释性:模型可以明确聚焦于哪些手-物交互实体。
原始材料
- 英文标题:G3Ego: Gaze-Guided Graphs for Egocentric Action Understanding
- 英文关键词(原文未单独列出,据标题与摘要提炼):Egocentric Action Understanding; Gaze-Guided Graphs; Action Scene Graph; Action Recognition; Action Anticipation
- arXiv ID:2608.20157v1
- 作者:Marko Haralović, Akash Ramakrishnan, Estefania Talavera Martinez
- 提交/更新日期:2026-08-20T15:15:08Z
- 分类:cs.CV
- 原始来源:https://arxiv.org/abs/2608.20157v1