知识卡片:EgoPolice:高风险警察随身摄像机视频的自我中心理解基准
一句话结论
EgoPolice 是一个由真实警察随身摄像机视频构成的基准数据集,用于评估模型在高风险、快速运动场景下的自我中心视频理解能力。测试表明,当前最强视频模型(如 Gemini 2.5 Pro)在预测“掏枪”等高风险动作时仍表现不佳。
事件概述或研究问题
警察随身摄像机(body‑worn camera)产生了大量第一人称视角视频,但有效分析其中关键行为(如暴力冲突、武器出现)非常困难。现有视频理解模型多针对平稳、预设场景,难以处理警民互动中常见的剧烈抖动、密集交互和稀有高风险事件。EgoPolice 旨在填补这一空白,提供一个专门针对执法场景的挑战性基准。
方法/产品要点
- 数据集构建:从公开的警察随身摄像机视频中精心筛选真实警民互动片段,以秒级粒度标注对警务行为研究至关重要的动作标签(如“掏枪”、“压制”等)。
- 任务设置:提供两种任务——行为分类与多选题问答(multiple‑choice question‑answering)。
- 基准测试:评估了开源和闭源模型,包括 Gemini 2.5 Pro 等顶级视频模型。
- 关键特征:视频包含快速不规则的相机运动、密集人体交互以及稀有高风险事件,对运动鲁棒性和上下文感知能力提出高要求。
主要结果或产业意义
- 当前模型表现:即使最好的模型 Gemini 2.5 Pro 也无法准确预测“Weapon Out”(掏枪)等高危动作。
- 产业意义:该数据集可作为开发更高效视频分析模型的基础,帮助大规模执法视频库的自动审查,减少人工审核负担。
为什么重要
- 首次系统性地将自我中心视频理解与执法场景结合,提供了真实、具有挑战性的基准。
- 揭示了当前视频模型在处理极端运动、密集交互和不平衡类别(稀有事件)时的局限性。
- 为警务行为研究、公共安全、AI 伦理等交叉领域提供标准化评估工具。
局限与不确定性
- 论文未明确说明数据集的总时长、视频数量和标注类别的具体统计信息(待核实)。
- 所有视频均来自公开来源,可能存在代表性偏差或隐私处理问题(待核实)。
- 仅测试了部分视频模型,未包含最新或特定领域专用模型(待核实)。
可用于图书/PPT/简报的角度
- 从 AI 视频理解的现实挑战切入:为何“看清警察随身摄像机画面”比想象中难。
- 以“枪支检测”为例,展示模型在高风险场景下的可靠性与伦理风险。
- 结合警方流程,介绍自动化工具如何在保证准确性的前提下提升人工审查效率。
原始材料
- 英文标题:EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage
- 英文关键词:Egocentric video understanding, police body-worn camera, benchmark, high-stakes events, action recognition
- 来源:arXiv preprint https://arxiv.org/abs/2607.06468v1 (2026‑07‑07)