知识卡片:面向儿童的YouTube视频商业内容识别共享任务ChildSafeAds 2026
一句话结论
ChildSafeAds 2026 是一个面向“可能触达儿童和青少年”的YouTube视频中商业内容检测的共享任务,提供来自939个频道的3,360个视频数据,并设置三个子任务和四级证据访问设置,用于评估系统在广告/商业内容识别、产品分类和法律风险识别上的表现。
事件概述或研究问题
儿童和青少年是YouTube的重要受众,视频中嵌入的赞助内容与商业推广若不充分披露,可能带来合规与儿童保护问题。本共享任务旨在推动对这类视频中商业内容的自动识别与分析。每个实例以SponsorBlock(一个开源的众包浏览器扩展)用户标注的赞助片段为起点,配对可用的转录文本、视频与频道信息,以及视频描述中链接的销售或服务页面,构建为可评估的数据集。
方法/产品要点
- 数据规模:3,360个视频,来自939个频道。
- 子任务:
- ST1:判断被推广的是何种类型的提供物(offer);
- ST2:分配产品类别;
- ST3:识别法律风险标记(legal risk flags)。
- 证据分级:证据被划分为四个累积访问级别,从转录文本到链接页面,以便在评估系统性能时对比不同数据收集成本。
- 标签生成方式:GPT-5.4在专家组织者团队审查样本并对分类体系、提示词和模型选择进行迭代后生成了标签;GPT-5.6-luna独立标注了开发集。
主要结果或产业意义
本报告描述了任务、数据与评估方法。初步统计显示,该数据集中45.5%的视频未正确使用平台内置广告披露方式(即“包含付费宣传”标签)。这表明现有平台披露机制在儿童相关内容场景中存在明显执行缺口。该数据集和任务设置可作为广告披露合规监测、平台治理和政策研究的基础资源。
为什么重要
这是少见的专门针对儿童/青少年受众YouTube视频商业内容识别的共享任务,结合了众包赞助片段、平台元数据和大模型标注,为隐性广告识别、法律合规评估和推荐系统安全提供了新的基准与数据资产。相比已有相关卡片,本条是全新的任务型资源,不涉及既有卡片中的机器人规划或知识蒸馏专题。
局限与不确定性
- 当前报告尚未包含参与系统的结果,参与系统和共享任务结果将在更新版本中发布。
- 标签由GPT-5.4与GPT-5.6-luna生成,尽管经过专家审查,但标签准确性、偏差与分类体系细节待核实。
- SponsorBlock众包片段的覆盖范围、用户标注标准以及“可能触达儿童和青少年”的视频判定方式待核实。
- 法律风险标记的具体维度、四级证据访问的实现方式、数据获取途径和评估指标均待核实。
可用于图书/PPT/简报的角度
- 儿童在线内容中的隐性广告与平台披露机制失效问题。
- 众包数据(SponsorBlock)与大模型(GPT系列)结合用于构建标注数据集的实践案例。
- 共享任务设计中的“证据分级”思路:如何在数据成本与评测需求之间做权衡。
- 从广告合规、法律风险识别到平台治理的跨学科研究切入点。
原始材料
英文标题:ChildSafeAds Shared Task 2026: Commercial Content in Child-Facing YouTube Videos
英文关键词:ChildSafeAds, child-facing YouTube, commercial content, SponsorBlock, shared task, legal risk, ad disclosure
原始来源:https://arxiv.org/abs/2608.19165v1