知识卡片:D2C-Routing:面向混合来源AI生成文本检测的维度到组合证据路由
英文标题:D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection
英文关键词:AI-generated text detection; mixed-origin writing; source attribution; evidence routing; gated composition
一句话结论
本文提出 D2C-Routing,将混合来源 AI 生成文本检测从二元文档级判断重构为“内容来源 + 表达来源”的维度到组合溯源,在 MixD2C 基准上达到 0.8603 的四类平均 TPR@1%FPR,比同设置下的 RACE-local 重跑高 6.5 个百分点。
研究问题
传统 AI 生成文本检测通常把整篇文本判断为“人类撰写”或“机器生成”。这种二元框架在混合来源写作中失效,因为文本的内容来源与表达来源可能不一致——例如 AI 提供内容但由人类改写表达,或人类构思内容但由 AI 润色表达。本文研究如何对这种混合来源文本进行检测与来源归因。
方法/产品要点
- 将混合来源检测建模为“维度到组合来源归因”:先推断内容来源与表达来源,再组合成四种协作类型。
- 提出 Dimension-to-Composition Routing(D2C-Routing):将内容侧和表达侧的证据分别路由到有监督的维度头(dimension heads),再由可学习的门控组合层预测最终标签。
- 代码已公开:https://github.com/bystander563/d2c-routing-artifact (待核实:仓库内容、运行环境及可复现性)。
主要结果
- 在 MixD2C(由 HART 混合来源基准重建的划分)上,公开的 D2C-Routing 检测系统达到 0.8603 four-way Avg TPR@1%FPR。
- 比同一划分上的 RACE-local 重跑高 6.5 个百分点。
- 核心消融实验支持路由设计。
- 错误分析表明:区分“AI 内容 / 人类表达”与“完全 AI 生成”仍是最难的边界。
为什么重要
- 挑战了“非人即机”的二元检测范式,提出更贴近真实人机协同写作的混合来源检测视角。
- 与已有 AI 生成图像检测、长文档 VQA、视频取证中的证据路由/元检测思路相比,本文将“路由”思想引入文本来源归因,并显式区分内容来源与表达来源,形成方法论增量。
局限与不确定性
- 当前仅能基于摘要确认论文核心主张;完整实验设置、数据集构造细节、对比基线配置等有待核实。
- MixD2C 是“重建的划分”,其与原始 HART 基准的关系及可复现性待核实。
- “RACE-local rerun”的具体含义和实现配置待核实。
- 四种协作类型的具体定义在摘要中未展开,待核实。
- 系统在真实世界混合来源文本上的泛化能力、对未见生成模型的鲁棒性待核实。
可用于图书/PPT/简报的角度
- 从“二元检测”到“维度到组合溯源”的范式转变。
- 内容来源与表达来源的四种协作如何定义及如何影响检测。
- 证据路由 + 门控组合的架构如何对应混合来源检测目标。
- 混合人机写作场景下的检测边界与待解决问题。
原始材料
- URL: https://arxiv.org/abs/2608.27380v1
- arXiv ID: 2608.27380v1
- 英文标题: D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection
- 作者: Xin Chen, Fuwei Zhang, Yiqi Tong, Wei Guo, Yutian Xiao, Fuzhen Zhuang
- 发布时间: 2026-08-27(待核实:版本状态及更新记录)