AI消息速览

预训练数据可通过计算宣传被投毒

事件日期 2026-07-16 · 学术前沿 · 已接受

事件日期2026-07-16
信息日期2026-07-16
入库日期2026-07-17
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:预训练数据可通过计算宣传被投毒

一句话结论:本文证明通过公开讨论界面(如论坛、评论区)向网络大规模注入恶意内容,可成功对语言模型预训练数据实施投毒攻击,且现有数据筛选流程难以完全过滤;并提出了评估投毒内容是否进入训练数据的分析工具HalfLife。

事件概述或研究问题
以往针对预训练数据的投毒研究大多依赖维基百科等已建立的数据源,其规模与异质性无法代表真实预训练语料库,且忽视了投毒数据与数据筛选管道之间的相互作用。本研究探索了在更现实的网络规模下,是否可以通过现有网络内容注入机制(公共讨论界面)对预训练数据进行投毒。

方法/产品要点

  • 攻击向量:利用公开讨论界面(如Web论坛、评论系统)作为内容注入通道,第三方可以低成本地发布大量包含恶意内容的页面,这些页面可能被网络爬虫抓取并进入预训练数据。
  • 分析工具:HalfLife——一种新颖的分析方法,用于估计在Web爬取和数据处理流程后,对抗性内容是否仍保留在语言模型训练数据中。HalfLife可以帮助评估投毒攻击的实际可行性。

主要结果或产业意义

  • 通过HalfLife分析,展示了基于公共讨论界面的投毒攻击在Web规模下是可行的,恶意内容有可能绕过常规数据筛选进入预训练语料。
  • 将第三方网页内容确立为攻击语言模型预训练的一个新的可能向量,强调了评估投毒内容是否被纳入训练数据的重要性。
    待核实:具体攻击成功率、受影响模型规模、HalfLife的定量指标数值等细节在摘要中未提供。

为什么重要

  • 拓宽了对预训练数据投毒威胁的认识:攻击者不再需要攻破权威数据源,只需利用开放的Web讨论平台即可大规模注入有害内容。
  • 针对数据筛选管道的盲点:许多现有数据清洗流程未考虑来自公开讨论界面的恶意内容,可能被系统性地绕过。
  • 提供了初步监测工具(HalfLife),为后续防御研究奠定基础。

局限与不确定性

  • 摘要未说明实验所采用的具体预训练模型或数据集,也未提及HalfLife在不同规模数据上的性能指标。
  • 攻击的实际落地成本、所需恶意内容比例、对下游任务(如有害行为诱发)的具体影响尚未量化。
  • 未讨论防御措施,HalfLife是否可扩展至实时检测尚不清楚。

可用于图书/PPT/简报的角度

  • 人工智能安全:计算宣传(computational propaganda)与现代AI供应链风险。
  • 大模型数据治理:预训练语料库的“供应链攻击”新范式。
  • 从维基百科到Web论坛:攻击面扩展案例。

原始材料

  • 标题:Pretraining Data Can Be Poisoned through Computational Propaganda
  • 英文关键词:pretraining data poisoning, computational propaganda, HalfLife, web-scale attacks
  • 来源:arXiv:2607.15267v1 (2026-07-16)
  • URL:https://arxiv.org/abs/2607.15267v1