AI消息速览

大语言模型的选择性披露水印技术

事件日期 2026-07-06 · 学术前沿 · 已接受

事件日期2026-07-06
信息日期2026-07-06
入库日期2026-07-07
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:大语言模型的选择性披露水印技术

一句话结论
现有大语言模型多比特水印方法无法选择性地披露信息,本文提出的层次化词汇路由(HeRo)框架首次实现了细粒度的访问控制,允许不同验证者仅解码与其权限对应的水印部分,同时保持文本质量和高检测精度。

事件概述或研究问题
大语言模型生成文本的水印技术可分为两类:零比特方案(区分机器生成与人类写作)和多比特方案(嵌入元数据)。现有多比特方案的一个关键缺陷是不支持选择性披露——验证水印的任何部分都必须揭示整个嵌入信息,导致不必要的隐私泄露。作者针对此问题提出了HeRo框架。

方法/产品要点

  • HeRo通过递归划分词汇表,将水印信息分布到层次化层级中。
  • 不同验证者根据其访问权限,只能解码对应层级的水印载荷。
  • 该方法保留了底层采样过程的无偏性,从而维持文本生成质量。
  • 实验表明该框架支持细粒度访问控制,同时实现高检测精度和低延迟。

主要结果或产业意义

  • HeRo在保持文本质量(无偏采样)的前提下实现了选择性披露能力。
  • 实验验证了高检测精度和低延迟,代码已开源(GitHub链接:https://github.com/xuyangc03/hero-watermark)。
  • 该技术可用于需要分级权限管理的水印场景,如版权保护中仅允许特定审核者验证部分信息。

为什么重要
当前多比特水印缺乏隐私控制机制,HeRo填补了这一空白,使水印系统更适用于多方协作或隐私敏感场景(如AI生成内容的溯源审计、法律文件等)。

局限与不确定性

  • 文中未明确给出在极端低资源语言或超长文本上的性能表现。
  • 实际部署中不同层级访问控制的安全强度(如抗共谋攻击)需进一步评估。
  • 待核实:是否支持动态调整访问等级或层级数量。

可用于图书/PPT/简报的角度

  • 标题灵感:《分层水印:让AI文本的“指纹”只给对的人看》
  • 核心对比图:零比特 vs 多比特 vs HeRo(选择性披露)的访问控制示意图
  • 应用案例:假设一个AI辅助司法文档系统,不同律师只能验证与自己案件相关的元数据片段。

原始材料

  • 英文标题:Selective Disclosure Watermarking for Large Language Models
  • 英文关键词:watermarking, large language models, selective disclosure, hierarchical vocabulary routing
  • 原始来源:arXiv:2607.05353v1 (2026-07-06),作者Xuyang Chen等。URL: https://arxiv.org/abs/2607.05353v1