AI消息速览

CLEAR:面向效用保持的LLM安全对齐的连续潜变量适配器路由

事件日期 2026-08-21 · 学术前沿 · 已接受

事件日期2026-08-21
信息日期2026-08-21
入库日期2026-08-25
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CLEAR:面向效用保持的LLM安全对齐的连续潜变量适配器路由

一句话结论

CLEAR 通过轻量级隐藏状态门控动态控制安全低秩适配器的激活强度,在冻结主干模型的前提下降低有害回应率,同时减少全局安全调优(如 SFT、标准 LoRA)带来的效用损失。

事件概述或研究问题

大型语言模型的安全微调常以提高安全性为代价损害通用能力,因为全局安全调优可能同时改变模型对有害输入和良性输入的反应。CLEAR 以条件式安全适配框架来解决这一安全-效用权衡问题。

方法/产品要点

  • 框架名称:CLEAR(Continuous Latent Adapter Routing,连续潜变量适配器路由)。
  • 核心设计:轻量级隐藏状态门控 + 安全低秩适配器。
  • 工作方式:门控根据模型隐藏状态连续调节安全适配器的激活强度,基础模型/主干保持冻结。
  • 目标:减少有害文本生成,同时尽量避免对良性提示的响应产生不必要的改动。
  • 相比全局安全微调(SFT)或标准低秩适配(LoRA),CLEAR 不全局修改模型行为,而是按输入条件进行安全干预。

主要结果或产业意义

  • 在安全基准 HarmBench 上,CLEAR 提升了模型鲁棒性,同时降低了全局安全调优造成的效用下降。
  • 在 Llama-3-8B-Instruct 上,HarmBench ASR 从 32.3% 降至 0.5%。
  • 保留基础模型大部分效用;GSM8K 准确率比全局 SFT 或标准 LoRA 最多高 7.1 个百分点。
  • 结果表明 CLEAR 是改善 LLM 对齐中安全-效用权衡的一种有前景的机制。

为什么重要

  • 现有安全对齐多面临“越安全越笨”的权衡,CLEAR 提示了一条不需要大规模改动主干模型的路径。
  • 增量信息:不同于已有知识卡片中的 PACR-Video、AURORA-LM 等工作,本条聚焦于 LLM 安全对齐中的效用保持,核心创新是“轻量门控 + 安全适配器”的条件路由,而非全模型微调或新表示空间设计。

局限与不确定性

  • 仅从摘要无法确认门控与适配器的完整实现细节、训练数据、计算开销等,均待核实。
  • 量化结果目前仅见于 Llama-3-8B-Instruct,其他模型规模与任务上的泛化效果待核实。
  • “连续控制”的具体方式、路由规则的可解释性以及极端对抗输入下的稳定性,材料未提供细节,待核实。

可用于图书/PPT/简报的角度

  • 以“安全对齐的效用税”为切入点,介绍 CLEAR 如何尝试“按需安全”而非“全局安全”。
  • 可用数字:HarmBench ASR 从 32.3% 到 0.5%,并保持大部分效用。
  • 引导讨论:安全机制是否可以不改变基础模型,而是在推理时动态路由?
  • 对比:全局 SFT/LoRA vs 条件式低秩路由,在安全与效用上的取舍。

原始材料

  • 英文标题:CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment
  • 英文关键词:LLM Safety Alignment; Utility Preservation; Low-Rank Adapter; Hidden-State Gate; Routing; HarmBench; GSM8K
  • 原始来源:arXiv:2608.21278v1
  • URL:https://arxiv.org/abs/2608.21278v1
  • 作者:Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo
  • 发布/更新时间:2026-08-21T16:36:10Z