AI消息速览

当话语安全但行动致命:在隐状态风险空间中探测文本安全之外的物理危险

事件日期 2026-07-16 · 学术前沿 · 已接受

事件日期2026-07-16
信息日期2026-07-16
入库日期2026-07-18
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:当话语安全但行动致命:在隐状态风险空间中探测文本安全之外的物理危险

一句话结论

大型语言模型(LLM)中的物理危险(Physical Danger,PD)与文本内容危险(Content Danger,CD)在隐状态空间中形成可分离信号;基于此设计的 PRISM 单层逻辑探针能以低误报率高精度检测物理风险,显著优于同等规模的 LLM 裁判。

事件概述或研究问题

LLM 越来越多地被用作具身智能体的高层次规划器。一条在语言层面完全安全的指令,一旦在物理世界中执行,可能变得不安全。本文研究“物理危险”是否等同于传统的“内容危险”问题。通过隐状态方向分析和随机分割零检验,作者证明 PD 和 CD 在多个 LLM 的表示空间中构成可分离的信号。

方法/产品要点

  • 隐藏状态方向分析:探索 LLM 内部表示中物理危险与内容危险的方向差异。
  • 随机分割零检验:验证两组信号的可分离性并非偶然。
  • PRISM:基于完整隐状态的单层 L2 正则化逻辑回归探针,直接利用表示层分类物理危险。
  • PhysicalSafetyBench‑1K (PSB‑1K):全新的对比基准,包含 1000 个物理风险配对样本,配对中不含直接伤害关键词,用于测试模型检测的是物理危险还是显式不安全措辞。

主要结果或产业意义

  • 在 SafeAgentBench 上,PRISM 准确率 86.2%–87.7%,假阳性率(FPR)11.7%–13.7%;同等规模 LLM 裁判的 FPR 达 24.7%–39.0%(过度阻止安全任务)。
  • 在 PSB‑1K 上,PRISM 准确率 99.6%,FPR 仅 0.7%;而 Qwen2.5‑3B 裁判错误拒绝了 67.8% 的安全任务。
  • 结果在 Qwen2.5‑3B/7B/14B/32B、Phi‑3.5 和 SmolLM2 等模型上稳定复现,并在 SafeText 和 EARBench 上得到验证。

为什么重要

  • 首次在表示层面明确区分了“物理危险”与“文本内容危险”,揭示现有文本安全过滤无法应对的物理安全维度。
  • PRISM 提供了一种轻量、高精度、低误报的表示级检测方法,避免传统 LLM 裁判对无害物理指令的过度抑制,对于部署具身智能体具有直接安全意义。
  • 与已有相关卡片(如状态空间模型、分布式攻击、多智能体辩论)主题不同,本卡片聚焦于 LLM 物理安全的新范式——从文本内容过滤转向隐状态风险空间探测。

局限与不确定性

  • 原文未明确讨论 PRISM 在不同类型具身任务(如机器人、无人机)中的泛化能力,需进一步验证。
  • PRISM 依赖完整隐状态,对于无法获取内部表示的封闭模型是否适用?待核实。
  • PSB‑1K 的构建标准、覆盖的物理风险类别范围?待核实。

可用于图书/PPT/简报的角度

  • AI 安全新维度:当语言无害但行动致命——从文本过滤到物理风险探测。
  • 表示级安全探针:用逻辑回归穿透模型黑箱,发现物理危险与内容危险的分界线。
  • 低误报率优势:避免“一刀切”式安全过滤影响正常物理任务执行。

原始材料

英文标题: When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
关键词: Physical Danger, Content Danger, LLM Safety, Hidden-State Probe, Embodied Agents
来源URL: https://arxiv.org/abs/2607.15218v1