知识卡片:UniTexture——针对视觉-语言-行动模型的跨任务通用对抗纹理攻击
一句话结论
UniTexture 提出用单个带纹理的 3D 物体作为跨任务通用对抗扰动源,只优化一个共享表面纹理,就能在多个操纵任务中使 VLA 模型产生攻击者指定的动作偏移;在 OpenVLA 和 π0.5 上,平均任务成功率从良性条件的 90.0% 降至攻击下的 48.4%,并可跨套件、跨模型迁移。
事件概述或研究问题
视觉-语言-行动(VLA)模型是通用机器人策略,可遵循语言指令完成多种操纵任务。由于它们直接控制具身智能体,对抗干扰可能引发不安全物理行为。已有攻击通常针对单一任务或指令优化,多任务 VLA 的跨任务漏洞尚少被探索。UniTexture 的研究问题是:能否用单一纹理化 3D 物体,在多个任务中同时诱导 VLA 动作预测产生定向偏差?
方法/产品要点
- 攻击载体:单个 3D 物体的表面纹理,而非每个任务单独一个纹理。
- 优化链路:从策略的动作输出回传梯度,经可微渲染器更新表面纹理参数。
- 优化目标:在任务、指令、状态、视角的分布上联合优化共享纹理,使用面向动作空间的定向目标使预测动作偏向攻击者指定方向。
- 评估对象:OpenVLA 与 π0.5;覆盖多种操纵任务和多种评估设置。
主要结果或产业意义
- 攻击效果:平均任务成功率从良性条件下的 90.0% 下降到攻击下的 48.4%。
- 定向性:攻击诱导出与目标对齐的动作偏移。
- 迁移性:无需重新优化即可跨套件、跨模型迁移。
- 产业/部署意义:说明多任务 VLA 存在可被单一表面纹理系统性利用的共享跨任务脆弱性;在机器人策略部署前,需要把跨任务、跨模型对抗鲁棒性纳入安全评测。
为什么重要
VLA 模型不只在感知层输出语义,而是直接输出动作。UniTexture 的警示在于:攻击者无需针对每个任务制作扰动,只需一个共享纹理的物体出现在环境中,就可能让多种任务同时失败。这暴露了多任务 VLA 共享表征中的安全弱点,也提示对抗攻击研究应从“单任务、单模型”走向“跨任务、跨模型”评测。
与既有脉络的关系
本条是已有 VLM/具身安全卡片脉络上的增量更新:既有卡片分别涉及 VLM 推理忠实性、红外遥感 VLM 热气流攻击、模态顺序一致性;UniTexture 进一步聚焦 VLA 的动作输出,提出跨任务通用对抗纹理,把单任务对抗攻击推进到多任务通用攻击。相比 AirflowAttack 对视觉感知的干扰,UniTexture 干扰的是机器人动作预测。
局限与不确定性
本卡片依据 arXiv 摘要撰写,尚未核对全文。以下细节待核实:
- 具体操纵任务类型、数量及仿真/真实平台配置。
- 纹理是否已物理制造并在真实机器人上验证。
- 跨套件/跨模型迁移的具体目标套件与目标模型。
- “良性条件 90.0%”的评估细节(如纹理基线、指令分布、状态分布)。
- 与单任务攻击或现有防御方法的定量对比。
可用于图书/PPT/简报的角度
- 安全案例:“一张纹理让机器人任务成功率从 90% 掉到 48%”。
- 方法论科普:可微渲染器如何把动作梯度回传到 3D 表面纹理。
- 研究趋势:对抗攻击从单任务优化到跨任务通用迁移。
- 评测建议:多任务具身模型应加入跨任务/跨模型的对抗压力测试。
英文关键词(English Keywords)
Vision-Language-Action Models; Universal Adversarial Textures; Differentiable Rendering; Cross-Task Transfer; Embodied AI Security
原始材料
- 英文标题:UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models
- 作者:Yukun Dai, Mingzhe Dai, Tianshi Wang, Fengling Li, Jingjing Li, Lei Zhu
- 发布信息:arXiv:2608.13453v1,发布于 2026-08-13
- 分类:cs.CV; cs.AI
- 来源元信息:Track: academic; Topics: foundation-model
- 摘要链接:https://arxiv.org/abs/2608.13453v1
- PDF 链接:https://arxiv.org/pdf/2608.13453v1
- 来源类型:学术论文(arXiv)