Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots
arXiv 论文 2608.05715v1 系统研究了 VLM 控制的机器人中的物理提示注入攻击,提出了四类攻击分类法,并在 20 个攻击提示、3 种物理场景布局和 3 种命令表述下,对 GPT-4o、Gemini 2.5 Flash 和 Qwen3-VL-32B 进行了 5670 次试验,攻击成功率分别为 27.0%、29.4% 和 5.0%。
Development
- First ReportHijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled RobotsarXiv cs.RO
- Current Assessment随着 VLM 在机器人规划中的部署增加,物理世界中的提示注入攻击成为新的安全威胁。该研究为攻击分类和基准测试提供了基础,可能推动行业制定针对 VLM 机器人系统的安全标准和防御措施。Agent Pulse · analysis
该论文针对视觉语言模型(VLM)控制的机器人系统,提出了一种新的攻击面:放置在机器人视野内的对抗性文本可作为间接提示注入,影响 VLM 的推理。作者提出了一个包含间接标志、任务重定义、权威冒充和冲突注入的四类攻击分类法,并构建了包含 20 个攻击提示的基准,在三种物理场景布局和三种命令表述下进行了 5670 次试验。结果显示,GPT-4o、Gemini 2.5 Flash 和 Qwen3-VL-32B 的攻击成功率分别为 27.0%、29.4% 和 5.0%,其中权威冒充和否定攻击在所有三个模型上均可转移。推理轨迹分析表明,成功的攻击几乎总是有意识的(99.9% 的确认率)。
物理提示注入攻击在 VLM 控制的机器人中具有实际可行性,且攻击成功率与模型能力相关。权威冒充和否定攻击的跨模型可转移性表明,这些攻击利用了 VLM 的通用推理弱点,而非特定模型的缺陷。99.9% 的确认率表明模型在推理时能意识到攻击,但无法抵抗,这提示防御应侧重于推理时的安全机制,而非输入过滤。
随着 VLM 在机器人规划中的部署增加,物理世界中的提示注入攻击成为新的安全威胁。该研究为攻击分类和基准测试提供了基础,可能推动行业制定针对 VLM 机器人系统的安全标准和防御措施。
对于开发 VLM 机器人产品的公司,该研究揭示了潜在的安全漏洞,可能影响产品设计和客户信任。投资于安全防御的公司可能获得竞争优势,而忽视此问题的公司可能面临安全事件风险。
未来可能看到更多针对 VLM 机器人系统的攻击变体和防御策略的研究,以及模型供应商在训练和推理阶段加入对抗性鲁棒性改进。