BadWAM 研究表明:针对视频-语言-动作管道的微小对抗性视觉改动,能将任务成功率从 96.5% 压至 43.1%,空间成功率低至 16%,揭示了世界动作模型自我验证机制的重大安全隐患。
微小的视觉扰动就能让多模态 Agent 的想象未来崩塌 [1]。BadWAM 研究表明,极轻微的视觉调整就能将视频—语言—动作流水线导向截然不同的预测帧,破坏模型所设想的内容与所执行内容之间的对齐。
World-action 模型(世界动作模型)一直被宣传为自检控制器,因为它们在行动前会生成对场景的显式预测。通过将未来预测与动作生成耦合,研究者认为机器人可以对照想象出的轨迹来验证自己的计划,表面上提升了安全性和可解释性。
BadWAM 的纯动作攻击将整体任务成功率从 96.5% 降至 43.1% [1]。这种退化是系统性的:空间成功率达 16.0%,目标成功率达 40.0%,长时域成功率达 23.5%,表明漂移渗透到了每一项评估指标中。
保持想象力的变体在相同的扰动预算下,将预测未来距离从 14.01 缩减至 13.04 [1]。通过让想象帧与干净预测在视觉上保持接近,攻击得以隐蔽存在,同时仍能迫使有害的动作偏移——这是一种在朴素视觉检查下不可见的失效模式。
该研究在 LIBERO 上评估了 FastWAM 检查点,留下了未解之谜:更大、更多样化的模型是否具有同样的脆弱性。这表明未来工作必须探究缩放效应,并探索超越适度正则化的防御手段,例如针对轨迹一致性的对抗训练。
具身 Agent 的鲁棒性套件应将漂移攻击作为部署前的强制基准纳入。将对抗漂移槽位加入现有评估流水线,将迫使开发者强化想象—动作闭环,而非假设它内在安全。
如果想象未来在不可察觉的扰动下都无法被信任,它们还能作为可靠的安全先知吗?
BadWAM:当世界动作模型想得对但做得错