论文提出BadWAM框架,研究针对世界-动作模型(WAM)的World-Action Drift攻击。攻击者通过微小视觉扰动,使模型执行失败动作;在更隐蔽的设定下,还能让模型保持接近正常的未来想象,却产生失配的实际动作。实验显示,动作攻击可将任务成功率从96.5%降至43.1%。
最近 24 小时暂无可用热度快照。