V-DEAL研究发现,视频大语言模型面对有害视频与良性问题的组合时,攻击成功率反而高于配合明确有害问题的情况。作者测试六个Video LLM和三个公开基准,发现模型识别有害内容的准确率超过81%,但平均攻击成功率仍达48.33%;隐藏状态分析显示视觉理解触发的拒答倾向弱于文本理解。提示注入干预可使攻击成功率平均下降48.24个百分点。
最近 24 小时暂无可用热度快照。