论文提出一种面向视觉语言模型供应链的架构后门:恶意提供者将触发器门控的表示加法逻辑嵌入模型架构、文本编码器或导出计算图,无需污染训练数据、控制下游微调或修改部署提示。无触发器时模型保持正常行为,触发后则将中间表示推向攻击者目标,并影响问答、文生图、检索、安全约束与排序公平性。
最近 24 小时暂无可用热度快照。