论文提出PolicyShiftBench,包含265张图像上的2,000个政策判别实例,平均每张图像配有7.55个政策条件提示,用于测试模型是否遵循当前政策而非固化的图像安全先验。作者进一步提出7B模型PolicyShiftGuard,以RP-SFT和BP-Adapt训练,在该基准上达到76.9 Avg. F1与72.1 Avg. PSS,并迁移至UnSafeBench和SafeEditBench。
最近 24 小时暂无可用热度快照。