论文提出RetroCoT,将有害请求改写为“事后法证重构”任务,测试模型是否会逆向还原造成有害结果的因果链。在AdvBench的50个样本中,gpt-4o和gpt-4o-mini的攻击成功率分别为58%和52%,明显高于直接请求基线;GPT-5系列拒绝该提示,但在延续既有法证语境的对话中仍出现脆弱性。
最近 24 小时暂无可用热度快照。