OpenAI 表示,GPT-Red 红队测试中每次成功的攻击都会被转化为防御训练数据。该做法意在让模型从真实失效案例中持续改进安全防护,但目前公开信息未说明数据筛选、隐私处理、训练方法或防御效果指标。
最近 24 小时暂无可用热度快照。