论文介绍GPT-Red,一种通过大规模自博弈训练、自动发现前沿大模型提示注入攻击的红队智能体。它同时攻击多种防御智能体,并被用于对抗训练GPT-5.6。作者称该系统可击破GPT-5.5及更早模型,在部分测试中发现的有效攻击多于人工红队,并能泛化到未见环境、模型和测试框架。
最近 24 小时暂无可用热度快照。