该论文提出 Skill Self-Play(Skill-SP),用提议者、求解器和动态技能控制器组成强化学习循环。提议者生成挑战任务,求解器探索方案,控制器依据执行反馈更新技能库,以兼顾开放式任务探索与可验证反馈。论文称其在工具使用和推理基准上提升了已有模型表现,并帮助部分初始失配模型实现能力逆转;代码已开源。
最近 24 小时暂无可用热度快照。