论文提出 Skill-α,将智能体技能生成建模为可评估的序列编辑过程,并用回滚奖励比较原始技能与编辑后技能在锚定查询上的下游执行效果。实验显示,在 GPT-4o worker 下,Skill-α 相比最强基线在 CL-Bench 和 tau2-bench 上分别提升 3.3 和 6.7 个百分点。
最近 24 小时暂无可用热度快照。