论文提出 ContinualSkillBench,用五个领域、每域100个难度递增且相互关联的子任务,评估智能体的上下文持续技能学习。摘要称顺序执行通常提升表现,但上下文学习平均可比显式技能维护,说明收益更多来自历史上下文与反馈适应;显式技能仅在可复用流程或精确输出任务中呈现选择性优势。
最近 24 小时暂无可用热度快照。