SEED提出一种面向长时程智能体任务的自进化训练框架:模型先分析已完成的在策略轨迹,提炼可复用技能,再通过技能增强上下文重新评分动作,将概率变化转化为密集的令牌级在策略蒸馏信号,并与结果奖励强化学习联合优化。论文称其在文本和视觉任务上提升了性能、样本效率及未见场景泛化,代码已开源。
最近 24 小时暂无可用热度快照。