论文提出“经验蒸馏”方法,将智能体从软件工程任务和文字冒险游戏中获得的交互历史内化到模型权重,无需额外环境交互。749个软件工程任务与6款游戏实验显示,该方法保留至少64.8%的上下文学习收益,而直接监督微调仅恢复3.8%;相比经典强化学习基线,所需环境样本至少减少9.6倍。
最近 24 小时暂无可用热度快照。