论文提出进化微调(EFT),将LLM参与进化搜索产生的轨迹转化为监督信号,训练模型学习变异、回溯和迭代策略。作者构建涵盖10个领域、371项任务的Finch Collection,共156K条轨迹,并在22项留出任务上报告平均10.22%的相对提升;结合测试时强化学习后,模型在两项圆打包任务上达到当前最佳表现。
最近 24 小时暂无可用热度快照。