EvoAgentBench提出面向智能体自我进化的能力迁移基准,覆盖网页研究、算法推理、软件工程和知识工作四类场景。它从执行轨迹提取并规范化可复用的“能力”,构建能力图连接程序重叠任务,并在528/267训练测试划分、两种脚手架和三个基础模型上评估迁移效果。结果显示能力内容可跨模型迁移,但现有自动方法尚不能在所有设置中持续带来正收益。
最近 24 小时暂无可用热度快照。