AgentStream提出统一评测框架,将智能体基准组织为可配置任务流,并在隔离、顺序和交错三种测试场景中评估自进化方法。论文组合比较了5种代表性方法与3个前沿基础模型,发现自进化收益受模型能力制约,随模型强度呈非单调变化,且没有方法能在所有模型和场景中稳定占优。
最近 24 小时暂无可用热度快照。