论文重新审视自动化 Harness 演化的评估协议,指出搜索阶段与最终测试共用公开基准,可能把额外搜索收益误认为 Harness 设计改进,也可能导致基准过拟合。作者在 Terminal-Bench 2.1 上以 GPT-5.4 和 Claude Opus 4.6 对比 Harness 演化、测试时扩展与发现基线,并用保留任务检验泛化,发现其优势并不稳定且泛化有限。
最近 24 小时暂无可用热度快照。