该研究分析 CLI 编码代理如何在执行过程中产生、演化并陷入失败,而非只关注最终结果。研究收集了 7 个前沿模型在 OpenHands、MiniSWE 和 Terminus2 三种脚手架、Terminal-Bench 任务上的 3,843 条轨迹,并筛选出 1,794 条完整轨迹及超过 63,000 个步骤进行人工标注,发现失败多由认知性错误驱动,且常在最初几步出现,最终评估难以及时发现。
最近 24 小时暂无可用热度快照。