HuggingFace 每日论文Fanzhe Meng
CalibForge:通过对抗式求解器校准扩展可学习终端任务
原标题:CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
论文72
论文提出终端任务合成系统 CalibForge,以已验证的求解器行为反向修订候选任务,并通过多求解器分歧或“强者通过、弱者失败”的对比关系定位可学习难度区间。作者称其生成了 5,431 个任务;训练后模型在 Terminal-Bench 2.0 上达到 32.58% 和 47.57%,并在多个基准上取得最高 30.04 个百分点的提升。
为什么值得读
它把任务“可执行”推进到相对特定求解器“可学习”,直接回应终端智能体训练数据难度失配问题,但未来日期与论文编号需先核验。
标签
CalibForge终端智能体任务合成求解器校准Terminal-BenchSWE-bench Pro训练数据