论文提出终端任务合成系统 CalibForge,以已验证的求解器行为反向修订候选任务,并通过多求解器分歧或“强者通过、弱者失败”的对比关系定位可学习难度区间。作者称其生成了 5,431 个任务;训练后模型在 Terminal-Bench 2.0 上达到 32.58% 和 47.57%,并在多个基准上取得最高 30.04 个百分点的提升。
最近 24 小时暂无可用热度快照。