论文将“验证”提出为继预训练、后训练和测试时计算之后的新扩展轴。框架利用评分token的概率分布期望生成连续分数,并通过提高评分粒度、重复评估和标准分解改善候选方案比较,在Terminal-Bench V2、SWE-Bench Verified等基准上报告领先结果,还可为代理进度估计和强化学习提供密集反馈。
最近 24 小时暂无可用热度快照。