ExplainBench提出一个用于自动评估编码智能体解释质量的基准,关注解释是否准确描述有缺陷代码的预期行为,以及应用智能体补丁后的实际影响。论文认为,解释应能帮助语言模型正确回答相关问题;初步实验显示,解释质量是独立于SWE-bench Verified的评测维度,并可能对不同智能体产生不同排序。
最近 24 小时暂无可用热度快照。