HuggingFace 每日论文Varun Ursekar
HarnessOpt-Bench:评估大语言模型进行智能体 Harness 优化的能力
原标题:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
论文88
HarnessOpt-Bench 提出一套端到端基准,用于评估大语言模型在提示词、工具、控制流、记忆和编排代码组成的智能体 Harness 上进行自动优化的能力。实验覆盖 5 个前沿模型、4 项下游任务和 111 次评分运行,并显示模型差异通常大于编码 Harness 差异,原生 Harness 也未稳定优于共享 Harness。
为什么值得读
智能体效果正从单一模型能力转向系统 Harness 能力,这项工作首次提供了可审计、带预算约束的统一评测框架,适合及时重估模型排行榜与自动改进流程。
标签
AgentHarnessBenchmark自动优化评测LLMCoding Agents