Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
HuggingFace 每日论文·Varun Ursekar·2026年8月5日 20:00

HarnessOpt-Bench:评估大语言模型进行智能体 Harness 优化的能力

原标题:HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

论文88

HarnessOpt-Bench 提出一套端到端基准,用于评估大语言模型在提示词、工具、控制流、记忆和编排代码组成的智能体 Harness 上进行自动优化的能力。实验覆盖 5 个前沿模型、4 项下游任务和 111 次评分运行,并显示模型差异通常大于编码 Harness 差异,原生 Harness 也未稳定优于共享 Harness。

为什么值得读

智能体效果正从单一模型能力转向系统 Harness 能力,这项工作首次提供了可审计、带预算约束的统一评测框架,适合及时重估模型排行榜与自动改进流程。

标签

AgentHarnessBenchmark自动优化评测LLMCoding Agents

评分依据

  • 新颖性93
  • 影响力88
  • 实践价值82
  • 可信度86
  • 时效性90