HarnessOpt-Bench 提出一套端到端基准,用于评估大语言模型在提示词、工具、控制流、记忆和编排代码组成的智能体 Harness 上进行自动优化的能力。实验覆盖 5 个前沿模型、4 项下游任务和 111 次评分运行,并显示模型差异通常大于编码 Harness 差异,原生 Harness 也未稳定优于共享 Harness。
最近 24 小时暂无可用热度快照。