阅读原文
hf-paperspapers86

模型还是 harness?一种以交互为中心的智能体故障定位分类法

原标题:Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

AI 导读

论文提出一种以交互为中心的智能体故障分类法,将模型、harness、用户、工具、记忆、环境与评测器之间的故障映射到具体交互边,并标注责任方。分类法整理出41种故障模式,旨在把表面结果转化为可执行的修复分配:模型问题用于后训练,harness问题用于脚手架和工具集成改进,环境或评测器问题则指向评测重设计。

为什么值得读

智能体评测正从“是否成功”转向“谁该修复”;这套41类、按交互边定位责任的框架可直接影响调试与基准设计。

深度解读

1. 发生了什么

原始事实: 论文提出一种以交互为中心的智能体故障分类法,将故障定位到组件之间的交互,并区分责任方。摘要称该体系包含41种故障模式。分析: 其目标是解决“修复应归属于模型、harness、环境还是基准”的分配问题。

2. 核心技术

原始事实: 分类法把故障分配到两个组件之间的边,并加入 fault side,表示修复应由哪一侧承担。涉及的组件包括模型、harness、用户、工具、记忆、环境和评测器。分析: 这相当于把单一的结果标签转化为带责任方向的交互图谱。

3. 关键证据与数字

原始事实: 摘要明确给出41种故障模式,并指出传统评测通常只记录系统级结果,现有分类法多为基准专用、缺少共享结构。未知或未验证推断: 摘要没有提供41类的完整清单、标注一致性、案例数量或实证修复收益,因此不能据此判断分类法的覆盖率和可靠性。

4. 为什么重要

分析: 同一个失败结果可能源于错误的模型行为、工具编排、记忆读写、环境约束或评分逻辑。若只看成功率,团队可能对模型进行无效后训练,或把基础设施问题误判为能力缺陷。交互级定位有望让评测结果更接近工程决策。

5. 实际影响

分析: Agent 团队可将故障报告扩展为“失败交互、责任侧、建议修复”的记录;评测平台可按模型、harness、工具和环境分别统计问题;基准作者则可检查任务定义、环境反馈和评分器是否制造了伪失败。该框架也适合用于回归测试和修复优先级排序。

6. 局限与不确定性

原始事实: 当前材料仅包含摘要,未确认论文是否提供标注协议、跨基准验证、评审者一致性或真实修复实验。分析: 交互边的责任归属可能存在多因一果、循环反馈和跨组件耦合;人为划分 fault side 也可能带来主观性。分类法能否稳定指导修复,仍取决于后续实证。

7. 原始来源

  • arXiv:2607.28802
  • 来源:Hugging Face Papers(hf-papers)
  • 发布时间:2026-07-29T20:00:00.000Z

标签

agent-evaluationfailure-analysistaxonomyharness-engineeringbenchmark-designpost-trainingarXiv:2607.28802