LongHorizon-Harness:面向真实任务推进长程智能体
原标题:LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
AI 导读
论文将长程智能体执行重构为外部任务状态管理,提出由管理器、全新上下文执行器和只读审计器组成的 MEA 循环,仅用环境独立验证的事实更新状态。据摘要,Qwen 3.7-Plus 在 WeaveBench 上由 51.8% 提升至 80.7%,但来源日期在未来且摘要截断,结果仍需核验。
为什么值得读
它直指长程智能体的状态漂移与错误自评,并给出可适配现有代理循环的审计式架构,但未来日期和截断信息值得立即核验。
深度解读
1. 发生了什么
原始事实: 所给摘要称,论文提出 LongHorizon-Harness,将长程智能体执行从不断增长的上下文中拆出,转化为显式的外部任务状态管理。系统通过 Manage-Execute-Audit(MEA)循环推进任务,并提供 AgentAdapter 以接入不同模型和 harness 后端。
2. 核心技术
原始事实: MEA 包含三个角色:管理器维护任务状态并选择下一子任务;执行器以全新上下文完成子任务;只读审计器检查执行后的环境状态。任务状态只依据从环境中独立验证的事实更新。
分析: 这种分工试图减少历史上下文膨胀、错误自评累积和执行角色自行宣告完成的问题。关键差异不只是压缩上下文,而是把状态变更置于独立验证之后。
3. 关键证据与数字
摘要报告的数据: Qwen 3.7-Plus 在 WeaveBench 上从 51.8% 提升至 80.7%,在 Terminal-Bench 2.1 上从 69.7% 提升至 77.2%,在 OSWorld 2.0 上从 2.8% 提升至 8.3%。摘要还提到 Claude Opus 4.7,但所给文本在具体数字处截断。
核验状态: 未提供完整实验表、方差、运行次数、成本、基线配置或显著性检验,因此无法据此判断提升是否稳定以及比较是否完全同条件。
4. 为什么重要
分析: 长程任务失败往往来自状态漂移和早期错误向后传播,而不只是单步推理能力不足。若外部审计在不同模型和环境中均有效,它可能说明 harness 架构能够在不更换基础模型的情况下显著影响代理可靠性。
5. 实际影响
分析: 该设计可用于软件工程、终端操作和桌面自动化代理。AgentAdapter 若确实无需修改原生代理循环,可降低现有系统的集成成本;代价可能是更多模型调用、环境读取和审计延迟,但摘要未量化这些开销。
6. 局限与不确定性
原始事实: 输入仅含截断摘要,没有作者、机构、代码仓库和完整实验细节。
未验证推断: 来源标注发布日期为 2026-08-02,且 arXiv 标识为 2608.01964;该日期属于未来元数据,文中 Qwen 3.7-Plus 与 Claude Opus 4.7 等名称也无法仅凭当前材料独立确认。论文真实性、版本信息和全部结果均应以 arXiv 原页及 PDF 为准。
7. 原始来源
- 所给 arXiv 页面:https://arxiv.org/abs/2608.01964
- 聚合来源:hf-papers
- 当前输入未提供论文 PDF、代码或项目主页链接。