阅读原文
arXiv 预印本Boxiu Li论文88

Argus:面向长程推理的通用智能体运行时

原标题:Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

长程推理需要一种智能体式运行时:当证据支持当前方法时,它能够持续推进;当测量结果揭示失败、隐藏约束或目标设定有误时,它能够及时转向。我们提出 Argus,一种持久化、自我演进的运行时,其中管理者(Manager)、规划者(Planner)、工程师(Engineer)和审查者(Reviewer)基于持久化项目状态执行边界明确的任务。Argus 将稳定的用户意图与操作目标、约束和验证标准分离;记忆、技能、流程、验证器、路由决策以及被否决的路线,只有经过相应角色负责的审查,并在条件允许时通过任务原生验证后,才会被纳入系统。模型权重保持固定;自我演进通过持久化运行时状态和控制策略实现,并在由操作员掌控的升级节点之间自主执行。

在七个 GPT-5.5 基准测试场景中,Argus 在 SWE-Bench Pro 上取得了约 78% 的成绩,而 Direct Copilot 为 59%,其总计使用的 token 数为后者的 1.41 倍。经过验证门控的自我演进后,相较于启动阶段的 SWE-Bench 批次,成熟阶段的批次在每项任务上减少了 21% 的求解输入 token,并将活跃工作流时间缩短了 15%,同时记录了 34 次验证器恢复和 22 次严格审查循环挽救。Argus 在 AARRI-Bench 上也达到了 76.8%,并在数学数据合成任务上取得了 28.0 个百分点的差距,在 GPU 内核和语言模型训练方面也展现出有竞争力的结果。

除基准测试外,一个经过优化的 RWKV6 内核已被合并至上游项目;一项持续多日的数学研究保留了被证伪的路线以及由证明支撑的前沿进展;六条论文流水线完成了 254 项任务,并进行了 16 次阶段回滚。这些结果表明,固定权重、自我演进的智能体框架能够修正方法、从失败中恢复并积累经过验证的方案,同时生成结构化轨迹,为未来的监督学习和强化学习提供支持。

为什么值得读

长程智能体的瓶颈正从单次生成转向状态持久化、失败恢复与可验证积累,Argus给出了一套可量化评估的运行时方案。

标签

agent-runtimelong-horizon-reasoningself-evolutionSWE-Bench Proverificationpersistent-stateresearch-agents