阅读原文
arxivpapers84

证据足够即停止:面向大语言模型智能体的证据条件渐进式执行

原标题:Stop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM Agents

AI 导读

论文提出 Router-Mem,用共享的低成本检索前缀获取证据,再由轻量级充分性路由器判断是否可以提前结束;证据不足时才扩展记忆块并进行更深分析。在 AMA-Bench 和 BEAM 上,相比完整记忆执行,平均推理时间分别降低 27.3% 和 25.5%,得分为 55.17% 和 38.77%。

为什么值得读

长上下文智能体的核心瓶颈正从能否检索转向何时停止,这项工作给出了可训练的成本—质量路由机制及两项基准结果。

深度解读

1. 发生了什么

原始事实: arXiv 论文 2608.01285 提出 Router-Mem,用于长时程 LLM 智能体记忆。系统先执行低成本检索,再判断当前证据是否足够;不足时才进入更深的记忆扩展、分析与聚合流程。

2. 核心技术

原始事实: Router-Mem 使用共享检索前缀、轻量级充分性路由器和推理时单 token 决策。训练阶段结合证据级监督与基于理由条件的表示蒸馏。其执行路径是渐进式的:证据足够则提前终止,否则复用检索命中结果继续处理。

3. 关键证据与数字

原始事实: 摘要报告在 AMA-Bench 上得分 55.17%,平均推理时间相对完整记忆执行降低 27.3%;在 BEAM 上得分 38.77%,平均推理时间降低 25.5%。摘要没有说明这些分数的具体指标、比较基线数量、硬件、模型规模或方差。

4. 为什么重要

分析: 传统记忆压缩可能丢失时间、因果和跨步骤关系,而始终进行深度研究又会增加延迟。Router-Mem 把“是否继续计算”变成显式决策,理论上可以让简单查询快速结束,把计算预算集中到证据不足的任务上。

5. 实际影响

分析: 该方法适合具有长期会话记忆、任务轨迹或外部知识库的智能体系统,尤其适用于在线交互中延迟和调用成本都敏感的场景。工程集成时需要监控提前停止率、错误停止率、端到端首 token 延迟和总 token 消耗,而不能只看平均推理时间。

6. 局限与不确定性

原始事实: 摘要未披露路由器误判的具体代价、不同任务上的提前停止比例,也未说明 55.17% 和 38.77% 是否优于完整执行或其他记忆系统。未验证推断: 如果路由器对证据不足的查询过早终止,速度收益可能以召回率或答案完整性下降为代价;这一权衡需要全文实验和消融结果确认。论文发布日期为 2026-08-02,属于所给元数据中的未来日期,时间信息应以 arXiv 页面为准。

7. 原始来源

  • arXiv:2608.01285
  • 标题:Stop When Memory Suffices: Evidence-Conditioned Progressive Execution for LLM Agents
  • 来源类型:论文摘要;本文解读中的实验数字均直接来自用户提供的摘要文本。

标签

agent-memoryretrievaladaptive-computationearly-exitlong-horizon-agentsinference-costAMA-BenchBEAM