Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Hongming Zhang·2026年9月9日 16:53

ConvMem:借鉴卷积结构的免训练长文本记忆框架

原标题:ConvMem: Convolutional Memory for Long-Context Reasoning

论文74

尽管大语言模型(LLM)展现出了令人瞩目的能力,但由于固定的上下文限制,它们在处理极长上下文时往往十分吃力。为解决这一问题,像 MemAgent 这样的序列化方法通过分段阅读文本并迭代更新固定大小的记忆来扩展有效上下文。然而,这种序列化范式存在延迟高的问题,且需要昂贵的强化学习(RL)训练,这可能会导致模型在特定数据集上发生过拟合。为了克服这些局限性,我们提出了 ConvMem,这是一种无需训练、高度可并行的框架,它将长上下文推理重新形式化为分层卷积。受卷积神经网络(CNN)的启发,ConvMem 将由特定查询提示的大语言模型视为卷积核。该卷积核以分层方式对文本片段进行总结,将推理路径从线性链缩短为对数树。具体而言,ConvMem 结合了“可配置步长”(Configurable Strides)和“跳跃连接”(Skip Connections)以确保稳健的证据捕获与传递,同时采用“多核卷积”(Multi-Kernel Convolution)将复杂查询分解为解耦的语义通道。这种设计不仅减轻了误差累积,还在文本片段和推理线程两个维度上实现了大规模并行化。在 RULER-HotpotQA 和 RULER-2WikiMultiHopQA 上的实验表明,ConvMem 的性能优于无需训练的基准方法,并避免了强化学习训练模型在分布外任务上常见的过拟合到参数先验的风险。

为什么值得读

它为超长文本推理提供了一种纯推理侧的并行结构解法,跳出了对强化学习记忆代理或注意力窗口硬性扩容的依赖。

标签

Long-Context LLMsMemory ArchitectureHierarchical ReasoningParallel InferenceRULER BenchmarkConvolutional Kernel

评分依据

  • 新颖性76
  • 影响力71
  • 实践价值76
  • 可信度72
  • 时效性75