GROVE:从连续视频经验中生长并推理时间分层记忆
原标题:GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
AI 导读
GROVE提出一种无需训练的连续视频记忆框架,让可穿戴助手用同一套因果增长的记忆同时支持事后问答与主动协助。系统保留细粒度感知证据,并逐步整合为带时间戳的时刻、连贯事件及跨日重复模式;每个层级配有对应检索技能。在MM-lifelong、EgoServe等基准上,论文称其优于对比方法,消融显示时间层级与访问技能具有互补性。
为什么值得读
可穿戴助手正从“被问才检索”转向主动理解情境,GROVE把记忆构建、跨时间检索和主动协助统一到一个可分析的框架中。
深度解读
发生了什么
论文提出 GROVE(Growing and Reasoning over Temporally Stratified Memory),面向持续接收视频流的可穿戴助手。原文摘要指出,现有视频记忆系统主要围绕用户问题进行条件式召回,而主动助手通常将记忆与控制机制分开;GROVE尝试用一套因果增长的记忆同时支持反应式问答和主动协助。
核心技术
GROVE从连续视频流中在线构建多层时间记忆:细粒度感知证据逐步整合为带时间戳的 moments、连贯的 episodes,以及跨日重复出现的 patterns。每个层级配套一种与其时间尺度相匹配的检索技能,分别用于定位单次观察、回放一段活动、或遍历长期规律。用户提问触发反应式检索,当前情境触发主动式检索,但两者共享记忆和访问接口。这里的“训练-free”是论文摘要中的事实性声明,具体实现依赖的基础模型、提示策略和索引机制尚未由所给材料说明。
关键证据与数字
原文摘要称,GROVE在包括 MM-lifelong 和 EgoServe 在内的多个基准上取得“compared methods among the best results”,并具体表述为 achieves the best results among the compared methods。摘要还称,受控消融表明时间层级与访问技能具有互补性,并指出 patterns 在部分结果中带来最大收益;但所提供摘要在“when evi...”处截断,因此无法确认完整条件、任务划分、提升幅度、对比基线或统计显著性。当前材料没有给出可核验的具体分数、视频规模、延迟、显存或成本数据。
为什么重要
该工作把视频记忆从单次“按问题找片段”扩展为持续演化的时间知识结构。对可穿戴设备而言,短时感知证据、完整活动和跨日规律具有不同的存储成本、检索目标与误差模式,将它们显式分层有助于控制检索范围,也为主动协助提供长期上下文。分析上,GROVE还提出了一个可拆解的接口:记忆如何增长、不同尺度如何访问、何时由当前情境触发检索,可以分别评估。
实际影响
工程上,该框架可能适用于个人活动回顾、物品或任务追踪、重复工作辅助,以及基于当前场景的提醒。分层记忆有望减少每次请求都扫描完整视频历史的需求,并让长期模式与单次证据分开管理。部署前仍需要明确在线处理的计算位置、视频压缩与删除策略、时间戳和事件边界的错误传播,以及主动建议的确认、撤销和权限机制。对于隐私敏感的第一视角视频,端侧处理和细粒度访问控制尤其关键。
局限与不确定性
目前仅有论文页面及一段截断摘要,无法独立验证完整实验结论。摘要没有说明基准的任务定义、数据规模、基线、评测指标或具体领先幅度,也没有证明“最佳”是否覆盖所有任务。训练-free系统仍可能依赖外部视觉语言模型、嵌入服务或提示工程,其运行成本和稳定性未给出。跨日 patterns 可能放大错误关联、隐私泄露或过度主动提醒;在新用户、新环境、长时间遮挡和分布变化下的表现也不能从摘要推断。关于“patterns收益最大”的表述只能按摘要所述记录,不能推导为普遍规律。
原始来源
- arXiv论文页面
- 来源标注:hf-papers
- 提供的发布时间:2026-08-02T20:00:00.000Z
- 以上评测与方法描述均基于用户提供的标题和摘要;未补写摘要中缺失的实验数字或引用。