论文提出 PAST-Bench,通过开启或关闭经验保留的匹配条件,测试个人智能体能否把跨会话积累转化为后续表现提升。基准覆盖 26 个场景、204 个回合、7 个基础模型和 4 种智能体框架,并追踪保存、检索与更新路径。作者还提出含 5 项干预的 Hermes+;摘要称其提升平均收益,尤其有助于替换过时状态,但效果依赖能力与模型。
最近 24 小时暂无可用热度快照。