Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

奖励驱动的LLM智能体工作流:融合POMDP路由与自我纠错的自主决策

首次出现 · 2026/7/19 10:51最近活动 · 2026/7/19 10:51

论文提出奖励驱动的LLM智能体工作流,将部分可观测马尔可夫决策过程(POMDP)路由、内部奖励模型、自我批评、多模态输入与图结构记忆结合,用于长程规划和动态交互。作者报告其在ALFWorld与WebShop上较标准ReAct基线取得24.5个百分点的任务成功率及轨迹效率提升,并称消融实验显示奖励驱动批评模块可降低幻觉,但摘要未给出完整实验配置。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/19 10:51非独立信源代表报道
    奖励驱动的LLM智能体工作流:融合POMDP路由与自我纠错的自主决策