论文提出奖励驱动的LLM智能体工作流,将部分可观测马尔可夫决策过程(POMDP)路由、内部奖励模型、自我批评、多模态输入与图结构记忆结合,用于长程规划和动态交互。作者报告其在ALFWorld与WebShop上较标准ReAct基线取得24.5个百分点的任务成功率及轨迹效率提升,并称消融实验显示奖励驱动批评模块可降低幻觉,但摘要未给出完整实验配置。
最近 24 小时暂无可用热度快照。