论文提出一种混合智能体架构:由大语言模型负责生成子目标、结构化计划和上下文指导,再由强化学习智能体通过环境交互优化低层动作。摘要称,该方法在序贯决策任务上较纯RL和纯LLM基线具有更高样本效率、成功率和轨迹连贯性,但未给出任务、模型、数值或统计显著性细节。
最近 24 小时暂无可用热度快照。