该论文构建统一、可控的多轮环境,系统研究长程规划在预训练、后训练和能力整合中的形成机制。摘要指出,显式世界模型、少量长程数据和高质量轨迹十分关键;OPD在低质量及长程场景下较GRPO更稳健,MOPD则可整合兼容的跨环境规划模式。
最近 24 小时暂无可用热度快照。