论文提出 OpenAgent 问题设定,用于研究工具、查询和交互动态变化下的智能体泛化能力。作者在受控沙盒中按感知、交互、推理和内化四层环境偏移进行实验,发现 SFT 与强化学习训练的智能体都会在开放环境变化下出现不同程度的性能下降,并提出扰动增强微调以提升鲁棒性。
最近 24 小时暂无可用热度快照。