论文在 AppWorld 智能体基准上,首次将独立训练的 Qwen3-8B 专家合并结果与同数据联合强化学习模型直接比较。使用 LOOP 训练难度 1、2 专家后,TIES、RAM+ 等合并方法在任务目标完成率上与联合 RL 无显著差异。任务向量余弦相似度仅 0.06–0.10,但支持集重叠约 65%,说明方向与参数支持并不一致,合并方法差异因此被削弱。
最近 24 小时暂无可用热度快照。