Harness-R1将智能体运行时框架编辑建模为可学习能力:专用9B框架工程师根据目标智能体失败轨迹生成并验证可执行补丁,再通过冻结目标的同批次重跑结果获得奖励。在线强化学习后,Qwen3.5-9B在WebShop、ALFWorld和DBBench上的成功率由44.3%升至53.6%;目标模型微调后,框架工程师仍将平均成功率从59.2%提升至64.2%。
最近 24 小时暂无可用热度快照。