论文研究如何用强化学习同时提升代码正确性与执行速度。作者构建 DMC-Optim 测试集和校准沙箱,设计结合正确性与速度的奖励,并改造 GRPO 以应对计时噪声和稀疏反馈。在严格 top-50% pass@1 上,Qwen 2.5 7B 从 18.0% 提升至 31.3%,CWM 32B 从 30.7% 提升至 50.4%。
最近 24 小时暂无可用热度快照。