论文提出代理引导更新信号传输(PUST)框架,将后训练中的行为探索与分布对齐解耦:先用轻量代理模型寻找高奖励行为,再提取优化前后的相对改进方向,传递给主模型。该方法支持异步生成、缓存复用及跨模型迁移,并在Qwen3系列数学与代码任务上验证了弱代理增强强模型的可行性。
最近 24 小时暂无可用热度快照。