阅读原文
arXiv 预印本Zheyuan Zhang论文80

优化策略学习的信息来源:面向可恢复性的 rollout 干预学习

原标题:Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

无评论员的基于群组的强化学习已成为大语言模型后训练的一种可扩展方法。然而,现有大多数方法为每个任务和轨迹状态分配相同数量的 rollout,尽管不同 rollout 所提供的有用学习信号差异很大。近期研究开始将 rollout 生成视为一种自适应决策,但仍存在两个重要局限。首先,干预策略通常基于固定启发式方法,因此无法随着训练过程中策略的变化进行调整。其次,这些方法通常只决定生成多少个 rollout,而没有明确控制在何处以及如何进行干预。为解决这些局限,我们提出可恢复性感知干预学习(Recoverability-Aware Intervention Learning,RAIL),这是一种训练时框架,能够根据每次干预带来的改进来学习如何生成 rollout。RAIL 将干预选择建模为在线上下文 bandit 问题,并利用通过 shadow-to-live 流程收集的干预轨迹训练可恢复性控制器。这使控制器能够在底层策略不断演化的同时持续学习。我们从有效性、自适应性、表达能力和效率等方面对 RAIL 进行了评估。在多种设置下,RAIL 都能在有限 rollout 预算下持续提升性能。结果表明,基于可恢复性感知的干预为生成信息量更高、冗余更少的 rollout 提供了一种原则性方法,从而在后训练过程中产生更强的学习信号。

为什么值得读

在 rollout 成本成为后训练瓶颈时,RAIL把“生成多少”扩展为“何时、何处、如何干预”,值得关注其自适应控制是否能稳定节省预算。

标签

强化学习LLM后训练rollout在线bandit策略优化训练效率