论文提出 Recoverability-Aware Intervention Learning(RAIL),将训练时 rollout 干预建模为在线上下文 bandit,并通过 shadow-to-live 流程训练可恢复性控制器。该方法根据每次干预带来的改进动态选择介入时机、位置与方式,适应策略持续变化,在有限 rollout 预算下生成更有信息量、较少冗余的学习信号。
最近 24 小时暂无可用热度快照。