论文提出伯努利续行策略 BCP,为固定动作块逐步作出“继续或重规划”决策,并在冻结基础 VLA 的情况下以轨迹级强化学习训练。摘要称,其在 RoboTwin 2.0、LIBERO、LIBERO-PRO 及两项真实机器人任务上均提升成功率,真实任务分别由 74% 升至 92%、44% 升至 84%。
最近 24 小时暂无可用热度快照。