论文提出 UniVR,探索仅依赖纯视觉示范同时学习复杂推理、细粒度物理动态与长期规划。其核心方法 VR-GRPO 结合全局奖励和步骤级奖励,配套构建涵盖长程操作、空间谜题和物理推理的 VR-X 基准,报告最高 25% 的性能提升,并宣称代码、数据和模型开源。
最近 24 小时暂无可用热度快照。