WorldDiT提出一种统一扩散Transformer,将机器人连续动作块生成与未来相机帧的归一化RGB图像块预测结合起来,无需大型预训练视觉语言模型作为动作骨干。在LIBERO四个仿真套件上,论文称其位于报告完整结果方法的参数量与平均成功率Pareto前沿,并提供低于十亿参数的基线。
最近 24 小时暂无可用热度快照。