阅读原文
hf-paperspapers89

DreamTraj:从未渲染的视频扩散潜变量生成6自由度物体轨迹

原标题:DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

AI 导读

DreamTraj提出一种无需视频、深度或CAD模型的方法:给定单张RGB图像和细粒度任务指令,从冻结的图像到视频扩散模型在早期去噪阶段的内部表示中读取运动信息,并由轻量级流匹配Reader解码相对6自由度位姿轨迹。论文同时发布MOVE数据集,包含5,038条带自然语言指令的物体中心第一视角轨迹。

为什么值得读

论文把视频扩散模型从视觉生成器转化为运动表征来源,且MOVE数据集直接回应了机器人操作中语言到动作监督不足的问题。

深度解读

1. 发生了什么

**原始事实:**论文提出DreamTraj,并发布MOVE数据集。DreamTraj从单张RGB图像和任务指令预测物体相对6自由度轨迹;推理时不需要视频、深度或CAD模型。MOVE包含5,038条物体中心第一视角轨迹,每条轨迹配有细粒度自然语言指令。

2. 核心技术

**原始事实:**方法使用冻结的图像到视频扩散模型,在早期去噪阶段读取其中间表示,而不是先完整生成视频。轻量级流匹配Reader负责解码query-key注意力轨迹和池化隐藏状态,输出相对6-DoF位姿。**分析:**其关键假设是扩散模型的中间表征已经编码了与任务相关的潜在运动结构。

3. 关键证据与数字

**原始事实:**MOVE数据集规模为5,038条轨迹;输入为单张RGB图像与自然语言任务指令;推理侧明确排除了视频、深度和CAD模型。**未核实推断:**提供的摘要没有包含与基线相比的轨迹误差、成功率、推理延迟或消融实验,因此不能仅据此判断性能优势的幅度。

4. 为什么重要

**分析:**传统方案可能依赖特权输入,或从完整生成视频中通过额外感知流程恢复运动。DreamTraj尝试直接利用生成模型的内部状态,可能减少视频生成和后处理带来的成本与误差。它也把语言监督从粗粒度的“动词-名词”标签推进到更细的动作描述。

5. 实际影响

**分析:**若实验结果在真实操作场景中稳定,该路线可用于单目、语言条件的抓取与操作规划,并降低对深度传感器和物体CAD资产的依赖。工程部署仍需处理坐标系标定、轨迹时序执行、闭环纠错和安全约束;论文摘要未证明这些问题已被解决。

6. 局限与不确定性

**原始事实:**论文摘要指出现有数据集缺少细粒度语言到运动标注,并指出已有预测器常依赖视频、深度或CAD模型。**不确定性:**提供材料未说明MOVE的场景多样性、物体类别、轨迹长度、训练测试划分、扩散骨干模型、Reader规模及跨域泛化表现。早期去噪表示是否始终保留可解码的运动信息,也需要消融和独立复现验证。

7. 原始来源

  • arXiv:2608.00486
  • 来源:Hugging Face Papers(hf-papers)
  • 提供的发布时间:2026-07-31T20:00:00.000Z

标签

roboticstrajectory prediction6-DoF posevideo diffusionflow matchingvision-language-actionmanipulationdatasets