ReferTrack提出“先指代、后跟踪”的具身视觉跟踪范式:模型先从图像中的候选框索引选择语言指代目标,再根据该决策生成跟踪航点,并用TVBI令牌保留历史目标框的几何与运动信息。在EVT-Bench三个划分上取得89.4%、73.3%和74.1%的成功率,论文还报告了腿足机器人与人形机器人的真实部署结果。
最近 24 小时暂无可用热度快照。