Robostral Navigate 是一个 8B 视觉语言导航模型,仅输入单目 RGB 图像流,并在当前视野中指向下一目标位置来预测航点。研究以 240 万条轨迹和 35 万个模拟场景训练模型,结合前缀缓存、树状注意力掩码与强化学习,将训练周期从数月缩短至数天。在 R2R-CE 上成功率达 77.4%,超过最佳单目方法 10.5 个百分点,也领先最强深度或多相机系统 5.3 个百分点。
最近 24 小时暂无可用热度快照。