InternVLA-A1.5以原生视觉语言模型为骨干,继续训练VQA与子任务预测,并通过轻量统一专家生成连续动作。模型用可学习前瞻token从冻结的视频生成模型中提取任务相关未来表征,避免像素级预测;基于120万机器人轨迹和300万多模态样本训练,在六项仿真基准取得摘要所称的最佳综合结果,并改善真实机器人对未见指令绑定的组合泛化与长时程执行。
最近 24 小时暂无可用热度快照。