多伦多大学研究团队提出 SeededGrasp,将视觉语言模型的高层语义推理与轻量级抓取生成模型解耦:VLM 先根据语言任务和场景预测抓取种子点,再由后续模型完成几何抓取生成。团队发布包含超过 250 万个杂乱场景抓取标注的多形态数据集,并报告仿真成功率 72%、真实机器人成功率 78%。
最近 24 小时暂无可用热度快照。