D3VL提出一个将视频、立体相机与LiDAR时间序列统一输入多模态大语言模型的自动驾驶框架,针对点云稀疏且缺乏网格结构的问题设计简化融合架构。在KITTI问答数据集上较基线提升11%,并发布面向多样驾驶条件的Waymo QA扩展。
最近 24 小时暂无可用热度快照。