论文提出MarineEVT海洋视频理解数据集,包含2万组多任务、视频级视觉问答,覆盖多维海洋理解与分析;同时提出事件中心视觉工具集成推理方法EVT-R1,用视觉工具定位并解释稀疏、不可预测且分布不均的关键事件。作者称其在对比11个先进VLM时,较最佳开源和商业模型分别提升5.22和11.09。
最近 24 小时暂无可用热度快照。