DeepVoyager-VL提出面向开放世界问题的长程多模态深度搜索框架,让视觉证据参与中间推理和后续检索,而不只用于输入或最终回答。方法包括多模态事件图数据合成、主动视觉获取、按需加载图像,并在无需强化学习的情况下进行微调;论文称其在十个多模态搜索基准上取得有效结果。
最近 24 小时暂无可用热度快照。