该论文将多模态深度研究从静态图像扩展到连续视频,指出现有智能体存在视觉工具使用偏差和参数知识泄漏。作者提出分离式感知—探索流程、分阶段工具解锁,以及SFT结合GRPO的训练方案,并发布包含200个多跳视频问答实例的Video-DR-Bench。其35B-A3B模型准确率达64.0%,高于论文报告的Claude-4.5-Sonnet、GPT-5和Gemini 2.5 Pro。
最近 24 小时暂无可用热度快照。