ChronoVision提出一种面向多模态大模型时间推理的框架:训练阶段用重构视觉头预测变换后的最终潜在状态,并通过ROI注意力定位关键视觉证据;后训练阶段采用结合结果正确性、潜在过程对齐和视觉聚焦的复合奖励。论文同时发布Vbvr-VQA图像排序数据集,在域内、域外分别达到74.8%和71.6%,并在IntPhys2上取得55.0%。
最近 24 小时暂无可用热度快照。