论文提出“多参考图像约束的视频描述”任务,要求模型生成事实准确的视频描述,并将短语级内容绑定到多张参考图像。RefCaptioner采用混合数据SFT与分层覆盖折扣GRPO两阶段后训练,配套构建含20,000个视频、171,354张参考图像的数据集及MRVBench基准,在开源模型中取得最佳综合表现。
最近 24 小时暂无可用热度快照。