阅读原文
arxivpapers87

面向覆盖率的自适应视频关键帧选择

原标题:Coverage-Driven Adaptive Keyframe Selection for Video Understanding

AI 导读

论文提出无需训练的语义关键帧选择器 CSES,通过估计帧—查询相关性分布的显著性,自适应决定需要评分的帧数和输入关键帧数量,并联合优化语义相关性、时间冗余与视觉冗余。四个 LVLM、两个基准上的实验显示,在保持准确率的同时,评分帧数减少 4—13 倍,选择帧数减少 18.4%—20.5%,帧选择速度提升 3.1—5.4 倍。

为什么值得读

长视频应用的瓶颈正从模型推理延伸到帧筛选;该方法用自适应覆盖率机制同时降低筛选与输入成本,适合评估视频智能体的端到端效率。

深度解读

1. 发生了什么

原始事实: 论文提出 CSES(Coverage-driven Semantic keyframe Selection),一种无需训练的长视频语义关键帧选择方法。它同时自适应决定要评分的帧数和最终输入模型的关键帧数量。

2. 核心技术

原始事实: CSES 先估计帧—查询相关性曲线的显著性,以指导主动采样并调整时间覆盖范围;随后把关键帧选择建模为覆盖问题,同时考虑语义相关性、时间冗余和视觉冗余。两阶段在覆盖率饱和时停止。 分析: 该设计把“多看一些帧”转化为按收益继续获取信息,减少对整段视频进行密集预评分的依赖。

3. 关键证据与数字

原始事实: 摘要称,实验覆盖 4 个 LVLM 和 2 个基准。在保持准确率的情况下,CSES 比现有基线少评分 4—13 倍帧,少选择 18.4%—20.5% 的输入关键帧;帧选择过程提速 3.1—5.4 倍。其选择目标是单调子模函数,因此可使用带标准近似保证的贪心优化。 未验证推断: “保持准确率”具体是统计上等价、近似持平,还是部分任务上的相同数值,摘要未说明。

4. 为什么重要

分析: 长视频成本不仅来自 LVLM 对选中帧的推理,也来自候选帧评分和预处理。若结果在不同模型、查询类型和视频长度上稳定,CSES 可能改善视频问答、检索和视频智能体的成本—延迟曲线。

5. 实际影响

分析: 工程上可将 CSES 放在 LVLM 调用前,作为查询条件的帧预算控制层;它尤其适合相关内容稀疏、视频时长变化大的场景。部署时应分别测量帧解码、特征提取、评分、传输和 LVLM 推理,避免只观察选择器本身的加速比。

6. 局限与不确定性

原始事实: 提供的信息没有列出 4 个 LVLM、2 个基准、数据规模、准确率变化、帧评分所用模型或硬件环境。 分析: 训练免费不等于零成本;主动获取仍可能需要视觉特征或相关性计算。覆盖目标的效果也可能依赖查询难度、镜头切换密度和相关片段的时间分布。子模贪心保证针对形式化目标成立,不直接保证下游 LVLM 准确率最优。

7. 原始来源

标签

视频理解关键帧选择LVLM长视频子模优化推理效率