arXiv 预印本Weitong Cai
单次字幕与按需取帧:面向长视频理解的视觉需求路由框架 CFD
原标题:Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding
论文76
边缘设备上的长视频理解必须在严苛的计算与带宽预算下,对长达数小时的内容进行推理。对视觉词元进行子采样会破坏时间结构,而纯文本的视频记忆又会丢失细粒度的视觉属性。我们观察到一种视觉-文本对偶性:语言记忆比密集帧更能有效地承载长程时间结构,而像素对于属性级别的感知则始终起着决定性作用。基于这一洞察,我们提出了预算感知的边云智能体框架 CFD(Caption-once, Frames-onDemand)。
边缘端仅需进行一次离线描述生成,即可构建包含事件级故事骨架与片段级微日志的双轨叙事索引;该索引经缓存后可在多次查询间复用,无需重新生成描述。在查询时,云端 MLLM 以轻量级“视觉需求路由器”(Visual-Need Router)为核心,在故事优先的循环中对索引进行推理:该门控模块针对每次查询进行判断,仅在遇到感知类问题(外观、屏幕文本、属性消歧)时触发有界限的关键帧检索,而将时间结构类问题保留在语言空间中处理。该路由器将视觉访问转化为受查询调节的一等开销,无论视频时长如何,都能对单次查询的帧消耗设定上限。在长视频基准测试上的实验表明,该方法在显著减少在线视觉处理的同时,实现了优异的准确率与效率权衡。
为什么值得读
它直面端侧处理长视频时的带宽与算力瓶颈,通过“文本管宏观结构、像素管微观辨析”的路由分工,给出了成本可控的工程解法。
标签
Long Video UnderstandingMLLMEdge AIVideo CaptioningAgentic FrameworkComputer VisionEfficiency